arxiv-wiki

V-FiLLM: Verified Financial LLM Reasoning Benchmark

← 2026-08-13 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Benchmark generation pipeline. Synthetic spreadsheets are decomposed into typed atoms, composed

Figure · 원문 PDF 3쪽 · Figure 1: Benchmark generation pipeline. Synthetic spreadsheets are decomposed into typed atoms, composed

Figure 2: Examples of grounded computation trees and

Figure · 원문 PDF 3쪽 · Figure 2: Examples of grounded computation trees and

한 문장 요약

V-FiLLM은 합성 스프레드시트에 근거한 실행 가능한 계산 트리로부터 자동 검증된 금융 QA 항목을 생성해 계산 깊이·폭·파생 개념·문맥 크기를 제어하며 LLM의 구성적 재무 추론과 강건성을 평가하는 프레임워크이다.

해결하려는 문제

기존 금융 QA 벤치마크는 인간 주석 또는 모델 보조 추출에 의존해 소스 수준의 잡음(형식 불일치, 결측, 모호한 문장)과 모델의 추론 실패를 혼동시키며, 난이도를 체계적으로 제어하기 어렵고 스케일 확장이 비용적으로 제한된다. 본 연구는 이러한 한계를 해결해 검증 가능한 정답을 가진 항목을 대규모로 생성하고, 계산(추론) 깊이·폭·도메인 개념 복잡성·문맥 변이성에 따라 LLM 성능을 정밀 진단하려고 한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(페이지 1–10)의 텍스트를 기반으로 작성되었다. 표(표 2–6)의 수치, 본문 설명(섹션 3–5)과 결론·한계(섹션 6–7)를 직접 참조했다. 논문이 언급했으나 본문에 상세 수치가 없는 하이퍼파라미터 외의 구현 세부(예: 학습 스텝 수, 배치사이즈, 랜덤 시드)와 실제 런타임·비용 수치는 PDF에서 제공되지 않아 포함하지 않았다.