arxiv-wiki

LAVA: Logic-Aware Validation and Augmentation Framework for Large-Scale Financial Document Auditing

← 2026-08-18 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Overview of LAVA. The architecture comprises two parallel pipelines—document processing and rule

Figure · 원문 PDF 3쪽 · Figure 1: Overview of LAVA. The architecture comprises two parallel pipelines—document processing and rule

Figure 2: Arithmetic Processor. Given a validation rule, the system generates a formula and delegates evaluation to

Figure · 원문 PDF 5쪽 · Figure 2: Arithmetic Processor. Given a validation rule, the system generates a formula and delegates evaluation to

Figure 3: Prompt excerpt for Symbolic Reasoner, dy-

Figure · 원문 PDF 5쪽 · Figure 3: Prompt excerpt for Symbolic Reasoner, dy-

한 문장 요약

금융 문서의 레이아웃·규칙 복잡성을 고려한 4단계(문서-규칙 검색, 레이아웃 보존 정보 추출, 메타데이터 보강, 산술·기호 검증) 모듈형 파이프라인 LAVA를 제안해 실무용 감사(검증)에서의 환각 억제와 정밀한 감사 추적을 달성한다.

해결하려는 문제

기업 환경의 금융 문서 검증(예: 급여 감사, 세무 준수, 대출 심사)은 이견이 허용되지 않는 정확성, 일관성, 감사 가능성이 요구된다. 기존 MLLM 기반 파이프라인은 (1) 이질적 레이아웃·스캔 잡음, (2) 문서 간·필드 간의 복잡한 비즈니스 규칙과 다단계 논리, (3) 모델 환각 및 수치 불안정성, (4) 감사 추적성 부족과 토큰·비용 증가 문제로 실무 요건을 충족하지 못한다. 본 연구는 이러한 한계를 해결하여 규칙-기반 검증과 신경모델의 적응성을 결합한 실무 적합한 프레임워크를 제시하는 것을 목표로 한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(주요 본문, 표, 부록)을 근거로 작성되었음. 표(특히 표 1·표 2)와 텍스트에서 제시된 수치와 구성 요소를 직접 인용하였으며, 데이터셋은 ‘약 1,000건 수준의 캐나다 모기지 신청 문서’로 명시되어 있음. 논문은 규칙 라이브러리 전체 내용과 코드·데이터를 공개하지 않아 일부 세부(정확한 규칙 수, 전체 규칙 목록, 원시 문서 예시)는 본문만으로 확인할 수 없었음. 또한 PDF 추출 과정에서 표의 레이아웃이 단순화되어 해석의 여지가 있을 수 있으므로, 정확한 재현을 위해서는 원저자의 공개 자료(코드·데이터) 확인을 권장함.