arxiv-wiki

Fast and Accurate Quotation Attribution in Literary Texts

한 문장 요약

공유 컨텍스트 창에서 다수의 인용-발화자 귀속을 함께 해결하는 span 기반의 joint scoring 엔코더 모델로 PDNC에서 SOTA 94.5%를 달성하고, 기존의 직접 점수화 방식보다 약 20배, LLM 기반 접근보다 1000배 이상 빠르게 처리한다.

해결하려는 문제

문학 텍스트에서 인용의 화자 귀속(quotation attribution)은 여전히 어려운 문제이며, 기존의 고정된 각 인용구를 독립적으로 예측하는 직접 점수화(direct scoring) 방식은 효율적이지만 정확도가 낮고, LLM 기반 접근은 높은 정확도를 달성하나 대규모 분석에 비현실적으로 비싸다. PDNC( Project Dialogism Novel Corpus)처럼 수천 개의 인용구를 포함하는 데이터에서 긴 맥락(window) 내 여러 인용구를 함께 해석하는 모델이 필요하다. 연구 문제는 이러한 한계를 넘어서, 긴 컨텍스트에서 다수의 attribution 결정을 공동으로 최적화할 수 있는 효율적이고 정확한 formalization을 제시하는 것이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Left: standard approaches score independent

Figure · 원문 PDF 3쪽 · Figure 1: Left: standard approaches score independent

Figure 2: Left column: Mention-Mention same-/different-character effect sizes (Cohen’s d, top) and mean cosine

Figure · 원문 PDF 6쪽 · Figure 2: Left column: Mention-Mention same-/different-character effect sizes (Cohen’s d, top) and mean cosine

Figure 3: Attribution accuracy vs. Q-M separability

Figure · 원문 PDF 13쪽 · Figure 3: Attribution accuracy vs. Q-M separability

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Left: standard approaches score independent

Figure · 원문 PDF 3쪽 · Figure 1: Left: standard approaches score independent

Figure 2: Left column: Mention-Mention same-/different-character effect sizes (Cohen’s d, top) and mean cosine

Figure · 원문 PDF 6쪽 · Figure 2: Left column: Mention-Mention same-/different-character effect sizes (Cohen’s d, top) and mean cosine

Figure 3: Attribution accuracy vs. Q-M separability

Figure · 원문 PDF 13쪽 · Figure 3: Attribution accuracy vs. Q-M separability

근거 범위: 논문 PDF 본문 기반 분석. 제시된 수치와 실험 구성을 PDF 본문에 기반해 정리했으며, Appendix B/C/D 및 외부 데이터(LitBank) 관련 세부 구현은 본문에 요약되어 있어 일부 세부 방법은 원문 부록에서 확인해야 할 수 있다. PDF에서만 확인 가능한 실험 세부사항이나 파라미터의 일부는 본문에 의존하여 기재하였고, 일부 수치가 표의 부재나 요약에 의해 달라 보일 수 있다.