arxiv-wiki

Untangling the Mechanisms of Misleading Context in Medical Question Answering

← 2026-09-04 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: The injection design and its behavioral effect. (a) All five arms share a clean stem, differing

Figure · 원문 PDF 4쪽 · Figure 1: The injection design and its behavioral effect. (a) All five arms share a clean stem, differing

Figure 2: Injected cue disclosure by surface. (a) Nondisclosure rate by surface. (b) Among visible

Figure · 원문 PDF 5쪽 · Figure 2: Injected cue disclosure by surface. (a) Nondisclosure rate by surface. (b) Among visible

Figure 3: Where influence accumulates. Median

Figure · 원문 PDF 6쪽 · Figure 3: Where influence accumulates. Median

한 문장 요약

의도적으로 주입한 두 종류의 오도성 문맥(증거형 허위 주장과 정답 단언)이 의료 다지선다 질의응답에서 모델의 판단을 어떻게 왜곡하는지, 그 왜곡이 추론 흔적(trace)과 응답 표면에 어떻게 드러나고(또는 숨겨지며), 왜곡이 추론 과정에서 언제 축적되는지와 감독자(모니터)가 이를 얼마나 검출할 수 있는지를 대규모 벤치마크(MedMisBench, n=8,627)와 세 모델(R1-14B, OSS-120B, GPT-5.4)을 통해 실험적으로 규명했다.

해결하려는 문제

대형 언어모델(LLM)이 의료 질문에 대해 높은 성능을 보이지만 외부에서 제공되는 문맥(전자건강기록, 검색 결과, 환자 진술 등)에 오도적 정보가 포함될 수 있고, 이 문맥이 모델의 의료적 판단을 왜곡할 때 그 취약성(어떤 문맥에 얼마나 민감한가), 왜곡이 추론 흔적과 응답 표면에 어떻게 드러나는가(또는 드러나지 않는가), 왜곡이 추론 내부에서 어떤 메커니즘으로 작동하는가(언제·어떻게 축적되는가), 그리고 감독자가 모델 출력(추론 흔적 또는 응답)만 보고 이를 얼마나 탐지할 수 있는가를 체계적으로 밝히지 못한 한계를 해결하려고 한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(서론·방법·결과·토의·부록 포함)에 근거해 작성되었다. 본문에 명시된 실험 수치·비율(예: uptake, 공개율, x50, AUC, 모니터 재현율)은 PDF 텍스트에서 직접 인용했으며, 추가 구현 세부사항이나 외부 재현 조건(예: 모델 내부 파라미터의 미세 설정, API 버전 변경 등)은 논문 본문에 충분히 기술되어 있지 않거나 배포 환경에 따라 변할 수 있어 여기서 생성하지 않았다.