arxiv-wiki

Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents

← 2026-08-13 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Semantically identical tasks in 41 languages pass through one fixed symbolic tool-

Figure · 원문 PDF 2쪽 · Figure 1: Semantically identical tasks in 41 languages pass through one fixed symbolic tool-

Figure 2: The central result. (a) Greedy decoding raises Iwithin by 0.134 but moves Icross

Figure · 원문 PDF 4쪽 · Figure 2: The central result. (a) Greedy decoding raises Iwithin by 0.134 but moves Icross

Figure 3: The temperature ladder separates language from sampling. (a) Cross-lingual

Figure · 원문 PDF 5쪽 · Figure 3: The temperature ladder separates language from sampling. (a) Cross-lingual

한 문장 요약

다국어로 동일한 작업을 줬을 때 도구를 호출하는 에이전트가 같은 행동정책(action trace)을 유지하는지를, 원시 트레이스의 다섯 가지 교란요인을 통제한 정규화된 추정치로 대규모(2.38M 롤아웃) 측정해 ‘정책 보존(policy retention)’의 경계와 원인을 규명했다.

해결하려는 문제

기존 다국어/에이전트 평가들은 최종 정답만 비교하고 중간의 행동(도구 호출 시퀀스)을 버린다. 그러나 에이전트의 실제 산출물은 행동 경로로서 비용·지연·실패 모드·감사 가능성에 직접 영향을 준다. 동일한 작업을 다른 언어로 줬을 때 행동정책이 달라지는지를 측정하려면 (1) 모델 자체의 비재현성, (2) 트레이스 길이, (3) 비파싱(빈 트레이스), (4) 모델 재현성(천장), (5) 우연히 일치하는 바닥값 등 다섯 가지 교란을 제거한 신뢰 가능한 추정치가 필요하다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(본문·표·그림·부록 인용 문구 포함)을 기반으로 작성되었다. 본문과 부록에서 수치와 실험설계(예: 2.38M 롤아웃, 505셀, 8모델, 6벤치, 41언어, 핵심 표/그림/절 내용)를 직접 추출해 사용했다. 부록의 세부 구현(예: 완전한 추정기 수식·일부 세부 표)은 본 텍스트에서 인용된 부분에 근거했으며, PDF에 있는 모든 부록 행렬·코드·데이터 파일 자체는 이 요약에서 직접 재검증하지 못했음을 밝힌다.