arxiv-wiki

From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents

한 문장 요약

지속적 상호작용 기록에서 암묵적 제약을 추론해 실행에 반영하는 IBA-BENCH와 IBA-Agent를 제안하여, 깊은 검색과 궤적 수준 합성으로 개인화된 LLM 에이전트의 행동 정렬을 크게 개선한다.

해결하려는 문제

개인화된 LLM 에이전트가 사용자의 동적으로 진화하는 선호와 제약을 정적 프로파일이나 QA 기반 추론에만 의존해 반영하기 어려운 지식-행동 간극(Knowledge-to-Action Gap)을 해결해야 한다. 현 벤치마크는 실제 실행 맥락에서의 암묵적 선호와 충돌하는 조건들을 충분히 다루지 못한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Personalization beyond QA: knowledge-to-action gap between preference inference and task execution.

Figure · 원문 PDF 2쪽 · Figure 1: Personalization beyond QA: knowledge-to-action gap between preference inference and task execution.

Figure 2: Benchmark construction flow chart.

Figure · 원문 PDF 3쪽 · Figure 2: Benchmark construction flow chart.

Figure 3: Overview of IBA-Agent for personalized task completion.

Figure · 원문 PDF 5쪽 · Figure 3: Overview of IBA-Agent for personalized task completion.

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Personalization beyond QA: knowledge-to-action gap between preference inference and task execution.

Figure · 원문 PDF 2쪽 · Figure 1: Personalization beyond QA: knowledge-to-action gap between preference inference and task execution.

Figure 2: Benchmark construction flow chart.

Figure · 원문 PDF 3쪽 · Figure 2: Benchmark construction flow chart.

Figure 3: Overview of IBA-Agent for personalized task completion.

Figure · 원문 PDF 5쪽 · Figure 3: Overview of IBA-Agent for personalized task completion.

근거 범위: 논문 PDF 본문 기반 분석. 본 분석은 논문 본문의 주요 챕터 및 표를 인용해 요약했으며, Appendix의 수치 및 프롬프트 상세는 본문에서 확인 가능하나, 특정 수치의 맥락(예: 각 judge 모델별 결과의 매핑)은 본문에 제시된 배열에 의존합니다. 필요 시 Appendix의 세부 표를 재확인하시길 권합니다.