arxiv-wiki

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

← 2026-08-06 목록으로 돌아가기

한 문장 요약

본 논문은 ‘스킬 엔트로피(Skill Entropy)’라는 방향성 쌍(pairwise) 지표로 LLM의 스킬 전환 난이도를 정량화하고, 이를 바탕으로 558개 스킬·9개 도메인으로 구성한 Skill2-Bench 벤치마크를 제안하며, 동일 신호를 보상으로 사용하는 Skill-Entropy RL로 크로스-스킬(long-horizon) 추론 성능을 크게 향상시킨다.

해결하려는 문제

현행 벤치마크들은 개별 스킬(단일 도메인) 능력 평가는 잘 하지만, 하나의 긴 추론 체인에서 서로 다른 스킬을 연속으로 사용해야 할 때 모델이 스킬을 적절히 전환하는 능력(스킬-스위칭 능력)을 측정·훈련할 수 있는 원칙적 척도가 부족하다. 이로 인해 모델은 각 스킬을 개별적으로 잘 해도 스킬이 섞인 장기 과제에서 정확도가 크게 떨어지는 문제(예: 이전 단계의 스킬·응답 형태를 다음 단계에 재사용하는 실패 모드)가 존재한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(본문 및 부록 포함)의 텍스트를 근거로 작성되었음. 주요 수치(예: Skill2-Bench 구성, 성능 지표, 보상 수식, 하이퍼파라미터, 실험 설정)는 본문 및 부록에 명시된 값을 그대로 인용함. PDF에서 잘린 부분이나 외부 코드·데이터의 세부 구현(예: 정확한 프롬프트 문자열 전체, 모델 API 호출 세부 옵션)은 본문에서 요약된 내용으로만 파악했으므로, 실제 재현 시 저자 공개 코드 저장소(논문에 링크됨)와 추가 부록을 함께 확인하기를 권함.