arxiv-wiki

MidTool: Mid-training Data Synthesis for Agentic Tool Use

← 2026-08-21 목록으로 돌아가기

한 문장 요약

일반적 도구 사용(agentic tool use)을 목표로 웹/PDF/코드/구조화된 툴 아티팩트를 합성해 20.3B-token 규모의 mid-training 코퍼스(MidTool-Mix)를 만들고, 이를 Qwen3-4B/8B 베이스 모델에 적용해 후속 SFT 및 RL 성능을 안정적으로 개선함으로써 ‘도구 사용은 전적으로 post-training에 맡길 것이 아니라 mid-training으로도 형성할 수 있다’를 입증한다.

해결하려는 문제

기존에는 LLM의 도구 사용 능력 개선을 주로 post-training(예: SFT, RL)으로 해결해 왔으나, 도구 인식(tool affordance), 스키마 기반 인자 추출, 다중-툴 워크플로우 구성, 불완전 정보에서의 복구 등 도구 사용에 필요한 기저 지식이 문서·코드·API 등 흩어진 형태로 존재해 좁은 후속 데이터만으로 습득시키기 어렵다. 연구 질문은 ‘일반적 도구 사용 능력을 전용 mid-training으로 조형하면 downstream SFT/RL 성능이 개선되는가’다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 논문 PDF 본문(메인 텍스트 및 부록)에 기재된 내용만을 근거로 작성되었다. 데이터 구성(20.3B tokens, 11.22M 샘플, 웹 42%/코드 26%/PDF 23%/네이티브 9%), 실험 설정(모델 이름·하드웨어·SFT 100K TOUCAN 사용·RL 환경 수 526), ablation 및 성능 수치(본문 Table 3–6 및 부록 수치)를 본문에서 직접 인용하였다. 복잡한 표의 일부 열 해석(예: BFCL 세부 하위 항목의 정확한 컬럼 레이블)은 PDF 표 서식 때문에 모호한 부분이 있어 가능한 한 본문에서 명시된 요약 및 Table 6의 ablation 델타를 중심으로 수치화하였다. 표나 부록의 세부적인 숫자 열 배치로 인해 해석상 불확실한 소수의 세부항은 본문에 명시된 정량적 요약(증가 폭·주요 수치)을 우선 사용했다.