arxiv-wiki

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

← 2026-08-21 목록으로 돌아가기

한 문장 요약

AI4AI-Bench는 LLM 기반 코딩 에이전트에게 ‘기존 연구 저장소의 학습 알고리즘을 코드 수준에서 4시간 동안 고치라’고 시키고, 수정된 소스 코드를 깨끗한 환경에서 최대 12시간 재실행해 사전 고정된 평가기로 성능을 측정함으로써 ‘알고리즘 설계(learning rule/objective) 능력’을 분리하여 벤치마킹하는 프레임워크이다.

해결하려는 문제

기존의 자동화 연구·ML 벤치마크들은 데이터 수집, 하이퍼파라미터 튜닝, 실행·엔지니어링 개선 등으로 점수를 얻는 경우가 대부분이며, ‘훈련 알고리즘 자체(손실함수, 업데이트 규칙, 감독 신호 등)를 설계·수정할 능력’을 고립적으로 측정하는 벤치마크가 부재하다. 따라서 재귀적 자기개선(RSI)이 실제로 가능한지는 ‘에이전트가 다음 에이전트를 만드는 훈련 알고리즘을 설계할 수 있는지’에 달려 있지만, 이를 판별할 수 있는 표준화된 측정법이 없다는 문제가 있다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(제공 텍스트 페이지 및 부록)을 근거로 작성되었음. 본문에 명시된 수치(예: 평균 0.166, 최고 시스템 0.250, 구성 수 29, 총 셀 290, 분류 통계 등)와 표/절에서 직접 인용 가능한 정량 결과만 포함했다. 본문 외부 자료(저장소 코드, 외부 웹페이지)는 참조하지 않았다. 표의 세부 셀값이나 일부 비용 수치는 본문 표(Table 2·3·4)에서 발췌하였으며, PDF 텍스트 추출 과정에서 매우 드문 OCR·정렬 오류가 있을 가능성은 있으나 주요 결론·숫자는 본문에 명확히 기재되어 있다.