arxiv-wiki

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

← 2026-08-12 목록으로 돌아가기

한 문장 요약

Macaron-V1은 ‘고정된 대형 베이스 모델 + turn-level로 선택되는 LoRA 전문화기’(Mixture-of-LoRA) 아키텍처와 모델-하니스 공동설계 기반의 재귀적 자기개선(Recursive Self-Improvement, RSI) 루프를 결합해 배포 후 경험으로 계속 학습하는 열린 연속학습(continual learning) 시스템을 제안한다.

해결하려는 문제

중앙집중식(post-training) 재학습 방식은 배포 환경, 도구, 사용자, 상호작용 상태가 계속 변하는 현실 세계에서 발생하는 새로운 지식·도메인·상호작용을 반영하지 못해 정적 최적화에 머무른다. 기존 통합 파라미터 학습은 이종 과제 간 교란(cross-task interference)을 일으키고, 배포 경험을 체계적으로 후속 모델·하니스 수정으로 전환하는 메커니즘이 부족하다. 논문은 배포 경험을 이용해 안전하게 반복 개정할 수 있고, 서로 다른 전문화기를 조합해 협업하는 시스템 설계 문제를 다룬다.

핵심 기여

접근 방법

주요 결과

한계

(추가 실험 설정·paired 평가·다양한 분포에서의 재현이 필요).

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(본문 및 부록)을 직접 인용·요약하여 작성했다. 표와 수치는 본문 및 부록에 명시된 값에 근거했으며, 일부 결과(예: 배포 성능·장문 처리 용량)는 다양한 엔진·하드웨어 구성에 크게 의존한다고 저자가 명시하므로 일반화에 주의가 필요하다. 독립적인 복제나 추가 실험이 필요한 항목(예: 전체 RSI 사이클의 누적 이득, 다팀 어댑터의 집합적 이점, paired 품질 검증)은 본문에서 저자도 열린 문제로 제시하고 있다.