arxiv-wiki

Intern-S2-Preview: Scientific Agentic Foundation Model

← 2026-08-14 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Architecture of the separate Memory Decoder extension for Intern-S2-Preview-397B. The frozen

Figure · 원문 PDF 3쪽 · Figure 1: Architecture of the separate Memory Decoder extension for Intern-S2-Preview-397B. The frozen

Figure 2: Architecture of the time series modules for long-sequence understanding and numerical forecasting.

Figure · 원문 PDF 4쪽 · Figure 2: Architecture of the time series modules for long-sequence understanding and numerical forecasting.

Figure 3: Overview of matched text and visual pre-training. The text pathway predicts tokens from parsed

Figure · 원문 PDF 5쪽 · Figure 3: Overview of matched text and visual pre-training. The text pathway predicts tokens from parsed

한 문장 요약

과학적 멀티모달 입력과 장기 도구 상호작용을 다루기 위해 대규모 과학적 에이전트형 파운데이션 모델(Intern-S2-Preview-397B)을 설계·학습하고, 시간열 예측 모듈과 분리형 메모리 디코더를 통해 과학적 이해·추론·생성·장기 에이전트 태스크 성능을 향상시키는 파이프라인을 제시한다.

해결하려는 문제

기존 일반 목적 LLM과 과학적 멀티모달 모델은 (1) 문서의 레이아웃·도표·표·수치 등 이질적 과학 증거를 종합적으로 이해·추론하지 못하고, (2) 장기 작업 지평(long-horizon)에서 도구 사용·반복적 상호작용을 통해 문제를 점진적으로 해결하는 에이전트적 워크플로를 충분히 지원하지 못하며, (3) 새로운 세부 도메인으로 빠르게 특화할 때 백본 모델을 재학습하면 일반성·에이전트 성능을 해칠 위험이 있어 효율적이고 안정적인 학습·운영 파이프라인이 필요하다는 한계가 있다. 본 논문은 이러한 한계를 해결하는 것이 목표이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(사전학습·아키텍처·포스트트레이닝·시스템 기술·결과 요약 섹션)을 바탕으로 작성되었음. 본문에 명시된 정량적 수치(예: Biology-Instructions 56.92→60.32, 시간열 길이 240k→300k, 5∼6× 추론 속도, GPU 메모리 약 20%, pretraining chunk ≤256K 토큰·512 토큰 overlap 등)는 PDF에서 직접 확인한 값이다. 반면 벤치마크별 상세 표·모든 정량적 비교(세부 태스크별 점수, 표준편차, 평가 집합 크기 등)는 본문 요약·서술로만 제공되거나 PDF 추출 범위에서 세부 표가 포함되지 않아 본 분석에서는 재구성하지 않았음.