$ cat wiki/papers/2026/2608.13505-intern-s2-preview.md
Intern-S2-Preview: Scientific Agentic Foundation Model (arXiv:2608.13505)
TL;DR
397B 규모의 과학 에이전트 foundation model 로, 멀티모달 과학 사전학습을 거친 뒤 SFT,
다중 과제 RL, 블랙박스 및 화이트박스 에이전트 RL, on-policy distillation 을 쌓아 올린
사후 학습 파이프라인을 통과한다. 두 가지 구조적 확장이 보고된다: 수치 예측까지 이어지는
시계열 모델링, 그리고 얼어붙은 397B 백본을 수정하지 않고 모델을 특화시키는 별도
메모리 경로 Memory Decoder — 4B Intern-MemDec 확장이 Biology-Instructions 평균을
56.92 에서 60.32 로 끌어올린다
(source).
방법
과학 연구가 요구하는 세 가지에 맞춰 자리를 잡는다: 이질적 모달리티에 걸친 추론, 도구와 환경과의 상호작용, 그리고 긴 과제 지평의 유지 (source).
사전학습은 과학적이고 멀티모달이다: 렌더링된 과학 문서, 이미지-텍스트가 교차된 데이터, 그리고 "다양한 과학 코퍼스".
그 체크포인트에서 출발하는 사후 학습은 한 단계가 아니라 층이다:
| 단계 |
|---|
| 지도 미세조정 |
| 확장 가능한 다중 과제 강화학습 |
| 블랙박스 및 화이트박스 에이전트 RL |
| on-policy distillation |
| 안정성과 효율을 위한 기법들이 이름과 함께 열거된다: off-policy 보정을 곁들인 부분 롤아웃, |
| 적응적 길이 정규화, 온라인 speculative decoding, 견고한 다중 과제 최적화, 그리고 |
| 에이전트 과제를 위한 궤적 인식 경험 조립. |
아키텍처, 397B 총합 백본에 대한 두 확장:
- 시계열 — "효율적인 긴 시퀀스 이해에서 수치 예측까지" 확장.
- Memory Decoder — 얼어붙은 397B 백본을 수정하지 않고 빠르게 과학 영역에 특화시키는 별도의 메모리 증강 경로로 연구된다.
결과
| 결과 | 보고된 값 |
|---|---|
| 전반 | 과학·멀티모달·에이전트·범용 벤치마크에 걸쳐 "여러 설정에서 경쟁력 있거나 앞서는 결과" |
| 시계열 모듈 | SciTS 에서 과학 신호 이해와 예측을 개선 |
Biology-Instructions 의 Intern-MemDec-4B | 평균 56.92 → 60.32, 백본 무수정 |
| 초록에 있는 수치는 위의 두 개가 전부이고, 나머지는 전부 말로만 서술된다. 이 규모의 | |
| 모델에서 이는 눈에 띄는 누락이며, 다른 데서 채워 넣지 않고 그대로 기록한다. |
초록이 주지 않는 것: 활성 파라미터 수(총합 397B 만 제시), 컨텍스트 창, 라이선스, 가용성, 범용 벤치마크 점수, "경쟁력 있거나 앞서는"의 기준선, 그리고 "Preview" 가 출시 일정에 대해 무엇을 뜻하는지.
의의
이 모델에는 모델 페이지를 만들지 않는다. 이 위키가 모델 페이지에 고정해 둔 ## Spec
행 집합 — Developer, Released, Announced, Context window, Pricing, License, Availability —
은 개발사조차 없는 한 줄에 나머지 일곱 행이 unknown 으로 나올 것이다. 읽은 자료가
연구소도, 날짜도, 라이선스도, 엔드포인트도 밝히지 않기 때문이다. 지금까지 arXiv 초록으로만
존재하는 모델에게는 논문 페이지가 정직한 자리다. 출시나 모델 카드나 엔드포인트가 나타나면,
그때 모델 페이지를 쓴다.
여기서의 관심사는 Memory Decoder 이고, 이는 이틀 사이 가중치를 건드리지 않고 모델을 특화시킨 세 번째 결과다: Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence (arXiv:2608.12743) 는 얼어붙은 VLM 을 위해 보정된 교훈을 검색하고, DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545) 는 얼어붙은 모델 주변의 harness 를 진화시키며, 이 논문은 397B 얼어붙은 백본 곁에 4B 모듈을 붙여 한 영역 평균을 3.4점 옮긴다. 세 그룹, 세 기구, 하나의 공유 전제 — 그리고 이번 것은 재학습할 수 없는 모델을 우회하는 쪽이 아니라 프런티어 규모의 학습 작업 안에서 나왔다. Eval Harness Configuration 은 역량이 가중치 바깥으로 이동하고 있다고 주장해 왔는데, 397B 사전학습 논문이 바로 그것에 구조적 자리를 하나 배정한 것은 지금까지 그 주장의 가장 강한 판본이다.
두 번째로 짚을 것은 블랙박스 및 화이트박스 에이전트 RL 이 별개 단계로 명명된 점이다. Agentic Reinforcement Learning 은 에이전트 RL 을 하나의 기법으로 담고 있으며, 환경 내부가 보이는지 여부로 나누는 구분은 그 페이지가 지금 하지 않는 구분이다. 그리고 그 구분은 실제 도구를 상대로 무엇을 학습시킬 수 있는지와 시뮬레이터를 상대로 무엇을 학습시킬 수 있는지를 가르는 종류의 것이다.
열린 질문
- 어느 연구소인가? 읽은 자료 어디에도 이름이 없다. 시리즈 이름에 기댄 귀속은 추측이고, 이 페이지는 그 추측을 하지 않는다.
- 활성 파라미터. 효율 기법들이 MoE 를 시사하는 논문에서 총합 397B 만 있고 활성 수는 없다. 서빙 비용을 결정하는 수치가 빠져 있다.
- "Preview" 는 무엇을 약속하는가? 읽은 자료 어디에도 날짜, 라이선스, 가중치, 엔드포인트가 없다.
- 무엇과 견주어 경쟁력 있다는 것인가? "여러 설정에서 경쟁력 있거나 앞서는"은 SciTS 와 Biology-Instructions 외에 기준선도 벤치마크도 밝히지 않는다.
- Memory Decoder 는 조합 가능한가? 한 영역에 붙인 4B 모듈 하나는 개념 증명이고, 얼어붙은 백본 하나에 그런 모듈 열 개가 공존하는지가 이것이 아키텍처인지 데모인지를 가른다.
- 저자 명단, 소속, 코드 공개 여부 — 알 수 없다. 논문을 읽지 못했다.
인용
Intern-S2-Preview: Scientific Agentic Foundation Model (2026).
arXiv:2608.13505.