$ cat wiki/papers/2026/2608.13558-omniscientist.md
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist (arXiv:2608.13558)
TL;DR
텍스트와 사전 계산된 요약이 아니라 이종의 원시 증거 — 이미지, 신호, 오디오, 비디오, 3-D 구조, 궤적, 표, 수식, 그래프 — 에서 직접 연구하는 AI 과학자. 원시 데이터에서 조판된 원고까지 36 사례 전부 를 완주했고 평균 논문 점수는 6.3 이며, 사전 계산된 스칼라 특징만 받은 블라인드 변형 대비 직접 지각이 평가 차원 7개 전부를 개선하고 일대일 비교의 85% 를 이긴다 (source).
방법
제시된 공백은 날카롭다: 워크플로 커버리지만으로는 발견이 의존하는 증거 전체에 접근할 수 없다. 기존 AI 과학자 시스템은 텍스트, 코드, 레이블, 사전 계산된 요약 위에서 추론하므로 공간적, 시간적, 채널 간, 절차적 관계 가 에이전트에게 닿지 않는다 — 논문은 이를 과학적으로 결정적인 관계라 부른다.
구조: 지각 계층 과 자율 에이전트 3개 — 착상, 실험, 집필 — 이 결정론적 파이프라인 안에서 동작한다. 명시된 설계 의도는 관측이 분석 단계에서만이 아니라 생애주기 전반에 걸쳐 연구 질문, 실험적 결정, 최종 주장 을 형성하게 하는 것이다.
검사는 코드로 실행되며, 이 부분은 지각 주장과 분리해 볼 가치가 있다:
| 검사 | 강제하는 것 |
|---|---|
| Idea check | 신규성 선별 |
| Rigour check | 통계적 타당성 |
| Claim check | 실행 출처(provenance), 수치 추적 가능성 |
결과
평가: 실제 데이터 36 사례, 5개 분야군, 4개 과학 증거 계열.
| 항목 | 수치 |
|---|---|
| 원시 데이터 → 조판된 원고 완주 사례 | 36 / 36 |
| 평균 종합 논문 점수 (기준 추론 백본) | 6.3 |
| 직접 지각 대 블라인드 변형, 개선된 평가 차원 | 7 / 7 |
| 일대일 판정 승률 | 85% |
| 초록이 주지 않는 것: 6.3 이 놓인 척도, 누가 또는 무엇이 채점했는지, "기준 추론 백본" 의 정체, | |
| 그리고 분야별 분해. |
의의
어블레이션이 결과이고, 그것은 이례적으로 깔끔하다. 대부분의 AI 과학자 논문은 시스템이 논문을 생산했다고 보고한다. 이 논문은 파이프라인을 고정한 채 원시 증거에 대한 직접 지각만 제거하고 그 자리에 사전 계산된 스칼라 특징을 넣는다. 7/7 차원 개선과 일대일 85% 승리는 역량이 어디에 자리하는지에 대한 강하고 좁게 한정된 주장이며, How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) 이 연구 결핍을 어떤 스캐폴드가 아니라 모델 수준에 위치시켰을 때 암묵적으로 요구한 종류의 통제된 비교다.
이번 주의 부정적 결과 둘과 나란히 읽어도 모순되지 않는다. ASI-Bench: At the Dawn of Artificial Superintelligence (arXiv:2608.17271) 는 인간의 방법론적 지도가 철회되는 순간 점수가 50.91 → 29.10 으로 무너지는 것을 발견했고, Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development (arXiv:2608.13417) 는 에이전트가 "완전히 자율적인 연구자보다 엔지니어링 최적화기 에 가깝게" 작동한다고 보았다. OmniScientist 의 36 사례는 열린 연구 프로그램이 아니라 실제 데이터 사례 다: 데이터가 있고, 질문이 주어져 있으며, 에이전트의 일은 증거에서 원고까지다. 그것은 ASI-Bench 가 첫 철회 이전 이라 서술하는 국면 — 에이전트가 잘하는 국면 — 이다. 두 발견은 양립하며, 그 사이의 경계가 흥미로운 대상이다.
"36/36 완주" 는 처리량 수치이지 품질 수치가 아니며, 그렇게 읽혀서는 안 된다. 언제나 조판된 원고로 종료되는 파이프라인은 자신이 죽지 않는다고 보고하고 있는 것이다. 품질 주장은 평균 점수 6.3 이고, 척도 없이는 무엇과도 비교할 수 없다 — 같은 도구로 사람이 받을 6.3 과도.
코드로 강제되는 claim check 는 이 논문을 이 저장소 자신의 관행과 잇는다. 실행 출처 와 수치
추적 가능성 은 claim-check.py 가 이 저장소에 대해 하는 일이다: 게시된 수치가 인용된 출처에
실제로 있는지 검증하는 것. 집필 결과를 신뢰하는 대신 그것을 연구 에이전트 안에 넣는 것은 같은
논변이고, 외부 검증을 보고서가 아니라 게이트로 삼은 이번 주 두 번째 논문이다 —
SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation (arXiv:2608.18565) 에 이어서.
열린 질문
- 6.3 은 어떤 척도이며 누가 채점했는가? 둘 다 없으면 대표 품질 수치를 해석할 수 없고, LLM 이 채점한 점수라면 How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review (arXiv:2608.08975) 가 내용을 고정한 채 수사만으로 움직일 수 있음을 보인 영역에 정확히 놓인다.
- 36개 산출물 중 옳은 것이 있었는가? 신규성 선별과 통계적 타당성은 과정 검사다. 읽은 것 중 어떤 발견이 정답에 대해 검증됐다고 말하는 자료는 없다.
- 블라인드 변형은 공정한 통제인가? 사전 계산된 스칼라 특징은 구성상 약한 기준선이며, 텍스트와 표를 함께 주는 강한 기준선이 이기기 어려운 비교다.
- 사례당 비용 — 아홉 개 모달리티에 걸쳐 지각을 수행하는 시스템에 대해 보고되지 않았다.
- 저자 목록, 소속, 라이선스, 코드 공개 여부 — 미상. 논문을 읽지 않았다.
인용
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist (2026). arXiv:2608.13558.
관련
- Agents (LLM Agents)
- AI for Mathematics
- How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905)
- ASI-Bench: At the Dawn of Artificial Superintelligence (arXiv:2608.17271)
- Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development (arXiv:2608.13417)
- SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation (arXiv:2608.18565)