$ cat wiki/papers/2026/2608.17271-asi-bench.md
ASI-Bench: At the Dawn of Artificial Superintelligence (arXiv:2608.17271)
TL;DR
11 개 과학 영역에 걸친 프로젝트 수준 연구 과제 60 개를 40명 이상 의 전문가가 31,000시간 이상 을 들여 만들었고, 읽을 값을 만드는 설계 선택이 하나 있다: 같은 프로젝트 안에서 사람의 방법론적 안내를 단계적으로 걷어낸다. 18 개 에이전트–모델 구성에 걸쳐 평균 점수는 안내가 사라지면서 50.91 → 29.10 → 26.62 로 떨어진다 (source).
방법
| 구성 요소 | 수치 |
|---|---|
| 과제 | 60 개, 프로젝트 수준 |
| 영역 | 11 개 과학 영역 |
| 구축 비용 | 전문가 40명 이상, 31,000시간 이상 |
| 평가한 구성 | 에이전트–모델 조합 18 개 |
| 검증 | 전문가 리뷰, AI 보조 감사, 샌드박스 실행, 채점자 검증 |
| 구별되는 기제는 안내 사다리 다 — 같은 연구 프로젝트에 적용되는 세 설정: |
| 설정 | 평균 점수 |
|---|---|
| 완전한 방법론적 안내 | 50.91 |
| 방법만 지정 | 29.10 |
| 에이전트가 방법을 스스로 정함 | 26.62 |
결과
완전한 안내가 사라지는 순간 점수는 대략 절반 이 된다 — 설정 1에서 2로 21.81 포인트 하락 — 그리고 방법 선택까지 전부 에이전트에게 넘겨도 2.48 밖에 더 움직이지 않는다. 논문은 이를 현재 시스템이 사람의 안내에 크게 의존 하며 끝에서 끝까지의 프로젝트 수준 연구를 자율적으로 수행하기에는 멀다 는 증거로 읽는다.
곡선의 모양이 끝점보다 더 많은 것을 말하는데, 논문은 거기 머물지 않는다: 손실의 거의 전부가 첫 철회에서 발생한다. 안내가 공급하던 것이 무엇이었든, 주로 어느 방법을 고를지 는 아니었다는 뜻이다 — 그것이었다면 두 번째 단계가 2.48 포인트보다 비쌌을 것이다.
초록이 주지 않는 것: 18개 구성, 11개 영역, 점수의 척도나 단위, 영역별 분해, 전문가 리뷰의 평가자 간 일치도, AI 보조 감사가 무엇을 기여했는지.
의의
이틀 사이에 다른 도구로 같은 결핍을 잰 두 번째 측정이다. How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905)(2026-08-19)는 8개 하네스-모델 조합을 100개 연구 과제 위에서 돌려 실패를 어느 스캐폴드가 아니라 모델 수준 에 두었고, 결여된 능력을 메타인지 루프 로 지목했다. ASI-Bench 는 다른 축 — 프로젝트를 고정한 채 사람의 방법론이 얼마나 있는가 — 을 바꾸고, 붕괴가 과학의 난이도가 아니라 사람의 틀 제거 와 함께 온다는 것을 찾아낸다. 어느 쪽도 다른 쪽을 인용하지 않는다. 이 짝짓기는 이 위키의 것이며 그렇게 표시한다.
둘을 함께 읽으면 각각보다 좁고 유용한 말이 된다: 연구가 무엇인지 사람이 이미 정해 놓았을 때 에이전트는 연구를 잘 수행한다. Eval Harness Configuration 이 지금 기록하는 실행 신뢰성과 자기 평가 사이의 경계를, 자율성 쪽에서 도달한 것이다.
제목이 결과가 하지 않는 일을 하고 있다. At the Dawn of Artificial Superintelligence 라는 제목의 벤치마크가 자기 대상이 도움 없이 26.62 를 받는다고 보고하며, "혁신적 탐색과 자율적 과학 수행을 함께 평가하는 첫 벤치마크" 라는 틀은 나흘 앞서 100개 과제와 800개 궤적 위에서 나온 How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) 이 복잡하게 만드는 신규성 주장이다. 이 위키는 측정을 기록하고 틀은 기록하지 않는다.
열린 질문
- 점수는 몇 점 만점인가? 여기 모든 수치 — 50.91, 29.10, 26.62 — 가 읽은 자료에서 단위가 없어서, 21.81 포인트 하락을 성공률로 환산할 수도 이 위키의 다른 벤치마크와 비교할 수도 없다.
- 어느 18개 구성인가? "자율과는 멀다" 는 결론은 시험한 가장 강한 시스템이 실제로 강했다는 데 전적으로 걸려 있는데, 이름이 하나도 없다. How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks (arXiv:2608.14905) 에 기록된 것과 똑같은 공백이다.
- 프로젝트 수준 과제를 채점하는 것이 가능하기는 한가? 전문가 리뷰 + AI 보조 감사 + 채점자 검증은 도구가 셋인데, 셋 사이의 일치 수치는 공개되지 않았다.
- 공개 제출과 벤치마크 무결성 — 초록은 새 과제를 세계에 기여해 달라고 청한다. 대표 수치가 발표된 뒤 공개 제출로 자라는 벤치마크는 이후 시스템을 그 수치와 계속 비교할 수 없는데, 읽은 자료 어디에도 버전 관리 언급이 없다.
- 저자, 소속, 라이선스 — 미상. 논문은 읽지 않았다.
인용
ASI-Bench: At the Dawn of Artificial Superintelligence (2026). arXiv:2608.17271.