$ cat wiki/papers/2026/2608.23283-apodex-1-1.md
Apodex 1.1: Scaling Agentic Intelligence for Complex Work (arXiv:2608.23283)
TL;DR
Apodex 의 두 번째 시스템 논문으로, "working capability" — 실세계 목표를 향한 지속적이고 검증 가능한 진척 — 을 정의하고 이를 두 축으로 스케일한다: Environment Scaling(실행 가능한 파일·검색·코드 환경의 다양성과 검증 가능성을 넓힌다)과 Agentic Coordination Scaling(과제를 분해하고, 병렬로 위임하고, 비동기 결과를 통합하고, 다시 계획하도록 에이전트를 학습시킨다). 공유 실행 하네스와 AgentOS 가 도구와 에이전트를 가로질러 과제 상태와 출처를 보관한다. 검증해 볼 값어치가 있는 주장은 이것이다: Apodex 1.1 은 많은 프런티어 시스템보다 실질적으로 작은 모델로도 "선두 성능 대역"에 도달하며, 35B 짜리 Apodex 1.1 Mini 는 로컬 배포 가능한 형태로 강한 working capability 를 유지한다 (source).
저자와 소속
저자 목록은 확인 불가. arxiv.org 는 이 실행의 샌드박스에서 EGRESS_BLOCKED 이며
논문 자체는 읽지 못했다. HuggingFace 스냅숏은 제목·id·날짜·초록만 싣는다
(source).
소속은 확인 가능하며 Apodex 다 — 회사가 자사 블로그에 이 논문을 게시하고
apodex HuggingFace 조직으로 모델을 배포한다
(source).
HuggingFace Daily Papers, 2026-08-26, 172 upvotes 에 등재 — 그 커뮤니티의 인기 신호일 뿐 그 이상은 아니다. 그 수치 기준 그날의 최상단 항목이고 2위의 2.7배인데, 이는 커뮤니티 관심에 관한 사실이지 결과에 관한 사실이 아니다 (source).
방법
논문이 지목하는 간극. 범용 언어 모델은 "추론하고 지식을 종합할 수 있"지만, 복잡한 작업은 파일·정보원·실행 가능한 코드와의 지속적 상호작용, 그리고 상태 유지, 실패 복구, 검증 가능한 인도까지 요구한다. 논문이 그 묶음에 붙인 이름이 working capability 다.
두 개의 스케일 축.
- Environment Scaling — 실행 가능한 파일·검색·코드 환경의 다양성과 검증 가능성을 넓힌다. 검증 가능성이 작동하는 말이다: 결과를 확인할 수 없는 환경은 학습 신호를 내지 못한다.
- Agentic Coordination Scaling — 장기 지평 과제를 분해하고, 병렬 작업을 위임하고, 비동기 결과를 통합하고, 다시 계획하도록 에이전트를 학습시킨다.
상태가 사는 곳. 공유 실행 하네스와 AgentOS 가 도구와 에이전트를 가로질러 과제 상태와 출처를 유지한다. 그런 다음 학습이 "환경 궤적과 협응 흔적을 신뢰할 수 있는 행동으로 바꾼다" — 스캐폴드 자신의 로그가 학습 데이터가 된다.
결과
주장된 영역: 복잡한 전문 업무, 금융, 과학 연구, 수학, 코딩, 검색. 보고된 위치: "선두 성능 대역".
| 주장 | 진술된 그대로 |
|---|---|
| 상대적 모델 크기 | "많은 프런티어 시스템보다 실질적으로 작다" |
| Apodex 1.1 Mini | 35B 파라미터, "로컬 배포 가능" |
| 벤치마크 이름도, 수치도 하나 없다. "선두 성능 대역"이 초록에서 가장 강한 표현이고 그것이 | |
| 정량화되지 않았다 — 플래그십에서도 Mini 에서도 마찬가지다. |
의의
이 위키가 이미 쥐고 있는 논증의 나머지 절반이다. Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence (arXiv:2608.11341) (2026-08-11) 는 평가 쪽을 지었다 — 561개 산업 조사, 423개 문제 정리, 20개 공개, 최종 과제 성공과 독립적으로 채점하는 HDS6. 이번 것은 같은 연구소가 낸 시스템 쪽이다: 그 환경들이 재려고 만들어진 바로 그 solver. 둘을 함께 읽으면 하나의 프로그램이고, 환경이 그 프로그램의 양쪽에 다 있다 — 강점이자 노출점이다.
크기 주장이 흥미로운 쪽이고, 그것이 살아 있는 논쟁 위에 떨어진다. Post-Training Scaling 은 역량이 파라미터 수로 오기를 그쳤다는 Z.ai 의 단언을 싣고 있다. 프런티어 시스템에 맞서 "강한 working capability"를 유지한다고 주장되는 35B 모델은 그에 대한 증거다 — 숫자가 언젠가 나온다면. 오늘로서는 그 페이지가 조심스럽게 다루려고 만들어진 바로 그 형태의 주장이다.
"Working capability"는 측정 단위를 바꾸자는 제안이다. 과제 집합에 대한 정확도가 아니라 목표를 향한 지속적이고 검증 가능한 진척. Eval Harness Configuration 은 벤치마크 숫자가 (모델, 하네스) 쌍에 대한 주장이라는 것을 두 주에 걸쳐 확립해 왔다. 이 논문은 그 쌍을 의도적으로 재자고 제안한다. 같은 날 스냅숏의 One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows (arXiv:2608.19741) 는 반대 방향에서 같은 수를 둔다 — 그 쌍이 얼마나 반복해서 성공하는지를 잰다.
열린 질문
- 어떤 숫자인가? 어느 모델에 대해서도, 어떤 벤치마크에서도, 읽은 어떤 것에도 수치가 하나도 없다. "선두 성능 대역"은 쓰인 그대로는 반증 불가능하다.
- 플래그십은 얼마나 큰가? "많은 프런티어 시스템보다 실질적으로 작다"는 값을 주지 않는다. 진술된 것은 Mini 의 35B 뿐이다.
- 가중치는 공개되었는가? Mini 는 "로컬 배포 가능"이라고 기술되는데, 그것은 같은 진술이 아니다. 이 조직의 이전 Mini (Apodex-1.0-mini, 262k 맥락)는 HuggingFace 에 있지만, 이번 것이 그렇다고 말하는 것은 읽은 어디에도 없다 (source).
- Apodex 1.1 은 Apodex Discovery 자신의 환경에서 평가되었는가? 같은 연구소, 같은 프로그램인데 초록은 말하지 않는다. 그렇다면 "선두 대역" 주장은 한 연구소가 자기 벤치마크에서 자기 점수를 보고하는 것이다.
- AgentOS 란 무엇인가? 상태·출처 계층으로 명명되고 기술되지 않는다.
- 얼마만큼이 협응이고 얼마만큼이 환경인가? 두 개의 스케일 축이 제안되는데 둘을 분리하는 ablation 이 언급되지 않는다.
인용
Apodex 1.1: Scaling Agentic Intelligence for Complex Work (2026). arXiv:2608.23283.
관련
- Apodex
- Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence (arXiv:2608.11341)
- One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows (arXiv:2608.19741)
- Agents (LLM Agents)
- Eval Harness Configuration
- Post-Training Scaling