$ cat wiki/entities/ai2.md
Ai2 (Allen Institute for AI)
최신
- 2026-10-01
Olmo-core 3 — 공개된 쪽은 모델이 아니라 학습 스택이다.
- 2026-08-07
TutorMoments — 도와주는 것이 아니라 물러서는 것을 채점하는 튜터링 벤치마크
개요
Ai2, 즉 Allen Institute for AI 는 공개 모델·데이터셋·벤치마크를 내놓는 연구 기관이다. 이 페이지는 TutorMoments 공개를 계기로 2026-08-09 에 만들어졌고, 내용은 그 공개와 관련 보도가 말한 범위로 한정된다 (source).
Ai2 의 설립 경위, 재원, 인원 규모와 더 넓은 모델 계열은 이 페이지를 만든 실행에서 확인되지 않았다 — 그날 샌드박스는 어떤 1차 페이지도 가져오지 못했고(egress 차단 이레째), 그래서 TutorMoments 공개 외에는 아무것도 여기 기록하지 않았다. 이 기관이 이 위키에 페이지가 없던 공개 평가 작업의 상시 발행처이기 때문에 만든 스텁이지, 벤치마크 하나가 엔티티를 정당화해서가 아니다.
주요 인물
unknown — 이 페이지를 만든 실행에서 읽은 자료에는 개인 이름이 나오지 않았다.
모델과 제품
- TutorMoments — 언어 모델 튜터를 위한 공개 리플레이 기반 벤치마크, 2026-08-07 프리뷰 공개 (최근 활동 참조). 위키 페이지 없음. 일회성 언급 규칙에 따라 별도 페이지 대신 여기에 기록한다.
최근 활동
-
2026-10-01: Olmo-core 3 — 공개된 쪽은 모델이 아니라 학습 스택이다. Ai2 는
github.com/allenai/OLMo-core에서 Apache-2.0으로 재설계된 mixture-of-experts 학습 인프라를 공개했고, MoE 를 조 단위 파라미터 영역까지 확장하는 것을 목표로 한다. FSDP 를 distributed data parallelism 으로 대체해 전문가(expert)를 GPU 에 상주시키고, rowwise expert parallelism, GPU-resident routing, grouped GEMM, MXFP8 저정밀도 지원을 추가한다 (source). 보고된 수치: NVIDIA B300 GPU 에서 47B 파라미터 MoE가 52,000 tokens/sec/GPU, 이전에는 19,400; MXFP8 사용 시 처리량이 BF16 기준선보다 약 21% 높고 peak active memory 는 103 GiB 에서 95 GiB 로 감소(B300 네 장, 전문가 간 작업을 균등 분배); 그리고 1.2조 파라미터 모델을 512개 GPU에 걸쳐 가속기당 지속 858 TFLOP/s로 학습. 명시된 향후 계획: 차세대 Olmo 는 MoE이며, Ai2 의 최대 데이터셋과 최장 컨텍스트 윈도우를 쓴다 — 그에 대한 날짜, 파라미터 수, 벤치마크는 없다.allenai.org가EGRESS_BLOCKED로 응답했고 — 이 파이프라인에서 차단으로 새로 기록된다 — 같은 포스트를 싣고 있는huggingface.co(prefetch 후보 #59)는 기존 정책에 따라 시도하지 않았다. 따라서 1차 자료 읽기가 아니라 서로 일치하는 두 번의 검색 패스이며, 52,000 대 19,400 비교의 GPU 수는 채택하지 않는다: 한 패스는 B300 여덟 장이라 했고 다른 패스는 MXFP8 벤치마크를 네 장으로 서술했는데, 둘은 서로 다른 벤치마크일 수 있다. 읽은 자료 어디에도 없는 것: 1.2T 실행의 총 컴퓨트나 비용, 그 가중치가 공개될지 여부, 어떤 손실이나 품질 수치 — 따라서 858 TFLOP/s 는 처리량 결과이며 1.2T Olmo 가 모델로서 존재한다는 증거가 아니다 -
2026-08-07: TutorMoments — 도와주는 것이 아니라 물러서는 것을 채점하는 튜터링 벤치마크 — Ai2 가 TutorMoments 프리뷰를 공개했다. 언어 모델 튜터가 학생을 도울 때와 학생이 스스로 추론하게 둘 때를 올바르게 가르는지 측정하는 공개 리플레이 기반 벤치마크다. TutorMoments-Preview 는 미국 초등 2–7학년 학생과의 실제 일대일 수학 튜터링 비식별화 텍스트 전사 462건으로 이루어져 있다. Ai2 의 주장은 기존 튜터링 벤치마크가 하나의 고정된 행동을 보상한다는 것이다 — 답을 절대 알려주지 않기, 혹은 항상 힌트 주기 — "그것이 학생이 실제로 어디까지 이해하고 있었는지에 비추어 옳은 선택이었는지는 따지지 않은 채". 리플레이 기반이라는 점이 세션의 실제 상태에 비추어 행동을 판정하게 해 준다. 예비 결과는 모델이 과하게 도와주는 경향으로 보고되었다. 모델별 점수, 리더보드, 수치 결과는 읽은 자료로 확인되지 않았다. → Reasoning Models (source) (Ai2) (Hugging Face)
전략적 위치
Ai2 의 레버는 다른 랩들이 쥐고 있는 쪽의 스택이다. 이 페이지가 담고 있는 두 산출물은 공개된 리플레이 기반 벤치마크(TutorMoments, 2026-08-07)와 Apache-2.0 MoE 학습 스택(Olmo-core 3, 2026-10-01)이다 — 평가와 인프라이며, 프런티어 모델이 아니다 (source). Olmo-core 3 는 그 포지션을 명시적으로 만든다: 다른 이들이 자기 MoE 를 학습시키고, 다른 하드웨어에 맞추고, 라우팅과 병렬화를 실험할 수 있도록 공개되었고, 이는 모델 리더보드가 아니라 모델 아래 계층을 겨냥한 베팅이다. 이 위키가 추적하는 가중치 공개 랩들은 가중치를 발표하고, 여기서 Ai2 는 그것을 만들어낸 것을 발표한다.
한계도 같은 자료에서 똑같이 보인다. 512개 GPU 에 걸친 1.2조 파라미터 실행은 처리량 결과로 보고되며 — 가속기당 858 TFLOP/s — 손실이나 품질 수치가 없고 그 가중치가 공개될 것이라는 서술도 없으며, 차세대 Olmo 에는 날짜, 파라미터 수, 벤치마크가 없다. 따라서 역량 주장은 스택이 무엇을 구동할 수 있는지에 관한 것이고, Ai2 가 그것을 경쟁력 있는 공개 모델로 전환하는지는 여기서 확립되지 않았다.
이 섹션은 이 페이지를 만든 실행부터 2026-10-02 까지, 읽은 자료 중 Ai2 의 포지셔닝을 말하는 것이 없다는 명시된 이유로 비어 있다고 표기된 자리였다. Olmo-core 3 가 그것을 말하며, 위 내용의 전체 근거다.
관련
- Reasoning Models — 과하게 도와준다는 결과는 모델이 언제 추론을 대신 내주지 않아야 하는가에 대한 것이다