AI Trend Notifier
EN한
← 아카이브

$ cat briefs/daily/2026-10-08.md

2026-10-08

2026년 10월 8일 (목)

주요 소식 3건 · 선정 논문 2편 · 새 페이지 5개

+5new pages
[01]

주요 소식

1. Haiku 5.5가 범위가 한정된 에이전트 작업의 진입 가격을 낮춘다

Anthropic은 프롬프트가 100K 토큰 이하일 때 입력 $0.10/M, 출력 $0.50/M를 부과한다. 그 이상이면 요금이 $0.50/$2.50로 오른다. 출시 발표는 **OSWorld 2.1 오프라인 부분집합에서 72.4%**를 보고한다. 이전 시 주의가 필요하다. 동일한 텍스트가 Haiku 4.5보다 약 30% 더 많은 토큰을 사용하며, 사고 설정도 바뀐다.

의의: 저렴한 하위 에이전트가 실용적인 선택지가 되지만, 짧은 프롬프트의 요금과 벤치마크 부분집합이라는 조건을 주장과 함께 유지해야 한다. → Claude Haiku 5.5 (launch) (migration)

2. Liquid AI가 공개 의사결정 모델을 출시한다

d1-3B는 텍스트/이미지를, 실험용 d1-omni-600M은 텍스트와 이미지 또는 오디오를 처리한다. 둘 다 토큰을 생성하지 않고 결정을 반환한다. Liquid는 Decision Index v0.2.1 공개 분할에서 각각 48.57과 15.95를 보고한다. 비공개 시각 분할 결과는 공개하지 않았다.

의의: 로컬 시스템이 텍스트 생성 반복 없이 구조화된 멀티모달 결정을 내릴 수 있다. → d1-3B · d1-omni-600M (source)

3. GPT-6가 생성형 인터페이스를 ChatGPT Chat에 도입한다

Intelligent UI는 텍스트와 점진적으로 표시되는 상호작용 구성요소를 결합한다. 유료 등급 배포는 October 7에 시작했고, Free/Go는 October 8에 시작하며, 각각 대화용으로 조정한 Sol과 Luna를 사용한다. Work와 Codex 모델은 바뀌지 않는다.

의의: 대화 안에서 답변이 사용할 수 있는 인터페이스가 된다. 이번 발표는 API 요금표가 아니라 Chat의 이용 범위를 바꾼다. → OpenAI (source)

[02]

논문 선정

CheckerBench — 패치에 그치지 않고 검사기를 만든다. 작업 300개와 모델·하네스 조합 21개에서 평균 Pass@1은 32.30%, 최고는 **45.33%**다. 독립적인 재빌드와 오탐 평가를 살펴볼 만하며, 초록에는 우승한 조합이 명시되어 있지 않다. → CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers? (source)

SafeActBench — 행동 전에 근거가 있었는가? 사례 656개에서 조사, 선행 조건과 실행을 추적한다. 정적 판단은 강해 보여도 상호작용 행동은 실패할 수 있다. 정확한 결과와 정당화된 행동의 차이를 살펴볼 만하다. 초록에는 수치화된 성공률이 없다. → From Evidence to Action: How Tool-Using Agents Fail (source)

[03]

주시

  • TRACE: 롤아웃 유도 FP4 학습이 MoE 모델 네 개에서 BF16에 견줄 만한 RL 성능과 최대 5.4x 롤아웃 속도 향상을 보고한다. 전체 학습의 속도 향상을 뜻하지는 않는다. → Agentic Reinforcement Learning (source)
[04]

위키 신규

[05]

갱신

  • Claude Sonnet 5.5의 캐시 읽기가 $0.20/M에서 $0.10/M로 인하되었다. Anthropic은 대부분의 에이전트 작업에서 약 20% 낮은 비용을 추정하며, 절감 폭은 작업량에 따라 달라진다. (source)