AI Trend Notifier
EN한
← 아카이브

$ cat briefs/daily/2026-10-07.md

2026-10-07

2026년 10월 7일 (수)

주요 소식 3개 · 논문 선정 2개 · 신규 페이지 4개

+4new pages
[01]

주요 소식

1. Ironclad가 업무 흐름 요구사항을 학습 대상으로 만든다

OpenAI는 계약 업무 11개에서 Astra가 55.0%, GPT-5.6 Sol이 **41.6%**를 기록했다고 보고한다. 이는 평가 기준 점수이며, 추론 설정도 다르다. 시도당 19.2분 대 37.0분이라는 시간은 시뮬레이션 추정치이며, 고객이 실제로 절약한 시간이 아니다.

의의: 소프트웨어 협력사는 현실적인 연습 환경과 명시적인 성공 기준을 함께 제공할 수 있다. → Astra (source)

2. Anthropic이 검증된 사이버 접근을 확대한다

CVP는 이제 Defense, Red Team, Specialized Access 등급으로 구성된다. CyScenarioBench에서 Opus 5.5의 Defense 등급은 50회 중 46회를 차단한다. Red Team 등급은 차단 없이 50회 중 34회를 완료한다.

의의: 안전장치 설정에 따라 동일 모델에서 관측되는 결과가 크게 달라진다. → AI-Enabled Cyberattacks (source)

3. Mistral Large 4가 공개 미리보기로 제공된다

API를 이용할 수 있으며, 가중치는 10월 말까지 공개하겠다고 약속했다. Mistral은 **DeepSWE v1.1 61.7%**와 **AutomationBench 59.9%**를 보고한다. 출시 발표문과 문서의 매개변수 수치가 달라 위키는 두 설명을 모두 보존한다.

의의: 에이전트 업무에 유럽의 선택지가 추가됐지만, 다운로드 가능한 가중치는 여전히 향후 약속이다. → Mistral Large 4 (launch) (documentation)

[02]

논문 선정

UndoBench — 완료만으로 안전한 복구를 입증할 수 없다. 정상 수행 역량은 83.54%, 조건부 복구는 **46.72%**에 도달하며, 단순 재시도는 시험의 **53.33%**에서 외부 효과를 중복 발생시킨다. 반사실적 장애 시험 방법을 살펴볼 만하다. 결과는 변경이 일어나는 시점에 따라 달라진다. → UndoBench: Separating Task Competence from Recovery Capability in Tool-Using AI Agents (source)

자체 생성한 피드백이 테스트 시점 학습을 불안정하게 만들 수 있다. 학습 텍스트 생성기를 동결하면 시험한 두 구성에서 손상의 98% 초과가 제거된다. 인과적 통제와 가중치 업데이트를 유지하기 전 독립적인 실제 텍스트를 검사하는 방법을 살펴볼 만하다. 모든 추가 추론 연산에 반대하는 결과는 아니다. → Self-Generated Feedback Destabilizes Test-Time Training: A Causal Decomposition of Long-Horizon Adaptation (source)

[03]

주시

  • EmbeddingGemma 2: Google이 모듈형 인코더와 8K 컨텍스트를 갖춘 740M, Apache 2.0 멀티모달 임베딩 모델을 출시했다. 로컬 검색에 유용한 선택지이며, 보고된 메모리는 기기와 양자화에 따라 달라진다. → EmbeddingGemma 2 (source)
  • 수학 결과 공개: OpenAI가 내부 모델의 새 결과에 대한 Lean 형식화, 추론 요약과 연산량 추정을 발표했다. 발표문은 모든 증명이 형식화됐다고 확정하지 않는다. → AI for Mathematics (source)
[04]

위키 신규

[05]

갱신