$ cat briefs/daily/2026-10-07.md
2026-10-07
2026년 10월 7일 (수)
주요 소식 3개 · 논문 선정 2개 · 신규 페이지 4개
주요 소식
1. Ironclad가 업무 흐름 요구사항을 학습 대상으로 만든다
OpenAI는 계약 업무 11개에서 Astra가 55.0%, GPT-5.6 Sol이 **41.6%**를 기록했다고 보고한다. 이는 평가 기준 점수이며, 추론 설정도 다르다. 시도당 19.2분 대 37.0분이라는 시간은 시뮬레이션 추정치이며, 고객이 실제로 절약한 시간이 아니다.
의의: 소프트웨어 협력사는 현실적인 연습 환경과 명시적인 성공 기준을 함께 제공할 수 있다. → Astra (source)
2. Anthropic이 검증된 사이버 접근을 확대한다
CVP는 이제 Defense, Red Team, Specialized Access 등급으로 구성된다. CyScenarioBench에서 Opus 5.5의 Defense 등급은 50회 중 46회를 차단한다. Red Team 등급은 차단 없이 50회 중 34회를 완료한다.
의의: 안전장치 설정에 따라 동일 모델에서 관측되는 결과가 크게 달라진다. → AI-Enabled Cyberattacks (source)
3. Mistral Large 4가 공개 미리보기로 제공된다
API를 이용할 수 있으며, 가중치는 10월 말까지 공개하겠다고 약속했다. Mistral은 **DeepSWE v1.1 61.7%**와 **AutomationBench 59.9%**를 보고한다. 출시 발표문과 문서의 매개변수 수치가 달라 위키는 두 설명을 모두 보존한다.
의의: 에이전트 업무에 유럽의 선택지가 추가됐지만, 다운로드 가능한 가중치는 여전히 향후 약속이다. → Mistral Large 4 (launch) (documentation)
논문 선정
UndoBench — 완료만으로 안전한 복구를 입증할 수 없다. 정상 수행 역량은 83.54%, 조건부 복구는 **46.72%**에 도달하며, 단순 재시도는 시험의 **53.33%**에서 외부 효과를 중복 발생시킨다. 반사실적 장애 시험 방법을 살펴볼 만하다. 결과는 변경이 일어나는 시점에 따라 달라진다. → UndoBench: Separating Task Competence from Recovery Capability in Tool-Using AI Agents (source)
자체 생성한 피드백이 테스트 시점 학습을 불안정하게 만들 수 있다. 학습 텍스트 생성기를 동결하면 시험한 두 구성에서 손상의 98% 초과가 제거된다. 인과적 통제와 가중치 업데이트를 유지하기 전 독립적인 실제 텍스트를 검사하는 방법을 살펴볼 만하다. 모든 추가 추론 연산에 반대하는 결과는 아니다. → Self-Generated Feedback Destabilizes Test-Time Training: A Causal Decomposition of Long-Horizon Adaptation (source)
주시
- EmbeddingGemma 2: Google이 모듈형 인코더와 8K 컨텍스트를 갖춘 740M, Apache 2.0 멀티모달 임베딩 모델을 출시했다. 로컬 검색에 유용한 선택지이며, 보고된 메모리는 기기와 양자화에 따라 달라진다. → EmbeddingGemma 2 (source)
- 수학 결과 공개: OpenAI가 내부 모델의 새 결과에 대한 Lean 형식화, 추론 요약과 연산량 추정을 발표했다. 발표문은 모든 증명이 형식화됐다고 확정하지 않는다. → AI for Mathematics (source)
위키 신규
- Mistral Large 4와 EmbeddingGemma 2 — 출시 기록과 출처의 한계. (Mistral) (Google)
- UndoBench: Separating Task Competence from Recovery Capability in Tool-Using AI Agents와 Self-Generated Feedback Destabilizes Test-Time Training: A Causal Decomposition of Long-Horizon Adaptation — 방법과 미해결 질문. (recovery) (adaptation)
갱신
- Agents (LLM Agents)에 업무 흐름 채점과 복구 평가의 연결을 추가했다. (source)
- Test-Time Compute (Inference-Time Compute Scaling)에서 고정 가중치 추론과 가중치를 바꾸는 적응을 구분한다. (source)