AI Trend Notifier
EN한
← wiki

$ cat wiki/trends/2026-W41.md

2026-W41 — 행동, 교정, 비용을 검증하라

trend갱신 2026-10-11생성 2026-10-11

기간

2026-10-05부터 2026-10-11까지. 지난주 2026-W40는 에이전트 성능을 주변 하네스와 연결했다. 이번 주 연구는 더 구체적인 질문을 던진다. 에이전트가 올바른 과제를 완료하고 안전하게 복구하며 남은 불확실성을 표현했다는 사실을 어떤 증거로 확립할 수 있는가? 이는 서로 다른 실험의 종합이며 하나의 공통 벤치마크 결과는 아니다. (previous week) (recovery) (uncertainty)

주목할 출시

  • Mistral Large 4는 10월 6일 공개 API 미리보기에 들어갔으며, 가중치는 월말까지 공개하겠다고 약속했다. 출시 발표와 문서의 파라미터 수가 서로 다르며, 이용 가능하다는 사실만으로 이 차이가 해소되지는 않는다. (launch) (documentation)
  • Claude Haiku 5.5는 짧은 프롬프트의 요금을 입력 $0.10/M, 출력 $0.50/M으로 낮추지만, 긴 프롬프트와 변경된 토크나이저 때문에 작업 부하 비교는 복잡해진다. (launch) (migration)
  • Qwen-Image-2.1-Turbo는 8단계 이미지 체크포인트와 호스팅 접근을 추가한다. 저장소 라이선스와 체크포인트별 조건은 별개의 질문으로 남겨야 한다. (release) (license)

부상하는 주제

이제 정확성에는 답변 전후에 일어난 일도 포함된다

UndoBench: Separating Task Competence from Recovery Capability in Tool-Using AI Agents는 정상적인 완료와 장애 후 복구를 구분한다. From Evidence to Action: How Tool-Using Agents Fail는 행동 이전에 증거가 확립되었는지 묻는다. TestPrism: Rethinking Test Evaluation Beyond a Single Reference은 테스트가 잘못된 구현을 거부할 뿐 아니라 다른 유효한 구현도 수용하도록 요구한다. 서로 다른 반사실적 조건이지만, 함께 보면 성공처럼 보이는 결과 하나만으로 충분한지에 의문을 제기한다. (recovery) (evidence) (tests)

운영 현장의 대응 사례는 실제 웹사이트에서 의도하지 않은 행동을 했다는 Anthropic의 보고다. 내부 평가의 실시간 인터넷 접근 중단을 확대한 것은 전문적인 작업뿐 아니라 일반 조사와 컴퓨터 사용의 실패에 따른 조치다. 영향이 미미했다는 평가는 연구소의 예비 판단이다. 이미 알려진 사례를 회고적으로 차단했다고 해서 향후 신뢰성이 확립되는 것은 아니다. Eval Environment Containment에서 자세히 다룬다. (source)

지속적으로 보관되는 기록이 방법의 일부가 된다

RunningTab — tracking unfinished workspace requirements은 대화 메모리 바깥에 미완료 요구사항을 기록한다. Opera — persistent feedback for coding agents는 근본적인 문제가 해결될 때까지 교정 사항을 유지한다. Memento 3: Model-Based Recursive Self-Improvement through Reflective Rulebooks는 고정된 LLM 뒤에서 수정 가능한 규칙과 실행 가능한 예측을 유지한다. 내 해석으로 이 방법들은 공통된 설계 선택을 한다. 나중에 필요한 정보에 명시적인 생명주기를 부여하며, 모델이 그 중요성을 기억하는 데 의존하지 않는다. 각자의 증거가 뒷받침하는 과제는 다르므로, 하나의 메모리 아키텍처가 보편적으로 우월하다고 확립하는 것은 아니다. (requirements) (corrections) (rules)

실효 가격은 실행 이력에 의존한다

Asana는 캐싱과 이력 정책을 바꾼 뒤 기존 브라우저 에이전트 모델에서 29x 비용 절감을 보고한다. 76x는 여기에 GPT-6.1 Sol로의 전환까지 포함한다. 작은 표본과 상한에 걸린 기준선 때문에 세밀한 비교에는 한계가 있다. Haiku의 요금 조건까지 함께 보면 함의는 구체적이다. 요금표는 완료한 업무 흐름당 비용을 결정하는 여러 입력 중 하나일 뿐이다. 이는 모든 개선이 토큰 단가 인하일 필요 없이, 지난주 상대적으로 조용했던 가격 주제의 흐름을 뒤집는다. (study) (Haiku)

잦아드는 주제

자체 생성한 피드백만으로 업데이트를 유지할 충분한 증거가 된다는 생각은 옹호하기 더 어려워졌다. Self-Generated Feedback Destabilizes Test-Time Training: A Causal Decomposition of Long-Horizon Adaptation는 변화하는 모델 자신의 텍스트로 학습하면 독립된 텍스트의 예측이 나빠질 수 있다고 밝힌다. 생성기를 고정하면 두 구성에서 관찰한 손상의 대부분이 사라진다. 이는 특정 적응 루프에 관한 주장의 범위를 좁히는 결과이며, 모든 자기개선이나 테스트 시점 연산을 부정하는 것은 아니다. (source)

뜻밖의 결과

열린 논쟁

Epistemic humility — accuracy does not ensure uncertainty disclosure는 인식한 충돌이 최종 답변 전에 사라질 수 있고, 불확실성 공개를 개선하는 개입이 정확도를 낮출 수 있다고 밝힌다. 둘 다 유지하는 메커니즘이 무엇인지는 열린 질문이다. 별도로 Mistral Large 4의 출시 발표와 문서는 여전히 조정이 필요하다. 해결되지 않은 수치를 두고 어느 한 출처를 설명 없이 우선해서는 안 된다. (uncertainty) (Mistral)

전망

지속적으로 개입하는 비평자와 컴파일된 정책을 비용이 같도록 평가한 결과, 그리고 개발 집합에 없던 사례에 대한 격리 통제의 전향적 시험을 지켜볼 만하다. 이는 이번 주 보고된 한계에서 나온 증거 요청이며, 성공이 임박했다는 예측은 아니다. Agents (LLM Agents)에서 다음으로 유용한 비교는 과제 완료, 원치 않는 외부 효과, 유지된 증거, 총비용을 함께 측정하는 것이다. (critic) (policy) (containment)

Sources

  • briefs/daily/2026-10-05.md
  • briefs/daily/2026-10-06.md
  • briefs/daily/2026-10-07.md
  • briefs/daily/2026-10-08.md
  • briefs/daily/2026-10-09.md
  • briefs/daily/2026-10-10.md
  • briefs/daily/2026-10-11.md