AI Trend Notifier
EN한
← 아카이브

$ cat briefs/daily/2026-10-10.md

2026-10-10

2026년 10월 10일 (토)

주요 소식 2건 · 추천 논문 2편 · 새 페이지 4개

+4new pages
[01]

주요 소식

1. Asana의 브라우저 에이전트 비용 절감은 캐시 재사용 유지에서 시작된다

Asana의 144회 실행 연구는 이력 캐싱, 스크린샷 일괄 제거, 더 큰 텍스트 예산을 결합한다. 최적화만으로 기존 모델의 비용이 29x 줄며, 대표 수치인 76x에는 GPT-6.1 Sol로의 전환도 포함된다. 기준선 실행 일부가 한도에 걸렸으므로 감소 배수는 하한이며, 작은 표본은 세밀한 비교를 제한한다.

의의: 이력 정책이 에이전트 비용을 좌우할 수 있으므로, 비용 비교에는 모델과 업무 흐름을 함께 명시해야 한다. → Asana (source)

2. Qwen이 여덟 단계 이미지 체크포인트와 호스팅 API를 공개했다

Qwen-Image-2.1-Turbo는 8회 잡음 제거 단계로 이미지를 생성하고 편집하며, Pro/Turbo API가 제공 중이라고 발표되었다. 저장소의 연구 라이선스는 비상업적 용도에 한정되지만, 별도의 Turbo 모델 카드는 확인하지 않았다. 체크포인트별 조건과 API 가격은 검증되지 않았다.

의의: 다운로드와 호스팅이라는 배포 경로를 이용할 수 있지만, 단계 수만으로 지연 시간이나 품질이 입증되지는 않는다. → Qwen-Image-2.1-Turbo (release) (repository license)

[02]

추천 논문

TestPrism — 테스트는 다른 올바른 구현도 수용해야 한다. 기준 구성 열네 가지에서 공동 성공률은 28.00%, 단일 참조 기준으로는 **59.67%**다. 놓친 버그와 부당한 실패 판정을 함께 평가하는 방법을 살펴볼 만하다. 초록은 TestHelix의 보고된 개선에 대해 비용을 맞춘 비교를 제시하지 않는다. → TestPrism: Rethinking Test Evaluation Beyond a Single Reference (source)

Memento 3 — LLM을 고정한 채 규칙집을 수정한다. 검증된 실행 가능 세계 모델이 공개 ARC-AGI-3 게임 25개의 모든 단계를 완료하며, 사람 행동 수의 **44%**로 평균 RHAE 100.0을 기록한다. 재현 기반 검증을 살펴볼 만하며, 비공개 시험 결과나 전체 비용 측정치는 아니다. → Memento 3: Model-Based Recursive Self-Improvement through Reflective Rulebooks (source)

[03]

주시할 동향

  • REMORY: 학습된 소프트 메모리가 텍스트 요약을 보완한다. 저자들은 SummHay에서 입력 위치의 **5.2%**만으로 전체 맥락의 공동 점수에 접근한다. 초록은 학습 비용과 전체 과정의 비용을 명시하지 않는다. → Context Compaction (source)
[04]

위키에 새로 추가

[05]

업데이트

  • Astra에 사람의 검토와 기록 보존을 수반하는 실험 실행을 추가했다. (source)
  • World Models에서 재현 일관성과 미관측 상태 일반화를 구분한다. (source)