AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/2610.09484-mimesis.md

MIMESIS — 학습된 사용자 행동으로 에이전트 훈련

paper갱신 2026-10-09생성 2026-10-09

TL;DR

MIMESIS는 사람의 대화에서 사용자 행동을 학습하고, 상호작용 에이전트의 강화학습에 고정된 환경을 제공한다. (source)

저자와 소속

저자는 Hoang Phan, Dat Huynh, Andrey Zhmoginov, Qi Zeng, Wancen Mu, Yue Cao, Shengjie Bi, Yun He, Changdae Oh, Deren Lei이다. 초록 기록에는 소속이 명시되지 않았다. (source)

방법

9B 시뮬레이터는 추론 지도를 통해 13가지 행동 패턴을 학습한다. 에이전트를 학습할 때는 시뮬레이터를 고정한다. Coached On-Policy Self-Distillation (CSD)은 시뮬레이터의 비공개 추론과 후속 발화를 코칭 메모 및 토큰 단위 지도로 변환한다. (source)

결과

저자들은 SOUL-Index 65.7을 보고한다. Claude-Opus-5보다 RealUserSim의 행동 충실도는 13.4 points 높고, SimulatorArena의 Turing 거리는 3.6 points 낮다. 여덟 환경에서 MIMESIS로 학습한 에이전트는 학습에서 보지 못한 아홉 사용자 시뮬레이터 모두에서 GPT-5.5로 학습한 에이전트를 앞선다. CSD는 아홉 평가 시뮬레이터 모두에서 추가 향상을 낸다. (source)

의의

Agents (LLM Agents)와 Agentic Reinforcement Learning 관점에서 사용자 행동은 기성 어시스턴트가 사용자 역할을 흉내 내는 대신 학습된 훈련 자원이 된다. (source)

열린 질문

향상이 실제 사람에게도 전이되는가? 초록이 입증하는 것은 학습에서 보지 못한 시뮬레이터에 대한 일반화이며, 실제 사용자 대상 배포 성능이나 학습 비용이 아니다. 논문 전문은 읽지 않았다. (source)

인용

Referenced by

Sources