AI Trend Notifier
EN
← wiki

$ cat wiki/concepts/embodied-agents.md

체화 에이전트 (Embodied Agents)

정의

물리 세계 또는 시뮬레이션 환경에서 perception 과 actuation 을 통해 행동하는 에이전트. 순수 텍스트 출력 LLM 과 달리 multi-modal perception API + actuation API + skill library 구조 필요.

왜 중요한가

  • agents 매칭 (1.5x) × robotics 교차 — 본인 관심사 인접
  • LLM 의 software 적용을 넘어선 next frontier
  • 2026 핵심 흐름: NVIDIA Project GR00T, DeepMind robotics 연구

현재 수준 (2026-08-21)

  • Zetta ζ — 하네스가 루프를 닫고, 정책은 고정된다 (2026-08-17, 08-21 기록)Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence (arXiv:2608.16590) 는 베이스 정책을 건드리지 않은 채 코드 기반의 런타임 크리틱과 복구 스킬을 온라인으로 진화 시키며, 시간 척도가 분리된 세 루프가 이를 통제한다: 행동 주파수 통제, 롤아웃 수준의 크리틱·복구 제안, 검증 게이트를 통과한 스킬 갱신. LIBERO-Pro 90.8%, RoboCasa 93.6%, 11.1배 추론 속도 향상 을 보고하며, 두 성공률 모두 "현재 우리의 롤아웃 예산 하에서" SOTA 라고 명시된다 — 그 예산이 공개되지 않았고 두 수치 모두 거기 스코프가 걸려 있으므로 단서를 그대로 둔다. 전제는 역량이 아니라 주파수 논변이다: 기존 embodied 하네스는 오픈 루프 로 에피소드가 끝난 뒤에야 반추하는데, 물리적 상호작용은 오늘날의 대형 에이전틱 모델이 낼 수 있는 빈도를 넘어서는 결정을 요구한다 — 그래서 빠른 루프를 생성된 코드에 넣고 느린 모델이 그 코드를 쓴다. 이는 DarwinX: Evolving Agent Harnesses Through Natural Selection (arXiv:2608.07545) 패턴(하네스를 진화시키고 모델을 고정)이 소프트웨어에서 물리 제어로 건너온 것이며, 그 클러스터에서 하네스를 옹호하는 논거가 벤치마크 여유에 관한 것이 아닌 유일한 자리다. "Aha Moments" 와 제로샷 스킬 전이는 횟수도 대상 과제도 없이 단언된다 (source)

  • Google DeepMind Gemini Robotics 2 (2026-07-28 / 2026-07-30) — 3종 모델: 휴머노이드 전신(다리, 몸통, 팔, 다지 손)을 하나의 학습된 정책으로 제어하는 VLA, 체화 추론 VLM, 그리고 온디바이스 VLA. Apollo 2 휴머노이드 전신 조작은 선반에서 집기 76.3%, 바닥에서 집기 45.7%. 22 자유도 SharpaWave 손의 정밀 손동작은 전구 풀기 92%, 쓰레기봉투 묶기 44%, 지퍼백 밀봉 40%, 전구 끼우기 36%, 쓰레받기 32%. On-Device 2 는 200 개 미만의 시연으로 몇 시간 안에 새 체화에 적응한다. 추론 계층이 행동 계층의 위험한 명령을 거부하는지, 물리적 가능성을 판단하는지, 불확실할 때 사람의 도움을 요청하는지 평가하는 오픈 벤치마크 ASIMOV-Agentic 과 함께 공개되었다. 의의: 정밀 손동작 편차가 이 분야의 현재 수준을 표 하나로 보여준다 — 전구를 빼는 일은 거의 해결되었고 끼우는 일은 아니며, 변형체는 맨 아래에 있다. 어느 계층이 배포되었는지도 함께 보라. 추론 모델은 Gemini API 로 공개되고 행동 모델 둘은 얼리 액세스 한정이다. → Gemini Robotics 2, Gemini Robotics ER 2 (source)

  • GRANT / ORS3D — 체화의 목적함수가 된 스케줄링 (AAAI 2026 Oral; 2026-07-30 HF Daily 1위) — arXiv 2511.19430 은 병렬화 가능한 하위 과제를 동시에 돌려 총 완료 시간을 최소화하는 ORS3D 를 정의하고(전자레인지가 도는 동안 싱크대 닦기), ORS3D-60K(60K 복합 과제, 4K 장면) 위에서 스케줄링 토큰을 가진 체화 멀티모달 LLM 을 학습시킨다. Time Efficiency +30.53%, 3D grounding +1.38%. 의의: 비대칭이 요점이다 — 접지는 거의 움직이지 않고 스케줄링은 크게 움직인다. 행동당 신뢰도가 올라갈수록 다단계 물리 과제에 남는 여지는 지각이 아니라 순서다. → Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution (GRANT) (source)

  • Mistral Robostral Navigate (2026-07-08) — 8B 로보틱스 내비게이션 모델. 단일 RGB 카메라와 자연어 프롬프트만 쓰고 깊이 센서도 LiDAR 도 없다. R2R-CE validation unseen 76.6% 달성 — 신규 SOTA(기존 최고 단일 카메라 대비 +9.7점, 최고 깊이·다중 카메라 대비 +4.5점). CISPO 온라인 RL 로 시뮬레이션 전용 훈련(+3.2%). 포인팅 기반 예측(이미지 좌표 → 목표 + 방향)이라 카메라 내부 파라미터 변화에 자연히 강건하다. 하드웨어 비종속. Mistral 의 첫 물리 AI 제품. 의의: 내비게이션의 sim-to-real 전이가 이제 RGB 만으로 실제 로봇에서 훈련한 깊이 센서 시스템을 이길 만큼 강해졌음을 보여준다. 배치의 하드웨어 문턱을 낮춘다. → Robostral Navigate (source)

  • NVIDIA ENPIRE — 실제 하드웨어에서의 에이전틱 로봇 자기개선 (2026-06-17) ⚡ 지연 수집 — Jim Fan 의 NVIDIA GEAR Lab 이 CMU·UC Berkeley 와 함께 ENPIRE 를 공개했다. 실제 로봇 8대 플릿이 자체 연구 루프(논문 읽기 → 가설 수립 → 시행 → 검증 → 코드 재작성)를 자율 수행하며 인간은 루프에 없다. 접촉이 많은 과제에서 pass@8 99%. 새 발견: 물리적 스케일링 법칙 — 병렬 로봇 8대가 더 적은 대수보다 정책을 초선형으로 빠르게 개선한다. LLM 시대의 데이터 병렬 스케일링 패러다임이 스킬 획득을 넘어 실세계 물리 조작 연구로 전이된다는 첫 시연. EgoScale 의 루프를 닫는다 — EgoScale 은 1인칭 영상에서 스킬을 획득하고, ENPIRE 는 그것을 자율적으로 개선한다. → ENPIRE: Agentic Robot Policy Self-Improvement in the Real World, Jim Fan (source) (arXiv)

  • NVIDIA EgoScale — 1인칭 영상으로 만든 정밀 조작 휴머노이드 (2026-06-07) ⚡ 신규 — Jim Fan 팀이 22-DoF 정밀 손을 가진 휴머노이드를 전부 2만 시간 이상의 1인칭 인간 영상만으로 훈련했다(로봇 원격조작 없음). 과제: 모형차 조립, 주사기 조작, 카드 분류, 셔츠 개기. 핵심 결과: 로그-선형 스케일링 법칙(R² = 0.998) — 인간 영상 분량 → 행동 예측 손실 → 실제 로봇 성공률. LLM 데이터 스케일링 패러다임이 정밀한 물리적 조작으로 직접 전이된다는 첫 강력한 실증. 가중치·코드·데이터셋·평가셋·백서 전부 오픈소스. → Jim Fan (source)

  • NVIDIA Cosmos 3 (2026-06-01) ⚡ 신규 — 세계 최초 완전 오픈 omnimodal physical AI foundation model. 64B (Super), Nano, Edge. MoT 아키텍처: 세계 생성 + 물리 추론 + 행동 예측 통합. R-Bench #1 오픈 모델. MIT 라이선스. Cosmos Coalition (Agile Robots, Runway, Black Forest Labs 등). → Cosmos 3 Super (source)

  • Gemini Robotics-ER 1.6 (2026-04-15) — Google DeepMind. 계기판 읽기 정확도 23%→93% (agentic vision 파이프라인). Boston Dynamics Spot 협업. 산업 현장 자율 점검 임계값 교차. Gemini API 공개. → Gemini Robotics ER 1.6 (source)

  • CaP-X (2026-04) — NVIDIA Jim Fan 팀 오픈소스. "Vibe agents alive in the physical world". Robot arms + humanoids, auto-synthesize skill libraries. (source)

  • Project GR00T — NVIDIA 의 휴머노이드 로봇 파운데이션 모델

  • DrEureka — LLM 이 robot skill training code 작성 (Jim Fan 팀)

  • Voyager — Minecraft 환경 평생 학습 에이전트

아키텍처 패턴

  • No-gradient orchestration: LLM 이 "prefrontal cortex" 로 high-level reasoning, lower-level control 은 code-gen 으로 위임
  • Skill library: 학습/생성한 스킬을 retrievable library 로 누적
  • Perception + actuation API 분리 — 환경 추상화

열린 문제

  • 시뮬레이션→실물 전이(sim-to-real)
  • 실세계 RL 의 샘플 효율
  • Skill library 의 generalization vs specialization 트레이드오프
  • 물리 구동에서의 안전
  • 멀티에이전트 협조

주요 소스

관련 개념

열린 논쟁

  • LLM-orchestrated 구조 vs end-to-end neural control — Jim Fan/NVIDIA 는 전자 강력 지지. 학계 일부는 후자 (e.g., Sergey Levine 그룹) 주장.

Referenced by

Sources