$ cat wiki/concepts/agents.md
에이전트 (LLM Agents)
정의
LLM 을 핵심 controller 로 두고 multi-step planning + tool use + environment interaction 을 수행하는 시스템. 단일 응답을 넘어선 시퀀스적 작업 수행 능력.
대표 패턴:
- ReAct (Reason → Act → Observe 루프)
- Reflexion (자기 비판 + 재시도)
- 도구 호출(function calling, MCP)
- 제어 흐름으로서의 코드 생성
왜 중요한가
- 본인 관심사 정중앙 (1.5x 가중치)
- 2026 AI 산업의 가장 두꺼운 흐름 — 거의 모든 frontier lab 이 agent 라인 보유
- LLM 의 "텍스트 생성기" → "범용 작업자" 전환점
현재 수준 (2026-05)
장기 호흡 R&D 위에서 측정된 결과: "연구자가 아니라 엔지니어링 최적화기" (2026-08-18)
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development (arXiv:2608.13417) 는 프런티어 모델 7종을 장기 호흡 AI 연구·개발 과제 36개 위에서 최종 점수가 아니라 규칙 기반 실행 내 지표로 평가하고, 입장을 분명히 진술한다. 현재의 에이전트는 "완전히 자율적인 연구자라기보다 엔지니어링 최적화기에 가깝게 동작한다" (source).
보고된 세 가지 발견:
- 실용적인 해법을 정식화하고 구현할 수 있다.
- 가장 좋은 해법도 기존 기법을 변형하거나 조합한 것이며, 진정한 방법론적 새로움은 여전히 드물다.
- 실행 간 성능 편차가 크고, 경험 재사용은 이후 판단을 돕기도 하고 잘못 이끌기도 한다.
여러 날에 걸친 작업에서 자율성이 실제로 어디쯤 와 있는지에 대해 이 페이지가 담고 있는 가장 직접적인 측정이며, 리더보드가 아니라 프로세스 증거에서 나왔다. 초록에는 수치가 없고 일곱 모델의 이름도 밝혀지지 않으므로, 여기의 모든 주장은 논문의 것이며 정성적으로 진술된 것이다. 이것이 거기 모인 하네스 결과들에 대해 무엇을 함의하는지는 Eval Harness Configuration 참고.
산업 측
- Claude Opus 4.7 — Anthropic, agents/multi-step 강조
- GPT-Rosalind + Codex — OpenAI, OpenAI 의 software engineering agent
- Muse Spark (1.0 / 1.1) — Meta MSL, "personal" 강조
- Mistral Medium 3.5 + Vibe remote agents — 유럽 진영
- Google DeepMind AlphaEvolve — coding 에이전트
에이전트 플랫폼과 인프라 (2026-06)
- Microsoft Build 2026 Agent Stack (2026-06-02 키노트 확정): 전체 에이전트 실행 스택 동시 출시.
- Windows Agent Framework 1.0 — MIT 라이선스 오픈소스; Windows 11/365/Azure Arc 지원; 사람 승인 큐(권한 필요 작업 사람 승인 필수) 내장; 모델 무관(model-agnostic)
- Azure Agent Mesh — on-prem Windows/Windows 365/Azure Arc edge에 걸친 federated 멀티에이전트 실행 플랫폼; 로컬과 동일 API 사용; 지연/GPU 가용성 기반 자동 라우팅; GA 목표 Q4 2026
- GitHub Copilot App — 에이전트 네이티브 독립 데스크톱 앱 (macOS/Windows)
- VS Code 멀티에이전트 GA — Build 당일
- Copilot Workspace GA (Enterprise) — 버그 픽스/테스트 작성/PR 오픈 자율 에이전트
- Azure AI Foundry — Claude, Mistral, Llama 4, DeepSeek 1차 지원 → 멀티모델 에이전트 오케스트레이션
- Project Polaris — MoE 코딩 에이전트, GitHub Copilot 기본 모델 2026-08 GA
- MAI-Code-1 / MAI-Code-1-Flash — 5B급, Copilot 전 티어 당일 GA
- MAI-Thinking-1 — 35B active, 추론/오케스트레이션 특화 → Microsoft (source)
비개발자 에이전트: 모든 직군을 위한 Codex (2026-06-02)
OpenAI 가 Codex 의 직군별 플러그인 확장을 발표했다(source):
- 직군별 플러그인 6종 — 인기 앱 62개 + 스킬 110개 연동(Analyst, Marketer, Operator, Designer, Researcher, Investor/Banker)
- Codex Sites(프리뷰): 텍스트에서 호스팅되는 인터랙티브 웹 앱을 만든다 → 대시보드, 플래너, 리뷰 워크스페이스
- 비개발자: Codex 사용자의 20%, 개발자보다 3배 빠르게 증가
- 예정: Corporate Finance, PE, Marketing Strategy, Strategy Consulting, Legal 플러그인
- 의의: "AI 에이전트"가 개발자 ↔ 비개발자 경계를 넘고 있다. 소프트웨어 엔지니어링 에이전트가 지식 노동으로 일반화되는 중이며, 가장 강력한 에이전트(Codex)가 이제 범용 지식 노동자 도구로 자리 잡았다.
→ OpenAI
장시간 작업을 위한 멀티에이전트 하니스 설계 (Anthropic, 2026년 4월 — 지연 수집)
Anthropic 엔지니어링 블로그가 여러 시간에 걸친 자율 코딩·프런트엔드 설계 세션을 가능하게 하는 3 에이전트 아키텍처를 설명한다(source):
- Planner — 짧은 제품 프롬프트를 완전한 명세로 확장한다
- Generator — 애플리케이션을 만든다
- Evaluator — Playwright MCP 로 동작을 계약 대비 검증한다(생성과 비평의 분리)
- 컨텍스트 리셋 기법 — 넘칠 때 컨텍스트 창을 완전히 비우고, 구조화된 인계(상태 + 다음 단계)를 새 에이전트에 넘긴다
- 결과: 단독 실행 $9/20분 대 전체 하니스 $200/6시간 → 완성도가 확연히 높은 결과물
- 관련: Anthropic 2026 Agentic Coding Trends Report(2026년 1월) — "위임 격차": 개발자는 작업의 0~20% 만 위임한다. 하니스 설계는 자율 실행을 길게 가져갈 때의 품질 문제를 겨냥한다
의의: 컨텍스트 리셋 + 구조화된 인계는 단일 컨텍스트 창을 넘어 에이전트 실행을 확장하는 새로운 패턴이다. 사람이 다시 개입하지 않고도 제품 수준의 결과물을 낼 수 있게 한다.
컴퓨터 사용 (GUI 에이전트)
- Anthropic + Vercept (Feb 2026): Vercept 인수로 Claude computer use 강화. OSWorld <15% (2024-Q4) → 72.5% (2026-05). Cloud-hosted MacBook 원격 제어 아키텍처. → Anthropic (source)
- 브라우저·데스크톱 GUI 조작이 agents의 중요 실행 환경으로 부상 — 코드 실행 넘어 범용 컴퓨터 사용
연구 측
- Agentic Reinforcement Learning — RL 적 학습 방향
- Embodied Agents — 물리 세계 확장
- MCP (Model Context Protocol) — Anthropic 표준 → 광범위 채택 (Microsoft 365 Copilot 기본 통합 2026-01)
Google ADK 2.0 GA + Agents CLI (2026-06-30)
Google ADK 가 그래프 워크플로(fan-out/fan-in, 루프, 상태 관리, human-in-the-loop)와 에이전트 간 위임을 위한 협업 Task API 를 갖추고 GA 에 도달했다. 새로 나온 Agents CLI 는 도구 하나로 전 생애주기를 다룬다(스캐폴드 → 평가 → 배포 → 관측 → 퍼블리싱). Claude Code·Cursor·Gemini CLI 와 호환된다. 핵심 평가 공백을 겨냥한다 — 팀의 89% 가 관측성을 갖췄지만 평가 체계를 갖춘 곳은 52% 에 불과하다. → Google ADK (Agent Development Kit), Google DeepMind (source)
하위 개념
- Agentic Reinforcement Learning — RL 측면
- Embodied Agents — 물리 세계 측면
- tool-use, mcp, reflection 별도 페이지 작성 예정
지속 메모리: OpenAI Dreaming V3 (2026-06-04)
OpenAI 가 Dreaming V3 를 공개했다. 백그라운드에서 메모리를 합성하는 아키텍처로, 최초 ChatGPT 메모리 출시 이후 에이전트·사용자 메모리 분야에서 가장 큰 진전이다(source):
- 작동 방식: 백그라운드 프로세스가 모든 대화에서 중요한 사실·선호·시간 맥락을 계속 합성한다. 사용자가 따로 지시할 필요가 없다
- 시간 인식: 시점에 민감한 기억을 자동으로 갱신한다(예: 지난 일정은 미래 시제에서 과거 시제로 고쳐 쓴다)
- 대체 대상: 단독 메모리 기반으로 쓰이던 명시적 "saved memories" 목록
- 성능: 사실 회상 41.5%(2024) → 82.8%(2026). 선호·시점 민감 정확도는 70% 초반대
- 연산: 메모리 관련 추론 연산 5배 감소 → 무료 등급 배포가 가능해졌다
- 배포: 6월 4일 미국 Plus·Pro 선행, 무료 등급과 글로벌은 순차
용어 구분: OpenAI 의 "Dreaming"(ChatGPT 사용자용 개인화 메모리)과 Anthropic 의 "Dreaming"(에이전트가 지난 세션을 되짚어 자기개선용 절차 기억을 만드는 것 — Claude Managed Agents 참고)은 이름만 같고 작동 방식이 다르다.
에이전트 관점의 의미: 지속되는 사용자 메모리는 장시간 실행 에이전트의 연속성을 위한 기본 요건이다. Dreaming V3 는 이를 소비자용 ChatGPT 의 제품 층위에서 풀었고, 핵심 기법은 그 아키텍처 패턴(명시적 저장이 아니라 백그라운드 합성)에 있다.
→ OpenAI
열린 문제
- Long-horizon stability — 50+ step 작업에서 drift / 실패 누적
- Verification — agent 가 자기 작업 결과 검증 가능?
- Memory — context 한계 vs 누적 학습 (Dreaming V3가 소비자 레이어 해법 제시). 2026-08-20 기준 이것은 측정됐고 답은 순위가 아니라 국면 의존적이다: Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents (arXiv:2608.15008) 는 어떤 기질도 우위를 갖지 않으며 검색을 더 하면 사실형 QA 는 도우면서 순차적 의사결정은 해친다고 본다
- Cost — agent run 당 token 비용 vs gain
- Safety — autonomous action 의 부작용
주요 논문 · 사건
-
2026-08-21 — 산업 자동화에서 온, 종료 조건으로서의 검증. SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation (arXiv:2608.18565) 는 PLC 코드 생성 하네스를 만들면서 완료를 기록된 외부 검사가 확인할 때만 선언하는 규칙을 둔다 — 모델이 자기 출력을 충분하다고 판단할 때가 아니라. 명세, 컴파일, 그리고 실제 PLC 런타임 에서 참조와 비교한 실행 트레이스. 평균 72.6% strict verified 통과율로 시험한 모델 일곱 개 전부에서 최고다. 전이 가능한 발견은 측정에 관한 것이다: 정적 점수는 모든 방법을 10 포인트 안에 몰아넣지만, 동적 동작은 22.4–31.4 대 52.2 로 흩어놓는다. 모두가 똑같이 통과하는 채점 방식은 그 대상을 재고 있지 않다. 프런티어 랩이나 AI 네이티브 스타트업이 아니라 산업 자동화에서 나온 에이전트 결과라는 점도 주목할 만하며, 수치는 더 낮고 검사는 소프트웨어 에이전트 문헌보다 엄격하다 (source)
-
2026-08-21 — 어블레이션이 곧 결과인 AI 과학자. OmniScientist: An Omni-Modal Omni-Discipline AI Scientist (arXiv:2608.13558) 는 착상·실험·집필 에이전트를 사전 계산된 요약이 아니라 원시 이종 증거(이미지, 신호, 오디오, 비디오, 3-D 구조, 궤적, 표, 수식, 그래프) 위에서 돌리며, 신규성·통계적 타당성·실행 출처 검사를 코드로 강제한다. 사전 계산된 스칼라 특징만 받은 블라인드 변형 대비, 실제 데이터 36 사례에서 직접 지각이 평가 차원 7개 전부를 개선하고 일대일 판정의 85% 를 이긴다. "36/36 완주" 는 처리량 수치이지 품질 수치가 아니며, 평균 논문 점수 6.3 은 척도가 공개되지 않았다 (source)
-
Demystifying Agent Skills: Why They Work — Until They Don't (arXiv:2608.14036) (arXiv:2608.14036, 2026-08-14) — 스킬이 실제로 무엇을 하는지, 가정이 아니라 측정. 정규화된 시행 기록 8,135건과 개방 코딩 라벨 238개에서: 절차적 앵커링이 스킬 사례의 65.7% 를 차지하고 명시적 지식 주입은 4.5% 이므로, 스킬 라이브러리는 지식 베이스가 아니라 런북 처럼 작동한다. 매칭 비교에서 Workflow Memory 를 +6.06 포인트 앞선다. 별개의 실패는 검색이다: 풀이 5개에서 100개로 커지면 실사용 정밀도가 29.6% → 3.3% — 이 위키의 모든 스킬 결과는 하나의 작은 풀 크기에서 보고된다 (source).
-
Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents (arXiv:2608.15008) (arXiv:2608.15008, 2026-08-15) — 아래 메모리 열린 문제를, 기질에 걸쳐 측정한 것. 하네스 하나, 지표 26개, 백본 3종, 벤치마크 4묶음, 밀집 인덱스부터 파라메트릭 갱신까지 흔한 기질 전부: 어떤 기질도 일관되게 우위를 갖지 않고, 넓은 검색은 긴 맥락 사실형 QA 에 이로우며, 과도한 검색은 순차적 의사결정을 해친다 — 행동에 결정적인 맥락에서 주의를 옮겨가기 때문이다. 중간 길이 히스토리에서 잘 작동하는 기질이 더 긴 구간에서는 비싸지거나 취약해질 수 있다. 제안은 승자가 아니라 기질 라우팅 이다 (source).
-
AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses (arXiv:2608.12307) (arXiv:2608.12307, 2026-08-12) — 스캐폴딩은 다른 모델이 테스트 시점에 만들 수 있고, 약한 모델의 점수를 대략 두 배로 올린다. 더 강한 빌더 가 더 약한 타깃 을 위한 추론 시점 하네스를 구성하고, 검증용으로 떼어 둔 데이터의 5% 에 맞춰 여러 라운드에 걸쳐 다듬는다. 네 개의 Theory-of-Mind 벤치마크 평균이 파라미터 갱신 없이 0.49 → 0.91 로 오른다. Salesforce AI Research 와 UIUC. 논문은 읽지 못했다 —
arxiv.org가 이 환경에서 차단돼 있고 HuggingFace Daily 스냅샷은 이 항목의 초록을 담고 있지 않아, 어떤 모델인지, 어떤 네 벤치마크인지, 산포가 어떤지는 여기서 알 수 없다 (source). 아래의 "에이전트 = LLM + 스캐폴딩" 대 "에이전트는 별도 학습이 필요하다" 논쟁에 직접 걸린다. 가중치를 건드리지 않고 얻은, 앞쪽을 지지하는 증거다. -
auto mode 가 2026-08-14 에 Claude Code 기본값이 됐다. 2026-08-07 에 예고된 일정 그대로다. 이번 실행이 더하는 수치는 짝지어진 쪽이다. 정면 대조에서 분류기는 사람 테스터가 승인한 명령 800건을 차단했고, 사람은 분류기가 허용한 6건을 차단했다. Anthropic 은 분류기의 토큰에 요금을 부과하지 않겠다고도 밝혔다. 오탐률은 공개되지 않았고, 그것이 그 800건의 대가를 말해 줄 수치다 (source).
-
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution (arXiv:2608.00677) (arXiv:2608.00677, 2026-08) — 프롬프트가 아니라 환경을 레드팀한다. 50개 도메인에 걸친 1만 개 이상의 검증된 상태 보존 시나리오를 50만 개 이상의 도구·스킬 풀에서 구성하고, 과제당 도구 호출 중앙값 97회와 75개 에이전트-모델 구성을 다룬다. 논거는 이렇다. 에이전트 리스크는 장기 워크플로에서 재사용되는 공유 상태를 통해 누적되고, 짧고 정적인 안전 벤치마크는 그것을 볼 수 없다. 결과는 읽지 못했다 — 초록은 규모 수치만 담고 있고
arxiv.org는 이 환경에서 차단되어 있다 (source). Fudan University, Shanghai AI Laboratory, XSafeAI — 이 위키가 보유한 에이전트 안전 평가가 거의 전부 1차 당사자의 것인 가운데 나온 학계 컨소시엄이다. -
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents — 2026-07-29: 모바일·컴퓨터·브라우저·DeepSearch 를 가로지르는 파운데이션 GUI 에이전트. MobileWorld 82.1% 로 Opus 4.8 대비 +14.6 포인트를 보고하며, 호출을 기다리는 대신 스스로 개시하는 하네스를 설명한다 (source)
-
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent — 2026-06-30: 에이전틱 과제에서는 horizon 스케일링이 파라미터 스케일링을 앞선다 (45K 토큰 궤적으로 35B MoE 가 1T급 모델과 대등)
-
Self-Distilled Agentic Reinforcement Learning — 2026-05 latest
상호작용 표면을 규제하기: TC260 초안 (2026-07)
중국 TC260 이 사이버보안 표준 실천 가이드 — AI 에이전트 상호작용 보안 요구사항(의견수렴용 초안 v0.23)을 내놓았다. 에이전트 대 에이전트와 에이전트 대 도구 상호작용을 설치·구성·사용·제거 전반에 걸쳐 다루고, 공급망 통제와 승인 없이 배포된 직원들의 "섀도 에이전트" 를 포함한다 (source).
여기서 추적하는 거버넌스 문서 중 모델이 무엇인가가 아니라 에이전트가 서로에게 무엇을 하는지를 규제하는 첫 사례다. 요구사항은 에이전트에 적용된 IT 자산 관리처럼 읽힌다. 사용 전 보안 평가, 배포 전 하드닝, 생애주기 전반의 엄격한 권한 통제, 폐기 시 안전한 데이터 소거. AI 에이전트 안전에 관한 별도의 강제 국가표준은 초안 계획 단계에 있다. 전체 내용은 AI Governance 에 있다.
권한 승인 프롬프트를 측정했더니 작동하지 않았다 (2026-08-07)
Anthropic 은 2026-08-14 부터 auto mode 를 Pro·Max·Team 의 Claude Code 신규 세션 기본 권한 모드로 삼는다고 발표했다. 모든 도구 호출 앞에 사용자가 아니라 분류기를 세우는 변경이다 (source).
근거가 된 수치. 명백히 위험한 명령에 대한 권한 승인 프롬프트를 보여준 유료 베타 테스터 1,053명 기준:
| 검사 주체 | 위험한 명령을 잡아낸 비율 |
|---|---|
| auto mode 분류기 | 89% |
| 사람, 수동 승인 | 13.6% |
| 사람, 프롬프트 50회 이후 | 5% 에 가까움 |
| 사람의 승인 프롬프트는 에이전트 코딩 도구 전반에서 업계의 기본 안전 장치였고, 그것이 | |
| 실제로 얼마나 작동하는지에 대한 측정치가 공개된 것은 이번이 처음이다. 수치가 말하는 | |
| 바는 애초에 약하다는 것, 그리고 노출될수록 약해진다는 것이다 — 부주의가 아니라 | |
| 습관화이며, 따라서 개별 사용자의 속성이 아니라 인터페이스의 속성이다. 이는 프롬프트를 | |
| 검토 장치가 아니라 동의 기록 장치로 만들고, 설계 질문을 "사용자가 승인했는가" | |
| 에서 "무엇이 그것을 검사했는가"로 옮긴다. |
빠져나갈 구멍 자체도 눈여겨볼 만하다. 연속 3회 차단 또는 한 세션에서 20회 차단 이후 auto mode 는 사용자에게 제어를 돌려준다 — 분류기가 가장 틀리기 쉬운 지점에서 사람에게 양보하는 셈이고, 이는 앞의 수치가 함의하는 신뢰 순서와 반대다. Anthropic 자신의 X 게시물은 사람 쪽 수치를 14% 로 반올림했고 문서 보도는 13.6% 를 적는다. 여기서는 더 정밀한 쪽을 쓴다. Anthropic 참조.
관련 개념
- Agentic Reinforcement Learning
- Embodied Agents
- Reasoning Models
- MCP — Model Context Protocol — 에이전트 시스템이 연결되는 도구 접근 프로토콜
- Eval Harness Configuration — 에이전트 벤치마크 점수가 하네스에 대한 주장이기도 한 이유
- AI Governance — TC260 에이전트 상호작용 초안
주목할 발언
- Andrej Karpathy (2026): "80% manual + 20% agents 에서 80% agent coding + 20% edits 로 빠르게 전환"
- Jim Fan: "LLM acts as 'prefrontal cortex' that orchestrates lower-level control APIs"
- Andrej Karpathy: "creating software at the end of 2026 어떻게 보일지 상상하기 어렵다" (via Sam Altman echo)
열린 논쟁
- Agent = LLM + scaffolding vs Agent 는 별도 학습 필요 — 학계 일부 (agentic RL 진영) 는 후자 주장. 산업 일부는 전자로 충분 주장.
- No-gradient orchestration (Jim Fan 입장) vs end-to-end neural control (Sergey Levine 진영) — 학습 패러다임 갈림.
Referenced by
Sources
- sources/papers-daily/hf-daily-2026-08-21.md
- sources/papers-daily/hf-daily-2026-08-20.md
- sources/papers-daily/hf-daily-2026-08-18.md
- sources/arxiv/2026-08-15/2608.12307-ai4ai-test-time.md
- sources/blogs/anthropic-2026-08-14-auto-mode-live-government-ga.md
- sources/blogs/anthropic-2026-08-07-claude-code-auto-mode-default.md
- sources/blogs/china-2026-07-30-tc260-ai-agent-interaction-security.md
- sources/blogs/anthropic-2026-02-25-vercept-acquisition.md
- sources/blogs/microsoft-2026-06-01-build-project-polaris.md
- sources/blogs/openai-2026-06-02-codex-every-role.md
- sources/blogs/anthropic-2026-04-harness-design-long-running.md
- sources/blogs/openai-2026-06-04-chatgpt-dreaming-v3.md
- sources/blogs/google-2026-06-30-adk-2-agents-cli.md
- sources/arxiv/2026-08-03/2607.28227-qwen-ui-agent.md