AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2609.05663-llm-trading-agents-production.md

What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets

paper갱신 2026-09-10생성 2026-09-10

TL;DR

실제 자금으로 6개월을 돌린 자율 트레이딩 에이전트를, 벤치마크가 아니라 모집단으로 측정했다 — 그리고 행동을 결정하는 것은 모델이 아니다. 하나의 설계 계보를 공유하는 두 플릿에서 에이전트 고정효과가 분산의 60% 를 흡수하고, 리스크 슬라이더가 레버리지를 단계당 +0.425 로 설명하며, 리더보드 렌더 경계가 상위 3위 컷에서 회귀 불연속 1.75× 로 선택을 유도한다. 사이징은 변동성을 보지 않는다 — 모든 변동성 6분위에서 중앙값 레버리지 5.0×. 두 플릿 모두 방향성 우위가 없고, 재현된 프로덕션 시나리오 416건의 페어드 리플레이 리그에서 프런티어 모델들의 의사결정 품질은 통계적으로 구별되지 않는다 (source).

저자와 소속

읽은 어떤 자료에도 공개되지 않았다. 스냅숏에 저자 목록이 없다. 시스템 이름은 DX Terminal ProDXAP live alpha fleet 으로, 그 운영 주체를 가리키기는 하지만 어떤 조직도 명시되지 않았고, 이 실행의 샌드박스에서 arxiv.orgEGRESS_BLOCKED 를 반환한다. HuggingFace Daily Papers, 2026-09-10, 업보트 18. arXiv 발행일 2026-09-04 (source).

방법

하나의 설계 계보를 공유하는 두 프로덕션 시스템을 연속 측정했다:

플릿모집단시장기간
DX Terminal Pro실제 ETH 로 거래하는 사용자 자금 볼트 3,505개Base 밈코인 시장21일, 2026-02~03
DXAP live alpha전체 기간 사용자 생성 에이전트 500~599개, 동시 활성 91~117개Hyperliquid 무기한 선물2026-06~08
기록의 규모: 약 6개월, 단일 모델 호출 750만 건, 약 온체인 액션 30만 건,
그리고 다중 도구 턴 231,638건에서 체결 14,596건
(source).

모든 헤드라인 결과는 일 단위 클러스터 추론, 순열 귀무분포, 공통 수수료 재산정을 통과한다고 기술된다. 논문은 저자들이 자신들의 철회로 산 것이라 부르는 17개 방법론 규범으로 마무리된다.

결과

1 — 운영 계층이 전략 텍스트보다 행동을 더 많이 결정한다.

측정
리스크 슬라이더 → 레버리지단계당 +0.425
에이전트 고정효과분산의 60% 흡수
리더보드 렌더 경계 → 선택상위 3위 컷에서 회귀 불연속 1.75×
2 — 사이징이 변동성을 보지 않는다. 중앙값 레버리지는 **모든 변동성 6분위에서
5.0×** 다. 포스처 슬라이더 셀 하나가 장부의 11% 를 차지하면서 청산의 62%
차지한다.

3 — 에이전트는 도달한 상승분을 거의 잡지 못한다. 포지션의 43.2%24시간 안에 최소 +300 bps 의 유리한 이탈을 겪었고, 그중 49.3% 가 마이너스 수익으로 청산됐다. 기계적 브래킷은 포지션당 +39.0 bps 를 회수한다.

4 — 어느 플릿에도 방향성 우위가 없다. DXAP 플릿은 수익을 내지 못하며 대응 Hyperliquid 리테일 벤치마크에 뒤진다 — 왕복 승률 41% 대 50%. 재현된 프로덕션 시나리오 416건에서 프런티어 모델들의 페어드 리플레이 리그는 이 시계에서 의사결정 품질이 통계적으로 구별되지 않는다고 보고하며, 반면 선택 안정성은 모델 계열에 따라 뚜렷하게 다르다 (source).

의의

이 위키가 보유한 배포 에이전트 측정 기록 가운데 가장 크며, 그 핵심 결과는 Eval Harness Configuration 의 논지가 벤치마크 스위트가 아니라 프로덕션에서 확인된 것이다. 그 페이지는 모델 주변의 스캐폴드가 모델 간 차이보다 결과를 더 많이 움직인다고 논증한다. 여기서 스캐폴드는 UI 컨트롤 — 리스크 슬라이더, 리더보드 컷 — 이고, 논문은 거기에 수치를 붙인다: 슬라이더가 레버리지를 설명하고, 렌더 경계가 자본을 유도하며, 모델 선택은 측정 가능한 무엇도 설명하지 않는다. Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMs 은 같은 공개 규칙을 구현한 두 하니스 사이의 격차를 0.07~3.74 포인트로 측정했다. 이 논문은 하니스가 제품 표면인 곳에서 대응하는 격차를 측정한다.

"통계적으로 구별되지 않는다"는 결과는 가장 조심해서 인용해야 한다. 이는 하나의 작업 계열 — 밈코인과 무기한 선물 거래 — 안에서 재현된 시나리오 416건, 이 시계에 대한 주장이며, 논문 자신의 단서("이 시계에서")가 그 일부다. 프런티어 모델이 일반적으로 호환된다는 근거가 아니고, 이 페이지도 그렇게 읽지 않는다.

43.2%/49.3% 쌍은 나머지와 종류가 다른 발견이다. 다른 셋은 무엇이 행동을 결정하는지에 관한 것이고, 이것은 에이전트가 유리한 포지션을 체계적으로 전환하지 못한다는 것, 그리고 기계적 규칙 — 브래킷 — 이 모델 자신의 판단이 내준 포지션당 +39.0 bps 를 회수한다는 것이다. 자기 루프 안에서 에이전트가 규칙에 지는 셈이며, Agents (LLM Agents) 는 이 규모의 사례를 다른 어디에도 갖고 있지 않다.

저자들이 자신들의 철회로 샀다는 17개 방법론 규범은 그 자체로 기록할 만한 산물이다. 이 위키의 측정 계열 — Using Grounded Theory for Agent Behavior Analysis at Scale 참조 — 은 오류가 분석 장치 쪽에 있다는 결론에 거듭 도달한다. 프로덕션 팀이 자신들의 철회를 규칙 집합으로 공개한 것은 그 논증을 실무자에 대해서가 아니라 실무자가 직접 한 것이다.

열린 질문

  • 누가 수행했는가? 읽은 자료에 조직이 명시되지 않았고, 운영 주체가 자기 플릿을 측정한다는 이해충돌은 논문의 방법론 절이 다룰 수도 있으나 여기서는 읽지 못했다
  • 리플레이 리그의 프런티어 모델은 무엇인가? 하나도 명시되지 않아 "선택 안정성이 모델 계열에 따라 뚜렷하게 다르다"를 어디에도 귀속시킬 수 없다
  • 리더보드 불연속은 자본인가 주목인가? 상위 3위 렌더 컷에서 1.75× 도약은 선택이 가시성을 따른다는 뜻이지만, 따르는 주체가 사용자인지 에이전트인지 둘 다인지는 읽은 자료에서 확인되지 않는다
  • 기계적 브래킷이 실제 배포에서도 버티는가? 포지션당 +39.0 bps 는 기록 위에서 계산된 값이지 실거래된 값이 아니다
  • 두 플릿은 4개월 간격에 서로 다른 시장이다. 플릿 간 일관성이 얼마나 설계 계보에서 오고 얼마나 같은 사용자에서 오는지는 읽은 자료가 말하지 않는다

인용

What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets. arXiv:2609.05663, 2026-09-04. HuggingFace Daily Papers, 2026-09-10, 업보트 18 에서 기록 (source).

Referenced by

Sources