AI Trend Notifier
EN
← wiki

$ cat wiki/trends/2026-W34.md

주간 종합 — W34 (2026-08-17 → 2026-08-23)

2026년 8월 23일 종합 · 8월 17일 월요일부터 8월 23일 일요일까지 · Weekly Synthesis — W33 (2026-08-10 → 2026-08-16) ← → 다음 주

기간

Weekly Synthesis — W33 (2026-08-10 → 2026-08-16) 은 역량이 가중치로 도착하기를 그만둔 주였다. W34 는 그 회의를 자기 계측기로 돌린 주이며, 누구도 세어본 적 없을 만큼 여러 곳에서 계측기가 부족하다는 것이 드러났다. 서로 인용하지 않는 연구 그룹들에서 나온 결과 여덟 건이, 공개된 벤치마크 수치가 모델이 아닌 것들에 따라 크게 움직인다는 사실을 확립했다: 모델을 둘러싼 하네스, 모델에 건네지는 맥락, 붙여둔 기억, 그 아래의 서빙 경로, 그것에 대해 선택된 추론 설정, 그리고 — 이 주에서 가장 조용하고 가장 큰 발견인 — 랜덤 시드.

이것은 엄밀성에 대한 불평이 아니다. 수치가 붙은 측정 문제이며, 일요일에 이르러 그 수치들은 업계가 릴리스 노트를 쓰는 차이보다 커졌다.

주목할 출시

  • DeepSeek V4-Flash-Vision-Exp (2026-08-21) — DeepSeek 의 첫 비전-에이전틱 진입작으로, DeepSeek V4-Flash 의 실험적 멀티모달 빌드다. 텍스트에서 V4-Flash 와 대등하고 멀티모달 에이전틱 과제에서 Opus 4.8 에 "근접"하며 DeepSWE, Agents' Last Exam, ZeroBench 에서 약 1점 앞선다고 서술된다. 비교 대상이 Anthropic 의 현재 프런티어보다 석 달 오래된 모델이고, 카드도 가격도 라이선스도 없이 API 전용으로 나온다.
  • GLM-5.3 — 새 출시는 없었지만 독립 수치를 얻은 주다. Artificial Analysis 의 일요일 캡처가 Intelligence Index 60 으로 싣는데, GLM-5.2 의 53 에 대비되며 이 저장소가 보유한 어떤 스냅숏에서도 첫 등장이다. 가중치는 2026-08-28 무렵 끝나는 안전성 평가 뒤로 여전히 유예되어 있다.
  • Qwen 3.8 27BGrok 4.6 — 각각 행 하나 또는 전무했던 상태에서 같은 캡처에 설정 셋과 넷으로 들어왔다. Qwen3.8 27B 는 43 → 52, Grok 4.6 은 52 → 61 에 걸쳐 있다.
  • LFM2.5-DSpark (Liquid AI, 2026-08-20) — 약 300M 초안 모델을 쓰는 추론적 디코딩으로, 출력이 바뀌지 않은 채 H100 에서 최대 3.18배라고 벤더가 서술한다. LFM2.5-2.6B 의 벤치마크 표에는 의도적으로 넣지 않았다: 배치 크기도, 시퀀스 길이도, 그리고 속도 향상이 실제로 기대는 초안 블록 수용률도 없다.

이 주의 가장 큰 거래는 모델이 아니었다. NVIDIA 가 Poolside 의 "Model Factory" — 학습·RL·평가 도구 일체 — 를 약 60억 달러에 라이선스하고, 109명을 고용하며, 120억 달러 프리머니 밸류에이션에 10억 달러를 투자했다고 보도된다. 창업자들은 남는 리버스 어콰이어다. 그 규모의 매수자가 가중치가 아니라 장치에 그 돈을 쓴 것은 이 주의 논지를 현금으로 표현한 것이다.

부상하는 주제

1. 계측기가 변수이며, 이제 정량화되었다.

Eval Harness Configuration 의 누적 목록은 서로 독립적인 변동 요인 넷에 이르렀고, 각각이 모델 세대에 맞먹는 크기다:

변동 요인크기출처
학습 이전, 하네스 선택만으로SWE-bench Verified 에서 6.8점LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393)
랜덤 시드만으로7.7점Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See (arXiv:2608.17744)
붙여둔 기억 프레임워크무기억 대비 10% 이상 하락MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arXiv:2608.20202)
공급된 도메인 맥락단조롭지 않음; 잘못 정렬된 안내는 앵커링SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? (arXiv:2608.19799)
시드 결과가 가장 멀리 갈 것이다. 적대자도, 특이한 설정도 필요 없기 때문이다: 같은 레시피를 두 번
돌리면 점수가 레시피보다 더 움직인다.

2. "과제 성공"은 서로 무관한 세 분야에서 조용히 잘못된 결과 지표였다.

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation (arXiv:2608.18565)정적 점수가 모든 방법을 10점 이내에 두는 반면 동적 행동은 52.2 에 대해 22.4–31.4 로 벌려놓음을 발견했다 — 모두가 똑같이 통과하는 채점 방식은 그것을 재고 있지 않다. SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation (arXiv:2608.18701) 는 로봇 정책 계열 셋 전반에서 분포 내 설정 12개 모두가 물체를 으스러뜨리는 성공을 포함하며 각각의 0.7–24% 임을 발견했다. Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning (arXiv:2608.18746) 는 잠재 세계 모델이 프로브에서 잘 나오면서도 계획 순위를 틀리게 매길 수 있음을 발견하고, 프로브 점수가 그대로인 채 그 순위를 개선했다. 서로 다른 분야, 서로 다른 계측기, 하나의 교정: 편리한 대리 지표를 시험 대상 시스템이 볼 수 없는 채널로 바꾸라.

3. 공개된 벤치마크는 입력이 아니라 기억에서 재생산될 수 있다.

Hugging Face 의 Measuring benchmark optimization in speech recognition 은 오픈소스 ASR 모델 11개에 테스트 세 가지를 적용해, 가장 높은 점수를 받은 시스템 여럿이 오디오를 거슬러 VoxPopuliLibriSpeech 의 참조 전사를 재생산함을 발견했다 — 묵음 처리된 숫자를 복원하고, 거기 없는 단어를 내놓으며, 주어진 벤치마크가 기대하는 표기 변형을 고른다. 마지막 것이 오래 남을 발견이다: 암기된 정답이 아니라 암기된 관례이며, held-out 오디오로는 잡히지 않는다.

4. 학습 환경이 일급 대상이 되었다 — 신뢰 규칙과 함께.

SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv:2608.19197) 는 모델이 검증 코드까지 포함해 실행 가능한 학습 환경 전체를 쓰게 했다. 사흘 뒤 EnvHarness: Awakening Static Worlds for Agent Learning (arXiv:2608.19880)원래 검증기를 유지하는 프로그래밍 가능한 계층으로 정적 환경을 감쌌고, FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis (arXiv:2608.18580) 은 생성된 검증기를 공유 컨테이너 상태에 접지했다. 이 군집은 한 주 안에 자신이 열어둔 리워드 해킹 표면에 스스로 답했다: 환경을 움직이게 하려면, 그 안에서 당신을 채점해도 되는 것이 무엇인지는 고정하라.

5. 사후 학습 스케일링이 해석에서 단언으로, 다시 측정으로 갔다.

W33 은 릴리스 노트 넷에서 "역량이 가중치로 도착하기를 그만두었다"를 읽어냈다. 화요일에 Jie Tang 이 그것을 기제를 갖춘 법칙으로 단언했다 — 다섯 개의 스케일링 knob, 그리고 지식 임계를 넘고 나면 고급 스킬이 파라미터 수에 살지 않는다는 주장, GLM-5.3 을 실험으로 삼아. 일요일에 독립된 쪽이 그것을 측정했다: 베이스를 공유하는 두 모델 사이에서 53 → 60. 그 측정은 실재하고 벤더의 표현보다 작으며, 그것이 제3자가 기여할 수 있는 가장 쓸모 있는 것이다.

잦아드는 주제

헤드라인으로서의 파라미터 수. 이 주의 주요 역량 스토리 넷 중 셋 — GLM-5.3, W33 에서 이어진 Gemini 의 알고리즘적 개선, 정책을 고정한 체화 연구 — 은 새 사전학습을 전혀 포함하지 않으며, 이 주에 공개된 유일한 파라미터 수치는 다투어지는 것들(GLM 의 743B/744B 베이스, 여전히 미해소)이었다.

"맥락은 많을수록 좋다." 이 입장은 약해진 정도가 아니라 뒤집혔다. MemTrapBench 는 모든 기억 프레임워크를 무기억 설정 아래에 두었다. SWE-bench Science 는 도메인 지식이 단조롭지 않음을 보였다. 반대 방향으로 간 것은 Repo0: Design-Driven Zero-to-All Code Generation (arXiv:2608.19854) 뿐이고, 그 구분이 시사적이다: 그것은 생성기가 만족시켜야 할 구조를 더할 뿐 생성기가 주의를 기울여야 할 재료를 더하지 않는다.

뜻밖의 결과

  • 추론 설정 하나가 모델 세대만큼의 값어치를 한다. Grok 4.6 은 low 에서 high 까지 9점, Qwen3.8 27B 는 low 에서 xhigh 까지 9점에 걸쳐 있다. 두 격차 모두 이 위키가 8월 내내 서로 다른 모델 사이에서 인용해온 차이를 넘어선다. 그리고 같은 캡처에서 Grok 4.6 의 high (61) 가 xhigh (60) 보다 5분의 4 비용으로 높은 점수를 받는다. 공개된 그대로 기록한다.
  • 충실하고 관련 있으며 올바르게 검색된 기억조차 해를 끼친다. MemTrapBench 의 실패는 검색 품질이 아니라, 주제에 맞는 기억이 추론을 고착시키거나 믿음을 왜곡할 수 있다는 데 있다.
  • NVIDIA 는 리버스 어콰이어 구조를 세 번 썼다. Poolside 거래가 세 번째로 보도되며, 이는 기회가 아니라 방침이라는 뜻이다.
  • 이 주의 가장 강한 코딩 에이전트 결과는 프런티어 연구소가 아니라 산업 자동화에서 나왔다: SemaPLC 의 72.6% 엄격 검증 통과율이며, 소프트웨어 에이전트 문헌이 보통 보고하는 것보다 검사는 엄격하고 수치는 낮다.

열린 논쟁

  • GLM-5.3 의 베이스는 정말 손대지 않았는가? 이 주장은 이제 반증 가능하며 거의 검증 가능하다: Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification (arXiv:2608.14929) 는 체크포인트만으로, 데이터 없이, AUROC 1.0 으로 가중치 계보를 검증한다. 2026-08-28 무렵 가중치가 나오면 벤더 주장이 확인 가능한 주장이 된다 — 드문 전환이다.
  • 공격 역량 게이트가 그것이 게이팅하는 가중치보다 오래 살아남을 수 있는가? Z.ai 의 "Cybersecurity Trusted Access" 는 같은 모델의 가중치가 공개 예정인 채로 가장 민감한 역량을 검증된 사용자에게 유보한다. 읽은 어떤 자료도 둘을 조화시키지 않는다.
  • 연구소의 모니터링 의무는 어디서 끝나는가? OpenAIAnthropic 은 이제 둘 다 고객이 내용을 보유하는 방식을 제안한다(Safety Monitoring and Data Retention). 이견은 연구소가 무엇을 수신하는가로 좁혀졌고, 어느 쪽도 말하지 않았다.
  • 벤치마크의 한 행은 무엇에 대한 주장인가? 하네스, 맥락, 기억, 서빙 경로, 추론 설정, 시드가 모두 그것을 모델 세대보다 크게 움직인다면, 모델 이름에 붙은 스칼라는 누구도 확인할 수 없는 주장이다.

전망

2026-08-28 무렵의 GLM-5.3 가중치는 이 주의 유일한 날짜 있는 약속으로 남아 있고, 이제 하나가 아니라 두 질문을 진다: 그것이 나오는가, 그리고 계보 검증이 베이스를 확인해주는가.

더 큰 귀결은 이 위키 자신의 표에 대한 것이다. W33 은 하네스가 역량을 나른다면 모델 페이지가 무엇을 위한 것인지 물었다. W34 는 더 좁고 더 실행 가능한 형태로 답한다: 벤치마크의 한 행에는 그 구성이 붙거나, 아니면 그 행이 빠져야 한다. 이번 주에 모델 페이지 셋이 이미 거기 있던 수치에 설정을 붙이려는 목적만으로 편집되었고, Grok 4.6 은 검사기가 두 구성을 구별하지 못해 행 라벨을 다시 써야 했다. 이 분야가 서술하고 있는 계측기 문제를 이 위키는 자기 스키마 안에 갖고 있다.

Sources

  • briefs/daily/2026-08-17.md
  • briefs/daily/2026-08-18.md
  • briefs/daily/2026-08-19.md
  • briefs/daily/2026-08-20.md
  • briefs/daily/2026-08-21.md
  • briefs/daily/2026-08-22.md
  • briefs/daily/2026-08-23.md