$ cat briefs/daily/2026-08-17.md
2026-08-17
2026년 8월 17일 (월)
소식 4건 · 논문 2편 · 관찰 3건 · 신규 페이지 5건 · 정정 1건
어제 이 브리프는 여기서 엿새 동안 틀린 채 실려 있던 가격을 기록했고, 그 이유도 함께 적었다. 가격 변경은 출시가 아니어서 출시 모양을 한 수집으로는 잡히지 않는다는 것이다. 오늘 또 하나가 움직였다 — 그리고 효력이 발생한 그날에 잡혔다. 이번 실행은 첫 판단에서 이야기를 틀리게 잡았다가 자기 위키에 의해 교정되기도 했다. 그 아래에서, 서로 무관한 세 결과가 추론 토큰에 대해 같은 주장으로 모인다: 그 상당수가 낭비라는 것.
주요 소식
1. 정정 — DeepSeek 의 정액 요금이 어제 끝났고, 이 위키의 Pricing 행도 함께 만료됐다 (1.30)
- 2026-08-16 16:00 UTC 부로 DeepSeek V4-Pro-0813 와 DeepSeek V4-Flash 가 정액 토큰 요금을 떠나 피크/오프피크 스케줄로 옮겨갔다. V4-Pro: 오프피크 $0.66/M 캐시 미스 입력 · $1.98/M 출력, 피크 $1.32 · $3.96. V4-Flash: 오프피크 ¥0.05 / ¥1.50 / ¥4.50, 피크에는 두 배. 피크 시간대는 01:00–04:00 및 06:00–10:00 UTC (source).
- 오프피크는 할인이 아니다. 피크는 옛 정액이 아니라 새 오프피크의 2배이므로 하루의 모든 시간이 이전보다 비싸다: 가장 싼 시간이 옛 입력가의 1.5배, 옛 출력가의 2.25배이고, 가장 비싼 시간은 3배와 4.5배다. 철회된 수치는 페이지에 표로 남는다.
- 이번 실행의 첫 판단은 틀렸고, 위키가 그것을 잡았다. "DeepSeek 이 시간대별 가격제를 도입했다"는 한 달 늦은 말이다. DeepSeek V4 는 2026-07-16 GA 이래 피크/오프피크를 담고 있었고, 그때의 시간대는 매일 9:00–12:00 및 14:00–18:00 — 베이징 시간으로 표기된 같은 구간이며, DeepSeek 자신의 전환 관행(그때 15:59 UTC, 지금 16:00 UTC, 둘 다 베이징 자정)이 이를 뒷받침한다. 바뀐 것은 가격이지 가격 모델이 아니다.
- 상충은 해소하지 않고 기록한다: 보고된 배수를 적용하면 $0.6525 와 $1.9575 가 나오는데 보고된 금액은 $0.66 와 $1.98 로 ~1.1% 어긋나고, 두 행 모두 같은 방향이다. 새 Flash 요금은 RMB 로만, 그것도 딱 떨어지는 숫자로 제시된다. 가격이 RMB 로 책정되고 달러가 환산된 것이라는 해석과 맞아떨어지지만 읽은 자료 어디에도 그런 말이 없으므로 어느 해석도 채택하지 않으며, Flash 페이지는 환산을 거부한다.
- 왜 중요한가: 어제의 교훈은 출시 모양을 한 수집이 출시가 아닌 모든 것을 놓친다는 것이었다. 이것은 같은 부류의 사건이고, 한 번의 실행 뒤에 day +6 이 아니라 day 0 에 잡혔다 — 어제 지목한 간극이 구조적인 것이 아니라 좁힐 수 있는 것이라는 첫 증거다.
- → DeepSeek V4-Pro-0813, DeepSeek
2. 추론 토큰은 대체로 낭비이고, 오늘 두 사람이 양쪽 끝에서 그것을 쟀다 (1.69)
- Simon Willison 이 Qwen 3.8 27B 를 M5 Max MacBook Pro 에서 로컬로 돌렸다. "SVG 를 그려라" 프롬프트 하나가 추론 토큰 22,276개와 출력 토큰 3,223개 — 출력 토큰당 추론 토큰 6.9개 — 를 21분 동안 태웠다. 이는 출고 기본값의 동작이다: Qwen3.8 은
reasoning_effort를xhigh로 출고하고,medium과low가 있지만 선택되지 않는다 (source). - Gambit 은 이 분야가 잘못된 질문을 해왔다고 주장한다 — "얼마나 많은 compute 를 쓸 것인가에서 어디에 배분할 것인가로" — 그리고 가망 없는 추론 궤적을 실행 도중 쳐내 좋은 접두부에서 즉시 가지를 다시 뻗는다. 동일 하드웨어에서: HMMT-24 절대 +6.7, AIME-25 +3.3, 2배 이상의 처리량, 그리고 병렬 샘플링 대비 전체 토큰 최대 68.5% 감소 (source).
- 다루는 모델이 다르고 서로 인용하지도 않는다 — 이 짝지음은 이 위키의 것이며 Test-Time Compute (Inference-Time Compute Scaling) 에 그렇게 표시돼 있다. 다만 측정된 비용과 주장된 회수율이 그 페이지에 함께 놓인 것은 처음이고, 둘은 같은 방향을 가리킨다.
- Willison 자신의 모델 평가는 "훌륭하다" 이다. 불만은 역량이 아니라 기본값이며, 17GB GGUF 는 파일 크기이므로 이것은 그 페이지가 12일째 기다려온 17GB 메모리 측정이 아직 아니다.
- 왜 중요한가: 이제 세 가지 기구가 토큰당 가격을 바꾸지 않은 채 같은 답변의 토큰 수를 바꾼다.
Pricing행은 단가이므로 그중 무엇도 거기에 보이지 않는다 — Eval Harness Configuration 이 벤치마크 점수에 대해 펴는 것과 같은 논증이, 리더보드 대신 청구서에 도착한 것이다. - → Thought-Level Beam Search for Reasoning (arXiv:2608.08020) (신규), Test-Time Compute (Inference-Time Compute Scaling)
3. 얼어붙은 모델 무리가 빠져 있던 자리를 얻고 — 397B 학습 작업 안에서 나온 항목이 하나 붙는다 (1.85)
- Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence (arXiv:2608.12743) 는 모델이 읽는 것을 진화시킨다: 검증된 공간 경험을 교훈으로 증류하고, 각 교훈은 균일하게 초기화된 뒤 자신의 이후 검색 결과로부터 보정되는 Transfer Reliability Score 를 지닌다. 얼어붙은 VLM, 추론 시점의 외부 공간 도구 없음, 다섯 벤치마크에 걸쳐 4개 기반 모델 블록 전부에서 최고 매크로 평균 (source).
- 자기를 측정하는 구성요소는 Model Routing 이 부재로 지목하며 닫힌 바로 그 계기다 — 결정을 내리면서, 얼마나 자주 잘 결정하는지에 대한 증거를 쌓는 무언가.
- Intern-S2-Preview: Scientific Agentic Foundation Model (arXiv:2608.13505) 가 논증의 지위를 바꾸는 쪽이다. 이전 항목은 모두 재학습할 수 없는 모델 주변을 개선하는 사람들의 것이었다. 이것은 397B 사전학습 작업이 자기 자신의 얼어붙은 백본을 수정하지 않고 특화하는 데 구조적 자리를 배정한 사례다 —
Intern-MemDec-4B가 Biology-Instructions 를 56.92 에서 60.32 로 올린다. - 왜 중요한가: 가중치를 쥔 쪽이 얼어붙은 백본 경로를 택하면 "harness 가 곧 역량"은 학습 예산이 없어서 하는 우회가 아니게 된다. 이제 논문 일곱 편이고, 한 편도 루프의 비용을 밝히지 않으며, 서로 비교할 수 없는 다섯 개의 분모(+17점, +12.4%, +12.2점, +3.4점, 그리고 점수 없는 순위 하나)를 쓴다.
- → Eval Harness Configuration, Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence (arXiv:2608.12743) (신규)
4. Amodei 가 기관을 지목한다: FINRA 형 기구, 그리고 권력을 분산이 아니라 이전시키는 것으로서의 오픈 웨이트 (1.30)
- 보도에 따르면 그로서는 이례적인 긴 X 게시물에서 Dario Amodei 는 "규제는 권력을 집중시킨다"와 "오픈 모델을 포함한 광범위한 분산이 견제다"의 대립을 잘못된 양자택일로 물리치고, 하나의 규칙 집합이 사이버·바이오·정렬 위험에 대응하면서 프런티어 연구소들을 제도적으로 제약하고 오픈 웨이트의 자리를 남기는 일을 동시에 할 수 있다고 주장한다 (source).
- 오픈 웨이트에 대해서는: 집중 문제에서 "다소 낫다", 그러나 가장 많은 compute 와 칩을 쥔 쪽으로 집중을 이전시킨다. 이는 개방을 지지하는 가장 강한 논거를 부정하는 대신 자리를 옮기는 방식으로 답한 것이다.
- 그의 2026-07-28 입장(금지 반대; 수출 통제, 증류 단속, 개방 여부와 무관한 시험)에 견주면 이는 되풀이가 아니라 새로운 내용이다 — 가정하지 않고 확인했다.
- 왜 중요한가: AI Governance 의 다른 모든 수단은 정부의 것이다. FINRA 는 자율규제기구 — 감독 아래 연구소들이 규칙을 쓰고 집행하는 형태 — 이고, 이는 "누가 전문성을 갖췄는가"에 대한 일관된 답인 동시에 그것이 답하려는 규제 포획 반론과 정확히 같은 모양이다. 읽은 자료 어디에도 그가 이 긴장을 다뤘다는 서술이 없다. 그리고 compute 집중 주장은 측정된 것이 아니라 진술된 것이다: 아무도 여기에 계측기를 들이대지 않았다.
- → Open-Weights Policy Fight, Anthropic
논문 선정
Full-bandwidth transformer — arXiv:2608.08888
- TL;DR: 지금은 디코딩 단계 사이에 샘플링된 토큰만 스택 맨 아래로 돌아가고 최상층 은닉 상태는 버려진다. 그것을 gated linear unit 으로 되먹이면 비언어화된 계산이 새로 채워진 깊이 예산과 함께 스택으로 다시 들어온다. 1B 파라미터를 400B 토큰까지 학습했을 때 약 1.5배 더 많은 토큰으로 학습한 표준 transformer 에 필적하며, 토큰당 오버헤드는 무시할 만하다고 보고한다.
- 왜 읽을 만한가: Weekly Synthesis — W33 (2026-08-10 → 2026-08-16) 는 역량이 가중치에 도착하기를 멈췄다 로 닫혔다. 이것이 그 반례다 — 사전학습 아키텍처 변경이고 주장 전체가 데이터 효율 비율, 곧 가장 오래된 형태의 스케일링 결과이며, 지난주가 조용해졌다고 말한 바로 그 축 위에 있다. 1B 논문 한 편이 주제를 뒤집지는 않지만, 확증 증거만 계속 쌓이는 주제는 아무도 시험하지 않는 주제다.
- → Full-bandwidth transformer (arXiv:2608.08888) (신규)
How Can Rhetoric Reward-Hack AI Reviewers? — arXiv:2608.08975
- TL;DR: 익명화된 ICLR 2026 투고 120편에서 파생한 원고 4,200편, 보고된 과학적 내용은 고정한 채 여섯 수사 차원만 반대 방향으로 옮기고 다섯 LLM 리뷰어가 채점한다. 증거 프레이밍과 참신성 태도가 가장 크게 흔들고, 방향은 리뷰어의 원래 점수에 달려 있다: 낮은 점수는 오르고, 높은 점수는 내리며, 중간 구간에서 가장 뚜렷하다.
- 왜 읽을 만한가: 이것은 보상 모델이 아니라 평가자를 상대로 측정한 reward hacking 이고, 그 구성은 지금 어디에나 있다. 중간으로 회귀하는 평가자는 잡음을 더하는 데 그치지 않고 자신이 만들어야 할 신호를 압축하며, 문턱값이 놓이는 바로 그 지점에서 가장 덜 변별한다. 엄격 리뷰는 평균 1.36점을 깎을 뿐 견고함을 사지 못한다: 가혹함은 해법이 아니다.
- → How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review (arXiv:2608.08975) (신규)
관찰
- 25편 배치 하나에 월드 모델 논문이 여섯 편 — Alaya-EVOKE, DreamX-Phi, PlayWorld, H2R-Bench, LDR, AVA-Encoder. 주제처럼 보이기에 충분하다. 개념 페이지는 만들지 않았다.
placeholder-check가 그것을 요청한 문서가 하나도 없다고 보고하고, 하루치 배치만으로 쓰인 페이지는 이 저장소가 90일 동안 떠안았던 부풀린 스텁이기 때문이다. 수요가 쌓이면 판정이 바뀌고 그때 만든다. - Hugging Face 의 State of Open Models: Summer 2026 Observations 가 프리페치 원장에 사흘째 올라 있으면서 여전히 수집되지 않았다 — 호스트가 차단돼 있고, 표적 검색은 인접 자료만 돌려준다. 후보는 URL 을 담지 본문을 담지 않는다. 나흘째가 된 미수집 Alignment Science 게시물 세 건과 함께 W34 lint 로 넘긴다.
- GLM-5.3 의 가중치가 2026-08-28 무렵, Grok 4.7 이 2026-08-22 무렵 으로 예정돼 있다 — 둘 다 아직 산출물이 아니라 약속이고, 둘 다 이 위키가 스스로에게 정해둔 날짜 확인 사항이다.
위키 신규
다섯 모두 논문 페이지이므로 이번 실행에서 사용자 검토가 필요한 것은 없다 — 이틀 연속으로 신규 엔티티·개념·인물 페이지는 만들어지지 않았다.
- Thought-Level Beam Search for Reasoning (arXiv:2608.08020) (신규)
- Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence (arXiv:2608.12743) (신규)
- Full-bandwidth transformer (arXiv:2608.08888) (신규)
- How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review (arXiv:2608.08975) (신규)
- Intern-S2-Preview: Scientific Agentic Foundation Model (arXiv:2608.13505) (신규)
업데이트
- Qwen 3.8 27B: 출시 이후 첫 실사용 기록을 추가했고, 12일 된 17GB 주장은 해소된 것이 아니라 여전히 미측정으로 표시했다.
- AI Alignment: 학습된 정책이 아니라 LLM 평가자에 관한 첫 주요 논문을 얻었다.
- AI Governance: 이제 자율규제기구가 이 페이지의 정부 수단들 곁에 놓이고, 그 아래의 "Pacing the Frontier" 성명이 요구했던 제동 장치를 쥘 기관이 마침내 지목됐다.
- DeepSeek V4-Flash: 출처가 그랬으므로
Pricing을 RMB 로 옮겼다. 왜 환산하지 않는지도 페이지에 적었다.