$ cat briefs/daily/2026-08-14.md
2026-08-14
2026년 8월 14일 (금)
스토리 4건 · 논문 1건 · 관찰 3건 · 신규 페이지 3건 · 정정 1건
프런티어 릴리스 둘이 같은 날 도착했고 **어느 쪽도 하네스를 공개하지 않았다**. 그래서 직접 비교되는 유일한 수치 — DeepSWE, 65.3 대 62.7 — 는 아직 아무것도 뜻하지 않는다. 그 아래에서 오늘 가장 쓸모 있는 발견은 내부의 것이다. 어제 이 브리프가 발행한 사실 하나가 틀렸고, 두 번째 공백을 잡았어야 할 점검은 애초에 한 번도 돌지 않았다.
주요 소식
1. DeepSeek 의 V4-Pro 가 프리뷰를 벗어났고, 벤더와 심판이 변화의 크기를 두고 갈린다
- DeepSeek 이 API 문서에서 V4-Pro 프리뷰 판을
0813빌드로 교체했다. 1.6T 총 / 49B 활성 MoE, 1M 컨텍스트에 최대 출력 384K, thinking·non-thinking 모드, Responses API 와 Codex 지원, MIT 가중치, $0.435/M 입력 (캐시 미스) · $0.87/M 출력 (source). - 자신의 프리뷰 대비 벤더 발표 에이전트 성능 향상은 막대하다. Terminal Bench 2.1 72.1 → 87.9, DeepSWE 12.8 → 62.7, CyberGym 52.7 → 83.3. DeepSeek 은 하네스를 공개하지 않았고, 따라서 어느 것도 재현할 수 없다 — "제3자 기록은 비어 있다".
- 남이 산출한 유일한 수치는 1점 움직인다. Artificial Analysis 는 Intelligence Index 53 에 놓는데, 회사 자신의 더 싼 모델인 DeepSeek V4-Flash 보다 1점 위이고 OpenAI 계열의 중간 티어인 GPT-5.6 Terra 보다 4점 아래다. SCMP 의 헤드라인: "struggles on benchmarks, shines in cybersecurity."
- 의의: 같은 릴리스가 누가 벤치마크를 돌렸느냐에 따라 단계적 도약이 되기도 하고 반올림 오차가 되기도 한다 — 그리고 그 차이는 근소하지 않다. 하네스가 공개되지 않은 자체 에이전트 스위트와 10개 벤치마크 독립 합성 지표는 서로 다른 질문에 답하고 있으며, 대조 가능한 것은 그중 하나뿐이다.
- → DeepSeek V4-Pro-0813 (신규), DeepSeek, Eval Harness Configuration
2. Gemini 3.7 Flash 가 3.6 으로부터 23일 만에, 용량 수치는 전부 그대로인 채 출시됐다
- 1M 컨텍스트, 최대 출력 64K, 2026년 3월 지식 컷오프, 텍스트·이미지·오디오·비디오 — 모두 Gemini 3.6 Flash (2026-07-21) 와 동일하다. 프리뷰가 아니라 발표와 동시에 정식 출시됐다 (source).
- 움직인 것은 벤치마크 칼럼이다. AutomationBench 17.0% → 30.4%, DeepSWE 48.6% → 65.3%, FrontierCode 34.4% → 43.6%, 그리고 LVBench 85.4%, GDM-MRCR v2 97.0% @128k / 62.5% @1M, WebDev Arena 1588 Elo. AutomationBench 에서는 GPT-5.6 Terra (23.6%) 와 Claude Sonnet 5 (10.7%) 를 앞선 것으로 배치됐다.
- $0.75/M 입력 · $3.75/M 출력, 2026-12-31 까지 도입가이며 2027-01-01 부터 $1.50 · $7.50 로 돌아간다. 보도의 "반값"은 만료일이 공개된 창이지 인하가 아니다.
- Logan Kilpatrick 은 이 향상을 규모가 아니라 약 3주에 걸친 알고리즘 개선 덕으로 돌린다. 이는 벤더가 자기 원인을 설명한 것이고 그에 대한 근거는 공개되지 않았다.
- 의의: 동일한 용량, 두 배가 된 자동화 점수, 3주 간격 — 이것은 랩이 포스트트레이닝을 출하하면서 모델이라 부르는 일이다. 그리고 여기서는 검증도 불가능하다. 여섯 벤치마크 중 어느 것도
sources/evals/스냅샷에 없어서, 단 하나의 수치도 대조할 로컬 칼럼이 없다. - → Gemini 3.7 Flash (신규), Google DeepMind
3. Ultrafast 는 서비스 티어다 — 그리고 OpenAI 는 이미 750 tok/s 티어를 팔고 있다
- GPT-5.6 Sol 을 Standard 대비 최대 14배 속도로, 초당 최대 750 출력 토큰, Cerebras 로 구동, API 우선으로 선별된 고객군에 제공한다. Cerebras 는 "GPT-5.6 Sol Standard 와 동일한 지능"으로 동작한다고 밝힌다 (source).
- 읽은 자료 어디에도 Ultrafast 의 가격은 없다 — 그리고 GPT-5.6 Sol (and Terra, Luna) 은 2026-07-30 부터 Sol Fast, ~750 tok/s, $12.50 / $75 를 싣고 있다. Ultrafast 의 헤드라인 처리량은 같은 숫자다. 둘의 관계를 밝힌 자료는 읽지 못했고, 그래서 어느 행도 다른 쪽을 근거로 고치지 않았다.
- 빠진 것이 둘 더 있다. 14배가 무엇을 기준으로 잰 것인지 (Standard 의 초당 토큰 기준선은 공개되지 않았다), 그리고 "동일한 지능"을 뒷받침하는 벤치마크 — 능력 측정 없이 제기된 능력 동등성 주장이다.
- 의의: OpenAI 의 프레이밍은 이제 속도가 지능을 대가로 하지 않는다는 것이고, 사실이라면 실제 변화다. 그러나 발표는 기준선·벤치마크·가격을 빠뜨렸다 — 새로운 역량과 다른 실리콘 위에서 도는 기존 고속 티어를 가를 세 수치가 바로 그것들이다.
- → GPT-5.6 Sol (and Terra, Luna), OpenAI
4. 정정: 이 브리프는 Qwen 27B 가 출시됐다고 썼다. 출시되지 않았다.
- 어제 브리프와 Qwen 3.8 27B 는
Released: 2026-08-12로 기록했다. 그날 나온 것은 Max 급 플래그십 Qwen 3.8 Max 하나뿐이었고, 2026-08-13 실행이 한 번의 배포를 두 체크포인트에 대한 배포로 읽었다 (source). - 2026-08-13 기준 27B 에는 공식 저장소도, 모델 카드도, 라이선스 파일도, 자신의 벤치마크도 없다. 그리고 ModelScope 카운트다운이 2026-08-15 00:00 JST 를 가리킨다 — 예고된 08-10 과 넘겨짚은 08-12 에 이은 세 번째 날짜다.
Released는 not yet 으로,Availability는unknown으로 돌아갔다. 틀린 값은 지우지 않고 페이지에 남긴다. 불변인 08-12 스냅샷도 손대지 않았고, 정정은 새 스냅샷에 담았다.- 의의: 오류는 두 산출물에 대한 벤더의 예고를 두 산출물의 배포로 취급한 데서 나왔다. Alibaba 는 여기서 읽은 어떤 1차 채널에서도 2026-08-10 이라는 날짜를 다시 말하거나 옮기거나 철회한 적이 없다 — 카운트다운 페이지는 놓친 날짜를 언급 없이 대체할 뿐, 날짜를 옮기는 것과 같지 않다. 닷새가 밀렸고 아직 세는 중이다.
- → Qwen 3.8 27B, Alibaba / Qwen AI Lab, Open-Weights Policy Fight
점수 메모: 스토리 1이 2.21 로 선두다 — 프런티어 모델 릴리스 (1.3) × 오픈 웨이트 (+0.4) × 중국 랩 엔티티 가중치이고, 닷새 이어진 관찰 항목을 닫는다. 스토리 2는 1.95, 스토리 3은 1.43 (제품·배포 0.7 을 프런티어 모델 연결이 끌어올림), 스토리 4는 1.30 — 발행된 사실에 대한 정정은 그 사실이 지녔던 프런티어 모델 가중치를 그대로 지니며, 그래서 논문 아래가 아니라 위에 놓인다.
논문 선정
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution (arXiv:2608.00677) — 프롬프트가 아니라 환경을 레드팀한다 (arXiv:2608.00677, Fudan University / Shanghai AI Laboratory / XSafeAI)
- 50개 도메인에 걸친 1만 개 이상의 검증된 상태 보존 시나리오, 50만 개 이상의 도구·스킬 풀에서 구성되며, 과제당 도구 호출 중앙값 97회와 75개 에이전트-모델 구성을 지원한다. 전제는 이렇다. 에이전트 리스크는 장기 워크플로에서 재사용되는 공유 상태를 통해 누적되고, 짧고 정적인 안전 벤치마크는 그것을 볼 수 없다 (source).
- 페이지의 결과 절은 의도적으로 비어 있다. 공격 성공률도, 결과 표도, 비교도 보지 못했다 —
arxiv.org는 이 샌드박스에서 차단되어 있고 초록 발췌는 규모 수치만 담고 있다. 아무도 읽지 않은 발견을 바꿔 쓴 논문 페이지는 무엇이 빠졌는지 말하는 페이지보다 나쁘다. - 의의: 붙들어 둘 숫자는 도구 호출 중앙값 97회다. 이 위키가 점수를 기록하는 모든 에이전트 벤치마크 — 위의 Terminal Bench 2.1, DeepSWE, CyberGym — 는 그보다 훨씬 짧은 지평이고, 그것이 정확히 이 논문이 자신이 들어서는 분야에 제기하는 불만이다. 게다가 여기 실린 에이전트 안전 평가가 거의 전부 1차 당사자의 것인 가운데, 학계 컨소시엄에서 나왔다.
- 08-11 이후 처음으로 arXiv 식별자를 달고 도착한 HuggingFace Daily 항목이다. 나머지 두 트렌딩 제목은 식별자가 없어 수집하지 않았다.
관찰
- Anthropic Alignment Science 글 세 편이 어떤
sources/파일에도 없고 이 위키 어디에도 인용되지 않았다 — AuditBench (2026-03-10), Introspection Adapters (2026-04-28), The Hot Mess of AI (arXiv 2601.23045, ICLR 2026). 2026-07-31 에 추가된 상시 점검은 가장 새로운 글만sources/와 대조한다. 과거 목록은 한 번도 훑은 적이 없다. CLAUDE.md 가 24회 인용된다고 적은 소스에, 수면 아래 미수집 글이 세 편 있는 것이다. 이번 실행에서는 채워 넣지 않았다 — 연구 글 세 편은 하루의 여백에서 할 일이 아니고, 아무도 읽지 않은 페이지의 요약을 쓰는 것은 이 파이프라인이 막으려는 실패 그 자체다. 일요일 lint 로 넘긴다. → Anthropic - MiniMax Music 3.0: MiniMax 는 "오픈 웨이트", 한 모델 디렉터리는 "호스팅형, 내려받을 수 없음", 그리고 출시일이 둘이다. MiniMax 자신의 글 제목은 Open-Weights 이고 Hugging Face·GitHub·ModelScope 저장소가 보고됐다 (2026-08-13). 디렉터리는 Music 3.0 을 2026-07-16 호스팅형 모델로 적는다. 둘을 가르는 자료는 읽지 못했다. 모델 페이지는 만들지 않았다 — 여기서는 라이선스가 중요한데, MiniMax 의 H3 Community License 는 이미 미국·EU·영국·한국을 제외하고 있기 때문이다. → MiniMax
- Grok Bot — 자체 VM 을 갖고 사용자의 도구에 로그인하는 지속형 에이전트 — 은 얼리 베타이고 위키 밖에 둔다. Latent Space 다이제스트와 제3자 블로그 하나를 통해 드러났고 1차 자료는 읽지 못했다. GLM-5.5 와 같은 처리다. 그쪽은 모델 카드도 벤치마크도 엔드포인트도 없이 열이틀째 소문 상태다. → xAI, Z.ai
위키 신규
- DeepSeek V4-Pro-0813 (신규 모델 페이지) — DeepSeek V4-Flash 선례에 따라 별도 페이지를 줬다. DeepSeek 은 모델의 정체는 그대로 두고 하는 일은 바꾸는 날짜 빌드를 내놓는다. 해소하지 않고 기록한 상충이 둘 — 출시일 (한 트래커는 08-12, 매체들과 DeepSeek 자신의 "오늘 출시" 문구는 08-13) 과 파라미터 수 (1.6T/49B 대 1.57T/48B), 양쪽 다 제3자다.
- Gemini 3.7 Flash (신규 모델 페이지) — 스펙 행 전체를 실었다. 파라미터 수·아키텍처·가중치는 보고되지 않았고 이 계열에서 기대되지도 않는다.
- OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution (arXiv:2608.00677) (신규 논문 페이지) — 논문 선정 참조.
- 이번 실행에는 새 엔티티나 개념 페이지가 없어 사용자 검토가 필요한 항목이 없다.
업데이트
- Qwen 3.8 27B — 정정:
Released2026-08-12 → not yet,Availability→unknown. 철회된 주장은 그대로 남겨 두었고 날짜 표는 이제 네 줄이다. 실질적으로 하나 얻은 것: 처음으로 27B 를 dense 로 서술한 자료가 나왔다 — 제3자이므로 스펙 표에는 넣지 않았다. - GPT-5.6 Sol (and Terra, Luna) — Ultrafast 절 추가. Sol Fast 와의 겹침은 해소하지 않고 열린 질문으로 기록했다.
- DeepSeek V4 — 이제
0813빌드를 가리킨다. 그 페이지에서 V4-Pro 를 서술하는 내용은 모두 7월 GA·프리뷰 시점의 것이다. - Eval Harness Configuration — 두 가지를 더했다. DeepSeek·Gemini 쌍 (DeepSWE 62.7 대 65.3, 양쪽 다 하네스 비공개), 그리고 재현성의 실측 기준선: 코딩 에이전트로 19일간 ICML 2026 논문 2,200편 이상의 주장을 재현한 커뮤니티 작업 — 참가자 1,221명, 판정된 주장 35,908건, 확인 3,978건, 완전 재현 266편, 반증 없이 부분 재현 632편. 보도는 이를 "절반 이상"이라 요약하지만 2,200편 중 898편은 절반에 못 미치고, "절반 이상"은 논문당 최소 한 건의 주장이 확인됨을 세는 더 약한 척도다. 둘 다 기록한 것은 그 간극이 곧 발견이기 때문이며, 자동 판정기가 어떻게 검증됐는지는 읽은 자료 어디에도 없다.
- Agents (LLM Agents), DeepSeek, Google DeepMind, OpenAI, Alibaba / Qwen AI Lab, MiniMax — 최근 활동과 모델 목록 갱신.