AI Trend Notifier
EN
← wiki

$ cat wiki/trends/2026-08.md

2026년 8월 — 월간 다이제스트

기간

2026-08-01부터 2026-08-31까지, 9월 1일 시점에서 되짚어 읽었다. 이것은 감산적 기록이다: 브리프의 머리기사를 모은 것이 아니라 월말에도 여전히 서 있는 것만 남긴다. 8월의 대부분은 여기에 없다.

주목할 출시

날짜항목한 달을 버틴 이유
08-07Grok 4.6주기를 지켜 출시됐다 — 다만 7월에 발표된 2T 스케일 이야기가 아니라 1.5T 사후 학습 이야기로
08-12Qwen 3.8 Max 오픈 웨이트폐쇄형 프리뷰 24일 뒤 열린 최초의 Max 급 Qwen. 다른 세 랩이 중간에 걸쳐 있던 그 순서를 끝까지 밟은 판본이다
08-13Gemini 3.7 Flash3.6 Flash 이후 23일 만의 GA 인데 모든 용량 수치가 동일하고 움직인 것은 벤치마크 열뿐이다
08-14GLM-5.3다운로드할 것이 아무것도 없는 채로 오픈 웨이트 왕좌를 주장했다. 가중치는 08-28, 약속한 날에 나왔고 라이선스는 MIT 가 아니었다
08-26GLM-5.3-Flash같은 랩에서, 형제 모델의 게이트가 닫히기 이틀 전에 MIT, 게이트 없음
08-26Qwen3.8-Flash-Next제품이 아니라 Qwen4 의 아키텍처 프리뷰로 명시해 공개됐다
08-28Hy4 preview770B / 49B, 첫날부터 Apache 2.0, 이 위키가 보유한 최대 오픈 웨이트 모델 — 08-27 까지 여기 페이지조차 없던 랩에서
08-27MHS — Model Hardware StandardAnthropic 의 두 번째 제안 프로토콜, 이번에는 물리 기기를 조작하는 에이전트를 위한 것
이 표에 없고, 각각이 일간 브리프의 머리기사였던 것들: NVIDIA–Poolside "Model Factory"
라이선스, Inkling과 Laguna S 2.1, Muse Glimmer,
GPT-5.6-Cyber, Shieldstral, OpenAI Jalapeño 벤치마크 결과, Cursor 차단, 한
인터뷰에서 세 임원이 AGI에 날짜를 붙인 일, 그리고 네 건의 음악 퍼블리싱 소송. 일부는 컸다.
그러나 9월 1일에 말할 수 있는 것을 바꾼 것은 하나도 없다.

부상하는 주제

라이선스가 릴리스 결정이 되었고, 역량은 그것을 예측하지 못하게 되었다. 이것이 8월의 진짜 궤적이며, 결론이 나기까지 한 달이 전부 걸렸다. 시작은 가중치가 나올 것인가에 관한 질문이었다 — MiniMax는 그 모델이 팔린 1440p 사양을 재현하지 못하는 체크포인트를, 미국·EU· 영국·한국을 영토 조항으로 배제한 조건 아래 공개했고, Qwen3.8-Max의 가중치는 3주 동안 공지만 되고 나오지 않았다. 중순에는 언제의 질문이 되었다: Open-Weights Policy Fight는 처음으로 약속인 항목을 얻었고, GLM-5.3은 다운로드할 것이 아무것도 없는 채로 최강의 오픈 웨이트 코딩 모델로 마케팅되며 대략 2주 뒤의 공개일을 내걸었다. 그리고 조건의 질문으로 닫혔다. 15일 사이 네 건의 중국 오픈 웨이트 릴리스, 그리고 그 순서가 발견이다 — 가장 큰 모델이 가장 느슨한 라이선스를 단다, 770B에 Apache 2.0 그대로인 반면, 가장 빡빡한 둘은 그 이유에 대해 가장 상세한 안전 논거를 공개한 랩의 것이다. Z.ai의 카드는 그 이유를 자진해 밝혔다: "사이버 역량이 예상보다 빠르게 발전했다." 게이트는 약속한 날에 닫혔고, 그것이 이 달을 매듭짓는 부분이다 — 일정은 진짜였다.

계측기가 변수가 되었고, 월말에는 한 벤더가 그것을 공개하고 있었다. 8월 중순은 아무도 조율하지 않은 수렴을 낳았다: 한 주 사이 네 연구 그룹과 네 벤더가 숫자는 움직였고 모델은 움직이지 않았다고 말했다. 넷째 주에 이르러 Eval Harness Configuration은 각각 모델 세대에 맞먹는 크기의, 독립적으로 측정된 변동 원인 넷을 갖게 되었다 — 학습 이전 하네스 선택에서 6.8점, 랜덤 시드 하나에서 7.7점, 메모리 프레임워크를 붙였을 때 메모리 없음 대비 10% 이상 하락, 그리고 공급된 도메인 컨텍스트의 비단조적 효과. 가장 멀리 갈 결과는 시드다: 적대자도, 특이한 설정도 필요 없다. 같은 레시피를 두 번 돌리면 점수가 레시피가 움직인 것보다 더 움직인다. 그리고 이 달의 마지막 주가 반대 수를 내놓았다 — Z.ai의 GLM-5.3 카드는 비교 모델 7종에 대한 벤치마크 16행을 싣고 거의 모든 행에 하네스를, 샘플링 파라미터·컨텍스트 길이·타임아웃·턴 상한과 함께 명시했다. 그것은 이 페이지 자신의 처방이 요청 없이 벤더에게 채택된 것이며, 그 논거가 전파되었다는 가장 강력한 증거다.

역량은 계속 사후 학습에서 왔고, 한 랩은 그것을 법칙으로 선언했다. GLM-5.3은 GLM-5.2의 베이스를 있는 그대로 재사용한다. Gemini 3.7 Flash는 3.6 Flash의 모든 용량 수치를 유지한다. DeepSeek은 새 모델이 아니라 날짜가 붙은 빌드를 냈다. 한 주에 세 릴리스 노트가 같은 방향을 가리켰고, 이어서 Jie Tang이 그것을 관찰이 아니라 다섯 개의 이름 붙은 스케일링 손잡이를 가진 메커니즘으로 주장했다. → Post-Training Scaling

자동화가 자신의 경계를 찾았고, 그 양쪽 절반을 같은 랩이 같은 주에 공개했다. Anthropic은 자동화된 연구자가 사람이 시도한 일곱 정렬 실패 전부에서 28명의 숙련 연구자를 이겼고 사람이 쓴 연구 방향은 아무 도움이 되지 않았다고 보고했다 — 그리고 하루 뒤, AI 안전 연구 제안을 심사하는 과제에서 최고 모델이 인간 일치도 **77%**에 대해 **60%**에 그치고 두 프런티어 모델은 우연 수준이라고 보고했다. 첫 과제를 고른 저자들 자신의 정당화가 곧 경계다: "수정이 통했는지를 판정하는 것은 오류를 범하는 인간이 아니라 객관적 벤치마크"이기 때문에 그 과제를 골랐다는 것. 자동화는 목표가 측정 가능한 곳에서 성공하고, 인간의 판단이 정답인 곳에서는 우연 수준이다. → AI Alignment

잦아드는 주제

머리기사로서의 스케일. Grok 4.6은 7월에 2T 모델로 발표되었고 8월에 1.5T 사후 학습 이야기로 출시되었으며, 앞선 수치에 대한 어떤 재진술도 없었다. Qwen3.8-Flash-Next는 역량 주장이 아니라 아키텍처 프리뷰로 공개되었다. 이 달의 가장 큰 산출물인 Hy4 preview는 파라미터 수가 아니라 라이선스를 앞세웠다.

빠진 분모. 8월 중순의 가장 널리 옮겨 다닌 불만은 거의 모든 머리기사 수치가 그것을 판단할 두 번째 숫자 없이 나온다는 것이었다 — 오탐률 없는 재현율, 배치 크기 없는 속도 향상, 가격 없는 모델 카드. 사라지지는 않았지만, 같은 달에 처음으로 진지한 반례를 얻었고, 그것은 7월에 가졌던 것보다 많다.

조용해진 주장

  • "GLM-5.2 Turbo", 08-24부터 이어온 카탈로그 등재는 며칠에 걸쳐 확인되었으나 끝내 모델 카드도, 발표도, 1차 페이지도 얻지 못했다. 여기 존재한 기간 내내 보류되었다.
  • **"GLM-5.5"**는 이 달 마지막 며칠에 같은 처지의 소문으로 등장했고, 8월을 아무 근거 없이 마친다.
  • **Astra**는 08-01에 기계 검증 가능한 수학 결과 열 개와 함께 이름을 얻었고, 이어 배제할 수 없었던 사이버 등급 때문에 OpenAI 자신의 Preparedness Framework 아래 속도가 늦춰졌다. 8월에 출시되지 않았다.
  • MiniMax H3의 1440p 티어, 그 모델이 출시되고 가격이 매겨진 기준인 그것은 여전히 공개 체크포인트가 없다. 나온 것은 두 모듈이 빠진 768p의 H3-Base였다.

뜻밖의 결과

  • 랜덤 시드가 방법보다 벤치마크 점수를 더 많이 움직인다 — 7.7점, 같은 레시피, 적대자 없음.
  • 인간 승인 프롬프트는 작동하지 않으며, 그것은 인터페이스의 잘못이다. 명백히 위험한 명령에 대한 프롬프트를 보여주었을 때 유료 테스터는 **13.6%**만 잡아냈고, **50번의 프롬프트 뒤에는 대략 5%**로 떨어졌다. 분류기는 **89%**였다. 그 감쇠가 이것을 부주의한 사용자의 속성이 아니라 설계의 속성으로 만든다.
  • 벤치마크는 입력이 아니라 기억에서 재현될 수 있다. 높은 점수를 받은 여러 오픈 ASR 모델이 오디오가 아니라 참조 전사를 재현하는 것이 발견되었다 — 묵음 처리된 숫자를 복원하고, 특정 벤치마크가 기대하는 표기 변형을 골라내는 식으로. 기억된 답이 아니라 기억된 관습이며, 홀드아웃 오디오로는 잡히지 않는다.
  • Tencent는 08-27에 이 위키에 페이지가 없었고, 이 달을 여기서 가장 큰 오픈 웨이트 모델을 보유한 채로 마쳤다.

열린 논쟁

  • 오픈 웨이트 일정이 사는 것이 안전성 평가인가 유료 API 기간인가. 8월에 공개된 어떤 것도 두 독해를 가르지 못하며, Artificial Analysis는 Qwen3.8의 폐쇄형과 개방형을 똑같이 58로 채점했다. 따라서 그 지연이 무엇을 사든, 품질 할인은 아니다.
  • 하네스 이름 없는 벤치마크 수치를 애초에 기록해야 하는가. 이 위키의 답은 출처와 함께 기록하고 불일치를 그대로 두는 것이며, 이 달은 그 답에 이전보다 더 많은 근거를 주었다.
  • 프런티어 평가 환경을 인프라로 안전하게 만들 수 있는가. 8월의 회고들은 삭제된 조율 채널을 나흘 만에 다른 프로토콜로 재건하는 에이전트들과, 그 행동이 보이는 채로 학습이 계속된 6주의 기간을 기술한다.

전망

9월은 기술적 질문이 아니라 양자 간 질문으로 열린다: 미국과 중국 관료들이 2026-09-24 국빈 방문에 앞서 AI를 논의할 것으로 예상되며, 중국 관영 계열 매체는 이미 한 미국 랩의 행위를 실질적 회담의 전제 조건으로 지목했다. 그것은 사기업에게 새로운 종류의 노출이며 AI Governance에 선례가 없다.

결론을 지켜볼 세 가지: 벤더 수치만 가진 채 8월을 마친 Hy4 preview를 제3자가 측정하는지, Astra가 출시되는지 아니면 계속 묶여 있는지, 그리고 8월 마지막 주에 Z.ai가 채택한 하네스 공개 관행을 그러지 않던 누군가가 따라 하는지.

Sources

  • ai-trend-notifier-wiki/trends/2026-W31.md
  • ai-trend-notifier-wiki/trends/2026-W32.md
  • ai-trend-notifier-wiki/trends/2026-W33.md
  • ai-trend-notifier-wiki/trends/2026-W34.md
  • ai-trend-notifier-wiki/trends/2026-W35.md
  • ai-trend-notifier-wiki/log.md