$ cat briefs/daily/2026-09-27.md
2026-09-27
2026년 9월 27일 (일)
소식 2건 · 논문 선택 3건 · 주시 5건 · 신규 페이지 8개
**어제 이 파이프라인은 폴링하지 않던 랩 둘을 발견했다. 오늘은 *실제로 캡처하고 있던* — 자기 저장소에, 매주, 일곱 주 동안 — 그러면서 한 번도 읽지 않은 모델을 발견했다.** [[models/ling-3-0-tiny]] 는 **2026-08-06** 에 출시되어 **52일 늦게** 도착한다. `Ling 3.0 Tiny` 는 **2026-08-09 이후 `sources/evals/` 의 모든 Artificial Analysis 스냅샷 — 연속 13회 캡처 — 에** 있고, `InclusionAI` 는 이 저장소가 보유한 **가장 오래된** 그런 스냅샷에 있다. 스냅샷 인테이크는 위키가 이미 이름을 가진 모델의 수치를 확인하려고 그 표들을 읽는다. **가지지 않은 랩에 대해서는 `Creator` 열을 읽지 않는다.** 매주 캡처되는 269행 리더보드는 누가 출시하고 있는가의 목록인데, 이 파이프라인은 그것을 조회 표로 써 왔다. **오늘의 다른 발견 둘도 가져오기가 아니라 읽기에 관한 것이다.** 어제 쓰인 [[concepts/world-models]] 는 그 용어의 두 의미를 비교할 계측기가 없다고 말했다 — **하나가 닷새 전에 발표되어 있었고**, 아래 논문 관련 항목에 있다. 그리고 `sources/evals/lmarena-2026-09-27.md` **가 없다**: 오늘은 일요일이고 리더보드 둘이 예정되어 있었는데 Action 은 하나만 커밋했다. W39 lint 로 넘겼다. **Egress**: `www.anthropic.com` 이 **다섯 번째 연속 런**에서 1차 자료로 응답하고 새로운 것을 반환하지 않았다 — 다만 그 인덱스가 9월 항목 **일곱 개**를 렌더링했고 어제 같은 페이지를 읽은 결과는 **네 개**였는데, 여기서는 아무것도 잡지 못할 dedup 위험이다. 차단: `alignment.anthropic.com` (**열 번째 연속 런**), `www.meta.com`, `ant-ling.medium.com`. **`huggingface.co` 는 시도하지 않았고**, 어제의 오류를 바로잡는다.
주요 소식
점수 순. 둘 다 오늘의 최고 논문 선택(1.65) 아래에 있으며, 나흘 중 세 번째로 이 페이지의 최고 점수가 논문이다 — interests.md 는 항목에 점수를 주고, 오늘의 발견은 이 파이프라인에 관한 것이며 그에 해당하는 행이 없다.
1. 7.9B MIT 모델이 일곱 주 전에 출시되었고, 이 저장소는 그 증거를 매주 일요일 커밋해 왔다 (1.40)
- 2026-08-06: inclusionAI / AntLing 의 Ling-3.0-tiny — 하이브리드 추론 MoE, 총 7.9B / 활성 ~1.3B, MIT, BF16, FP8, INT4, GGUF 가중치, 로컬 에이전트 용도로 만들어졌고 NVIDIA DGX Spark, Apple Silicon MacBook, Mac mini 에서 검증되었다고 진술된다 (source)
- 아키텍처, 그리고 사실이라면 그것이 핵심이다: KDA 와 MLA 를 번갈아 쓰는 하이브리드 선형 어텐션 스택 (2개 패스; 하나는 KDA 를 Kimi Delta Attention 으로 풀어쓴다 — Moonshot AI 의 라인 이름이 다른 랩 모델 안에 있다), 한 패스는 그 스택이 "이전에는 프런티어 규모 모델에서만 검증되었다" 고, 여기서 활성 ~1.3B 까지 내려왔다고 말한다. 희소 128 전문가 MoE 는 단일 패스이고 채택하지 않았다
- 공개된 수치 셋이 이 저장소 자체의 캡처된 리더보드와 상충하며, 매번 캡처된 페이지가 이긴다. Artificial Analysis Intelligence Index 15 * 대 요약의 25 — 그리고 25 는 같은 스냅샷이 형제
Ling 3.0 Flash에 주는 수치이고, 그것이 명백한 설명이지만 어디에도 진술되지 않으므로 추론으로 해소하지 않고 상충으로 기록한다. 컨텍스트 262k 대 260k. Median Tokens/s 31 대 주장된 160+, 같은 측정이 아니다. 네 번째 수치 — "Artificial Analysis Agentic Index 에서 16" — 은 여기서 원리적으로도 확인할 수 없다.aa-fetch.py가 단언하는 일곱 열에 그것이 없다 (source) - 랩이 없다고 기록된 모델 라인을 얻었다. 어제의 Ant Group (inclusionAI / AntLing) 은 "Ling 모델 라인이 있는지 읽은 것으로는 확립되지 않는다" 고 적었다. 있다 — 오늘 캡처된 표에 형제 다섯 개가 더 있고 그중 하나는 1T 모델이므로
Ling과Ring은 두 라인이며 읽은 자료 어디에도 둘을 구분하는 것이 무엇인지 없다. 어느 것도 페이지를 받지 않는다: 리더보드 행은 이름, 컨텍스트 창, 점수를 주고 출시일, 라이선스, 발표는 주지 않는다 - 의의: MIT, 다운로드 가능, 52일 — 그리고 이 위키에서 그 위에 만들어진 것이 아무것도 없다. Ternary Bonsai 2 27B 는 누군가 Qwen 파생 모델을 Apache 2.0 으로 재구축했기 때문에 존재한다. 관대한 라이선스는 필요조건이며 명백히 충분조건이 아니다. 여기서 없던 것은 들여다보는 사람이었다
- 확립되지 않음: 1차 문서를 읽지 못했다 —
ant-ling.medium.com과huggingface.co모두EGRESS_BLOCKED; 학습 데이터 진술 없음; 이름이 붙은 벤치마크 점수 전무, 평가된 도메인만 있다.Catalogue id행을 의도적으로 넣지 않았다 — Ming-Image-0.1-Design 이 이미 09-26 에 확인되지 않은 것 하나를 안고 있고, 두 번째는 그 행의 용도가 아니다 - → Ling-3.0-tiny · Ant Group (inclusionAI / AntLing) · Open-Weights Policy Fight
2. Meta 의 아바타 모델은 모든 것에 워터마크를 넣는다 — 그리고 이 위키는 어제 하루를 그렇지 않다고 기록하며 썼다 (1.10)
- 2026-09-23, Meta Superintelligence Labs: Muse Realtime Avatar, "Muse Realtime Voice 를 표현력 있고 상호작용하는 아바타로 바꾸는 state-of-the-art embodiment 기술" (그대로, 2개 패스). Muse Realtime Voice 와 짝을 이뤄 Muse 가 1초 이내에, 대화를 이어가는 동안 계속 응답하는 사이 오디오와 영상이 동기를 유지하고, 참조 이미지 — 사진, 일러스트, 동물, 생활용품 — 를 말하고 몸짓하고 자세를 바꾸는 연속 영상으로 렌더링한다 (source)
- 사양: 448×768, 25 fps, ~870 ms 종단 (2개 패스), 그리고 모든 출력에 AI 워터마크, "지연을 더하지 않고". 출하 기본값은 만화다 — "Jolly", 크림색, "완전히 커스터마이즈 가능" — 반면 진술된 입력에는 "사진" 이 있다
- 의의, 그리고 그것은 모델보다 절차에 관한 것이다. 09-26 에 이름은 단일 패스로 표면화되어 Meta AI 의
상충 보고에 채택하지 않음으로 보류되었고, 읽은 어떤 것도 워터마킹을 진술하지 않는다는 관찰이 함께 적혔다. 오늘 세 패스가 사양을 준다. 보류의 사실관계 추측은 틀렸고, 보류는 옳았다. 하루 앞서 쓰인 페이지는 진실의 반대를, 인용을 달고 공개했을 것이다. 그 항목은 삭제하지 않고 자기 해소를 기록하도록 다시 쓰였다 - 실시간 생성 영상 모델 셋, 서로 다른 세 프로비넌스 답: Gemini 3.8 Live 는 모든 프레임에 SynthID, 이름이 있고 공개된 방식; 이 모델은 기제 진술 없이 "AI 로 워터마크됨"; GWM Worlds 2 — 길이 제한 없는 포토리얼 영상과 오디오 — 는 어떤 것도 없고, 다른 둘이 역량에서 따라가는 모델이다
- "지연을 더하지 않고" 가 붙들 만한 주장이고 여기서는 검증할 수 없다. 870 ms 예산 안에서 초당 25 프레임에 표시하는 것은 실제 엔지니어링 결과이거나 반올림 주장이며, 읽은 자료 어디에도 그 표시가 가시적인지, 비지각적인지, 서명되는지, Meta 밖의 누구든 검출할 수 있는지 없다
- 확립되지 않음: 모델 크기, 아키텍처, 베이스 모델 없음; 가용성, 출시일, 지역, 가격, 라이선스 없음. Meta 가 Runway Characters 와 HeyGen LiveAvatar 를 head-to-head 테스트에서 이겼다고 한 주장에는 승률, 표본 크기, 평가자 서술, 비교 대상 버전이 없으므로 결과가 아니라 벤더의 선호 주장으로 기록한다. Meta 1차 페이지는 이 런에서도 다른 어떤 런에서도 읽지 못했다
- → Muse Realtime Avatar · Meta AI · Content Provenance (AI output marking)
논문 선택
sources/papers-daily/hf-daily-2026-09-27.md 에서 — 페이지 와 어제의 일회성 언급까지 대조한 dedup 뒤 항목 25개 중 17개가 신규. upvote 수는 그 커뮤니티의 인기 신호이며 그 이상이 아니다.
SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue — arXiv 2609.26780 (1.65 — 오늘의 최고 점수)
- TL;DR: 범용 에이전트 메모리는 내용을 검색하고 누가 누구에 대해 말했는지를 잃는다. 두 트랙 — 발화자 레이블 원문 메시지와 인물 수준·집단 수준 뷰의 유도 상태 — 을 쿼리 시점에 엔티티, 사건, 시간으로 결합. GroupMemBench / SocialMemBench / EverMemBench 이진 정확도 47.9 / 69.2 / 61.9%, LoCoMo 전체 1,986 문항 70.85%
- 읽을 이유: 구성 요소를 지워 온 한 주의 흐름에 대한 반례다. Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents 은 큐레이션이 쿼리를 기다려야 한다고 논증했고, 이것은 발화자 귀속은 뒤섞인 전사에서 나중에 복원할 수 없으므로 쓰기 시점에 만들어야 한다고 논증한다. 둘은 정확히 서술된 같은 불일치이며 하루 차이로 발표되고 어느 쪽도 서로를 인용하지 않는다. 자기 대표 수치도 어블레이션이다: writer 만 RL 하면 57.38 → 68.20, +10.82, 아키텍처 고정
- → SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue
Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms — arXiv 2609.27321 (1.65)
- TL;DR: 파이프라인은 "환경의 outcome rule 을 정의하기 전에 환경을 구축하고" 둘을 나중에 맞춘다. VHD-Play 는 수학적 모델을 먼저 풀고 setter 가 그 결정 과정을 stateful tool 로 렌더링하여, 실행 가능한 dynamics 와 궤적 채점이 같은 풀린 모델에서 유도된다. 환경 3,300개 각 몇 센트; Qwen3.6-35B-A3B 평균 agentic score 0.204 → 0.815, 본 적 없는 기제 계열 8개와 function calling·여행 계획·e-commerce 로 전이; E-Commerce Bench 에서 파산 없이 모든 실행을 완주하고 Qwen3.7-Max 를 능가
- 읽을 이유: 4× 대표 수치가 아니라 어블레이션. 서술형 문제와 stateful 버전을 비교하면 학습 가능한 격차의 대부분이 근본적인 문제 해결이 아니라 stateful 상호작용으로 드러난다 — 에이전트형 벤치마크와 추론 벤치마크가 갈라지는 이유에 대해 이 위키가 가진 가장 직접적인 증거다. 대표 수치 자체는 정의되지 않은 척도 위에 있다: agentic score 가 무엇을 재는지, 천장이 어디인지 읽은 자료에 없다
- → Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms
ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds — arXiv 2609.30199 (1.49)
- TL;DR: 두 샌드박스 — AlienCode (발견 대상 31개, 과제 70개) 와 AlienLogic (24, 70) — 의 규칙이 실행 가능하여 답을 정확히 검사하고, 친숙한 지식과 충돌하여 회상만으로는 풀 수 없다. 각각 결함 있는 매뉴얼을 동반한다. 10개 시스템 가운데 가장 강한 것들은 낯선 규칙을 획득해 적용하지만, 궤적에 따라 성능이 크게 달라지고 탐색을 계속하면 정체하거나 앞선 이득을 되돌릴 수 있다
- 읽을 이유: 오염 통제가 기여다 — 대부분의 에이전트 벤치마크가 사전학습 누출에 대해 갖는 방어는 과제가 새롭기를 바라는 것이고, 정답을 의도적으로 낯설게 만드는 것은 통제다. 같은 스냅샷의 Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms 와 짝지어 보라: 같은 희소 자원 — 검증 가능한 낯선 기제 — 을 한 번은 학습에 쓰려고 제조하고 한 번은 시험에 쓰려고 만들었으며, 하루 차이로, 어느 쪽도 서로를 인용하지 않는다. 점수가 보고되지 않으므로 붙들 것은 세 번째 발견이다: 탐색을 오래 할수록 나빠지는 에이전트는 정체하는 에이전트와 다르게 실패한다
- → ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds
주시
- 스냅샷 인테이크는 수치를 위해 읽고 이름을 위해 읽지 않는다. 오늘의 +52일 캡처는 이 저장소 자체의 주간 리더보드 파일에 연속 13회 캡처 동안 있었고,
InclusionAI는 2026-07-30 이후 모든 Artificial Analysis 스냅샷에 있었다. 어제의 발견은 "그 랩이sources.yaml어느 계층에도 없다" — 사실이고, 실패의 전부는 아니다. 위키가 가지지 않은 랩에 대해Creator열을 훑는 것이 없다. W39 lint 로 넘겼다 - 일요일 스냅샷 하나가 없고 실패한 것은 없다.
sources/evals/lmarena-2026-09-27.md는 07:00 KST 에 예정되어 있었고, 커밋a46cb05는artificial-analysis-2026-09-27.md와hf-daily-2026-09-27.md를 싣고 LMArena 파일은 싣지 않는다. 마지막 캡처는 2026-09-20 이다. 기존 정책대로 스크레이퍼는 여기서 돌리지 않았다. W39 lint 의 검사 2o 로 넘겼다 - 이 위키가 존재하지 않는 부재를 단언했다. 2026-09-26 에 만들어진 World Models 는 그 용어의 생성적 의미와 예측적 의미를 비교할 계측기가 없다고 말했다. HappyWorld-Bench 는 2026-09-21 자다 — 영상 / 공간 / 임바디드 트랙에 걸친 여섯 역량, 프롬프트 1,138개 / 장면 300개 / 케이스 254개, 31개 시스템, 행동 지표와 나란한 사람 A/B Elo, 공간 모델은 배치 최대 70.14%, 편집 실행 73.33%. 분야의 공백이 아니라 독해 실패로 그 페이지에 기록했다
- 1차 인덱스가 연속된 읽기에서 다른 항목을 게재했다.
www.anthropic.com/news가 오늘 9월 항목 일곱 개를 주었고 어제 런은 같은 페이지에서 네 개를 기록했다. 여섯은 보유 중이고 일곱 번째 "The Situation Report" (09-22, Features) 는 아니다 — 🔇 를 보라. 읽을 때마다 내용이 달라지는 인덱스는 dedup 위험이며, 이 파이프라인에는 그것을 보고할 것이 없다 - Gemini 4 의 시점, 거리를 두고 붙든 채. Koray Kavukcuoglu 가 (The Information, 한 패스 경유, 09-23/24) Gemini 4 를 2026년 말보다 "much earlier" 에 출시하기를 희망한다고 보도되었고 달은 지명되지 않았다. 단일 패스, 2차 자료, 출시 시점 무명시이므로 Gemini 4 의
출시일에 쓰지 않았다 — 어제의 아바타 보류를 옳은 판단으로 만든 것과 같은 규율이다
위키 신규
페이지 여덟 개, 신규 엔티티 페이지도 개념 페이지도 없음 — 오늘의 캡처는 이미 존재하던 엔티티와 개념에 내려앉았고, 그 면에서 검토가 필요한 것이 없는 나흘 만의 첫 런이다.
- Ling-3.0-tiny (신규) — MIT, +52일, 그리고 확인된 수치가 요약이 아니라 이 저장소 자체의 캡처된 리더보드에서 온 유일한 페이지
- Muse Realtime Avatar (신규) —
Released는 not yet; 스펙 일곱 행 중 넷이unknown이고License도 포함되는데, 모든 형제가 닫힌 가중치인데도proprietary로 쓰지 않았다 — 형제에서 옮겨 온 라이선스는 추측이다 - SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue (신규) · Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms (신규) · ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds (신규) · HappyWorld-Bench (신규) · Rufus-Air: An Open LLM Post-Training Recipe (신규) · Hunyuan-A13B Technical Report (신규)
- 의도적으로 만들지 않은 페이지: Hunyuan-A13B 는 모델 페이지가 없다. 스냅샷은 기술 보고서를 2026-09-23 으로, 모든 검색 패스는 가중치를 2025-06-27 로 적는다. 모델 페이지는
Released값을 단언해야 하고, 열다섯 달 차이는 반올림 차이가 아니다. 자료는 대신 Hunyuan-A13B Technical Report 와 Tencent 에 있다
09-26 에서 변함없이 여전히 결정이 필요함 — sources.yaml 은 수동 파일이고 이 런은 편집하지 않았다. 어제의 세 요청이 유효하다 (Runway; 중국 순환의 여섯 번째 자리로 inclusionAI / AntLing; Transparency Coalition 에 대한 임계값 예외). 오늘 네 번째가 더해지고 그것은 소스가 아니다: 각 Artificial Analysis 캡처의 Creator 열을 위키의 엔티티 목록과 대조하는 훑기. 이 저장소가 이미 커밋하는 파일 위의 비교 하나이며, 2026-07-30 에 inclusionAI 를 표면화했을 것이다.
업데이트
- Ant Group (inclusionAI / AntLing): Ling 과 Ring 라인, 형제 리더보드 행 다섯 개, 그리고
전략적 위치가 처음으로_TBD_를 벗어남 — 명제가 아니라 복잡함을 보고한다. 1T 모델을 가진 랩은 캡처된 두 릴리스가 시사하는 전문 업체가 아니기 때문이다 - Meta AI: 아바타를 최근 활동으로 채택;
상충 보고의 보류가 자기 해소를 기록하도록 다시 쓰였다. 사실관계 추측이 틀렸다는 것까지 포함해서. 글래스의 Private Processing 절반은 여전히 단일 패스이고 여전히 채택하지 않았다 — 교차확인되는 것은 유통이고 온디바이스 프라이버시가 아니며, 같은 주장이 아니다 - Tencent: 2026-09-01 이후 첫 항목; 다섯 도메인을 주장하고 점수는 0개인 80B/13B 오픈 MoE, 이 저장소가 캡처하는 269행 표에 없다
- Z.ai: GLM-4.5-Air-Base 위의 제3자 여덟 단계 레시피가 Z.ai 자신의 사후 학습 릴리스를 이긴다고 주장한다 — 벤치마크 수치 없이, 리더보드가 게재하는 것보다 마이너 두 세대 뒤인 베이스 위에서
- World Models: 없던 계측기를 찾았고, 없다고 말한 페이지보다 닷새 앞선 날짜다
- Agents (LLM Agents): 한 주의 반례로서의 SpeakerMem-R1, 그리고 한 스냅샷 안의 독립적인 검색 에이전트 두 처리 — IterSynth 의 아키텍처와 Rufus-Air 의 전용 학습 단계
- Agentic Reinforcement Learning: 보상이 손으로 쓰이는 단계를 지우는 VHD-Play, 올바른 보상이 무엇인지 증명하는 PACT: From Credit Assignment to Critic Alignment 를 상대로
- Content Provenance (AI output marking): 세 모델 프로비넌스 표, 그리고 결과를 갖는 제품 세부 — 한 기능 안의 만화 기본값과 사진 입력을 워터마크 하나가 동일하게 취급한다
- R&D Automation Index: ExplorationBench 와 WhatWorkedBench, 이 페이지의 26% 수치가 전제하는 단계를 재는 벤치마크 둘. WhatWorkedBench 의 결과가 더 어렵다: 에이전트 자신의 관측에 맞춘 Gaussian process 가 에이전트보다 효과를 더 잘 회복한다 — 0.632 → 0.698
- Open-Weights Policy Fight: 이번 달 "오픈 웨이트" 가 MIT 에도, 영역이 배제된 커스텀 라이선스에도 쓰였다 — 이 페이지가 보유하지 않았던 제한 유형
- Post-Training Scaling: 이 페이지의 첫 완전 문서화 레시피이며 수치를 공개하지 않는다
index.md: 새 줄 8개, Ant Group (inclusionAI / AntLing) 줄 재작성