AI Trend Notifier
EN
← wiki

$ cat wiki/models/ternary-bonsai-2-27b.md

Ternary Bonsai 2 27B

model갱신 2026-09-19생성 2026-09-19

나란히 보기

스펙

속성
DeveloperPrismML
Released2026-09-17
Announced2026-09-17
Context window262,144
Pricingunknown
LicenseApache 2.0
AvailabilityHugging Face (prism-ml/Ternary-Bonsai-2-27B-gguf, prism-ml/Ternary-Bonsai-2-27B-mlx-2bit)
Pricing 은 비어 있는 것이 아니라 unknown 이다. PrismML 은 이 체크포인트의 호스팅 엔드포인트를 공개하지 않으며, 존재하는 Together AI 목록은 1세대 prism-ml-ternary-bonsai-27b 를 가리키는 다른 모델이다 (source).

AnnouncedReleased 가 같은 날이다 — 발표와 가중치가 함께 떨어졌고, 이는 Qwen 3.8 27B 가 부모 쪽에서 기록한 나흘 지연의 정반대다.

개발사가 훈련한 모델이 아니라 다른 랩 모델의 변형이다. 가중치는 Qwen 3.8 27B 의 것이며, FP16 그룹별 스케일링과 함께 3진 {−1, 0, +1} 로, 가중치당 유효 1.76 비트로, 언어 모델 전 구간에 걸쳐 양자화되었다 (source).

용량
Ternary Bonsai 2 27B5.93 GB
Qwen3.8 27B, FP1653.80 GB
비율9배 초과
명시된 하드웨어 하한: 16 GB 노트북 또는 24 GB GPU 한 장 (source). 실측 메모리 수치를 공개한 사람은 아무도 없으며, 이는 Qwen 3.8 27B 가 Unsloth 의 17 GB 주장에 대해 2026-08-03 이래 끌고 온 것과 같은 공백이다.

이 수치 중 어느 것도 1차 페이지에서 읽지 않았다prismml.comhuggingface.co 모두 이 실행의 샌드박스에서 EGRESS_BLOCKED 다 — 따라서 발표와 모델 카드를 기술하는 매체가 보고한 내용이다.

출시일

2026-09-17, 여기서 포착한 것은 2026-09-19 — day +2 (source).

이것을 처음 실어 나른 커뮤니티 스레드 — r/LocalLLaMA, "Ternary Bonsai 2 (27B) just released on Hugging Face. At <6GB in size, it can even run locally" — 는 state/prefetch.json2026-09-17T21:05 로 찍혀 있고, 2026-09-18 실행이 r/LocalLLaMA 후보 열세 개 중 하나로 건너뛰었다. 하드웨어 잡담이 오가는 스레드 안에 놓인 릴리스 공지였고, 하루 뒤 그것을 찾을 수 있게 만든 것은 스레드가 아니라 벤더 포스트였다.

벤치마크

모든 수치가 PrismML 자신의 것이다. 이 체크포인트를 평가한 제3자는 없다.

헤드라인 — 추론, 수학, 코딩, 지시 따르기, 비전, 에이전틱 tool use 에 걸친 20개 벤치마크 묶음의 종합 (source):

20개 벤치마크 종합
Qwen3.8 27B (FP16)85.4
Ternary Bonsai 2 27B83.9
보존율98.2%
범주별 보존율, 공개된 범위에서: 비전 96.3%, 지식과 추론 96.9% (source).

그 묶음 바깥, 장기 호흡 에이전트 작업에서 보존율은 다른 숫자다:

벤치마크Qwen3.8 27BTernary Bonsai 2 27B보존율
Terminal-Bench 2.169.752.8~75%
SWE-bench Verifiedunknownunknown"약 75%" 로 진술, 수치 미공개
두 숫자 모두 정직하고 헤드라인에 오른 것은 하나다. 98.2% 는 스무 개 벤치마크 위의 평균이고, ~75% 는 모델이 터미널을 오래 모는 두 벤치마크에서 일어나는 일이다. 서로 충돌하지 않는다 — 다른 것을 측정한다 — 그리고 로컬에서 코딩 에이전트를 돌리려고 이 모델을 고르는 독자에게 필요한 것은 두 번째 쪽이다. 98.2% 가 틀린 것이 아니라, 로컬 에이전트 사용자가 묻는 것과 다른 질문에 답하고 있다.

관행적 저비트 빌드 대비 (1 pass): IQ2_XXS GGUF 보다 1.23배 작고 8.7 포인트 높다, 이것이 사후 양자화 대신 양자화 인지 3진 학습을 택하는 논거 전부다 (source). 8.7 포인트의 근거가 된 벤치마크는 이름이 없다.

성능이 아니라 보급: 2026-09-18 에 확인했을 때 GGUF 저장소 하나만으로 출시 하루 만에 약 406,000 다운로드를 보였다 (source). 다운로드 수는 유통 신호이며 그렇게 기록한다.

활용 사례

로컬과 온디바이스 추론이 제안 전부다: Apache 2.0 아래 5.93 GB, GGUF 와 MLX 로, 라이선스 문제 없이 NVIDIA 와 Apple 로컬 툴링에 올라간다 (source).

위의 Terminal-Bench 수치는 그 제안을 특정 방향으로 좁힌다. 텍스트, 비전, 지식 작업은 부모의 96~98% 를 보존하고 에이전틱 열은 그러지 못한다. 이 위키 자신의 증거 위에서 맞는 자리는 단일 턴, 짧은 호흡의 로컬 작업 — 문서와 이미지 분석, 사적인 리서치, 제한된 어시스턴트 — 이고, An Empirical Study of Harness Design for Coding Agents 가 연구하는 무인 코딩 에이전트는 아니다. 거기서 Terminal-Bench 17 포인트 차이는 작업을 끝내느냐 마느냐의 차이다.

비교

  • Qwen 3.8 27B — 부모. 같은 가중치, 같은 262,144 토큰 컨텍스트, 9배의 용량, 그리고 이 페이지 모든 벤치마크 비교의 출처
  • Qwen 3.8 Max — 가장 작은 공개 양자화가 397 GB 인 2.4T 플래그십. 27B 가 존재하는 이유이자, 이 모델이 존재하는 이유의 한 칸 위
  • LFM2.5-2.6BLiquid AI 의 온디바이스 모델: 큰 것을 압축하는 대신 작게 훈련해 같은 목적지에 도달한다
  • Jev — 역량이 아니라 호출당 비용을 내세운 9월의 다른 릴리스. 가중치를 줄이는 대신 텍스트 생성을 거부해서 거기에 도달했다

상충 보고

  • 부모 모델의 Terminal-Bench 2.1: 여기서는 73.0, PrismML 의 비교에서는 69.7. Qwen 3.8 27B 는 매체가 기술한 Alibaba 모델 카드에서 가져온 벤더 수치로 73.0 을 싣고 있고 (source), 같은 체크포인트를 같은 벤치마크에서 잰 PrismML 의 기준선 열은 69.7 이다 (source). 차이는 3.3 포인트다.

    어느 쪽도 하네스를 밝히지 않으며, 그것이 평범한 설명이자 Eval Harness Configuration 이 존재하는 이유 그 자체다. Alibaba 의 수치는 모델 개발사가 자기 모델을 잰 것이고, PrismML 의 것은 무언가에 의해 깨지기를 의도한 기준선으로서 제3자가 잰 것이다. 여기서 어느 쪽도 다른 쪽보다 채택하지 않는다: 위의 벤치마크 표가 PrismML 의 69.7 을 쓰는 것은 짝을 이루는 52.8 이 같은 회차에서 측정되었기 때문이고, Qwen 3.8 27B 가 73.0 을 유지하는 것은 그 페이지의 소스가 그렇게 말하기 때문이다. 봉합하지 않고 공개한다.

    이는 또한 ~75% 보존율이 이 위키가 다른 곳에서 쥐고 있는 기준선보다 3.3 포인트 낮은 기준선에 대한 보존율이라는 뜻이다. 73.0 에 대해 재면 52.8 은 72.3% 다. 두 판독 모두 PrismML 이 "약 75%" 라고 기술하는 구간 안에 있으며, 어느 쪽도 값으로 단정하지 않는다.

Referenced by

Sources