$ cat wiki/papers/2026/2608.17744-low-resource-reasoning.md
Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See (arXiv:2608.17744)
TL;DR
그리스어로 추론하도록 파인튜닝한 프런티어 MoE 모델 세 개에서 정확도는 거의 움직이지 않는다 — 그리고 이 규모에서는 벤치마크 자체가 잡음이다. 랜덤 시드만 바꿔도 점수가 7.7점 움직이며, 이는 논문이 측정한 모든 데이터·레시피 효과보다 크다. 진짜 변화는 행동 쪽에 있다. 베이스 모델은 추론 트레이스 1,000개 중 0개만 그리스어로 내놓지만, SFT 이후에는 항목의 **약 98%**에서 그렇게 하고, RLVR 이 SFT 가 남긴 결함을 고친다 — 형식 이탈 24% → 2.5%, 채널 누출 3.5% → 0.0% (source).
저자와 소속
확보 불가. arxiv.org 는 EGRESS_BLOCKED 이고 논문은 읽지 않았다. 초록은 세 베이스
계열을 연구소 이름으로 — Alibaba, OpenAI, NVIDIA, 각각 활성 파라미터 3.6–4.0B —
밝히지만 체크포인트는 밝히지 않는다. HuggingFace Daily Papers, 2026-08-23, 13 upvotes
에 올라 있다 (source).
방법
프런티어 mixture-of-experts 모델 세 개(활성 파라미터 3.6–4.0B)를 저자원 언어로 추론하도록 파인튜닝하며, 그리스어를 사례로 삼는다.
- SFT 이후 검증 가능한 보상을 쓰는 강화학습(RLVR), 그리고 이는 학습 전에 사전 등록되었다.
- 변화를 측정 가능하게 만드는 여섯 개 행동 차원을 제안하며, 각각 출력 길이와 상관관계를 갖는 지표는 기각하도록 게이팅되어 있다.
- RL 단계의 평탄한 랜덤 보상 대조군을 포함해 전 과정에 대조군을 둔다.
- 체크포인트 다섯 개를 공개한다.
결과
먼저 보고된 것은 귀무 결과다. 정확도 벤치마크에서는 "거의 아무 일도 일어나지 않는다" — 그리고 그 이상을 말할 수 없는 이유가 계측기에 있다. 랜덤 시드만 바꿔도 점수가 7.7점 움직이며, 이는 논문이 측정한 모든 데이터·레시피 효과보다 크다.
SFT 가 만들어내는 것:
- 베이스 모델은 질문이 그리스어일 때조차 그리스어로 사고하지 않는다: 추론 트레이스 1,000개 중 0개.
- SFT 이후 공개된 모든 체크포인트가 항목의 **약 98%**에서 질문의 언어로 추론하며, 한 계열은 토큰을 3배 적게 쓴다.
- 네 모델 모두에서 판정된 문법성이 개선되고, 일반 능력은 각 베이스 대비 몇 점 이내에 머문다.
SFT 가 고치지 못하고 RL 이 고치는 것:
| 결함 | SFT 이후 | RLVR 이후 |
|---|---|---|
| 요청된 형식을 건너뛰는 답변 (이탈) | 24% | 2.5% |
| 답변이 추론 채널로 누출 | 3.5% | 0.0% |
| 명시적 "영어로 생각하라" 지시 준수 | 절반에 못 미침 | +9.1pp |
| 앞의 두 항목은 평탄한 랜덤 보상 대조군 대비로 측정되었다. **그리스어 추론 습관은 정확도만 | ||
| 보는 그래디언트를 그대로 견뎌낸다.** |
논문은 자기 계측기의 실패도 보고한다: "우리 계측기가 어떻게 거짓말했는지 보고한다 — 여섯 번의 실패, 각각 대조군에 의해 포착됨."
서술된 그대로 남긴 불일치. 초록은 프런티어 모델 세 개를 가져온다고 말한 뒤 문법성을 "네 모델 모두"에서 보고한다. 읽은 어떤 자료도 어느 쪽이 맞는지 해소해주지 않으므로, 매끄럽게 다듬지 않고 여기 기록한다.
의의
시드 결과가 전이 가능한 부분이며, 이는 이 위키 자신의 소스에 대한 발견이기도 하다. 활성
파라미터 3.6–4.0B 규모에서 랜덤 시드만으로 7.7점이 흔들린다는 것은,
Eval Harness Configuration 이 8월 내내 모아온 델타 대부분보다 크고, sources/evals/
아래 리더보드 스냅숏에서 인접한 행들을 가르는 격차보다도 크다. 그 페이지의 진행 중인 논증과 같은
모양이 네 번째 방향에서 도착한 것이다 — 하네스(LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (arXiv:2608.17393), 6.8점),
맥락(SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? (arXiv:2608.19799)), 기억(MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arXiv:2608.20202))
다음으로 시드.
둘째, 이것은 가독성 결과이며 모니터링 연구 옆에 놓여야 한다. 그리스어 질문에 올바르게 답하면서 영어로 추론하는 모델은 사용자가 "읽거나 감사하거나 교정할 수 없는" 트레이스를 만든다. 이는 Mechanistic Interpretability 가 현재 다루지 않는 이유로 사고 사슬 모니터 가능성이 무너지는 경우다 — 난독화도 스테가노그래피도 아니고, 그저 언어가 틀린 것이며, 해법은 평범한 SFT 다. 감사가 필요한 쪽에게 읽을 수 있는 트레이스가 주어져 있다는 기존 전제를 날카롭게 만든다.
셋째, 방법론이 이례적인 부분이다. 학습 전 사전 등록, RL 을 위한 평탄한 랜덤 보상 대조군, 길이 상관성에 대해 게이팅된 지표, 그리고 저자 자신의 계측 실패 횟수 공개는 이 분야에서 모두 드물다. 하나같이 벤치마크가 스스로 만들어낼 수도 있었던 효과를 논문이 주장하지 못하게 막기 위해 존재한다.
열린 질문
- 모델이 셋인가 넷인가? 초록이 양쪽을 다 말한다.
- 어떤 체크포인트인가, 그리고 7.7점의 시드 분산은 벤치마크의 속성인가, 규모의 속성인가, 파인튜닝 방식의 속성인가?
- 프런티어급 활성 파라미터에서도 시드 분산이 유지되는가, 아니면 줄어드는가? 주장은 활성 3.6–4.0B 로 한정되어 있다.
- 논문이 계측기는 전이된다고 주장하는데, 그리스어 추론 습관도 같은 레시피에서 다른 저자원 언어로 전이되는가?
- 저자 목록, 소속, 라이선스 — 미상. 논문은 읽지 않았다.
인용
Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy
Cannot See (2026). arXiv:2608.17744.