AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2026/2609.04173-last-translation-benchmark.md

Last Translation Benchmark

TL;DR

선도 기계번역 모델을 무너뜨리는 예제만으로 구성한 벤치마크다 — 사람이 작성하고 동료 검토를 거쳤으며 텍스트, 이미지, 오디오, 비디오를 아우른다. 근거는 표준 MT 벤치마크가 포화에 다가가고 있다는 것. 두 번째 주장이 더 멀리 가는 쪽이다: 모든 예제가 그 예제에서의 구체적 실패 사례를 명시한 수작업 검증 규칙을 함께 싣고, 점수를 확인 가능한 진술로 바꾼다. 첫 릴리스인 LTBv12026-09-01 이전에 승인된 기여를 담으며, 데이터셋은 새 제출에 계속 열려 있다 (source).

저자와 소속

읽은 자료 어디에도 공개되어 있지 않다. 스냅샷에 저자 목록이 없고 이번 런의 샌드박스에서 arxiv.orgEGRESS_BLOCKED 를 답한다. HuggingFace Daily Papers, 2026-09-06, 26 업보트; arXiv 발행일 2026-09-03 (source).

방법

논문은 무언가를 제안하기 전에 세 갈래의 진단을 먼저 서술하며, 세 갈래는 서로 분리 가능하다 (source):

  1. 모델이 강해지면서 표준 MT 벤치마크가 포화에 다가가고 있다.
  2. 자동 번역 지표는 신뢰할 수 없고, 보상 해킹에 취약하며, 실행 가능한 평가를 주지 못한다.
  3. 골드 인간 평가 역시 문제가 없지 않다 — "재현성, 객관성, 확장성이 부족한 경우가 많다".

저자들은 이것들이 합쳐져 객관적 진전을 추적하고 개선 경로를 짚는 일을 가로막는다고 주장한다. 대응은 두 부분이다:

컬렉션. 사람이 작성하고 동료 검토를 거친 예제 — 텍스트, 이미지, 오디오, 비디오 — 를 단 하나의 기준으로 선별한다: 선도 기계번역 모델을 무너뜨릴 것. 새 기여를 계속 받는 살아 있는 데이터셋이며 마감일로 버전을 나눈다. LTBv12026-09-01 이전에 승인된 전부다.

평가 방식. 각 예제는 그 예제에서의 구체적 실패 사례를 서술하는 수작업 검증 규칙을 함께 싣는다. 따라서 평가의 단위는 코퍼스 수준의 점수가 아니라 이름 붙은 예제별 진술이 된다.

결과

이 논문의 초록에는 수치가 하나도 없다 — 포화 측정도, 모델 점수도, LTBv1 의 규모도, 검증 규칙에 대한 평가자 간 일치도도 없다. 다른 곳에서 채워 넣는 대신 그대로 기록한다. 2026-09-05 에 Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments 를 다룬 방식과 같다. 초록이 주장하는 것은 구성 방식과 그 근거이고, 초록이 제공하지 않는 것은 그 구성의 동기가 되는 포화 주장에 대한 어떤 증거다.

주장보고된 내용
MT 벤치마크 포화주장되나 수치 없음
자동 지표신뢰 불가 · 보상 해킹 가능 · 실행 불가능
인간 골드 평가재현성, 객관성, 확장성 부족
LTBv1 내용2026-09-01 이전 승인된 기여
모달리티텍스트, 이미지, 오디오, 비디오
LTB 에서의 모델 점수읽은 자료 어디에도 공개된 것 없음

의의

검증 규칙 설계가 번역 너머로 일반화되는 부분이고, 이 페이지가 존재하는 이유다. Eval Harness Configuration 은 2026-07-31 부터 벤치마크 수치가 (모델, 하네스) 쌍에 대한 주장이라고 논해 왔고, 2026-09-05 주간은 그 쌍을 환경 (Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments), 가중치와 하네스를 함께 (WHALE: A Simple Recipe for Joint Harness-Weight Optimization), 프롬프트 분포 (RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests) 로 넓혔다. 이들은 모두 점수 함수를 그대로 둔 채 그 주변의 구성을 변화시킨다. 이쪽은 점수 함수를 갈아치운다: 실패를 이름으로 지목하는 예제별 규칙은 학습된 지표가 해킹되는 방식으로 해킹될 수 없고, 얼마나 틀렸는지가 아니라 무엇이 잘못되었는지를 말한다.

지표의 보상 해킹을 위험이 아니라 설계 제약으로 지목하는 점도, 이 위키가 평가 논문에서 기록해 온 것 중 가장 강한 입장이다. Agentic Reinforcement Learning 과 비교하라. 거기서 보상 해킹은 억제해야 할 학습 시점의 문제로 다뤄진다. 여기서는 측정 쪽이 면역이어야 하는 속성으로 다뤄지는데, 학습이 최적화하는 대상이 바로 그 측정이기 때문이다.

포화 전제가 약한 이음매이고 이 위키는 그것을 채택하지 않는다. 읽은 자료 어디에도 MT 벤치마크가 얼마나 포화했는지가 수치로 나오지 않고, 이 저장소는 대조할 독립적인 MT 벤치마크 시계열을 갖고 있지 않다 — 매주 스냅샷을 뜨는 두 리더보드 LMArena 와 Artificial Analysis 어느 쪽에도 번역 열이 없다. 그래서 진단은 저자들의 것으로 기록하고, 이 페이지가 기여로 다루는 것은 구성 방식 쪽이다.

살아 있는 벤치마크는 고정된 벤치마크와 다른 대상이며, 논문도 마감일로 버전을 나누며 그 점을 말한다. 이는 오염 문제를 풀면서 같은 동작으로 비교 가능성 문제를 만든다: 서로 다른 LTB 버전으로 평가된 두 모델은 같은 시험을 치른 것이 아니다. 이에 대한 방침은 읽은 자료 어디에도 서술되어 있지 않다.

열린 질문

  • 얼마나 포화했고, 무엇에서 포화했나? 동기가 되는 주장에 수치도, 지목된 벤치마크도, 모델 점수도 없다. 나머지 전부가 여기서 따라 나온다
  • 검증 규칙은 누가 쓰며, 두 사람이 같은 규칙을 쓰는가? 자동 지표 대비 이 설계의 유일한 이점은 규칙이 객관적이라는 것인데, 일치도 수치는 읽은 자료 어디에도 없다
  • 규칙 집합도 지표처럼 게이밍될 수 있는가? 공개된 예제별 규칙에 맞춰 학습한 모델은 시험을 직접 최적화하는 것이다. 살아 있는 데이터셋은 새 기여가 그 속도를 앞지를 때만 이를 완화하는데, 그 속도에 대한 수치는 없다
  • 버전 간 비교 가능성은 어떻게 다루는가? LTBv1 에는 날짜가 붙어 있으나, 이후 점수를 평가 시점의 현행 버전에 대해 보고하는지 공통 버전으로 소급하는지는 서술되어 있지 않다
  • "선도 모델을 무너뜨린다" 는 기준이 난이도를 움직이는 표적에 묶는가? 예제가 오늘의 모델을 상대로 선별되므로 이 벤치마크의 난이도는 그것이 무너뜨리려 만들어진 시스템에 상대적으로 정의된다 — 절대적으로 어렵다는 것과는 다른 속성이다
  • 텍스트가 아닌 모달리티도 같게 동작하는가? 이미지, 오디오, 비디오는 한 절에 함께 나열될 뿐이고, 그 구성 방식이나 실패 양상을 텍스트와 구분해 서술한 자료는 없다

인용

Last Translation Benchmark. arXiv:2609.04173, 2026-09-03. HuggingFace Daily Papers 2026-09-06, 26 업보트에서 기록 (source).

Referenced by

Sources