AI Trend Notifier
EN한
← wiki

$ cat wiki/papers/2026/2609.22947-rewardverse.md

RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling

paper갱신 2026-09-28생성 2026-09-28

TL;DR

비디오 리워드 모델은 "이 비디오가 좋은가"를 스칼라 하나로 압축하라고 요구받는데, 이 논문은 그로부터 따라오는 실패를 명명한다: 스칼라 드리프트 — 점수 스케일이 프롬프트에 따라 붕괴하거나 이동해서, 같은 숫자가 다른 곳에서 다른 것을 뜻하고 리워드가 RL 에 쓸 수 없게 된다. RewardVerse 는 질의와 스코어러 사이에 동적 루브릭을 끼워 넣는다: 평가 기준을 먼저 생성하고, 그다음 그것에 대고 채점한다. 훈련은 2단계(RGPO)다: 자기진화 씨앗 루브릭으로 스코어러를 워밍업한 뒤, 루브릭 생성기를 질의 적응형 기준을 내도록 공동으로 최적화하면서 스코어러를 사람 평점에 계속 정렬시킨다. 16차원 EvalVerse 벤치마크에서 포인트와이즈·페어와이즈 모두 최고 수준 (source).

저자와 소속

명시되지 않음 — HuggingFace Daily 스냅샷은 이 항목에 대한 저자 블록을 담지 않고, arxiv.org 는 이 런의 샌드박스에서 EGRESS_BLOCKED 로 응답하며, 검색을 한 차례도 쓰지 않았다. 추측하지 않고 확인되지 않음으로 기록한다.

방법

진단이 확인 가능할 만큼 정확하게 진술되어 있는데, 리워드 모델링 논문으로서는 드문 일이다: 기존 비디오 RM 들은 "복잡하고 주관적인 비디오 품질을 명시적 평가 기준 없이 단일 점수로 곧바로 매핑한다", 그리고 그 귀결이 스칼라 드리프트 — 서로 다른 프롬프트에 걸쳐 스케일이 붕괴하거나 이동하는 것 — 이다.

해법은 중간 표현이다:

기존 비디오 RMRewardVerse
입력질의 + 비디오질의 + 비디오
중간없음생성된 루브릭 (동적, 질의 적응형)
출력스칼라루브릭 기반 점수
루브릭은 안정적인 의미적 기준점으로 서술된다: 기준이 질의별로 적혀 있기 때문에
스코어러는 열린 질문 대신 닫힌 질문을 받고, 스케일은 기준점으로 삼을 것을 갖는다.

RGPO (Rubric-Guided Policy Optimization) 는 두 절반을 순서대로 훈련한다:

  1. 워밍업 — 스코어러가 자기진화 씨앗 루브릭에 대고 훈련된다. 루브릭은 작성되는 것이 아니라 스스로 부트스트랩한다.
  2. 공동 최적화 — 루브릭 생성기가 질의 적응형 기준을 내도록 최적화되고, 동시에 스코어러가 사람 평점에 계속 재정렬된다.

명시된 착상 출처는 전문적인 인간 어노테이션 엔지니어링이다 — 인간 어노테이션 파이프라인은 어노테이터에게 1~10 슬라이더를 주고 잘되기를 바라지 않는다. 루브릭을 준다.

결과

  • EvalVerse (16차원) 최고 수준, 포인트와이즈와 페어와이즈 모두, 그리고 외부 데이터셋에서도.
  • 스칼라 드리프트가 완화되었다고 보고된다. 이것이 그 아키텍처가 존재하는 이유인 주장이고, 스냅샷은 그에 대한 수치를 주지 않는다 — 프롬프트 간 스케일 안정성의 척도가 인용되지 않으므로, 중심 결과가 여기서 정성적으로만 진술된다.
  • 리워드 신호는 비디오 생성에서의 RL 에 대해 견고하고 해석 가능하다고 서술된다. 여기서 해석 가능성은 루브릭이 읽을 수 있다는 뜻이며, 측정이 아니라 표현의 속성이다.

이 항목의 어떤 수치도 점수로 인용할 수 없다. 여기 논문 페이지로서는 이례적으로, 스냅샷은 표도 백분율도 없이 결과 주장을 담고 있다 — "최고 수준"과 "스칼라 드리프트 완화"가 그 전부다. 그것은 논문에 대한 비판이 아니라 캡처의 공백으로 기록한다.

의의

Agentic Reinforcement Learning 과 Post-Training Scaling 은 둘 다 같은 의존성 위에서 돌아간다: RL 은 리워드만큼만 좋고, 리워드는 보통 검증기(싸고, 정확하고, 좁다)이거나 학습된 모델(넓고, 흐릿하고, 드리프트한다)이다. 비디오 생성에는 검증기가 없다 — "영화적"에 대한 단위 테스트는 없다 — 그래서 학습된 쪽으로 밀려나며, 이 논문은 거기서 무엇이 잘못되는지에 관한 것이다.

메커니즘은 비디오를 넘어 일반화되며, 그것이 이것을 붙잡아 둘 이유다. 스칼라 드리프트는 비디오 문제가 아니다. 하나의 숫자가 이질적인 프롬프트들을 아우르라고 요구받을 때마다 일어나는 일이다. 질의별로 생성된 루브릭은 리워드 모델의 영역을 좁히지 않으면서 그 질문을 좁히는 방법이며 — 그것은 Learning to Discover Interesting Mathematics 가 "흥미로움"을 비율로 환원하며 하는 것과 같은 거래이고, Coding Agents for Generalized Task and Motion Planning Problems 가 시뮬레이터에서 공짜로 얻는 것과 같은 거래다. 하루에 캡처된 논문 셋, 검증기가 없는 곳에서 검증기를 제조하는 세 가지 방법.

읽히는 것보다 약한 지점: 루브릭 생성기 자체가 학습되므로 드리프트는 제거된 것이 아니라 이동한 것이다 — 루브릭 생성기도 스코어러와 똑같이 프롬프트에 걸쳐 드리프트할 수 있다. 논문의 답은 사람 평점에 대고 하는 공동 최적화이며, 그것은 사람 평점을 최후의 기준점으로 만든다. 그 커버리지는 명시되지 않는다.

열린 질문

  • 스칼라 드리프트가 얼마나 줄었나? 측정이 인용되지 않았다. 논문의 중심 주장이 빠진 그 하나의 수치다.
  • 루브릭 생성기가 드리프트할 수 있는가? 생성된 기준이 의미적으로 유사한 프롬프트에 걸쳐 안정적인지를 다룬 것은 읽은 것에 없다.
  • 누구의 사람 평점이며, 몇 개이고, 어떤 스케일인가? 공동 단계가 그것에 기준점을 두는데 출처가 명시되지 않는다.
  • 루브릭이 생성기를 돕는가, 스코어러만 돕는가? 최고 수준의 리워드 모델 정확도는 더 나은 생성 비디오와 같은 것이 아니며, 스냅샷에 하류 생성 결과는 보고되지 않는다.
  • 저자와 소속 — 위와 같다.

인용

arXiv 2609.22947 — RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling, 2026-09-19. HuggingFace Daily Papers, 2026-09-28, 24 upvotes — 그 커뮤니티의 인기 신호이며 품질이나 중요도 순위가 아니다 (source).

Referenced by

Sources