
本篇分享论文 Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs,南开大学程明明实验室、西北工业大学脑与人工智能实验室、中国科学院自动化研究所、南开国际先进研究院联合提出把标注直接当作rollout使用的视频强化学习框架OraRL。论文第一作者为南开大学博士研究生李运恒,通讯作者为侯淇彬教授。

论文图1:Video-ORA以一套OraRL方案统一处理七类视频感知任务
多模态大模型已是统一视频感知的主流方案,但在大规模多任务数据上做强化学习后训练一直很难。GRPO这类方法只在模型自采样的一组rollout里比较奖励,而在结构化视频任务上,模型很难采到精确的时间区间、空间框、掩码或轨迹,许多样本组缺少可靠的正样本——即使花大代价生成思维链也没有明显改善。
论文指出了一个被忽视的事实:标注不该只用来打分,它本身就能写成一条rollout,直接放进候选里当可靠的正样本。但直接放会出事:高分标注抬高了整组的及格线,那些本来高于策略平均水平的rollout反而被判成负分。作者把这一失效现象命名为优势反转(advantage inversion),并实测出它的严重程度——22.4%本应被强化的rollout反而得到负优势,8.3%的样本组彻底失去全部正样本。
OraRL把策略优势与标注指导解耦:基线只由策略rollout决定,标注则通过方向性增益和独立的标注优势发挥作用。配合符号平衡剪枝,单步耗时仅为SFT的2.2×,不到GRPO+思维链所需4.9×的一半。训练出的Video-ORA在七类视频任务上全部超过此前最强模型,而且全程不生成思维链——9B模型的解码时间从4,780 ms降到130 ms。

论文图2:四种标注使用范式对比
本文关注视频多模态大模型强化学习的样本效率与可扩展性。GRPO完全依赖模型自采样,一组rollout里得同时有好有坏,比较才有意义。但在结构化视频任务上,很多样本组缺少可靠的正样本;现成的高质量标注却只被用来计算奖励,大量信息没有得到利用。
围绕怎么用标注做后训练,已有做法各有短板:监督微调直接模仿标注,但输出格式一旦学会,收益迅速饱和;GRPO类方法只拿标注算奖励,天花板受限于策略采样质量;Tempsamp-R1用任务特定的奖励整形缓解标注混入的冲突,但每个任务都要单独设计;LUFFY引入离策略示范做加权更新,一旦策略与标注信号错配反而削弱更新(三任务均值仅54.7,跟踪掉到50.0)。
另一条路线是修正归一化本身的偏置,但Dr. GRPO、CPPO、GDPO这些变体彼此差距不超过0.4分——换优势估计器带不来实质提升,关键在于有没有引入新的监督信号。

论文图3:OraRL整体框架
OraRL不改GRPO的目标函数,只动三处:组里放什么、优势怎么算、哪些样本参与更新。
1)标注即rollout。 每个任务配一个适配器,把标注写成模型输出格式的一条rollout,追加到n条策略rollout之后,而不是替换掉其中一条。这样策略样本和它们之间的相对比较都完整保留,标注只增加监督、不挤占探索。时间区间、空间框、框轨迹、答案选项等都能这样序列化。
2)基线里不放标注。 策略优势就取「自己的奖励 − 策略平均奖励」,不含标注,也不做方差归一化。于是任何高于平均水平的rollout都不可能拿到负分,反转区间在构造上就是空的。
3)方向性增益。 标注与策略的差距并没被丢掉,而是从「加入标注前后奖励离散度的变化」估出一个增益系数,差距越大系数越大(限定在1到4倍)。关键在于它只放大高于平均线的样本,不放大本该被压制的样本。
4)独立的标注优势。 标注单独给一条优势,大小由它与策略的奖励差距决定,并以当前最强正样本的优势为上限,防止标注压过整组。策略追平标注时该优势自动归零,标注监督悄悄退场。
5)符号平衡剪枝。 优势全算完再剪枝,保留样本的数值因此不受影响。保留集合固定含标注,其余名额在正负两侧尽量均分、各取绝对值最大的几条——比CPPO那种只按幅度筛选更稳,因为强化信号和抑制信号都保住了;剪枝后再做一次矩校正,把均值拉回零并恢复更新尺度。8条rollout剪掉一半时,只需对「标注+1条正样本+2条负样本」做前向反向传播。
SFT和RL数据均覆盖七类任务,分别包含284,779条和100,032条提示词,骨干为Qwen3.5系列。

结果汇总:Video-ORA-9B在七类任务上相对此前最强模型的提升
提升幅度如上图,其中时空定位+7.1、指代分割+6.1、目标跟踪+5.2最为明显。与Qwen3.5-9B骨干相比,视频分割在MeViS上涨29.2 J&F、在ReasonVOS上涨42.2 J&F,因为骨干本身无法生成可用的掩码提示。

论文表1:时序定位结果
Video-ORA-9B在Charades、ActivityNet、QVHighlights三个基准的全部指标上都排第一。

论文表6:VSI-Bench结果
VSI-Bench上Video-ORA-9B拿到73.1分,比最强开源模型高2.2分,比最强闭源模型高18.0分(GPT-5为55.0,Gemini-3-Pro为55.1),并在物体计数、物体尺寸、相对距离、出现顺序四项上排名第一。路径规划仍落后于闭源模型,是后续要补的短板。

论文图6:优势反转可视化

论文表14:不同方法的优势反转率
在11,503个样本组、92,024条rollout上,朴素混入标注会让22.4%本应被强化的rollout得到负优势;奖励整形只能把反转率压到11.9%,OraRL则降至1.9%。这些残余样本几乎都会被剪掉,真正参与梯度的仅0.3%。

论文图7:训练与推理效率
训练方面,OraRL把不带思维链的GRPO从58.7提到61.4 mIoU,单步耗时同时从93.9 s降到62.4 s。符号平衡剪枝还把峰值显存从62.4 GB降到50.9 GB,精度只损失0.4分。
推理方面,Video-ORA-9B的输出中位数仅为13.5个答案token,骨干却要生成808.5个推理token。首字之后的延迟因此从4.78 s降到0.13 s,P90端到端延迟从62.67 s降到25.15 s。

论文图4:模型Scaling结果
同一套配置下,0.8B、2B、4B、9B四个规模在全部七类任务上都超过各自骨干,宏平均从51.8单调升到66.2,且始终领先骨干8分以上。换成Qwen3-VL-8B骨干也无需重新调参,OraRL仍优于GRPO(+2.6分)。

论文图5:数据Scaling与奖励动态
数据从6.4k增加到100k提示词时,OraRL在视频感知和空间智能上分别提升5.2分和3.6分,GRPO只提升2.8分和3.1分,两者差距持续拉大;同期SFT在视频感知上反而下降4.1分。右图也显示,OraRL的训练奖励始终高于GRPO和SFT,并随训练稳定上升。

论文表15:组件消融
去掉方向性增益、独立标注优势、奖励差距权重,均值分别下降1.5、1.4、1.1分。它们的作用也互补:方向性增益主要影响跟踪(-2.7),独立标注优势主要影响时序定位(-2.5)。

论文表12:训练范式对比
同样的初始化和数据预算下,继续做SFT只提升0.9分,各种GRPO变体提升2.5~2.9分,彼此差距不超过0.4分;OraRL达到62.7,比最强变体再高2.0分。这说明增益来自新引入的标注监督,而不是简单更换优势估计器。
更新时间:2026-09-04
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号