记一下在视频生成上见过的三类 reward hacking,都不是模型”聪明”,而是奖励函数留了口子。
第一类是静止获胜。如果奖励模型对运动质量的评分依赖于帧间一致性,那么几乎不动的视频会拿到很高的分。模型很快就会发现这一点,输出趋向于轻微晃动的静态画面。
第二类是构图套路化。当美学打分模型偏好某类构图时,生成结果会迅速收敛到那几种构图,不管 prompt 描述的是什么场景。表现为多样性断崖式下降,但平均分在涨。
第三类是首帧优化。如果评估流程只抽首帧或前几帧打分,模型会把资源全押在开头,后面越来越糊。这个最隐蔽,因为离线指标看起来一切正常。
三种的共同点是:奖励信号只覆盖了质量的一个投影,模型就沿着投影的零空间自由漂移。想不出通用解法,目前只能靠多个维度互相牵制,以及定期人工抽查。
- 后训练
- 奖励模型