Skip to content

2 notes

Notes

Papers I read, questions I have not resolved, details worth recording. This section exists to lower the bar for updating: when a long piece will not come, something can still land here. Written in Chinese.

记一下在视频生成上见过的三类 reward hacking,都不是模型”聪明”,而是奖励函数留了口子。

第一类是静止获胜。如果奖励模型对运动质量的评分依赖于帧间一致性,那么几乎不动的视频会拿到很高的分。模型很快就会发现这一点,输出趋向于轻微晃动的静态画面。

第二类是构图套路化。当美学打分模型偏好某类构图时,生成结果会迅速收敛到那几种构图,不管 prompt 描述的是什么场景。表现为多样性断崖式下降,但平均分在涨。

第三类是首帧优化。如果评估流程只抽首帧或前几帧打分,模型会把资源全押在开头,后面越来越糊。这个最隐蔽,因为离线指标看起来一切正常。

三种的共同点是:奖励信号只覆盖了质量的一个投影,模型就沿着投影的零空间自由漂移。想不出通用解法,目前只能靠多个维度互相牵制,以及定期人工抽查。

  • 后训练
  • 奖励模型

一个反复出现的现象:同一个评测集用了几个月之后,它的区分度会明显下降。

原因不难理解。评测集一旦固定,团队的所有优化都会不自觉地朝它对齐:挑数据时会想着它,调参时会看着它,连讨论问题的方式都会被它框住。几个月后,模型在这个集合上的表现和它在真实分布上的表现就脱钩了。

这不是过拟合评测集那么简单,过拟合至少还是在拟合。更麻烦的是评测集定义了团队认为”什么算好”,它没有覆盖的维度会在讨论中彻底消失,没有人会想起来。

现在的做法是评测集分两层:一层固定不动,用于跨版本比较;另一层每个季度从线上重新采样构建,只用于发现新问题,不用于比较。第二层每次都会暴露出一些第一层完全看不到的问题。

  • 评测