RL微调VLM的鲁棒性与思维链一致性研究
On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs
强化学习(RL)微调被扩展至视觉语言模型(VLM)。研究发现,简单的文本扰动——误导性标题或错误思维链(CoT)——会显著降低模型鲁棒性和置信度,且开源模型衰退更明显。闭源模型呈现类似失败模式,但鲁棒性和推理一致性更强。进一步分析揭示准确性与忠实性的权衡:微调提升基准准确率,但同时侵蚀CoT的可靠性及对上下文变化的鲁棒性;对抗性增强可改善鲁棒性,却无法阻止忠实性漂移。引入忠实性感知奖励能恢复答案与推理的对齐,但与增强结合时训练易崩溃到捷径策略。这些发现强调需联合关注正确性、鲁棒性与视觉推理的忠实性。
RL微调让VLM基准分变好看,却可能让它的推理链变得靠不住,这个反直觉的诊断对正在用RL打磨多模态模型的团队是个警醒。
强化学习(RL)微调已成为提升大语言模型(LLM)在推理密集型任务上表现的关键技术,这也推动其向视觉语言模型(VLM)扩展。尽管经过 RL 调优的 VLM 在视觉推理基准上有所提升,但它们仍然容易受到视觉 grounding 薄弱、模型幻觉以及过度依赖文本线索的影响。我们表明,简单且受控的文本扰动——误导性描述或错误的思维链(CoT)轨迹——会导致鲁棒性和置信度大幅下降,而且在开源多模态推理模型中,当把 CoT 一致性纳入考量时,这些影响更为显著。相比之下,闭源模型表现出类似的失败模式,但保持了明显更高的鲁棒性和推理一致性,这表明这一差距反映的是当前开源 RL 微调的不足,而非该任务本身的固有限制。为了更好地理解这些脆弱性,我们进一步分析了 RL 微调动态,并揭示了一种准确率与忠实度之间的权衡:微调提高了基准准确率,但可能同时侵蚀伴随 CoT 的可靠性及其对上下文变化的鲁棒性。尽管对抗性增强提升了鲁棒性,但它本身并不能阻止忠实度漂移。引入忠实度感知奖励可以恢复答案与推理之间的一致性,但当与增强结合使用时,训练存在坍缩到捷径策略的风险,鲁棒性仍然难以实现。总之,这些发现凸显了仅以准确率为导向的评估的局限性,并推动建立同时强调正确性、鲁棒性以及视觉 grounding 推理忠实度的训练与评估协议。
- † 哈佛大学
- ‡ OpenAI
- ** 在 Apple 期间完成的工作
来源:Apple Machine Learning Research(RSS) · machinelearning.apple.com