引用Jaskirat Singh@1jaskiratsingh
‼️ 表征对生成至关重要!但事实证明,我们一直以来对表征如何帮助生成的理解都是错的 ‼️
我们原本以为的:(我们错了)
❌ 更大的视觉编码器 → 更好的表征 → 更好的生成
❌ 更好的全局语义 → 更好的表征 → 更好的生成
事实证明:
🤯 小 20 倍以上的视觉编码器在表征对齐方面可以拥有与更大模型相似甚至更好的性能
🤯 线性探测准确率(衡量全局语义的指标)约 20% 的视觉编码器可以胜过准确率超过 80% 的编码器。
🤯 甚至像 SiFT 和 HoG 这样的经典特征也能带来与现代大得多的视觉编码器相当的竞争力提升 ‼️
🚨 隆重介绍:表征对齐的关键是什么?全局信息还是空间结构 🚨
TL;DR:
✅ 更好的全局语义信息 ≠ 更好的生成
✅ 空间结构(而非全局语义)驱动表征的生成性能
✅ 我们提出 iREPA:仅 3 行代码,即可强化空间结构迁移,并在 REPA、REPA-E、Meanflow、JiT 等中持续提升收敛速度
令人兴奋的项目,来自 @AdobeResearch,并与 @xingjian_leng、@zongze_wu、@LiangZheng_06、@rzhang88、@elishechtman 和 @sainingxie 合作 🙏
对我来说,这也是一次特别有趣且独特的经历,我们在项目的每一步都在证明自己的偏见是错的 😆
还要特别感谢 @YouJiacheng、@ShumingHu 和 @gallabytes,他们在 X 上的评论开启了这一方向的探索 🫡
论文:https://arxiv.org/abs/2512.10794
代码:https://github.com/End2End-Diffusion/iREPA
项目主页:https://end2end-diffusion.github.io/irepa
更多细节见推文串:[1/n] 🧵