新功能
2026-09-06
浙大港大开源 LayerRecall:6.6MB 治好 AI 视频「离场就变脸」
来源:新智元 / arXiv
浙大港大开源 LayerRecall:6.6MB 治好 AI 视频「离场就变脸」
一句话说清:浙大和港大的团队开源了一个只有 6.6MB 的「记忆路由器」LayerRecall,专门治 AI 生成视频的一个老毛病——人物走出画面再回来,脸和衣服就变了。
发生了什么
- 自回归视频生成模型有个通病:主角中途离开镜头、再回来时,五官、衣服颜色甚至手里拿的东西都可能「变了个人」——本质是模型能记住的上下文有限,远处的信息被挤掉了。
- 浙江大学与香港大学团队提出 LayerRecall:不把整段历史硬塞回模型,而是回答两个问题——「现在该想起什么」(从历史里挑相关记忆)+ 「该把这些记忆送进网络的哪几层」(不同层管不同信息)。
- 它极轻量:可训练参数约 165 万,权重文件仅 6.6MB,叠加在现有 5B 视频模型之上,额外开销约 3.5 秒;在 MemoBench、MovieBench 等评测中综合第一,且基础画质不掉。
- 论文、项目主页、GitHub 代码、6.6MB 权重和 100 组评测提示词已全部开源(论文 arXiv: 2608.28460)。
来源:新智元(2026-09-06)、AGI Hunt、arXiv 论文。
对我有什么用
- 它把「长视频里角色前后一致」这个难题,从「堆大模型、加大上下文」变成了一个可插拔的小模块——成本低、好部署。
- 对视频生成从「玩具」走向「生产工具」很关键:品牌广告里产品包装颜色前后一致、教学视频里老师不换脸、虚拟人直播不漂移,都是刚性需求。
- 轻量 + 开源,意味着中小团队不用千卡集群也能跟进,降低视频 AI 的参与门槛。
我可以怎么做
- 直接用成果:如果你玩 AI 视频(可灵、即梦、Wan 等),这类「一致性」技术会慢慢变成底层能力,未来生成的多镜头短片人物更稳。
- 理解趋势:视频 AI 的竞争正从「画质、时长」转向「细节不出错」,这是它真正能干活的前兆。
- 学开源精神:论文、代码、权重全公开,想深入可以上 GitHub 看,普通用户也能感受「科研如何变产品」。
温馨提醒
- 不是万能药:它主要解决「身份/外观跨时间一致」,不解决叙事逻辑、物理合理性、音画同步等问题;一个角色可以不换脸走完全程,但动作仍可能不合常理。
- 需要自备基础模型权重(Wan2.2-TI2V-5B、LongLive-2.0),默认配置要两张 GPU,目前是评测 prompt 而非在线 Demo。
- 评测分数提升与最终观感之间还有距离,建议以官方开源仓库实测为准。
📤 一键转发小助手
帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发
💬 说说你的看法