新功能 2026-09-06

浙大港大开源 LayerRecall:6.6MB 治好 AI 视频「离场就变脸」

浙大港大开源 LayerRecall:6.6MB 治好 AI 视频「离场就变脸」

一句话说清:浙大和港大的团队开源了一个只有 6.6MB 的「记忆路由器」LayerRecall,专门治 AI 生成视频的一个老毛病——人物走出画面再回来,脸和衣服就变了。

发生了什么

  • 自回归视频生成模型有个通病:主角中途离开镜头、再回来时,五官、衣服颜色甚至手里拿的东西都可能「变了个人」——本质是模型能记住的上下文有限,远处的信息被挤掉了。
  • 浙江大学与香港大学团队提出 LayerRecall:不把整段历史硬塞回模型,而是回答两个问题——「现在该想起什么」(从历史里挑相关记忆)+ 「该把这些记忆送进网络的哪几层」(不同层管不同信息)。
  • 它极轻量:可训练参数约 165 万,权重文件仅 6.6MB,叠加在现有 5B 视频模型之上,额外开销约 3.5 秒;在 MemoBench、MovieBench 等评测中综合第一,且基础画质不掉。
  • 论文、项目主页、GitHub 代码、6.6MB 权重和 100 组评测提示词已全部开源(论文 arXiv: 2608.28460)。

来源:新智元(2026-09-06)、AGI Hunt、arXiv 论文。

对我有什么用

  • 它把「长视频里角色前后一致」这个难题,从「堆大模型、加大上下文」变成了一个可插拔的小模块——成本低、好部署。
  • 对视频生成从「玩具」走向「生产工具」很关键:品牌广告里产品包装颜色前后一致、教学视频里老师不换脸、虚拟人直播不漂移,都是刚性需求。
  • 轻量 + 开源,意味着中小团队不用千卡集群也能跟进,降低视频 AI 的参与门槛。

我可以怎么做

  1. 直接用成果:如果你玩 AI 视频(可灵、即梦、Wan 等),这类「一致性」技术会慢慢变成底层能力,未来生成的多镜头短片人物更稳。
  2. 理解趋势:视频 AI 的竞争正从「画质、时长」转向「细节不出错」,这是它真正能干活的前兆。
  3. 学开源精神:论文、代码、权重全公开,想深入可以上 GitHub 看,普通用户也能感受「科研如何变产品」。

温馨提醒

  • 不是万能药:它主要解决「身份/外观跨时间一致」,不解决叙事逻辑、物理合理性、音画同步等问题;一个角色可以不换脸走完全程,但动作仍可能不合常理。
  • 需要自备基础模型权重(Wan2.2-TI2V-5B、LongLive-2.0),默认配置要两张 GPU,目前是评测 prompt 而非在线 Demo。
  • 评测分数提升与最终观感之间还有距离,建议以官方开源仓库实测为准。
📤 一键转发小助手 帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发