新模型 2026-09-08

微信开源 WeMM-Embedding 登顶国际榜单:朋友圈搜索背后的模型,日调用 10 亿次

微信开源 WeMM-Embedding 登顶国际榜单:朋友圈搜索背后的模型,日调用 10 亿次

一句话说清:你在朋友圈里搜「去年那张海边的照片」能搜到,靠的就是这类模型——它把文字、图片、视频翻译成同一种「机器听得懂的坐标」,所以文字能搜出图片。微信把自家每天被调用 10 亿次的这个模型免费开源了,还在国际榜单上拿了第一。

发生了什么

据太平洋科技(引 IT 之家)、AIBase、腾讯研究院 AI 速递等报道(2026-09-04 开源公告,09-07 至 09-08 大规模落地细节披露):

  • 微信 AI 官方宣布开源通用多模态嵌入模型 WeMM-Embedding,由微信视觉团队研发,提供 2B、4B、9B 三种参数版本,以 Qwen3.5 多模态架构作为基础骨干网络。
  • 支持文本、图片、视频、视觉文档以及多种模态交错混合输入(比如一段话中间夹着几张图,也能整体理解)。
  • 在国际权威多模态检索评测榜单 MMEB-v2 上取得综合排名第一,性能超越此前榜单上所有开源及闭源参赛模型:
  • 9B 版本 80.6 分,位列第一;
  • 2B 版本 77.9 分,超过此前领先的 8B 开源模型(也就是说体积小 4 倍还更强);
  • 降维到 256 维时仍保留 98.7% 性能(这意味着存储和检索成本可以大幅压缩)。
  • 不是实验室玩具:该模型已在微信内部大规模落地,朋友圈搜索、视频号内容推荐、公众号推荐、微信电商等业务均已接入,每日调用规模达 10 亿次,完成 14 次在线 A/B 测试并全量上线。
  • 生态资源已完整开放:论文发布在 arXiv,代码托管在 GitHub 的 Tencent/WeMM-Embedding 项目,模型权重在 Hugging Face。

来源:太平洋科技 / IT 之家(2026-09-04)、AIBase(2026-09-04)、腾讯研究院 AI 速递(2026-09-08)、百度百科「微信视觉团队」词条(引 2026-09-08 报道)。

对我有什么用

先解释「嵌入模型(Embedding)」到底是什么,这是理解本条新闻的关键:

  • 计算机不认识「猫」这个字,也不认识猫的照片。嵌入模型的工作,就是把任何内容(一段话、一张图、一段视频)转换成一串数字坐标,让意思相近的内容坐标也相近。
  • 所以「海边日落」这几个字的坐标,会离一张海边日落照片的坐标很近——这就是「文字搜图片」能实现的原理。
  • 现在几乎所有 AI 应用的「记忆」和「查资料」能力(业内叫 RAG)都靠它:AI 之所以能在你上传的 100 页 PDF 里精准找到那一段,就是嵌入模型在干活。

它重要的原因:

  • 多模态统一是刚需。以前文字、图片、视频要用不同模型分开处理,检索时对不上。WeMM 把它们放进同一个语义空间,一次搞定。
  • 已经被 10 亿次日调用验证过。很多开源模型是「刷榜专用」,实际部署一塌糊涂。WeMM 是先在微信这种规模的真实业务里跑了 14 轮 A/B 测试才开源的,工程可靠性有底。
  • 2B 版本小而强,普通显卡跑得动。这对个人开发者、小团队搭建自己的「知识库检索」意义很大——不用租昂贵的云 GPU。
  • 完全开源、可商用(需查阅具体许可),国内团队做多模态搜索、相册管理、内容推荐的门槛直接降低。

我可以怎么做

如果你不写代码,这条新闻的价值在于理解原理,从而更会用现有工具:

  1. 用好你手机里的「相册语义搜索」。iPhone 相册、华为图库、小米相册、Google Photos 都支持直接用大白话搜图(比如搜「蛋糕」「猫」「海」)。原理就是文中这类嵌入模型。以前很多人不知道能这么搜,一直在手动翻。
  2. 朋友圈/微信搜索也能试试描述性词:搜索时不要只输入人名,试试输入内容特征(地点、物品、场景),命中率会比你以为的高。

如果你想动手搭一个自己的「AI 知识库」:

  1. 去 Hugging Face 搜索 WeMM-Embedding,先下载 2B 版本(对显存最友好,8GB 显存左右可跑)。
  2. 配一个向量数据库存坐标,新手推荐 Chroma 或 Milvus Lite,都能 pip install 一行装好。
  3. 把你的资料(PDF、图片、笔记)灌进去建索引,之后就能用「文字搜图片」「一句话找文件」。
  4. 想更省事的话,直接用现成的 RAGFlow、Dify 这类开源框架,在设置里把嵌入模型换成 WeMM-Embedding 即可,不用自己写检索逻辑。
  5. GitHub 仓库路径:Tencent/WeMM-Embedding,README 里有调用示例。

温馨提醒

  • 嵌入模型不是聊天模型。它不会跟你对话、不会写文章,只负责「把内容变成坐标、做检索匹配」。想聊天写作还是得用 GPT、Qwen、DeepSeek 这类生成模型——两者是配合关系。
  • 榜单第一 ≠ 你的场景第一。MMEB-v2 是通用评测,具体到你自己的资料(比如全是专业图纸或医学影像),效果需要实测。
  • 开源许可要看清。商用前务必阅读 GitHub / Hugging Face 上的 LICENSE 文件,确认商业使用范围与署名要求。
  • 9B 版本对硬件有要求,个人电脑跑起来可能吃力。先用 2B 版本验证效果,需要更高精度再升级。
  • 本地建库涉及隐私:这类工作放在本地跑反而是优势,你的照片和文件不用上传到任何云端。
📤 一键转发小助手 帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发