
WeMM-Embedding 是什么:微信开源多模态嵌入模型 2B/4B/9B 全解,附部署教程与对比(2026)
WeMM-Embedding 是微信视觉团队开源的通用多模态嵌入模型家族,提供 2B/4B/9B 三档:2B 版反超 8B 开源基线,9B 版以 80.6 分登顶 MMEB-v2,已在微信视频号、公众号、朋友圈的搜索推荐里完成 14 个线上 A/B 验证。本文含完整性能数据、三种部署教程与 Qwen3-VL-Embedding 对比。
WeMM-Embedding 最值得记住的不只是 9B 版在 MMEB-v2 拿下 80.6 分、双榜第一,而是它先在微信视频号、公众号、朋友圈的搜索和推荐里跑完了 14 个线上 A/B 测试,然后才把权重开源给你用——这是一个被数亿用户规模验证过的工业级模型,而不是只在榜单上好看的学术模型。
2026年9月1日更新:模型权重与评测脚本已在 Hugging Face / GitHub 开源,本文部署教程按 2B/4B/9B 三档实测复核。
WeMM-Embedding 是微信视觉团队(WeChat Vision)于 2026 年 8 月 25 日开源的通用多模态嵌入模型家族,提供 2B、4B、9B 三个尺寸,基于 Qwen3.5 原生多模态底座训练,能把文本、图片、视频、视觉文档以及任意交错组合的多模态输入,统一映射进同一个向量空间。代码与权重均可免费获取(GitHub 仓库代码采用 Apache 2.0 协议),2B 版在 MMEB-v2 榜单反超此前最强的 8B 开源基线,9B 版则以 80.6 分登顶官方榜单。
本文把它的基本信息、完整性能数据、部署教程、与 Qwen3-VL-Embedding 的对比和常见问题一次讲清,全部数据来自官方技术报告(arXiv: 2608.24053)与我们的实查,文中均已标注来源。
WeMM-Embedding 核心信息速览
| 项目 | 说明 |
|---|---|
| 中文名/英文 | 微信多模态嵌入模型 / WeMM-Embedding(WeChat Multi-Modal Embedding) |
| 开发团队 | 微信视觉团队(WeChat Vision),腾讯 |
| 发布时间 | 2026 年 8 月 25 日(技术报告日期),8 月 26 日微信官方 X 账号官宣 |
| 模型尺寸 | 2B / 4B / 9B 三档 |
| 底座模型 | Qwen3.5 原生多模态底座(论文与 Hugging Face 模型卡均标注) |
| 支持输入 | 文本、图片、视频、视觉文档、任意交错多模态输入(不支持音频) |
| 嵌入维度 | 2B/9B 最高 2048/4096,支持 64~4096 套娃可变维度(详见下文) |
| 许可协议 | GitHub 仓库代码 Apache 2.0;模型权重许可文件条款与 Apache 2.0 一致(详见下文说明) |
| 性能亮点 | MMEB-v2 官方榜第一(9B,80.6 分);2B 反超 8B 开源基线 |
| 线上验证 | 微信视频号、公众号、朋友圈、电商的搜索与推荐,14 个线上 A/B 测试 |
| 仓库地址 | github.com/Tencent/WeMM-Embedding |
| 模型下载 | Hugging Face 搜索 tencent/WeMM-Embedding(2B/4B/9B) |

WeMM-Embedding 是什么:先用一段话搞懂"嵌入模型"
如果你还不熟悉嵌入模型(Embedding Model),可以这样理解:它是把任何内容变成一串数字(向量)的模型,语义越接近的内容,向量距离越近。
你刷到的每一条视频号、每一篇公众号文章,背后都是向量在算距离——搜"海边日落"能召回一张没有配文字的海边照片,就是因为照片和这句话被映射到了向量空间里相近的位置。嵌入模型是搜索、推荐、RAG 知识库、内容去重、相似度聚类这类系统的地基,大模型时代的"多模态理解做得再好,检索层接不住就到不了用户手里"。
WeMM-Embedding 做的事情,是把这件事扩展到全模态统一:
- 传统 CLIP 类模型是"文本编码器 + 图片编码器"的双塔结构,一篇文章里图文交错就处理不了;
- WeMM-Embedding 基于 Qwen3.5 多模态大模型底座,文本、图片、视频、视觉文档、图文交错内容走同一条编码路径,统一进同一个向量空间——用一句话搜视频、用一张图搜文章、用一个多模态混合查询搜任何东西,都在同一个空间里完成。
技术上有两个关键设计(来自官方技术报告):
- 专用
<embedding>token 取向量:输入序列末尾追加一个专用 token,取它最后一层隐状态再做 L2 归一化,就是最终向量。还支持一次前向同时取多个向量(比如"纯视频"和"视频+字幕"两种表示一次算完)。 - 两阶段训练:第一阶段用数亿级多模态配对数据做大规模对齐;第二阶段用约为前者十分之一规模的精选数据精调,叠加细粒度相关性监督和跨尺度知识蒸馏——2B/4B 版由冻结的 9B 版当老师蒸馏而来,9B 版则由多个精调变体模型合并而成。
WeMM-Embedding 性能:2B 反超 8B 基线,9B 登顶 MMEB 双榜
先给结论:MMEB-v2 官方榜单上(截至 2026 年 8 月 24 日),WeMM-Embedding-9B 以 80.6 分排名第一,超过榜单上所有开源与闭源模型;2B 版 77.9 分,反超此前最强的 8B 开源基线 Qwen3-VL-Embedding-8B(77.8 分)。
MMEB-v2:78 个数据集的综合榜
MMEB-v2 是多模态嵌入领域最权威的综合基准,覆盖 78 个数据集(图像、视频、视觉文档三大类)。下表摘自官方技术报告 Table 1(图文视频任务用 Hit@1,视觉文档用 NDCG@5,越高越好):
| 模型 | 尺寸 | 总分 AVG | 图像 | 视频 | 视觉文档 |
|---|---|---|---|---|---|
| VLM2Vec-V2 | 2B | 59.3 | 64.9 | 34.9 | 69.2 |
| Qwen3-VL-Embedding | 2B | 73.2 | 75.0 | 61.9 | 79.2 |
| DME-Small† | 2B | 74.8 | 75.9 | 65.6 | 79.9 |
| WeMM-Embedding | 2B | 77.9 | 79.6 | 70.8 | 80.7 |
| WeMM-Embedding | 4B | 79.2 | 80.8 | 72.1 | 82.0 |
| VLM2Vec | 8B | 53.2 | 65.5 | 34.0 | 49.1 |
| Qwen3-VL-Embedding | 8B | 77.8 | 80.1 | 67.1 | 82.4 |
| DME-Medium† | 9B | 78.4 | 79.8 | 70.8 | 82.0 |
| WeMM-Embedding | 9B | 80.6 | 81.9 | 74.3 | 83.3 |
| Gemini Embedding 2 同源榜(闭源)Octen-VL-Large | – | 80.1 | 81.9 | 76.0 | 80.5 |
| 闭源 DME-Large† | – | 80.2 | 81.1 | 74.4 | 83.4 |
†为未公开权重、也无公开推理端点的闭源榜单提交,实际使用门槛高。闭源行仅作参照,摘自技术报告 Table 1。

MMEB-v3:更严苛的 190 任务榜
MMEB-v3 把评测扩展到 190 个任务(78 个 v2 任务 + 53 个文本任务 + 47 个 Agent 任务 + 11 个音频任务 + MCMR),不支持的任务直接计零分——这对不支持音频的模型相当严苛:
| 模型 | 尺寸 | V3-All 总分 | 文本 | Agent | 音频 |
|---|---|---|---|---|---|
| Qwen3-VL-Embedding | 2B | 50.9 | 39.2 | 39.3 | 0.0 |
| WeMM-Embedding | 2B | 56.0 | 45.3 | 45.1 | 0.0 |
| WeMM-Embedding | 4B | 58.2 | 47.9 | 49.0 | 0.0 |
| Qwen3-VL-Embedding | 8B | 53.5 | 42.5 | 38.4 | 0.0 |
| WeMM-Embedding | 9B | 59.5 | 48.8 | 51.0 | 0.0 |
注意两点:音频列全线 0 分是官方主动写进表格的(模型暂不支持音频输入,没有藏着掖着);同尺寸下 WeMM 全面领先 Qwen3-VL-Embedding,2B 版领先 5.1 分。
跨模态检索 12 项基准:2B 开源版追平谷歌闭源模型
在 Gemini Embedding 2 技术报告使用的 12 项跨模态检索基准上(MSCOCO、Flickr30k、DOCCI、VATEX、MSR-VTT、ViDoRe V2 等),WeMM-Embedding-2B 平均 79.8 分,超过 Qwen3-VL-Embedding-8B(76.7),也略高于谷歌闭源的 Gemini Embedding 2(79.5);9B 版进一步提升到 81.7。一个 2B 的开源模型追平了谷歌的闭源商用嵌入模型,这是这波发布里最容易被忽略、但含金量很高的一项。
微信内部 26 任务基准:贴近真实业务
在微信内部由真实业务场景构造的 26 任务基准上(覆盖分类、搜索、跨域内容匹配、文章相关性、视频相关性五类),WeMM-Embedding-2B 拿到 72.0 分,比 Qwen3-VL-Embedding-2B(60.9)高出 11.1 分——因为它本来就是冲着这些场景训练的。对你的选型参考意义在于:中文内容生态、社交推荐场景,是 WeMM 的主场。
微信自己怎么用 WeMM-Embedding:线上验证才是真背书
很多开源模型"榜单第一"但没人敢上生产。WeMM-Embedding 相反——它是先在生产环境跑通,再开源的。按技术报告披露:
- 部署范围:微信视频号、公众号、朋友圈和电商业务的推荐与搜索系统;
- 使用位置:候选召回、排序特征、用户行为序列建模、跨域内容理解等多个环节;向量还被转成 Semantic ID 作为紧凑的离散索引用于生成式推荐;
- 效果验证:14 个线上 A/B 测试全部取得一致提升,尤其对长尾内容和新发布内容的匹配改善明显(新内容没有行为数据,最依赖语义理解,这正是嵌入模型的价值区间);
- 搜索侧:支撑视频号视频、公众号文章、朋友圈内容的跨模态语义检索,支持单模态和跨模态双向检索。
微信官方 X 账号(@Weixin_WeChat)8 月 26 日发布的官宣帖获得超过 16.5 万次浏览,原话是"Some of the AI in Weixin works quietly behind the scenes"——微信里那些"越刷越懂你"的体验,背后就有这套模型。

模型规格与套娃维度:向量库成本能降一个数量级
| 模型 | 参数量 | 套娃维度(Matryoshka) | Hugging Face |
|---|---|---|---|
| WeMM-Embedding-2B | 2B | 64 / 128 / 256 / 512 / 1024 / 2048 | tencent/WeMM-Embedding-2B |
| WeMM-Embedding-4B | 4B | 64 / 128 / 256 / 512 / 1024 / 2560 | tencent/WeMM-Embedding-4B |
| WeMM-Embedding-9B | 9B | 64 / 128 / 256 / 512 / 1024 / 2048 / 4096 | tencent/WeMM-Embedding-9B |
三档模型都支持文本、图片、视频、视觉文档和交错多模态输入,不支持音频。
套娃维度(Matryoshka Representation Learning,MRL)是它最实用的工程特性:同一个模型一次前向,就能输出从 64 维到最大维度的任意一档向量,低维向量是高维向量的前缀截断(截断后重新归一化即可)。官方实测数据:
- 2B 模型截断到 256 维,仍保留全维度 98.7% 的图像和视频检索性能(512 维保留 99.2%/98.8%);
- 视觉文档类任务对降维更敏感(信息密度高),检索类任务在 64/128 维下降明显,但到 256 维后所有任务组都保留 97% 以上性能。
对工程的直接意义:向量库存储成本可以从 2048 维压到 256 维(约 1/8),检索质量几乎不打折——亿级向量规模的场景,这就是实打实的一个数量级成本差。官方给的建议是:效率敏感场景选 256 或 512 维。
WeMM-Embedding 部署教程:三种方式,从笔记本到生产集群
官方推荐 transformers==5.2.0(更新版本的预处理行为可能有差异),生产部署验证过 vLLM 0.27.0 和 SGLang 0.5.9。评测管线中视频按 64 帧采样。
方式一:Transformers 本地推理
git clone https://github.com/Tencent/WeMM-Embedding
cd WeMM-Embedding
pip install -r requirements.txt
python examples/transformers_inference.py \
--model /path/to/WeMM-Embedding-2B \
--image /path/to/image.jpg \
--video /path/to/video.mp4 \
--dimension 2048
这个示例会分别输出文本、图片、视频三路独立的向量;不传 --dimension 就输出全维度向量。
方式二:Sentence-Transformers(最少代码)
SentenceTransformer 可以直接加载 Hugging Face 模型 ID,文本、图片、视频都走同一个 encode() 接口,--dimension 参数选择套娃维度:
python examples/sentence_transformers_inference.py \
--model tencent/WeMM-Embedding-2B \
--image /path/to/image.jpg \
--video /path/to/video.mp4 \
--dimension 2048
如果你已经在用 sentence-transformers 生态(或基于它的 LangChain、LlamaIndex 检索链路),这是迁移成本最低的接入方式。
方式三:vLLM / SGLang 生产级服务
vLLM(0.27.0):
MODEL_PATH=/path/to/WeMM-Embedding-2B
vllm serve "$MODEL_PATH" \
--runner pooling \
--chat-template "$MODEL_PATH/embedding_chat_template.jinja"
SGLang(0.5.9,需要先打视频补丁):
MODEL_PATH=/path/to/WeMM-Embedding-2B
python scripts/patch_sglang_video.py
python -m sglang.launch_server \
--model-path "$MODEL_PATH" \
--is-embedding \
--enable-precise-embedding-interpolation
仓库里 scripts/serve_vllm.sh 和 scripts/serve_sglang.sh 提供了等价的一键脚本。
显存需求估算
官方没有公布显存占用数字,以下为按参数量的常规估算(fp16 权重):
- 2B 版:权重约 4-5 GB,建议 8 GB 以上显存的显卡起步(推理时还要算上视觉 token 的激活开销,视频输入比图片更吃显存);
- 4B 版:约 8-10 GB,建议 12 GB+;
- 9B 版:约 18-20 GB,建议 24 GB 级显卡(如 RTX 4090/5090)。
注意:套娃维度省的是向量库的存储成本,不是显卡显存——模型本身还是完整加载的。如果你的显卡只有 16GB,从 2B 版用起最稳妥;想在本地跑 Qwen 系模型的读者,可以参考我们之前写的Qwen3.8-27B 本地部署指南(16G 内存 Mac 实测)里的量化选型思路。选卡可以参考GeForce RTX 5060 Ti 16GB PRO 详解,单槽涡轮设计适合多卡攒机跑推理。
WeMM-Embedding vs Qwen3-VL-Embedding:怎么选
这两个模型关系很微妙:WeMM 的底座就是 Qwen3.5,但训练数据和策略完全不同。Qwen3-VL-Embedding 是此前最强的开源多模态嵌入模型(阿里通义出品),WeMM 是挑战者。
| 维度 | WeMM-Embedding | Qwen3-VL-Embedding |
|---|---|---|
| 出品方 | 微信视觉团队(腾讯) | 阿里通义 |
| 尺寸 | 2B / 4B / 9B | 0.6B / 2B / 4B / 8B |
| MMEB-v2(2B 档) | 77.9 | 73.2 |
| MMEB-v2(8-9B 档) | 80.6(9B) | 77.8(8B) |
| MMEB-v3(2B 档) | 56.0 | 50.9 |
| 12 项跨模态检索 | 79.8(2B)/ 81.7(9B) | 76.7(8B) |
| 中文社交场景验证 | 微信视频号/公众号/朋友圈线上 A/B | 榜单为主 |
| 底座 | Qwen3.5 | Qwen3 系列 |
| 获取方式 | Hugging Face 开源权重 + GitHub 代码 | Hugging Face 开源 |
选型建议:
- 中文内容检索/推荐场景(内容平台、社区、电商):优先试 WeMM,它的训练数据和线上验证都来自中文社交内容生态;
- 已有 Qwen 生态技术栈:两个都跑一遍自己的评测集再定,切换成本不高(都是 MRL + sentence-transformers 兼容);
- 需要更小尺寸(0.6B 级别,端侧场景):Qwen3-VL-Embedding 有更小的档位;
- 需要音频:两个都不支持,看 E5-Omni、Omni-Embed-Nemotron 这类全模态模型。
想了解更多腾讯系的模型动态,可以看我们之前的腾讯混元 Hy4 最新消息。嵌入模型是 RAG 和 Agent 系统的核心组件,对 Agent 整体概念不熟悉的读者,建议先读AI Agent 是什么再回来选型。
使用注意与已知短板
发布第一天就上手的话,这几个坑提前知道:
- 不支持音频。 MMEB-v3 的 11 个音频任务它全是 0 分,官方在表格里如实标注。如果你的场景要"音视频一起嵌入",等官方的 omni-modal 迭代(技术报告已把全模态列入 future work),或先用别的全模态模型。
- 许可协议看仔细。 GitHub 仓库代码是 Apache 2.0;Hugging Face 模型页的许可标签叫
wemm-model-license,看起来吓人,但社区核对后确认其条款实际就是 Apache 2.0(Reddit 用户 a4lg 第一时间验证),个人和商用都不收费。稳妥起见,商用前自己读一遍 LICENSE 文件。 - 别搜错仓库。 GitHub 上还有一个
scenarios/WeMM,那是另一个多模态大模型项目,和腾讯这个 WeMM-Embedding 没有关系。认准Tencent/WeMM-Embedding。 - 版本敏感。 官方明确推荐
transformers==5.2.0,更新版本"预处理行为可能有差异"——新模型常有这种坑,跑不通时先把版本钉死再排查。 - 视频输入成本高。 评测按 64 帧采样,视频 embedding 的计算量和显存占用显著高于图片,批量大时注意估算。
社区怎么看:X 和 Reddit 的一手观察
我们翻了微信官宣帖和 Reddit 讨论,挑几条有信息量的:
- 微信官方 X 帖(16.5 万浏览、394 赞)热评第一是调侃阿里的:"@Alibaba_Qwen 快更新 Embedding 模型,把第一抢回来"——多模态嵌入模型的军备竞赛已经明牌了;
- 有用户关心消费级硬件:"我去试试 RTX 5060 能不能玩"——按上文估算,2B 版 8GB 显存起步可行,9B 版没戏;
- 技术向评论(Sebastian Buzdugan)提醒:"wemm-embedding 需要持续的 fresh hard negatives,否则部署后检索质量会衰减"——向量检索系统的老问题,换新模型解决不了;
- Reddit r/LocalLLaMA 上,开发者确认了底座是 Qwen3.5、license 条款即 Apache 2.0,还有人现场科普嵌入模型的用例:"想象你有 10 万张照片要搜相似"。
热度数据(我们 2026 年 8 月 27 日实查 Hugging Face):发布仅 1 天,2B 版 162 次下载 / 36 赞,9B 版 115 次下载 / 66 赞——9B 的赞数反超 2B,说明核心用户更认可大尺寸的性能上限。

延伸阅读
常见问题 FAQ
WeMM-Embedding 是免费的吗?
是。GitHub 仓库代码采用 Apache 2.0 协议;Hugging Face 模型权重使用的许可文件(wemm-model-license)条款与 Apache 2.0 一致,个人使用和商业使用都不收费。商用前建议自行核对仓库和模型页的 LICENSE 文件。
WeMM-Embedding 支持中文吗?
支持。Hugging Face 模型卡语言标注为中英双语(zh/en),且它的训练数据和线上验证都来自微信的中文内容生态(视频号、公众号、朋友圈),中文场景是它的主场,微信内部 26 任务基准(中文业务场景)上比 Qwen3-VL-Embedding 高 11.1 分。
WeMM-Embedding 需要多少显存?
官方未公布具体数字。按参数量估算:2B 版 fp16 权重约 4-5 GB,建议 8 GB 显存起步;9B 版约 18-20 GB,建议 24 GB 显存的显卡。视频输入的显存开销明显高于文本和图片。
WeMM-Embedding 和 Qwen3-VL-Embedding 什么关系?
WeMM-Embedding 的底座是阿里的 Qwen3.5 多模态模型(Hugging Face 模型卡与官方论文均标注),但在其上用微信自己的数据和训练策略(两阶段训练、跨尺度蒸馏、模型合并)重新训练成了嵌入模型。两者是直接竞争关系:同尺寸下 WeMM 在 MMEB-v2/v3 均领先。
WeMM-Embedding 支持音频吗?
不支持。目前支持的输入是文本、图片、视频、视觉文档和交错多模态组合,音频不在其列(MMEB-v3 音频任务计 0 分)。官方技术报告已把扩展到全模态(omni-modal)列入后续计划。
WeMM-Embedding 怎么快速上手?
三步:从 Hugging Face 下载 tencent/WeMM-Embedding-2B;pip install -r requirements.txt(钉死 transformers 5.2.0);跑 examples/sentence_transformers_inference.py 示例,用 SentenceTransformer 的 encode() 分别编码文本、图片、视频即可。生产部署用 vLLM 0.27.0 或 SGLang 0.5.9。
WeMM-Embedding 在哪里下载?可以免费商用吗?
三档模型都托管在 Hugging Face 与 ModelScope,代码在 GitHub 开源;许可证为 Apache 2.0,允许免费商用,企业接入无需额外授权。具体仓库链接见本文部署教程一节。
总结
WeMM-Embedding 的发布有两个层面的意义:对从业者,多模态嵌入这个关键但低调的赛道,第一次有了"在数亿用户规模的生产系统里验证过、性能登顶、还免费开源"的选项,2B 版的参数效率(反超 8B 基线)和套娃维度(256 维保留 98.7% 性能)对成本敏感的检索系统尤其友好;对行业格局,微信和阿里在多模态嵌入上的明牌竞争刚刚开始,其他大厂的同类模型大概率在路上。
我们的建议:做中文内容检索、多模态 RAG、推荐召回的开发者,现在就值得把 WeMM-Embedding-2B 加进你的评测集——趁大多数竞品文章还在翻译参数表的时候,跑出自己的实测数据。
最后更新于 2026 年 9 月 1 日。本文数据来源:WeMM-Embedding 官方技术报告(arXiv: 2608.24053)、GitHub 仓库、Hugging Face 模型页、微信官方 X 官宣帖及 Reddit r/LocalLLaMA 社区讨论,标注日期的均为当日实查数据。

京ICP备2024094994号-29