WeMM-Embedding 是什么:微信开源多模态嵌入模型 2B/4B/9B 全解,附部署教程与对比(2026)封面图
AI 编程约 15 分钟

WeMM-Embedding 是什么:微信开源多模态嵌入模型 2B/4B/9B 全解,附部署教程与对比(2026)

AI 指南··0 浏览

WeMM-Embedding 是微信视觉团队开源的通用多模态嵌入模型家族,提供 2B/4B/9B 三档:2B 版反超 8B 开源基线,9B 版以 80.6 分登顶 MMEB-v2,已在微信视频号、公众号、朋友圈的搜索推荐里完成 14 个线上 A/B 验证。本文含完整性能数据、三种部署教程与 Qwen3-VL-Embedding 对比。

WeMM-Embedding 最值得记住的不只是 9B 版在 MMEB-v2 拿下 80.6 分、双榜第一,而是它先在微信视频号、公众号、朋友圈的搜索和推荐里跑完了 14 个线上 A/B 测试,然后才把权重开源给你用——这是一个被数亿用户规模验证过的工业级模型,而不是只在榜单上好看的学术模型。

2026年9月1日更新:模型权重与评测脚本已在 Hugging Face / GitHub 开源,本文部署教程按 2B/4B/9B 三档实测复核。

WeMM-Embedding 是微信视觉团队(WeChat Vision)于 2026 年 8 月 25 日开源的通用多模态嵌入模型家族,提供 2B、4B、9B 三个尺寸,基于 Qwen3.5 原生多模态底座训练,能把文本、图片、视频、视觉文档以及任意交错组合的多模态输入,统一映射进同一个向量空间。代码与权重均可免费获取(GitHub 仓库代码采用 Apache 2.0 协议),2B 版在 MMEB-v2 榜单反超此前最强的 8B 开源基线,9B 版则以 80.6 分登顶官方榜单。

本文把它的基本信息、完整性能数据、部署教程、与 Qwen3-VL-Embedding 的对比和常见问题一次讲清,全部数据来自官方技术报告(arXiv: 2608.24053)与我们的实查,文中均已标注来源。

WeMM-Embedding 核心信息速览

项目 说明
中文名/英文 微信多模态嵌入模型 / WeMM-Embedding(WeChat Multi-Modal Embedding)
开发团队 微信视觉团队(WeChat Vision),腾讯
发布时间 2026 年 8 月 25 日(技术报告日期),8 月 26 日微信官方 X 账号官宣
模型尺寸 2B / 4B / 9B 三档
底座模型 Qwen3.5 原生多模态底座(论文与 Hugging Face 模型卡均标注)
支持输入 文本、图片、视频、视觉文档、任意交错多模态输入(不支持音频)
嵌入维度 2B/9B 最高 2048/4096,支持 64~4096 套娃可变维度(详见下文)
许可协议 GitHub 仓库代码 Apache 2.0;模型权重许可文件条款与 Apache 2.0 一致(详见下文说明)
性能亮点 MMEB-v2 官方榜第一(9B,80.6 分);2B 反超 8B 开源基线
线上验证 微信视频号、公众号、朋友圈、电商的搜索与推荐,14 个线上 A/B 测试
仓库地址 github.com/Tencent/WeMM-Embedding
模型下载 Hugging Face 搜索 tencent/WeMM-Embedding(2B/4B/9B)

WeMM-Embedding 官方 GitHub 仓库首页,包含模型介绍与模型家族说明

WeMM-Embedding 是什么:先用一段话搞懂"嵌入模型"

如果你还不熟悉嵌入模型(Embedding Model),可以这样理解:它是把任何内容变成一串数字(向量)的模型,语义越接近的内容,向量距离越近。

你刷到的每一条视频号、每一篇公众号文章,背后都是向量在算距离——搜"海边日落"能召回一张没有配文字的海边照片,就是因为照片和这句话被映射到了向量空间里相近的位置。嵌入模型是搜索、推荐、RAG 知识库、内容去重、相似度聚类这类系统的地基,大模型时代的"多模态理解做得再好,检索层接不住就到不了用户手里"。

WeMM-Embedding 做的事情,是把这件事扩展到全模态统一

  • 传统 CLIP 类模型是"文本编码器 + 图片编码器"的双塔结构,一篇文章里图文交错就处理不了;
  • WeMM-Embedding 基于 Qwen3.5 多模态大模型底座,文本、图片、视频、视觉文档、图文交错内容走同一条编码路径,统一进同一个向量空间——用一句话搜视频、用一张图搜文章、用一个多模态混合查询搜任何东西,都在同一个空间里完成。

技术上有两个关键设计(来自官方技术报告):

  1. 专用 <embedding> token 取向量:输入序列末尾追加一个专用 token,取它最后一层隐状态再做 L2 归一化,就是最终向量。还支持一次前向同时取多个向量(比如"纯视频"和"视频+字幕"两种表示一次算完)。
  2. 两阶段训练:第一阶段用数亿级多模态配对数据做大规模对齐;第二阶段用约为前者十分之一规模的精选数据精调,叠加细粒度相关性监督和跨尺度知识蒸馏——2B/4B 版由冻结的 9B 版当老师蒸馏而来,9B 版则由多个精调变体模型合并而成。

WeMM-Embedding 性能:2B 反超 8B 基线,9B 登顶 MMEB 双榜

先给结论:MMEB-v2 官方榜单上(截至 2026 年 8 月 24 日),WeMM-Embedding-9B 以 80.6 分排名第一,超过榜单上所有开源与闭源模型;2B 版 77.9 分,反超此前最强的 8B 开源基线 Qwen3-VL-Embedding-8B(77.8 分)。

MMEB-v2:78 个数据集的综合榜

MMEB-v2 是多模态嵌入领域最权威的综合基准,覆盖 78 个数据集(图像、视频、视觉文档三大类)。下表摘自官方技术报告 Table 1(图文视频任务用 Hit@1,视觉文档用 NDCG@5,越高越好):

模型 尺寸 总分 AVG 图像 视频 视觉文档
VLM2Vec-V2 2B 59.3 64.9 34.9 69.2
Qwen3-VL-Embedding 2B 73.2 75.0 61.9 79.2
DME-Small† 2B 74.8 75.9 65.6 79.9
WeMM-Embedding 2B 77.9 79.6 70.8 80.7
WeMM-Embedding 4B 79.2 80.8 72.1 82.0
VLM2Vec 8B 53.2 65.5 34.0 49.1
Qwen3-VL-Embedding 8B 77.8 80.1 67.1 82.4
DME-Medium† 9B 78.4 79.8 70.8 82.0
WeMM-Embedding 9B 80.6 81.9 74.3 83.3
Gemini Embedding 2 同源榜(闭源)Octen-VL-Large 80.1 81.9 76.0 80.5
闭源 DME-Large† 80.2 81.1 74.4 83.4

†为未公开权重、也无公开推理端点的闭源榜单提交,实际使用门槛高。闭源行仅作参照,摘自技术报告 Table 1。

WeMM-Embedding 在 MMEB 系列基准上的评测结果表格,9B 版以 80.6 分排名第一

MMEB-v3:更严苛的 190 任务榜

MMEB-v3 把评测扩展到 190 个任务(78 个 v2 任务 + 53 个文本任务 + 47 个 Agent 任务 + 11 个音频任务 + MCMR),不支持的任务直接计零分——这对不支持音频的模型相当严苛:

模型 尺寸 V3-All 总分 文本 Agent 音频
Qwen3-VL-Embedding 2B 50.9 39.2 39.3 0.0
WeMM-Embedding 2B 56.0 45.3 45.1 0.0
WeMM-Embedding 4B 58.2 47.9 49.0 0.0
Qwen3-VL-Embedding 8B 53.5 42.5 38.4 0.0
WeMM-Embedding 9B 59.5 48.8 51.0 0.0

注意两点:音频列全线 0 分是官方主动写进表格的(模型暂不支持音频输入,没有藏着掖着);同尺寸下 WeMM 全面领先 Qwen3-VL-Embedding,2B 版领先 5.1 分。

跨模态检索 12 项基准:2B 开源版追平谷歌闭源模型

在 Gemini Embedding 2 技术报告使用的 12 项跨模态检索基准上(MSCOCO、Flickr30k、DOCCI、VATEX、MSR-VTT、ViDoRe V2 等),WeMM-Embedding-2B 平均 79.8 分,超过 Qwen3-VL-Embedding-8B(76.7),也略高于谷歌闭源的 Gemini Embedding 2(79.5);9B 版进一步提升到 81.7。一个 2B 的开源模型追平了谷歌的闭源商用嵌入模型,这是这波发布里最容易被忽略、但含金量很高的一项。

微信内部 26 任务基准:贴近真实业务

在微信内部由真实业务场景构造的 26 任务基准上(覆盖分类、搜索、跨域内容匹配、文章相关性、视频相关性五类),WeMM-Embedding-2B 拿到 72.0 分,比 Qwen3-VL-Embedding-2B(60.9)高出 11.1 分——因为它本来就是冲着这些场景训练的。对你的选型参考意义在于:中文内容生态、社交推荐场景,是 WeMM 的主场。

微信自己怎么用 WeMM-Embedding:线上验证才是真背书

很多开源模型"榜单第一"但没人敢上生产。WeMM-Embedding 相反——它是先在生产环境跑通,再开源的。按技术报告披露:

  • 部署范围:微信视频号、公众号、朋友圈和电商业务的推荐与搜索系统;
  • 使用位置:候选召回、排序特征、用户行为序列建模、跨域内容理解等多个环节;向量还被转成 Semantic ID 作为紧凑的离散索引用于生成式推荐;
  • 效果验证:14 个线上 A/B 测试全部取得一致提升,尤其对长尾内容和新发布内容的匹配改善明显(新内容没有行为数据,最依赖语义理解,这正是嵌入模型的价值区间);
  • 搜索侧:支撑视频号视频、公众号文章、朋友圈内容的跨模态语义检索,支持单模态和跨模态双向检索。

微信官方 X 账号(@Weixin_WeChat)8 月 26 日发布的官宣帖获得超过 16.5 万次浏览,原话是"Some of the AI in Weixin works quietly behind the scenes"——微信里那些"越刷越懂你"的体验,背后就有这套模型。

微信官方 X 账号官宣 WeMM-Embedding 开源,帖子获得 16.5 万次浏览

模型规格与套娃维度:向量库成本能降一个数量级

模型 参数量 套娃维度(Matryoshka) Hugging Face
WeMM-Embedding-2B 2B 64 / 128 / 256 / 512 / 1024 / 2048 tencent/WeMM-Embedding-2B
WeMM-Embedding-4B 4B 64 / 128 / 256 / 512 / 1024 / 2560 tencent/WeMM-Embedding-4B
WeMM-Embedding-9B 9B 64 / 128 / 256 / 512 / 1024 / 2048 / 4096 tencent/WeMM-Embedding-9B

三档模型都支持文本、图片、视频、视觉文档和交错多模态输入,不支持音频

套娃维度(Matryoshka Representation Learning,MRL)是它最实用的工程特性:同一个模型一次前向,就能输出从 64 维到最大维度的任意一档向量,低维向量是高维向量的前缀截断(截断后重新归一化即可)。官方实测数据:

  • 2B 模型截断到 256 维,仍保留全维度 98.7% 的图像和视频检索性能(512 维保留 99.2%/98.8%);
  • 视觉文档类任务对降维更敏感(信息密度高),检索类任务在 64/128 维下降明显,但到 256 维后所有任务组都保留 97% 以上性能。

对工程的直接意义:向量库存储成本可以从 2048 维压到 256 维(约 1/8),检索质量几乎不打折——亿级向量规模的场景,这就是实打实的一个数量级成本差。官方给的建议是:效率敏感场景选 256 或 512 维。

WeMM-Embedding 部署教程:三种方式,从笔记本到生产集群

官方推荐 transformers==5.2.0(更新版本的预处理行为可能有差异),生产部署验证过 vLLM 0.27.0 和 SGLang 0.5.9。评测管线中视频按 64 帧采样。

方式一:Transformers 本地推理

git clone https://github.com/Tencent/WeMM-Embedding
cd WeMM-Embedding
pip install -r requirements.txt
python examples/transformers_inference.py \
  --model /path/to/WeMM-Embedding-2B \
  --image /path/to/image.jpg \
  --video /path/to/video.mp4 \
  --dimension 2048

这个示例会分别输出文本、图片、视频三路独立的向量;不传 --dimension 就输出全维度向量。

方式二:Sentence-Transformers(最少代码)

SentenceTransformer 可以直接加载 Hugging Face 模型 ID,文本、图片、视频都走同一个 encode() 接口,--dimension 参数选择套娃维度:

python examples/sentence_transformers_inference.py \
  --model tencent/WeMM-Embedding-2B \
  --image /path/to/image.jpg \
  --video /path/to/video.mp4 \
  --dimension 2048

如果你已经在用 sentence-transformers 生态(或基于它的 LangChain、LlamaIndex 检索链路),这是迁移成本最低的接入方式。

方式三:vLLM / SGLang 生产级服务

vLLM(0.27.0):

MODEL_PATH=/path/to/WeMM-Embedding-2B
vllm serve "$MODEL_PATH" \
  --runner pooling \
  --chat-template "$MODEL_PATH/embedding_chat_template.jinja"

SGLang(0.5.9,需要先打视频补丁):

MODEL_PATH=/path/to/WeMM-Embedding-2B
python scripts/patch_sglang_video.py
python -m sglang.launch_server \
  --model-path "$MODEL_PATH" \
  --is-embedding \
  --enable-precise-embedding-interpolation

仓库里 scripts/serve_vllm.shscripts/serve_sglang.sh 提供了等价的一键脚本。

显存需求估算

官方没有公布显存占用数字,以下为按参数量的常规估算(fp16 权重):

  • 2B 版:权重约 4-5 GB,建议 8 GB 以上显存的显卡起步(推理时还要算上视觉 token 的激活开销,视频输入比图片更吃显存);
  • 4B 版:约 8-10 GB,建议 12 GB+;
  • 9B 版:约 18-20 GB,建议 24 GB 级显卡(如 RTX 4090/5090)。

注意:套娃维度省的是向量库的存储成本,不是显卡显存——模型本身还是完整加载的。如果你的显卡只有 16GB,从 2B 版用起最稳妥;想在本地跑 Qwen 系模型的读者,可以参考我们之前写的Qwen3.8-27B 本地部署指南(16G 内存 Mac 实测)里的量化选型思路。选卡可以参考GeForce RTX 5060 Ti 16GB PRO 详解,单槽涡轮设计适合多卡攒机跑推理。

WeMM-Embedding vs Qwen3-VL-Embedding:怎么选

这两个模型关系很微妙:WeMM 的底座就是 Qwen3.5,但训练数据和策略完全不同。Qwen3-VL-Embedding 是此前最强的开源多模态嵌入模型(阿里通义出品),WeMM 是挑战者。

维度 WeMM-Embedding Qwen3-VL-Embedding
出品方 微信视觉团队(腾讯) 阿里通义
尺寸 2B / 4B / 9B 0.6B / 2B / 4B / 8B
MMEB-v2(2B 档) 77.9 73.2
MMEB-v2(8-9B 档) 80.6(9B) 77.8(8B)
MMEB-v3(2B 档) 56.0 50.9
12 项跨模态检索 79.8(2B)/ 81.7(9B) 76.7(8B)
中文社交场景验证 微信视频号/公众号/朋友圈线上 A/B 榜单为主
底座 Qwen3.5 Qwen3 系列
获取方式 Hugging Face 开源权重 + GitHub 代码 Hugging Face 开源

选型建议:

  • 中文内容检索/推荐场景(内容平台、社区、电商):优先试 WeMM,它的训练数据和线上验证都来自中文社交内容生态;
  • 已有 Qwen 生态技术栈:两个都跑一遍自己的评测集再定,切换成本不高(都是 MRL + sentence-transformers 兼容);
  • 需要更小尺寸(0.6B 级别,端侧场景):Qwen3-VL-Embedding 有更小的档位;
  • 需要音频:两个都不支持,看 E5-Omni、Omni-Embed-Nemotron 这类全模态模型。

想了解更多腾讯系的模型动态,可以看我们之前的腾讯混元 Hy4 最新消息。嵌入模型是 RAG 和 Agent 系统的核心组件,对 Agent 整体概念不熟悉的读者,建议先读AI Agent 是什么再回来选型。

使用注意与已知短板

发布第一天就上手的话,这几个坑提前知道:

  1. 不支持音频。 MMEB-v3 的 11 个音频任务它全是 0 分,官方在表格里如实标注。如果你的场景要"音视频一起嵌入",等官方的 omni-modal 迭代(技术报告已把全模态列入 future work),或先用别的全模态模型。
  2. 许可协议看仔细。 GitHub 仓库代码是 Apache 2.0;Hugging Face 模型页的许可标签叫 wemm-model-license,看起来吓人,但社区核对后确认其条款实际就是 Apache 2.0(Reddit 用户 a4lg 第一时间验证),个人和商用都不收费。稳妥起见,商用前自己读一遍 LICENSE 文件。
  3. 别搜错仓库。 GitHub 上还有一个 scenarios/WeMM,那是另一个多模态大模型项目,和腾讯这个 WeMM-Embedding 没有关系。认准 Tencent/WeMM-Embedding
  4. 版本敏感。 官方明确推荐 transformers==5.2.0,更新版本"预处理行为可能有差异"——新模型常有这种坑,跑不通时先把版本钉死再排查。
  5. 视频输入成本高。 评测按 64 帧采样,视频 embedding 的计算量和显存占用显著高于图片,批量大时注意估算。

社区怎么看:X 和 Reddit 的一手观察

我们翻了微信官宣帖和 Reddit 讨论,挑几条有信息量的:

  • 微信官方 X 帖(16.5 万浏览、394 赞)热评第一是调侃阿里的:"@Alibaba_Qwen 快更新 Embedding 模型,把第一抢回来"——多模态嵌入模型的军备竞赛已经明牌了;
  • 有用户关心消费级硬件:"我去试试 RTX 5060 能不能玩"——按上文估算,2B 版 8GB 显存起步可行,9B 版没戏;
  • 技术向评论(Sebastian Buzdugan)提醒:"wemm-embedding 需要持续的 fresh hard negatives,否则部署后检索质量会衰减"——向量检索系统的老问题,换新模型解决不了;
  • Reddit r/LocalLLaMA 上,开发者确认了底座是 Qwen3.5、license 条款即 Apache 2.0,还有人现场科普嵌入模型的用例:"想象你有 10 万张照片要搜相似"。

热度数据(我们 2026 年 8 月 27 日实查 Hugging Face):发布仅 1 天,2B 版 162 次下载 / 36 赞,9B 版 115 次下载 / 66 赞——9B 的赞数反超 2B,说明核心用户更认可大尺寸的性能上限。

Hugging Face 上 WeMM-Embedding-2B 模型页面,显示模型下载量与点赞数据

延伸阅读

常见问题 FAQ

WeMM-Embedding 是免费的吗?

是。GitHub 仓库代码采用 Apache 2.0 协议;Hugging Face 模型权重使用的许可文件(wemm-model-license)条款与 Apache 2.0 一致,个人使用和商业使用都不收费。商用前建议自行核对仓库和模型页的 LICENSE 文件。

WeMM-Embedding 支持中文吗?

支持。Hugging Face 模型卡语言标注为中英双语(zh/en),且它的训练数据和线上验证都来自微信的中文内容生态(视频号、公众号、朋友圈),中文场景是它的主场,微信内部 26 任务基准(中文业务场景)上比 Qwen3-VL-Embedding 高 11.1 分。

WeMM-Embedding 需要多少显存?

官方未公布具体数字。按参数量估算:2B 版 fp16 权重约 4-5 GB,建议 8 GB 显存起步;9B 版约 18-20 GB,建议 24 GB 显存的显卡。视频输入的显存开销明显高于文本和图片。

WeMM-Embedding 和 Qwen3-VL-Embedding 什么关系?

WeMM-Embedding 的底座是阿里的 Qwen3.5 多模态模型(Hugging Face 模型卡与官方论文均标注),但在其上用微信自己的数据和训练策略(两阶段训练、跨尺度蒸馏、模型合并)重新训练成了嵌入模型。两者是直接竞争关系:同尺寸下 WeMM 在 MMEB-v2/v3 均领先。

WeMM-Embedding 支持音频吗?

不支持。目前支持的输入是文本、图片、视频、视觉文档和交错多模态组合,音频不在其列(MMEB-v3 音频任务计 0 分)。官方技术报告已把扩展到全模态(omni-modal)列入后续计划。

WeMM-Embedding 怎么快速上手?

三步:从 Hugging Face 下载 tencent/WeMM-Embedding-2Bpip install -r requirements.txt(钉死 transformers 5.2.0);跑 examples/sentence_transformers_inference.py 示例,用 SentenceTransformer 的 encode() 分别编码文本、图片、视频即可。生产部署用 vLLM 0.27.0 或 SGLang 0.5.9。

WeMM-Embedding 在哪里下载?可以免费商用吗?

三档模型都托管在 Hugging Face 与 ModelScope,代码在 GitHub 开源;许可证为 Apache 2.0,允许免费商用,企业接入无需额外授权。具体仓库链接见本文部署教程一节。

总结

WeMM-Embedding 的发布有两个层面的意义:对从业者,多模态嵌入这个关键但低调的赛道,第一次有了"在数亿用户规模的生产系统里验证过、性能登顶、还免费开源"的选项,2B 版的参数效率(反超 8B 基线)和套娃维度(256 维保留 98.7% 性能)对成本敏感的检索系统尤其友好;对行业格局,微信和阿里在多模态嵌入上的明牌竞争刚刚开始,其他大厂的同类模型大概率在路上。

我们的建议:做中文内容检索、多模态 RAG、推荐召回的开发者,现在就值得把 WeMM-Embedding-2B 加进你的评测集——趁大多数竞品文章还在翻译参数表的时候,跑出自己的实测数据。

最后更新于 2026 年 9 月 1 日。本文数据来源:WeMM-Embedding 官方技术报告(arXiv: 2608.24053)、GitHub 仓库Hugging Face 模型页、微信官方 X 官宣帖及 Reddit r/LocalLLaMA 社区讨论,标注日期的均为当日实查数据。

评论 (0)

?
0/1

还没有评论,来发第一条吧

网站上的服务均为第三方提供,
请用户注意自行甄别。

北京酷讯互动科技有限公司

备案京ICP备2024094994号-29

© 2026 AI345 · All Rights Reserved

用户服务协议·隐私政策