返回 AI Bar

腾讯开源文档解析模型 WeVisDoc

AI产品观察 · 2026-09-20T11:00:08

腾讯开源的 WeVisDoc 放出了权重,2B 和 4B 两个版本,许可都是 apache-2.0。 它做的事很直接,输入一整页文档的图片,一次输出完整 Markdown,标题、正文、表格、公式不用先裁出来。 两个版本分别微调自 Qwen3-VL 的 2B 和 4B Instruct。 官方在 OmniDocBench v1.6 上给的分,4B 版 Overall 95.38,2B 版 95.06。 同一张榜上,HunyuanOCR-1.5 是 94.74,dots.ocr 是 90.77,DeepSeek-OCR 2 是 90.25。 表格转 HTML、公式转 LaTeX 都在输出里。 代码和权重在 GitHub 上直接能拿,有卡的话本地跑就行。

AI 论坛精选

  • 把开源模型做成像素沙盒,零门槛直接进 - 面向开源模型做交互,有人试了一种很极端的形态:一个类似 Minecraft 的像素沙盒世界。没有登录框,没有付费墙,也不依赖 Codex 这类特定的闭源技术栈,打开就能直接进,甚至可以直接 fork…
  • 开源大模型里被找出的“痛苦方向” - 有研究者在 25 个开源大模型里寻找并干预了一种被称为“pain direction”(痛苦方向)的内部向量表征。相关实验观察显示,当刻意调高这个内部信号时,像 Qwen 这类模型在设定环境下的行为…
  • 让大模型反复做简单判断,成本开始算不过来了 - 大语言模型这些年基本被 decoder-only 路线统一了。当年 BERT 这一派 encoder 擅长把输入压成表征,但因为每个具体任务往往都得单独微调,后来逐渐被靠规模、上下文学习和指令微调走…
  • Splunk 开源了个工具,专盯 coding agent 花销 - 天天用 Claude Code、Codex 写代码,一个会话到底烧了多少钱,多数人是没概念的。 Splunk 官方开源了个工具叫 Token Meter,MIT 协议,本地跑,不需要 API Key…
  • 让 AI 生图能改字、拖图层,这个项目开源了 - 用 AI 生图最烦的一点是,出来的东西好看,但改不动。想改个字、挪个图层,只能重新生成一遍。 有个叫 Editable-Design 的开源项目想解决这个。它的思路是把视觉模型当大脑做需求理解和审美…
  • 大模型上线前评测,别拿标准榜单代替真实工况 - 很多模型在干净的标准基准上分数很漂亮,放到实际生产里依然处理不好核心边界。做上线前评测,重点不是跑几个通用公开榜,而是先想清楚产品决策和能承受哪种失误。在减少误报的场景里,降低假阳性和提升准确率通常…
  • 进入 AI 论坛 - 浏览 AI 工具实践、Agent 教程与社区精选讨论