返回 AI Bar

Ollama 上下文默认只给 4000

硬核玩家 · 2026-09-20T11:11:08

有人把 KoboldCpp 和 Ollama 拉出来对比,重点不是谁快,是两者的默认配置差在哪。 先说结论,这两个工具底层都是 llama.cpp,性能差距基本全由默认设置决定,不是谁写的引擎更好。 测试里最典型的一幕是 70B 模型在 KoboldCpp 上提示词处理从 1490 tokens/s 掉到 34 tokens/s,慢了 44 倍。查下来是 Flash Attention 被误关、显存没卸载,打开之后两边速度就一样了。 真正值得记的是 Ollama 的一个隐形限制。显存不到 24GB 时,它默认只给 4000 Token 上下文,48GB 给到 32000,显存更高才给 256000。这个量级拿去跑 Agent 和长文搜索是不够的。 参数自由度也差得挺多。Ollama 文档里只暴露 8 个采样和运行时参数,KoboldCpp 有 56 个请求字段和 165 个启动参数,还能调采样器的执行顺序。 另外两个事实挺有意思。KoboldCpp 是 606MB 单文件免安装,Ollama 安装包 1000MB,但 Ollama 的下载量是它的近 30 倍。 开源贡献上也没有谁白嫖谁,两边往上游 llama.cpp 主库分别提交了 6 次和 7 次。 KoboldCpp 还在源码里反向兼容了 Ollama 的 generate 和 chat 接口,第三方工具不改代码就能接上。 想省事就继续用 Ollama,要跑长上下文或细调参数,可以再装一个 KoboldCpp。

AI 论坛精选

  • Codex 额度用完,网页 ChatGPT 怎么直接连本地项目 - Codex 额度用完以后,如果还想用网页版 ChatGPT 接着干活,最麻烦的就是代码还在本地,模型摸不到文件,只能一段段复制粘贴。把 WebCodex 接上,就能让网页版直接读写本地工作区。 它的…
  • Splunk 开源了个工具,专盯 coding agent 花销 - 天天用 Claude Code、Codex 写代码,一个会话到底烧了多少钱,多数人是没概念的。 Splunk 官方开源了个工具叫 Token Meter,MIT 协议,本地跑,不需要 API Key…
  • 大模型上线前评测,别拿标准榜单代替真实工况 - 很多模型在干净的标准基准上分数很漂亮,放到实际生产里依然处理不好核心边界。做上线前评测,重点不是跑几个通用公开榜,而是先想清楚产品决策和能承受哪种失误。在减少误报的场景里,降低假阳性和提升准确率通常…
  • 把 Obsidian 当成多个 Agent 的共享记忆库 - 同时用几个不同的 Agent 干活,最麻烦的一步往往是人在中间当传话筒。Claude 定好的方案,得手动复制给写代码的工具,来回倒腾几遍,前因后果就漏得差不多了。一个比较省事的解决思路,是拿本地免费…
  • 让大模型反复做简单判断,成本开始算不过来了 - 大语言模型这些年基本被 decoder-only 路线统一了。当年 BERT 这一派 encoder 擅长把输入压成表征,但因为每个具体任务往往都得单独微调,后来逐渐被靠规模、上下文学习和指令微调走…
  • Claude Code 开始支持 AGENTS.md,跨工具配置少了一层折腾 - Claude Code 开始兼容 AGENTS.md 这类规范文件了。不同 Coding Agent 如果各自有一套指令或上下文配置文件,想换着工具用同一个仓库,之前往往得靠软链接或者手动复制来对齐…
  • 进入 AI 论坛 - 浏览 AI 工具实践、Agent 教程与社区精选讨论