Ollama 上下文默认只给 4000
硬核玩家 · 2026-09-20T11:11:08
有人把 KoboldCpp 和 Ollama 拉出来对比,重点不是谁快,是两者的默认配置差在哪。 先说结论,这两个工具底层都是 llama.cpp,性能差距基本全由默认设置决定,不是谁写的引擎更好。 测试里最典型的一幕是 70B 模型在 KoboldCpp 上提示词处理从 1490 tokens/s 掉到 34 tokens/s,慢了 44 倍。查下来是 Flash Attention 被误关、显存没卸载,打开之后两边速度就一样了。 真正值得记的是 Ollama 的一个隐形限制。显存不到 24GB 时,它默认只给 4000 Token 上下文,48GB 给到 32000,显存更高才给 256000。这个量级拿去跑 Agent 和长文搜索是不够的。 参数自由度也差得挺多。Ollama 文档里只暴露 8 个采样和运行时参数,KoboldCpp 有 56 个请求字段和 165 个启动参数,还能调采样器的执行顺序。 另外两个事实挺有意思。KoboldCpp 是 606MB 单文件免安装,Ollama 安装包 1000MB,但 Ollama 的下载量是它的近 30 倍。 开源贡献上也没有谁白嫖谁,两边往上游 llama.cpp 主库分别提交了 6 次和 7 次。 KoboldCpp 还在源码里反向兼容了 Ollama 的 generate 和 chat 接口,第三方工具不改代码就能接上。 想省事就继续用 Ollama,要跑长上下文或细调参数,可以再装一个 KoboldCpp。