Ollama v0.32.10-rc0 优化 double-scale nvfp4 模型 prefill 速度
快讯摘要
Ollama 发布 v0.32.10-rc0 版本,针对 double-scale nvfp4 模型加速 prefill。通过将 float32 全局缩放中的乘法和类型转换合并为一个 kernel 执行,减少了额外的 kernel 启动和中间结果。在 M5 Max 上,qwen3.6:27b 的 prefill 从 703 t/s 提升至 769 t/s(+7.9%),muse-glimmer:30b 从 790 t/s 提升至 84...
核心事实
- 1Ollama 发布了 v0.32.10-rc0 版本
- 2该版本针对 double-scale nvfp4 模型加速 prefill
- 3优化方法是将 float32 全局缩放中的乘法与类型转换合并为单个 kernel
- 4在 M5 Max 上,qwen3.6:27b prefill 从 703 t/s 提升至 769 t/s,提升 7.9%
- 5muse-glimmer:30b prefill 从 790 t/s 提升至 843 t/s,提升 6.7%
- 6推测解码性能在两个模型上均保持在噪声范围内
为什么值得关注
Ollama 作为本地大模型推理工具,持续优化推理性能。此次针对特定量化模型 prefill 的加速,能让使用相关检查点的用户在本地获得更快的前处理速度,尤其对长上下文或批量推理场景有明显帮助。
详细内容
Ollama 发布了 v0.32.10-rc0 版本,该版本对 double-scale nvfp4 模型进行了 prefill 速度优化。具体而言,ModelOpt 生成的检查点会在每组量化缩放之外,对每个投影输出额外应用一个 float32 全局缩放。此前,乘法和类型转换作为两个独立的 eager 操作执行,每次都会引入额外的 kernel 启动和中间结果物化。新版本将这两个操作编译进同一个 kernel,从而减少开销。 性能测试在 M5 Max 上进行,采用 A/B 交替运行取中位数,贪心解码输出逐字节一致。结果显示,qwen3.6:27b 的 prefill 从 703 t/s 提升到 769 t/s,提升 7.9%;muse-glimmer:30b 从 790 t/s 提升到 843 t/s,提升 6.7%。推测解码(speculative decode)在两个模型上的变化均在噪声范围内。 该优化针对特定类型的检查点(带全局缩放),对于使用相关模型的用户可获得明显性能收益。更多版本细节可参考官方发布说明。