Ollama 2026年7月更新汇总 - v0.32.5 MLX修复+Windows ARM64 CUDA


📦 v0.32.5 - 2026年7月27日

📅 v0.32.5 | 2026年7月27日发布

🐛 修复

v0.32.5 是紧急修复版本,解决了一个影响输出质量的 MLX Metal 问题:

MLX Metal 输出质量修复:修复了 MLX Metal 错误,该错误可能降低 NVFP4 模型的输出质量,特别是 Laguna 模型。

🔗 完整更新日志


📦 v0.32.4 - 2026年7月25日

📅 v0.32.4 | 2026年7月25日发布

🍎 Apple GPU 支持

Laguna 模型支持:通过 MLX 引擎支持在 Apple GPU 上运行 Laguna 模型。

⚡ 性能优化

推测解码优化:创建推测解码草稿时,按请求的类型量化 draft-model 输出头。

Qwen3 MoE 修复与加速:修复不同量化专家的 Qwen3 MoE 解码问题,packed gate/up projection 提升约 4-9%(M5 Max)。

🔗 完整更新日志


📦 v0.32.3 - 2026年7月23日

📅 v0.32.3 | 2026年7月23日发布

v0.32.3 是稳定性和 GPU 支持为主的修复版本:

🐛 修复与改进

模型下载修复:解决了模型下载在传输数据前卡住的问题。

集成恢复:恢复 Claude Code Channels 支持,修复 Anthropic thinking streams,Hermes Desktop 正确尊重 --force-build 标志。

GLM 工具调用修复:修复 GLM 模型在生成末尾工具调用被静默丢弃的问题。

🎮 GPU 支持扩展

Windows ARM64 CUDA:首次支持 Windows ARM64 平台上的 CUDA 加速。

B200 支持:通过 CUDA 12 支持 NVIDIA B200 GPU。

Linux 集显优化:降低 Linux CUDA/ROCm 集成显卡的内存占用。

🆕 模型支持

Laguna 2.1:新增 Laguna 2.1 模型的聊天、思考和工具调用支持,包含 Metal 推理修复。

⚙️ 底层引擎

✅ 更新 MLX 和 llama.cpp 引擎版本。

🔗 完整更新日志

📦 v0.32.1 - 2026年7月17日

📅 v0.32.1 | 2026年7月16日发布

🔥 这次更新了什么?

v0.32.1 是个小版本,但有几项对日常使用影响不小的改进。Gemma 4 用户的体验会明显提升,MLX 用户也少了个烦人的内存泄露。

1. Gemma 4 工具调用和多轮推理优化

Gemma 4 的工具调用更稳了,多轮对话中的 tool-response 续接也更可靠。之前经常出现工具调用后模型断片的问题,这次修复后流畅很多。

2. MLX 模型缓存泄露修复

修复了 MLX 后端反复调用请求时会持续增加显存占用的 bug。同时优化了缓存快照性能,跑多轮对话时内存更可控了。

3. MLX 加载超时支持

MLX 文本模型加载现在会遵循 OLLAMA_LOAD_TIMEOUT 环境变量了。Apple Silicon 用户配大模型时可以精确控制加载超时,不用再死等。

4. Agent 联网搜索鉴权提示

Agent 做联网搜索和抓取时,如果需要鉴权会提示用户先执行 ollama signin。交互更友好了,不再莫名其妙报错。

5. 交互式 Agent 获取当前目录

交互式 Agent 现在能拿到当前工作目录路径,做项目上下文时更精准了。比如问这个目录下的文件时 Agent 知道你在哪。

6. VS Code 扩展文档更新

官方 VS Code 扩展的安装配置文档更新了,之前有用户反映配置步骤不清晰,现在重新整理了。

✅ 适合哪些人?

Gemma 4 用户:工具调用和多轮对话体验明显提升

Apple Silicon (MLX) 用户:修复内存泄露,必升

用 Agent 做联网搜索的:鉴权提示更友好

⚠️ 不用 Gemma 4 也不用 MLX 的:可以等大版本再升

🛠️ 快速上手

升级方式一如既往:

# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# 或直接下载
ollama --version  # 确认版本

❓ 常见问题

Q:升级后 Gemma 4 的 tool calling 还是不灵?

A:建议重新 pull 一下模型:ollama pull gemma4,确保搭配最新模型文件。

Q:MLX 内存泄露修复要手动做什么?

A:不需要,升级后自动生效。如果之前遇到过长期运行后内存暴涨的问题,升级后重启一下 Ollama 服务就行。


📦 v0.31.2 - 2026年7月6日

📅 v0.31.2 | 2026年7月6日

🔥 这次更新了什么?

v0.31.2 是小版本更新,主打硬件兼容和 bug 修复,没有重磅新功能,但对特定硬件用户和老模型用户很关键。

🛠️ 重点更新

1. 老 NVIDIA 显卡开启 Flash Attention

计算能力 6.x 的老 NVIDIA GPU(Pascal 架构,GTX 10xx 系列)现在能启用 Flash Attention 了。推理速度有肉眼可见的提升。

2. iGPU 视觉模型卸载

集成显卡现在可以把视觉模型的输入做 padding 适配,让它能放进可用显存。跑小尺寸视觉模型在集显上现在能跑起来了。

3. 思考模型结构化输出修复

修复了思考模型在禁用思考时的结构化输出问题。之前禁用 thinking 后 JSON 输出会出错,现在正常了。

4. GGUF 模型创建加固

自己用 Ollama 创建 GGUF 模型时,边界场景更稳了,少踩一些坑。

5. Claude Code 集成默认关掉遥测

ollama launch 启动 Claude Code 时,默认关闭 Claude Code 的遥测上传。隐私敏感的用户不用每次手动关。

6. 非 UTF-8 路径修复

模型路径包含非 UTF-8 字符(比如某些 Windows 中文用户名下的路径)现在能正常加载了。

7. MLX 和 llama.cpp 引擎升级

Apple Silicon 的 MLX 后端和 llama.cpp 都升级到新版本,推理性能和新模型支持都有提升。

✅ 适合哪些人?

✅ 用 GTX 10xx 系列老显卡跑 Ollama 的用户(性能提升最明显)

✅ 集成显卡跑视觉模型的人

✅ 用 Claude Code + Ollama 组合的开发者

✅ 路径里有非 ASCII 字符的环境(Windows 中文路径常见)

⚠️ 如果用得挺好,可以不急着升级,等下个大版本

🛠️ 快速上手

macOS / Linux:

curl -fsSL https://ollama.com/install.sh | sh
# 或者手动升级 brew 装的
brew upgrade ollama

Docker 用户:

docker pull ollama/ollama:0.31.2
docker compose restart

❓ 常见问题

Q:升级后已下载的模型会丢吗?

A:不会,模型存在独立目录,升级 Ollama 不影响模型文件。

Q:Windows 升级路径出错怎么办?

A:如果模型路径含中文还出错,先把 Ollama 的模型目录搬到纯英文路径,再升级。

📝 写在最后

v0.31.2 看着不起眼,但 Flash Attention 支持老显卡和 iGPU 视觉模型这两个改动,对特定硬件用户来说是实打实的提升。如果你的硬件是新版支持范围里,这次值得升;否则可以等 v0.32.0。

#Ollama #版本更新 #本地大模型

发表评论