📦 v0.32.5 - 2026年7月27日
📅 v0.32.5 | 2026年7月27日发布
🐛 修复
v0.32.5 是紧急修复版本,解决了一个影响输出质量的 MLX Metal 问题:
✅ MLX Metal 输出质量修复:修复了 MLX Metal 错误,该错误可能降低 NVFP4 模型的输出质量,特别是 Laguna 模型。
🔗 完整更新日志
📦 v0.32.4 - 2026年7月25日
📅 v0.32.4 | 2026年7月25日发布
🍎 Apple GPU 支持
✅ Laguna 模型支持:通过 MLX 引擎支持在 Apple GPU 上运行 Laguna 模型。
⚡ 性能优化
✅ 推测解码优化:创建推测解码草稿时,按请求的类型量化 draft-model 输出头。
✅ Qwen3 MoE 修复与加速:修复不同量化专家的 Qwen3 MoE 解码问题,packed gate/up projection 提升约 4-9%(M5 Max)。
🔗 完整更新日志
📦 v0.32.3 - 2026年7月23日
📅 v0.32.3 | 2026年7月23日发布
v0.32.3 是稳定性和 GPU 支持为主的修复版本:
🐛 修复与改进
✅ 模型下载修复:解决了模型下载在传输数据前卡住的问题。
✅ 集成恢复:恢复 Claude Code Channels 支持,修复 Anthropic thinking streams,Hermes Desktop 正确尊重 --force-build 标志。
✅ GLM 工具调用修复:修复 GLM 模型在生成末尾工具调用被静默丢弃的问题。
🎮 GPU 支持扩展
✅ Windows ARM64 CUDA:首次支持 Windows ARM64 平台上的 CUDA 加速。
✅ B200 支持:通过 CUDA 12 支持 NVIDIA B200 GPU。
✅ Linux 集显优化:降低 Linux CUDA/ROCm 集成显卡的内存占用。
🆕 模型支持
✅ Laguna 2.1:新增 Laguna 2.1 模型的聊天、思考和工具调用支持,包含 Metal 推理修复。
⚙️ 底层引擎
✅ 更新 MLX 和 llama.cpp 引擎版本。
🔗 完整更新日志
📦 v0.32.1 - 2026年7月17日
📅 v0.32.1 | 2026年7月16日发布
🔥 这次更新了什么?
v0.32.1 是个小版本,但有几项对日常使用影响不小的改进。Gemma 4 用户的体验会明显提升,MLX 用户也少了个烦人的内存泄露。
1. Gemma 4 工具调用和多轮推理优化
Gemma 4 的工具调用更稳了,多轮对话中的 tool-response 续接也更可靠。之前经常出现工具调用后模型断片的问题,这次修复后流畅很多。
2. MLX 模型缓存泄露修复
修复了 MLX 后端反复调用请求时会持续增加显存占用的 bug。同时优化了缓存快照性能,跑多轮对话时内存更可控了。
3. MLX 加载超时支持
MLX 文本模型加载现在会遵循 OLLAMA_LOAD_TIMEOUT 环境变量了。Apple Silicon 用户配大模型时可以精确控制加载超时,不用再死等。
4. Agent 联网搜索鉴权提示
Agent 做联网搜索和抓取时,如果需要鉴权会提示用户先执行 ollama signin。交互更友好了,不再莫名其妙报错。
5. 交互式 Agent 获取当前目录
交互式 Agent 现在能拿到当前工作目录路径,做项目上下文时更精准了。比如问这个目录下的文件时 Agent 知道你在哪。
6. VS Code 扩展文档更新
官方 VS Code 扩展的安装配置文档更新了,之前有用户反映配置步骤不清晰,现在重新整理了。
✅ 适合哪些人?
✅ Gemma 4 用户:工具调用和多轮对话体验明显提升
✅ Apple Silicon (MLX) 用户:修复内存泄露,必升
✅ 用 Agent 做联网搜索的:鉴权提示更友好
⚠️ 不用 Gemma 4 也不用 MLX 的:可以等大版本再升
🛠️ 快速上手
升级方式一如既往:
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh
# 或直接下载
ollama --version # 确认版本
❓ 常见问题
Q:升级后 Gemma 4 的 tool calling 还是不灵?
A:建议重新 pull 一下模型:ollama pull gemma4,确保搭配最新模型文件。
Q:MLX 内存泄露修复要手动做什么?
A:不需要,升级后自动生效。如果之前遇到过长期运行后内存暴涨的问题,升级后重启一下 Ollama 服务就行。
📦 v0.31.2 - 2026年7月6日
📅 v0.31.2 | 2026年7月6日
🔥 这次更新了什么?
v0.31.2 是小版本更新,主打硬件兼容和 bug 修复,没有重磅新功能,但对特定硬件用户和老模型用户很关键。
🛠️ 重点更新
1. 老 NVIDIA 显卡开启 Flash Attention
计算能力 6.x 的老 NVIDIA GPU(Pascal 架构,GTX 10xx 系列)现在能启用 Flash Attention 了。推理速度有肉眼可见的提升。
2. iGPU 视觉模型卸载
集成显卡现在可以把视觉模型的输入做 padding 适配,让它能放进可用显存。跑小尺寸视觉模型在集显上现在能跑起来了。
3. 思考模型结构化输出修复
修复了思考模型在禁用思考时的结构化输出问题。之前禁用 thinking 后 JSON 输出会出错,现在正常了。
4. GGUF 模型创建加固
自己用 Ollama 创建 GGUF 模型时,边界场景更稳了,少踩一些坑。
5. Claude Code 集成默认关掉遥测
ollama launch 启动 Claude Code 时,默认关闭 Claude Code 的遥测上传。隐私敏感的用户不用每次手动关。
6. 非 UTF-8 路径修复
模型路径包含非 UTF-8 字符(比如某些 Windows 中文用户名下的路径)现在能正常加载了。
7. MLX 和 llama.cpp 引擎升级
Apple Silicon 的 MLX 后端和 llama.cpp 都升级到新版本,推理性能和新模型支持都有提升。
✅ 适合哪些人?
✅ 用 GTX 10xx 系列老显卡跑 Ollama 的用户(性能提升最明显)
✅ 集成显卡跑视觉模型的人
✅ 用 Claude Code + Ollama 组合的开发者
✅ 路径里有非 ASCII 字符的环境(Windows 中文路径常见)
⚠️ 如果用得挺好,可以不急着升级,等下个大版本
🛠️ 快速上手
macOS / Linux:
curl -fsSL https://ollama.com/install.sh | sh
# 或者手动升级 brew 装的
brew upgrade ollama
Docker 用户:
docker pull ollama/ollama:0.31.2
docker compose restart
❓ 常见问题
Q:升级后已下载的模型会丢吗?
A:不会,模型存在独立目录,升级 Ollama 不影响模型文件。
Q:Windows 升级路径出错怎么办?
A:如果模型路径含中文还出错,先把 Ollama 的模型目录搬到纯英文路径,再升级。
📝 写在最后
v0.31.2 看着不起眼,但 Flash Attention 支持老显卡和 iGPU 视觉模型这两个改动,对特定硬件用户来说是实打实的提升。如果你的硬件是新版支持范围里,这次值得升;否则可以等 v0.32.0。
#Ollama #版本更新 #本地大模型