Ollama 2026年8月更新汇总 - v0.32.15 生成速度翻倍+流式修复


⏰ 发布:2026-08-21

⭐ 版本:v0.32.15

🏷️ 费用:免费开源

🦙 Ollama v0.32.15 带来了一个相当实用的性能提升——模型元数据缓存让首次生成速度几乎翻倍,同时修复了流式解析错误导致的卡死问题,Qwen 3.8 的系统消息处理也更规范了。桌面端首次启动还有了个全新的引导流程。

📦 v0.32.15 - 2026年8月21日

📅 发布日期:2026年8月21日 | 🏷️ 来源:GitHub Releases

🔥 这次更新了什么?

1. 模型元数据缓存——TTFT 速度翻倍:之前每次请求都要重新解析模型元数据,现在做了缓存,首次生成时间(Time to First Token)从约 995ms 降到约 524ms,几乎减半。这对需要快速响应的场景提升明显。

2. 流式解析错误修复:之前在 chat 和 generate 过程中,如果流式解析出错,进程会卡住(wedge),现在修复了这个问题,稳定性更好。

3. Qwen 3.8 系统消息规范化:Qwen 3.8 模型对 system 消息的位置更敏感了,现在会统一规范化处理,非开头位置的 system 消息也能正常工作。

4. 桌面端首次启动引导:第一次打开 Ollama 桌面版时,会有一个全新的 onboarding 流程,对新手更友好。

5. 底层依赖更新:MLX 和 llama.cpp 引擎都做了版本更新,底层性能和兼容性有提升。

✅ 适合哪些人?

所有 Ollama 用户 — TTFT 减半是实打实的体验提升
高频调用场景 — 缓存机制在连续请求时效果更明显
使用 Qwen 3.8 的用户 — 系统消息处理更稳定
用桌面版的新用户 — 新引导流程上手更快

🛠️ 快速上手

# 升级 Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
# 期望: ollama version 0.32.15

# 测试 Qwen 3.8(系统消息在中间也能正常工作)
ollama run qwen3.8

❓ 常见问题

Q: TTFT 缓存对所有模型都有效吗?
A: 是的,元数据缓存是通用机制,所有模型都能受益。

Q: 流式解析错误修复会影响输出质量吗?
A: 不会。这只是一个稳定性修复,输出质量不受影响。

写在最后

v0.32.15 是一个"润物细无声"的版本——没有大功能,但 TTFT 缓存这个优化对日常使用体验提升很大。配合之前版本的 WebP 支持和 Qwen 容错,Ollama 的稳定性又上了一个台阶。

🔗 官方:GitHub Release

#Ollama #TTFT #性能优化 #Qwen3.8 #本地AI

⏰ 发布:2026-08-16

⭐ 版本:v0.32.14

🆓 费用:免费开源

🦙 Ollama v0.32.14 是一个小修复版本,主要解决了 WebP 图像支持和 Qwen 模型消息格式容错问题。虽然改动不大,但对多模态场景和 Qwen 用户来说是实打实的体验提升。

📦 v0.32.14 - 2026年8月16日

📅 发布日期:2026年8月16日 | 🏷️ 来源:GitHub Releases

🔥 这次更新了什么?

1. WebP 图像转码支持:llama-server 现在可以直接处理 WebP 格式的图像,不再需要手动转换格式。之前发 WebP 图片会报错,现在直接传就行。

2. Qwen 渲染器消息格式容错:Qwen 模型现在可以容忍 system 消息不在消息列表开头的情况。之前如果 system 消息被放在中间或后面,Qwen 会拒绝处理,现在能正常工作了。

✅ 适合哪些人?

✅ 多模态应用开发者 — WebP 图像现在可以直传,省去格式转换步骤
✅ 使用 Qwen 系列模型的用户 — 消息格式更灵活,不用担心 system 消息位置问题
✅ 所有 Ollama 用户 — 这两个修复提升了整体稳定性

🛠️ 快速上手

# 升级 Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
# 期望: ollama version 0.32.14

# 测试 WebP 图像支持
ollama run llava "描述这张图片" --file image.webp

# 测试 Qwen 模型(system 消息在中间也能正常工作)
ollama run qwen3.8

❓ 常见问题

Q: WebP 支持是所有模型都支持吗?
A: 需要模型本身支持多模态输入(如 LLaVA、Muse Glimmer 等),纯文本模型本身不处理图像。

Q: Qwen 的消息容错会影响输出质量吗?
A: 不会。这只是放宽了输入格式要求,让 system 消息在任意位置都能被正确处理。输出质量不受影响。

写在最后

这是 Ollama 持续迭代的又一个小版本。WebP 支持和 Qwen 容错虽然看起来不起眼,但解决了实际使用中的两个痛点。保持更新,体验更好。

🔗 官方:GitHub Release

#Ollama #WebP #Qwen #多模态 #本地AI


⏰ 发布:2026-08-15

⭐ 版本:v0.32.13

🆓 费用:免费开源

🦄 Ollama v0.32.13 主要更新了 Qwen 3.8 模型的开发者指令支持。这是一个小版本更新,主要针对 Qwen 3.8 模型的功能增强。

📦 v0.32.13 - 2026年8月15日

📅 发布日期:2026年8月15日 | 🏷️ 来源:GitHub Releases

🔥 这次更新了什么?

1. Qwen 3.8 开发者指令支持:Qwen 3.8 模型现在支持开发者指令功能,可以让开发者更精细地控制模型的行为和输出。

✅ 适合哪些人?

✅ 使用 Qwen 3.8 模型的开发者
✅ 需要精细控制模型行为的用户
✅ 对模型输出有特定要求的场景

🛠️ 快速上手

升级到最新版本:

# 升级 Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
# 期望: ollama version 0.32.13

# 拉取 Qwen 3.8 模型
ollama pull qwen3.8

❓ 常见问题

Q: 开发者指令是什么?
A: 开发者指令是一种让开发者通过特定提示词来控制模型行为的功能,可以指定模型的响应风格、格式等。

Q: 这次更新对其他模型有影响吗?
A: 主要是针对 Qwen 3.8 模型的功能增强,其他模型不受影响。

写在最后

这是一个小版本更新,主要针对 Qwen 3.8 模型的功能增强。如果你正在使用 Qwen 3.8 模型,这个更新会让你的开发体验更好。

#Ollama #Qwen3.8 #开发者指令 #本地部署 #AI工具


⏰ 发布:2026-08-14

⭐ 版本:v0.32.12

🆓 费用:免费开源

🦙 这次 Ollama 直接拉来了 Qwen 3.8 27B 模型支持。Mac 用户是最大受益者,Apple Silicon 这次专门优化了性能,对 coding agent 这种重复任务尤其有用。下面拆给你看。

📦 v0.32.12 - 2026年8月14日

📅 发布日期:2026年8月14日 | 🏷️ 来源:GitHub Releases

🔥 这次更新了什么?

1. Qwen 3.8 27B 模型支持:阿里千问 3.8 的 27B 参数版本正式加入 Ollama 模型库,可直接 ollama pull qwen3.8 一键拉取。

2. Apple Silicon 专项优化:针对 M 系列芯片做了底层优化,性能和输出质量都提到最大档,官方明确点名适合"重复任务和 coding agents"。

3. Qwen 3.8 整体能力提升:相比上一代在 coding、专业工作、研究、长周期 agentic 任务上都有显著进步。本地跑 27B 在 Mac 上终于不是鸡肋了。

✅ 适合哪些人?

✅ 用 Mac(M1/M2/M3/M4 系列)做开发的用户
✅ 想本地跑 27B 规模大模型的人
✅ 用 AI 写代码、做 coding agent 重度使用的人
✅ 对中文任务质量有要求的本地化部署用户
⚠️ Windows + NVIDIA 用户这次没什么特别优化,主要针对 Apple Silicon

🛠️ 快速上手

升级 + 拉取模型:

# 升级 Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
# 期望: ollama version 0.32.12

# 拉取 Qwen 3.8 27B(约 16GB)
ollama pull qwen3.8:27b

# 直接对话
ollama run qwen3.8:27b "用 Python 写一个 HTTP 服务器"

Mac 用户第一次跑可能会下载一会,27B 不小。下载完直接用,体验比之前的 Qwen 3 系列明显顺滑。

❓ 常见问题

Q:Qwen 3.8 跟 Qwen 3 区别大吗?
A:官方说法是 coding、专业工作、研究、长周期 agentic 任务都有显著提升。具体差异要看你跑的实际任务,建议先小批量对比。

Q:27B 在 Mac 上跑得动吗?
A:能跑。官方这次专门优化就是为了让 M 系列芯片带得动 27B。16GB 内存起步,32GB 更稳。

Q:Windows / Linux 用户有性能提升吗?
A:这次的 Apple Silicon 优化主要针对 macOS,但模型本身在所有平台都能跑,Windows/Linux 用户只是没享受到 Mac 专属的性能调优。

写在最后

本地大模型终于有了一个能跟在线版掰手腕的中文选项。Qwen 3.8 27B 的更新,加上 Mac 平台的专项优化,让"本地跑 coding agent"这件事从"勉强能用"升级到"日常可用"。

如果你之前因为本地模型效果不好而一直用云端,这次值得重新试一试。

#Ollama #Qwen3.8 #AppleSilicon #本地部署 #大模型


⏰ 发布:2026-08-14

⭐ 版本:v0.32.11

🆓 费用:免费开源

🦙 Ollama 这次更新把 AI 工具链打通了不少。两个新命令行整合 DeepSeek 和 Meta 的 agentic CLI,Responses API 也终于能联网搜索了。这意味着什么?本地跑大模型的同时,agent 干活有更多选择。下面挑干货说。

📦 v0.32.11 - 2026年8月14日

📅 发布日期:2026年8月14日 | 🏷️ 来源:GitHub Releases

🔥 这次更新了什么?

1. ollama launch dsh 支持 DeepSeek Harness:之前只能本地跑模型,现在能直接调用 DeepSeek 官方开源的 agent harness,agent 工作流终于不用自己拼了。

2. ollama launch muse 支持 Muse Code:Meta 出的 agentic 编码 CLI,对写代码的人来说多了一个本地化的选择,不用切到云端 IDE。

3. Responses API 支持 web search:OpenAI 兼容 API 加了联网搜索能力,本地 Ollama 现在也能给 agent 喂最新信息,不会再是"知识截止 2024"的尴尬。

4. Muse Glimmer 模板更新:Muse 模型有新的提示词模板,调教质量能上一个台阶。

✅ 适合哪些人?

✅ 想用本地模型 + agent 框架的人
✅ 不愿意把代码和数据丢到云端的开发者
✅ 用 OpenAI 兼容 API 但苦于知识截止的人
⚠️ 如果你只用 Ollama 跑对话聊天,这次更新对你影响不大

🛠️ 快速上手

升级到最新版:

# macOS / Linux 一键升级
curl -fsSL https://ollama.com/install.sh | sh

# 验证版本
ollama --version
# 期望输出: ollama version 0.32.11

# 试试新的 launch dsh
ollama launch dsh --help

如果你用 Responses API 想要联网搜索,按 OpenAI 接口规范传 web_search_options 即可,Ollama 会自动调用。

❓ 常见问题

Q:Responses API 的联网搜索走哪个搜索引擎?
A:Ollama 默认用内置的搜索后端,本地化处理,不会把你的请求打到第三方。具体行为建议看官方文档。

Q:DeepSeek Harness 是什么?
A:DeepSeek 团队开源的 agent 执行框架,让模型能自主调用工具、规划步骤。跟 Cursor、Claude Code 一个赛道,但完全开源。

Q:Muse Code 跟 Cursor 比有什么区别?
A:Meta 出的,开源 + 本地化是它的卖点,但生态还在早期。Cursor 现成生态更丰富,看你愿意选哪个。

写在最后

这版本更新里,Responses API 支持联网搜索是最大的亮点。本地模型一直被人诟病的"知识截止"问题,Ollama 用兼容 API 的方式曲线解决了。做 agent 的同学值得一试。

#Ollama #大模型 #本地部署 #agent #AI工具


⏰ 发布:2026-08-11

⭐ 版本:v0.32.9

🆓 费用:免费开源

NVIDIA 出了个 30B 的 MoE 模型,但只有 3B 参数激活,专门为"常驻 Agent"设计。同时修复了 Muse Glimmer 的函数调用解析问题。一天一个版本,Ollama 更新是真勤快🔥

🔥 这次更新了什么?

1. NVIDIA Nemotron 3.5 Lightning

NVIDIA 发布的 30B 混合专家(MoE)模型,但推理时只激活 3B 参数,速度快到飞起。专门为"常驻 Agent"场景设计,比如 OpenClaw、Hermes 这种 7×24 跑着的助手。配合 NVIDIA NemoClaw 安全管理框架使用,企业级 Agent 方案直接就位了。

2. Muse Glimmer 函数调用修复

修复了 Muse Glimmer 函数调用解析器的边界条件问题,工具调用更稳定了。


✅ 适合哪些人?

✅ 想跑轻量级常驻 Agent 的 — 3B 激活参数,资源占用极低

✅ 企业用户 — NemoClaw 框架加持,安全管理到位

✅ 用 Muse Glimmer 做工具调用的 — 函数调用更稳定了


🛠️ 快速上手

# 下载运行 Nemotron 3.5 Lightning
ollama run nemotron-3.5-lightning

❓ 常见问题

Q: 30B 模型只激活 3B,效果能行吗?

A: MoE 架构就是靠这个思路,参数多但每次只用一部分,在保证质量的同时大幅提升速度。Nemotron 系列一直是 NVIDIA 的招牌,3.5 Lightning 是专门为 Agent 场景优化的。

Q: 需要什么硬件?

A: 3B 激活参数意味着大部分显卡都能跑,8GB 显存就够。比昨天的 Muse Glimmer 30B 友好太多了。


⏰ 发布:2026-08-11

⭐ 版本:v0.32.8

🆓 费用:免费开源

昨天刚发的 Muse Glimmer 只能在 Apple Silicon 上跑,今天 NVIDIA 和 AMD 用户也能用了。Meta 这个 30B Agent 模型正式全平台覆盖🚀

🔥 这次更新了什么?

1. Muse Glimmer 全平台支持

v0.32.7 只给 Apple Silicon 的 MLX 引擎做了适配,这次 v0.32.8 把 NVIDIA、AMD 等平台全补上了。不管你是 Mac 还是 Linux + 显卡,都能跑 Muse Glimmer 30B。

2. 用法不变

命令和昨天一样:

# 下载运行
ollama run muse-glimmer:30b

# 用编码 Agent 跑
ollama launch claude --model muse-glimmer:30b

# 用 OpenClaw 跑
ollama launch openclaw --model muse-glimmer:30b

✅ 适合哪些人?

✅ NVIDIA / AMD 用户想跑 Muse Glimmer 的 — 终于支持了

✅ Linux 服务器用户 — 之前只能 Mac 跑,现在服务器也能用

✅ 已经在 v0.32.7 用 Muse Glimmer 的 — 建议更新,兼容性更好


❓ 常见问题

Q: NVIDIA 显卡需要多大显存?

A: 30B 模型建议至少 24GB 显存(如 RTX 4090、A5000 等)。16GB 可以用量化版本。

Q: 和 v0.32.7 比有什么区别?

A: 纯粹是平台扩展,功能没有变化。如果你是 Mac 用户且 v0.32.7 用得好好的,不更新也没问题。


⏰ 发布:2026-08-10

⭐ 版本:v0.32.7

🆓 费用:免费开源

Meta 超级智能实验室的第一个开源模型来了,名字叫 Muse Glimmer。30B 参数,多模态,专门为本地跑 Agent 设计。Ollama 第一时间适配了 MLX 引擎。Mac 用户直接起飞🚀

🔥 这次更新了什么?

1. Muse Glimmer 30B 支持

Meta 超级智能实验室(Meta Superintelligence Labs)发布的第一个开源模型。30B 参数,多模态,专为本地 Agent 场景打造。支持编码 Agent(Claude Code、Codex、Pi)和个人助手框架(OpenClaw、Hermes)。

2. MLX 引擎 + DFlash 加速

Apple Silicon 上的 MLX 引擎提供顶级性能,支持 DFlash 和图像输入。Muse Glimmer 在 M 系列芯片上跑起来很流畅。

3. ollama launch 命令

新增 ollama launch 命令,可以直接用指定模型启动 Claude Code、Pi、OpenClaw 等框架,一行搞定:

ollama launch claude --model muse-glimmer:30b-mlx
ollama launch pi --model muse-glimmer:30b-mlx
ollama launch openclaw --model muse-glimmer:30b-mlx

✅ 适合哪些人?

✅ Mac 用户想跑本地大模型的 — 30B 参数在 M 芯片上表现很好

✅ 用 Claude Code / Pi 等编码 Agent 的 — 可以用本地模型替代云端

✅ OpenClaw / Hermes 用户 — 本地 Agent 方案多了一个强力选项

⚠️ 目前仅支持 Apple Silicon MLX 引擎,NVIDIA/AMD 支持后续跟进


🛠️ 快速上手

# 下载并运行 Muse Glimmer
ollama run muse-glimmer:30b-mlx

# 用 Claude Code 跑
ollama launch claude --model muse-glimmer:30b-mlx

# 用 OpenClaw 跑
ollama launch openclaw --model muse-glimmer:30b-mlx

❓ 常见问题

Q: 需要多大内存?

A: 30B 参数模型建议至少 32GB 统一内存(M 系列芯片)。16GB 可能会比较吃紧。

Q: NVIDIA 显卡能用吗?

A: 目前仅支持 Apple Silicon 的 MLX 引擎。NVIDIA、AMD 等平台的支持会在后续版本中加入。

Q: 和 v0.32.6 比,除了 Muse Glimmer 还有其他变化吗?

A: 这个版本主要是为了适配 Muse Glimmer,没有其他功能性更新。


🔗 相关链接

📦 GitHub: v0.32.7 Release

🌐 官网: ollama.com


⏰ 发布:2026-08-05

⭐ 版本:v0.32.6

🆓 费用:免费开源

Ollama 又更新了,这次 v0.32.6 带来了不少实用改进。Apple GPU 上跑 Qwen3.5 更快了,OpenAI 兼容接口也更规范了。来看看具体更新了啥👇

🔥 这次更新了什么?

1. Qwen3.5 Apple GPU 加速

MLX 引擎现在自动利用模型的 MTP head 做投机解码,在 Apple GPU 上跑 Qwen3.5 速度明显提升。用 Mac 的朋友有福了。

2. OpenAI 兼容接口更规范

/v1/chat/completions 的 streaming 现在严格匹配 OpenAI 的 wire format:role 只在第一个 chunk 出现,finish_reason 独立一个 chunk,usage 单独一个 chunk。之前有些客户端兼容性问题,这次应该解决了。

3. 截断响应修正

当 OpenAI 响应被截断时,finish_reason 现在正确返回 "length" 而不是 "tool_calls"。之前这个 bug 会导致一些工具调用场景误判。

4. Kimi K3 云模型支持

运行 ollama run kimi-k3 时,如果没有本地模型,现在会自动提供 kimi-k3:cloud 云端选项,而不是直接报错。

5. TUI 体验修复

终端界面也修了几个烦人的问题:管道分隔的文本不再被误渲染成表格,Enter 键正确接受 @ 文件补全,/prompt 滚动不再卡顿。

6. 图像生成暂时移除

⚠️ 实验性图像生成功能被临时移除了。如果需要这个功能,建议继续使用 v0.32.5。

7. 引擎更新

MLX 和 llama.cpp 引擎都更新了,底层性能和兼容性有提升。


✅ 适合哪些人?

✅ Mac 用户跑本地模型的 — Qwen3.5 加速很香

✅ 用 OpenAI 兼容接口的开发者 — streaming 行为更标准

✅ 工具调用场景 — 截断判断修复了

⚠️ 依赖图像生成的 — 暂时别升级,等下个版本


🛠️ 快速上手

升级很简单:

ollama --version  # 确认当前版本
# macOS
brew upgrade ollama
# Linux
curl -fsSL https://ollama.com/install.sh | sh

跑 Qwen3.5 测试加速效果:

ollama pull qwen3.5
ollama run qwen3.5

❓ 常见问题

Q: 升级后图像生成还能用吗?

A: 不能,v0.32.6 临时移除了。需要的话回退到 v0.32.5。

Q: Qwen3.5 加速对所有 Mac 都有效吗?

A: 需要 Apple Silicon(M1/M2/M3/M4),Intel Mac 没有 MLX 加速。

Q: streaming 接口变化会影响现有代码吗?

A: 如果你的代码之前依赖了非标准的 streaming 行为(比如每个 chunk 都有 role),可能需要调整。标准 OpenAI 客户端应该不受影响。


写在最后

v0.32.6 是一个稳扎稳打的更新,Apple GPU 加速和 OpenAI 兼容性改进都是实打实的提升。唯一遗憾是图像生成被移除了,希望下个版本能加回来。

🔗 官方:GitHub Release

#Ollama #本地AI #开源工具 #LLM #AppleGPU

发表评论