⏰ 发布:2026-08-21
⭐ 版本:v0.32.15
🏷️ 费用:免费开源
🦙 Ollama v0.32.15 带来了一个相当实用的性能提升——模型元数据缓存让首次生成速度几乎翻倍,同时修复了流式解析错误导致的卡死问题,Qwen 3.8 的系统消息处理也更规范了。桌面端首次启动还有了个全新的引导流程。
📦 v0.32.15 - 2026年8月21日
📅 发布日期:2026年8月21日 | 🏷️ 来源:GitHub Releases
🔥 这次更新了什么?
1. 模型元数据缓存——TTFT 速度翻倍:之前每次请求都要重新解析模型元数据,现在做了缓存,首次生成时间(Time to First Token)从约 995ms 降到约 524ms,几乎减半。这对需要快速响应的场景提升明显。
2. 流式解析错误修复:之前在 chat 和 generate 过程中,如果流式解析出错,进程会卡住(wedge),现在修复了这个问题,稳定性更好。
3. Qwen 3.8 系统消息规范化:Qwen 3.8 模型对 system 消息的位置更敏感了,现在会统一规范化处理,非开头位置的 system 消息也能正常工作。
4. 桌面端首次启动引导:第一次打开 Ollama 桌面版时,会有一个全新的 onboarding 流程,对新手更友好。
5. 底层依赖更新:MLX 和 llama.cpp 引擎都做了版本更新,底层性能和兼容性有提升。
✅ 适合哪些人?
✅ 所有 Ollama 用户 — TTFT 减半是实打实的体验提升
✅ 高频调用场景 — 缓存机制在连续请求时效果更明显
✅ 使用 Qwen 3.8 的用户 — 系统消息处理更稳定
✅ 用桌面版的新用户 — 新引导流程上手更快
🛠️ 快速上手
# 升级 Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
# 期望: ollama version 0.32.15
# 测试 Qwen 3.8(系统消息在中间也能正常工作)
ollama run qwen3.8
❓ 常见问题
Q: TTFT 缓存对所有模型都有效吗?
A: 是的,元数据缓存是通用机制,所有模型都能受益。
Q: 流式解析错误修复会影响输出质量吗?
A: 不会。这只是一个稳定性修复,输出质量不受影响。
写在最后
v0.32.15 是一个"润物细无声"的版本——没有大功能,但 TTFT 缓存这个优化对日常使用体验提升很大。配合之前版本的 WebP 支持和 Qwen 容错,Ollama 的稳定性又上了一个台阶。
🔗 官方:GitHub Release
#Ollama #TTFT #性能优化 #Qwen3.8 #本地AI
⏰ 发布:2026-08-16
⭐ 版本:v0.32.14
🆓 费用:免费开源
🦙 Ollama v0.32.14 是一个小修复版本,主要解决了 WebP 图像支持和 Qwen 模型消息格式容错问题。虽然改动不大,但对多模态场景和 Qwen 用户来说是实打实的体验提升。
📦 v0.32.14 - 2026年8月16日
📅 发布日期:2026年8月16日 | 🏷️ 来源:GitHub Releases
🔥 这次更新了什么?
1. WebP 图像转码支持:llama-server 现在可以直接处理 WebP 格式的图像,不再需要手动转换格式。之前发 WebP 图片会报错,现在直接传就行。
2. Qwen 渲染器消息格式容错:Qwen 模型现在可以容忍 system 消息不在消息列表开头的情况。之前如果 system 消息被放在中间或后面,Qwen 会拒绝处理,现在能正常工作了。
✅ 适合哪些人?
✅ 多模态应用开发者 — WebP 图像现在可以直传,省去格式转换步骤
✅ 使用 Qwen 系列模型的用户 — 消息格式更灵活,不用担心 system 消息位置问题
✅ 所有 Ollama 用户 — 这两个修复提升了整体稳定性
🛠️ 快速上手
# 升级 Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
# 期望: ollama version 0.32.14
# 测试 WebP 图像支持
ollama run llava "描述这张图片" --file image.webp
# 测试 Qwen 模型(system 消息在中间也能正常工作)
ollama run qwen3.8
❓ 常见问题
Q: WebP 支持是所有模型都支持吗?
A: 需要模型本身支持多模态输入(如 LLaVA、Muse Glimmer 等),纯文本模型本身不处理图像。
Q: Qwen 的消息容错会影响输出质量吗?
A: 不会。这只是放宽了输入格式要求,让 system 消息在任意位置都能被正确处理。输出质量不受影响。
写在最后
这是 Ollama 持续迭代的又一个小版本。WebP 支持和 Qwen 容错虽然看起来不起眼,但解决了实际使用中的两个痛点。保持更新,体验更好。
🔗 官方:GitHub Release
#Ollama #WebP #Qwen #多模态 #本地AI
⏰ 发布:2026-08-15
⭐ 版本:v0.32.13
🆓 费用:免费开源
🦄 Ollama v0.32.13 主要更新了 Qwen 3.8 模型的开发者指令支持。这是一个小版本更新,主要针对 Qwen 3.8 模型的功能增强。
📦 v0.32.13 - 2026年8月15日
📅 发布日期:2026年8月15日 | 🏷️ 来源:GitHub Releases
🔥 这次更新了什么?
1. Qwen 3.8 开发者指令支持:Qwen 3.8 模型现在支持开发者指令功能,可以让开发者更精细地控制模型的行为和输出。
✅ 适合哪些人?
✅ 使用 Qwen 3.8 模型的开发者
✅ 需要精细控制模型行为的用户
✅ 对模型输出有特定要求的场景
🛠️ 快速上手
升级到最新版本:
# 升级 Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
# 期望: ollama version 0.32.13
# 拉取 Qwen 3.8 模型
ollama pull qwen3.8
❓ 常见问题
Q: 开发者指令是什么?
A: 开发者指令是一种让开发者通过特定提示词来控制模型行为的功能,可以指定模型的响应风格、格式等。
Q: 这次更新对其他模型有影响吗?
A: 主要是针对 Qwen 3.8 模型的功能增强,其他模型不受影响。
写在最后
这是一个小版本更新,主要针对 Qwen 3.8 模型的功能增强。如果你正在使用 Qwen 3.8 模型,这个更新会让你的开发体验更好。
#Ollama #Qwen3.8 #开发者指令 #本地部署 #AI工具
⏰ 发布:2026-08-14
⭐ 版本:v0.32.12
🆓 费用:免费开源
🦙 这次 Ollama 直接拉来了 Qwen 3.8 27B 模型支持。Mac 用户是最大受益者,Apple Silicon 这次专门优化了性能,对 coding agent 这种重复任务尤其有用。下面拆给你看。
📦 v0.32.12 - 2026年8月14日
📅 发布日期:2026年8月14日 | 🏷️ 来源:GitHub Releases
🔥 这次更新了什么?
1. Qwen 3.8 27B 模型支持:阿里千问 3.8 的 27B 参数版本正式加入 Ollama 模型库,可直接 ollama pull qwen3.8 一键拉取。
2. Apple Silicon 专项优化:针对 M 系列芯片做了底层优化,性能和输出质量都提到最大档,官方明确点名适合"重复任务和 coding agents"。
3. Qwen 3.8 整体能力提升:相比上一代在 coding、专业工作、研究、长周期 agentic 任务上都有显著进步。本地跑 27B 在 Mac 上终于不是鸡肋了。
✅ 适合哪些人?
✅ 用 Mac(M1/M2/M3/M4 系列)做开发的用户
✅ 想本地跑 27B 规模大模型的人
✅ 用 AI 写代码、做 coding agent 重度使用的人
✅ 对中文任务质量有要求的本地化部署用户
⚠️ Windows + NVIDIA 用户这次没什么特别优化,主要针对 Apple Silicon
🛠️ 快速上手
升级 + 拉取模型:
# 升级 Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
# 期望: ollama version 0.32.12
# 拉取 Qwen 3.8 27B(约 16GB)
ollama pull qwen3.8:27b
# 直接对话
ollama run qwen3.8:27b "用 Python 写一个 HTTP 服务器"
Mac 用户第一次跑可能会下载一会,27B 不小。下载完直接用,体验比之前的 Qwen 3 系列明显顺滑。
❓ 常见问题
Q:Qwen 3.8 跟 Qwen 3 区别大吗?
A:官方说法是 coding、专业工作、研究、长周期 agentic 任务都有显著提升。具体差异要看你跑的实际任务,建议先小批量对比。
Q:27B 在 Mac 上跑得动吗?
A:能跑。官方这次专门优化就是为了让 M 系列芯片带得动 27B。16GB 内存起步,32GB 更稳。
Q:Windows / Linux 用户有性能提升吗?
A:这次的 Apple Silicon 优化主要针对 macOS,但模型本身在所有平台都能跑,Windows/Linux 用户只是没享受到 Mac 专属的性能调优。
写在最后
本地大模型终于有了一个能跟在线版掰手腕的中文选项。Qwen 3.8 27B 的更新,加上 Mac 平台的专项优化,让"本地跑 coding agent"这件事从"勉强能用"升级到"日常可用"。
如果你之前因为本地模型效果不好而一直用云端,这次值得重新试一试。
#Ollama #Qwen3.8 #AppleSilicon #本地部署 #大模型
⏰ 发布:2026-08-14
⭐ 版本:v0.32.11
🆓 费用:免费开源
🦙 Ollama 这次更新把 AI 工具链打通了不少。两个新命令行整合 DeepSeek 和 Meta 的 agentic CLI,Responses API 也终于能联网搜索了。这意味着什么?本地跑大模型的同时,agent 干活有更多选择。下面挑干货说。
📦 v0.32.11 - 2026年8月14日
📅 发布日期:2026年8月14日 | 🏷️ 来源:GitHub Releases
🔥 这次更新了什么?
1. ollama launch dsh 支持 DeepSeek Harness:之前只能本地跑模型,现在能直接调用 DeepSeek 官方开源的 agent harness,agent 工作流终于不用自己拼了。
2. ollama launch muse 支持 Muse Code:Meta 出的 agentic 编码 CLI,对写代码的人来说多了一个本地化的选择,不用切到云端 IDE。
3. Responses API 支持 web search:OpenAI 兼容 API 加了联网搜索能力,本地 Ollama 现在也能给 agent 喂最新信息,不会再是"知识截止 2024"的尴尬。
4. Muse Glimmer 模板更新:Muse 模型有新的提示词模板,调教质量能上一个台阶。
✅ 适合哪些人?
✅ 想用本地模型 + agent 框架的人
✅ 不愿意把代码和数据丢到云端的开发者
✅ 用 OpenAI 兼容 API 但苦于知识截止的人
⚠️ 如果你只用 Ollama 跑对话聊天,这次更新对你影响不大
🛠️ 快速上手
升级到最新版:
# macOS / Linux 一键升级
curl -fsSL https://ollama.com/install.sh | sh
# 验证版本
ollama --version
# 期望输出: ollama version 0.32.11
# 试试新的 launch dsh
ollama launch dsh --help
如果你用 Responses API 想要联网搜索,按 OpenAI 接口规范传 web_search_options 即可,Ollama 会自动调用。
❓ 常见问题
Q:Responses API 的联网搜索走哪个搜索引擎?
A:Ollama 默认用内置的搜索后端,本地化处理,不会把你的请求打到第三方。具体行为建议看官方文档。
Q:DeepSeek Harness 是什么?
A:DeepSeek 团队开源的 agent 执行框架,让模型能自主调用工具、规划步骤。跟 Cursor、Claude Code 一个赛道,但完全开源。
Q:Muse Code 跟 Cursor 比有什么区别?
A:Meta 出的,开源 + 本地化是它的卖点,但生态还在早期。Cursor 现成生态更丰富,看你愿意选哪个。
写在最后
这版本更新里,Responses API 支持联网搜索是最大的亮点。本地模型一直被人诟病的"知识截止"问题,Ollama 用兼容 API 的方式曲线解决了。做 agent 的同学值得一试。
#Ollama #大模型 #本地部署 #agent #AI工具
⏰ 发布:2026-08-11
⭐ 版本:v0.32.9
🆓 费用:免费开源
NVIDIA 出了个 30B 的 MoE 模型,但只有 3B 参数激活,专门为"常驻 Agent"设计。同时修复了 Muse Glimmer 的函数调用解析问题。一天一个版本,Ollama 更新是真勤快🔥
🔥 这次更新了什么?
1. NVIDIA Nemotron 3.5 Lightning
NVIDIA 发布的 30B 混合专家(MoE)模型,但推理时只激活 3B 参数,速度快到飞起。专门为"常驻 Agent"场景设计,比如 OpenClaw、Hermes 这种 7×24 跑着的助手。配合 NVIDIA NemoClaw 安全管理框架使用,企业级 Agent 方案直接就位了。
2. Muse Glimmer 函数调用修复
修复了 Muse Glimmer 函数调用解析器的边界条件问题,工具调用更稳定了。
✅ 适合哪些人?
✅ 想跑轻量级常驻 Agent 的 — 3B 激活参数,资源占用极低
✅ 企业用户 — NemoClaw 框架加持,安全管理到位
✅ 用 Muse Glimmer 做工具调用的 — 函数调用更稳定了
🛠️ 快速上手
# 下载运行 Nemotron 3.5 Lightning
ollama run nemotron-3.5-lightning
❓ 常见问题
Q: 30B 模型只激活 3B,效果能行吗?
A: MoE 架构就是靠这个思路,参数多但每次只用一部分,在保证质量的同时大幅提升速度。Nemotron 系列一直是 NVIDIA 的招牌,3.5 Lightning 是专门为 Agent 场景优化的。
Q: 需要什么硬件?
A: 3B 激活参数意味着大部分显卡都能跑,8GB 显存就够。比昨天的 Muse Glimmer 30B 友好太多了。
⏰ 发布:2026-08-11
⭐ 版本:v0.32.8
🆓 费用:免费开源
昨天刚发的 Muse Glimmer 只能在 Apple Silicon 上跑,今天 NVIDIA 和 AMD 用户也能用了。Meta 这个 30B Agent 模型正式全平台覆盖🚀
🔥 这次更新了什么?
1. Muse Glimmer 全平台支持
v0.32.7 只给 Apple Silicon 的 MLX 引擎做了适配,这次 v0.32.8 把 NVIDIA、AMD 等平台全补上了。不管你是 Mac 还是 Linux + 显卡,都能跑 Muse Glimmer 30B。
2. 用法不变
命令和昨天一样:
# 下载运行
ollama run muse-glimmer:30b
# 用编码 Agent 跑
ollama launch claude --model muse-glimmer:30b
# 用 OpenClaw 跑
ollama launch openclaw --model muse-glimmer:30b
✅ 适合哪些人?
✅ NVIDIA / AMD 用户想跑 Muse Glimmer 的 — 终于支持了
✅ Linux 服务器用户 — 之前只能 Mac 跑,现在服务器也能用
✅ 已经在 v0.32.7 用 Muse Glimmer 的 — 建议更新,兼容性更好
❓ 常见问题
Q: NVIDIA 显卡需要多大显存?
A: 30B 模型建议至少 24GB 显存(如 RTX 4090、A5000 等)。16GB 可以用量化版本。
Q: 和 v0.32.7 比有什么区别?
A: 纯粹是平台扩展,功能没有变化。如果你是 Mac 用户且 v0.32.7 用得好好的,不更新也没问题。
⏰ 发布:2026-08-10
⭐ 版本:v0.32.7
🆓 费用:免费开源
Meta 超级智能实验室的第一个开源模型来了,名字叫 Muse Glimmer。30B 参数,多模态,专门为本地跑 Agent 设计。Ollama 第一时间适配了 MLX 引擎。Mac 用户直接起飞🚀
🔥 这次更新了什么?
1. Muse Glimmer 30B 支持
Meta 超级智能实验室(Meta Superintelligence Labs)发布的第一个开源模型。30B 参数,多模态,专为本地 Agent 场景打造。支持编码 Agent(Claude Code、Codex、Pi)和个人助手框架(OpenClaw、Hermes)。
2. MLX 引擎 + DFlash 加速
Apple Silicon 上的 MLX 引擎提供顶级性能,支持 DFlash 和图像输入。Muse Glimmer 在 M 系列芯片上跑起来很流畅。
3. ollama launch 命令
新增 ollama launch 命令,可以直接用指定模型启动 Claude Code、Pi、OpenClaw 等框架,一行搞定:
ollama launch claude --model muse-glimmer:30b-mlx
ollama launch pi --model muse-glimmer:30b-mlx
ollama launch openclaw --model muse-glimmer:30b-mlx
✅ 适合哪些人?
✅ Mac 用户想跑本地大模型的 — 30B 参数在 M 芯片上表现很好
✅ 用 Claude Code / Pi 等编码 Agent 的 — 可以用本地模型替代云端
✅ OpenClaw / Hermes 用户 — 本地 Agent 方案多了一个强力选项
⚠️ 目前仅支持 Apple Silicon MLX 引擎,NVIDIA/AMD 支持后续跟进
🛠️ 快速上手
# 下载并运行 Muse Glimmer
ollama run muse-glimmer:30b-mlx
# 用 Claude Code 跑
ollama launch claude --model muse-glimmer:30b-mlx
# 用 OpenClaw 跑
ollama launch openclaw --model muse-glimmer:30b-mlx
❓ 常见问题
Q: 需要多大内存?
A: 30B 参数模型建议至少 32GB 统一内存(M 系列芯片)。16GB 可能会比较吃紧。
Q: NVIDIA 显卡能用吗?
A: 目前仅支持 Apple Silicon 的 MLX 引擎。NVIDIA、AMD 等平台的支持会在后续版本中加入。
Q: 和 v0.32.6 比,除了 Muse Glimmer 还有其他变化吗?
A: 这个版本主要是为了适配 Muse Glimmer,没有其他功能性更新。
🔗 相关链接
📦 GitHub: v0.32.7 Release
🌐 官网: ollama.com
⏰ 发布:2026-08-05
⭐ 版本:v0.32.6
🆓 费用:免费开源
Ollama 又更新了,这次 v0.32.6 带来了不少实用改进。Apple GPU 上跑 Qwen3.5 更快了,OpenAI 兼容接口也更规范了。来看看具体更新了啥👇
🔥 这次更新了什么?
1. Qwen3.5 Apple GPU 加速
MLX 引擎现在自动利用模型的 MTP head 做投机解码,在 Apple GPU 上跑 Qwen3.5 速度明显提升。用 Mac 的朋友有福了。
2. OpenAI 兼容接口更规范
/v1/chat/completions 的 streaming 现在严格匹配 OpenAI 的 wire format:role 只在第一个 chunk 出现,finish_reason 独立一个 chunk,usage 单独一个 chunk。之前有些客户端兼容性问题,这次应该解决了。
3. 截断响应修正
当 OpenAI 响应被截断时,finish_reason 现在正确返回 "length" 而不是 "tool_calls"。之前这个 bug 会导致一些工具调用场景误判。
4. Kimi K3 云模型支持
运行 ollama run kimi-k3 时,如果没有本地模型,现在会自动提供 kimi-k3:cloud 云端选项,而不是直接报错。
5. TUI 体验修复
终端界面也修了几个烦人的问题:管道分隔的文本不再被误渲染成表格,Enter 键正确接受 @ 文件补全,/prompt 滚动不再卡顿。
6. 图像生成暂时移除
⚠️ 实验性图像生成功能被临时移除了。如果需要这个功能,建议继续使用 v0.32.5。
7. 引擎更新
MLX 和 llama.cpp 引擎都更新了,底层性能和兼容性有提升。
✅ 适合哪些人?
✅ Mac 用户跑本地模型的 — Qwen3.5 加速很香
✅ 用 OpenAI 兼容接口的开发者 — streaming 行为更标准
✅ 工具调用场景 — 截断判断修复了
⚠️ 依赖图像生成的 — 暂时别升级,等下个版本
🛠️ 快速上手
升级很简单:
ollama --version # 确认当前版本
# macOS
brew upgrade ollama
# Linux
curl -fsSL https://ollama.com/install.sh | sh
跑 Qwen3.5 测试加速效果:
ollama pull qwen3.5
ollama run qwen3.5
❓ 常见问题
Q: 升级后图像生成还能用吗?
A: 不能,v0.32.6 临时移除了。需要的话回退到 v0.32.5。
Q: Qwen3.5 加速对所有 Mac 都有效吗?
A: 需要 Apple Silicon(M1/M2/M3/M4),Intel Mac 没有 MLX 加速。
Q: streaming 接口变化会影响现有代码吗?
A: 如果你的代码之前依赖了非标准的 streaming 行为(比如每个 chunk 都有 role),可能需要调整。标准 OpenAI 客户端应该不受影响。
写在最后
v0.32.6 是一个稳扎稳打的更新,Apple GPU 加速和 OpenAI 兼容性改进都是实打实的提升。唯一遗憾是图像生成被移除了,希望下个版本能加回来。
🔗 官方:GitHub Release
#Ollama #本地AI #开源工具 #LLM #AppleGPU