Ollama 2026年9月更新汇总 - v0.34.2 首次运行向导+ollama://apps直达桌面Apps页

⏰ 发布:2026-09-19

⭐ 版本:v0.34.2(2026-09-16 发布)

🆓 费用:免费开源

v0.34 系列第二个补丁版。新用户第一次跑 ollama 命令会有设置向导了,macOS 和 Windows 桌面版多了个直达 Apps 页面的链接,另外修掉了 MLX 投机解码跑长文时内存一直涨的老毛病。

📦 v0.34.2 - 2026年9月16日

一句话:首次运行有向导,ollama://apps 直达桌面 Apps 页,MLX 投机解码内存问题修复。

🔥 更新内容

1. 首次运行设置向导

第一次运行 ollama,会先出设置界面:登录账号,或者跳过继续本地用。设置完成的状态在 macOS 和 Windows 上和桌面应用共享,命令行、桌面端认同一个状态,不用各配一遍。对刚装完的新用户来说,少了到处翻文档的环节。

2. ollama://apps 直达桌面 Apps 页面

macOS 和 Windows 上新增 ollama://apps,终端、浏览器或者脚本里触发一下,桌面应用的 Apps 页面直接打开。写教程放跳转链接、自己收藏个快捷入口,都比截图指路方便。

3. MLX 投机解码内存修复

Apple Silicon 上用 MLX 投机解码(speculative decoding)跑长生成,内存占用会持续增长,这次修掉了。跑长文档、长代码任务的用户建议升级,别让一条长任务把内存吃穿。

4. llama.cpp 更新

底层 llama.cpp 常规升级,跟上游保持一致。

✅ 适合哪些人

✅ 刚装 Ollama 的新用户:首次运行有向导,登录或本地继续一步到位

✅ macOS / Windows 桌面版用户:ollama://apps 一键直达 Apps 页面

✅ 开投机解码跑长任务的 Apple Silicon 用户:内存膨胀修了,建议尽快升

🛠️ 快速上手

# macOS brew 用户
brew upgrade ollama

# Linux 一键脚本
curl -fsSL https://ollama.com/install.sh | sh

# 验证版本
ollama --version   # 0.34.2

# 直达桌面 Apps 页面(需装桌面版)
open "ollama://apps"        # macOS
# Windows:Win+R 运行框输入 ollama://apps

升完先跑一句 ollama --version 确认版本,再试试 ollama://apps 通不通。

❓ 常见问题

Q:ollama://apps 在 Linux 上能用吗?
A:不行,这个链接目前只支持 macOS 和 Windows 的桌面应用。Linux 用户继续用命令行就好。

Q:装了 v0.34.2,v0.34.1 的提速还在吗?
A:在。补丁版是累积的,模型库查询提速、MLX 转正这些都保留,直接升到最新就行。

Q:MLX 投机解码是什么,我要开吗?
A:用小模型给大模型打草稿的加速技术,Apple Silicon 上能明显加快生成。这次修复针对的是它跑长任务时的内存问题,已经在用的建议升级。

写在最后

这版改动不大,方向倒是清楚的:命令行和桌面应用在往一块儿并,设置状态共享、URL 直达都是同一个思路。你平时敲命令多还是点桌面应用多?评论区聊聊。

🔗 GitHub:v0.34.2 Release

#Ollama #本地大模型 #MLX


⏰ 发布:2026-09-17

⭐ 版本:v0.34.1(2026-09-15 发布)

🆓 费用:免费开源

这是 v0.34 系列第一个补丁版,改动集中在维护上:MLX 转正式功能、大模型库的接口查询从 3.1 秒压到 294 毫秒、废弃 typical_p 参数。想升级的可以跟着升,不急的等下个功能版也行。

📦 v0.34.1 - 2026年9月15日

一句话:MLX 从实验转正,大模型库查询快了 10 倍,参数清理规范化。

🔥 更新内容

1. MLX 模型创建转正,GGUF 转换回归专业工具

MLX safetensors 的 ollama create 不再是实验特性。代价是另一头收紧了:GGUF 模型自己做 safetensor 转换和量化,以后要交给 llama.cpp 官方工具链。Ollama 里的模型创建专注 MLX 一条线,转换类需求拆出去。

2. 模型库查询提速 10 倍

官方测试数据:模型装得多的时候,/api/tags 冷查询从 3.1 秒降到 294 毫秒。几十上百个模型的库,列表加载从"卡一下"变成即点即出。模型能力(capabilities)字段的报告方式也统一了。

3. 重复 token 检测阈值放宽

触发重复检测的门槛从少量重复提高到 100 个连续 token。OCR 这类场景里表格、编号本来就有大量重复内容,之前容易被误杀截断,这次误报会少很多。

4. 废弃 typical_p 参数

新建模型不能再设置 typical_p;已有的 GGUF 模型继续支持,不受影响。这个采样参数在社区里用得少,属于例行清理。另外 MLX 和 llama.cpp 底层库常规升级。

✅ 适合哪些人

✅ 模型装了很多的用户:/api/tags 提速 10 倍,管理界面不再卡顿

✅ 做 OCR / 批量文档处理的:重复内容误判截断的问题缓解

✅ Apple Silicon 用户:MLX 模型创建正式可用,内存管理也有优化

⚠️ 用 typical_p 的少数用户:新模型设不了了,已有模型不受影响

🛠️ 快速上手

# macOS brew 用户
brew upgrade ollama

# Linux 一键脚本
curl -fsSL https://ollama.com/install.sh | sh

# 验证版本
ollama --version   # 0.34.1

# 感受一下 /api/tags 提速
time curl -s http://localhost:11434/api/tags > /dev/null

升级后用 time 跑一次 /api/tags,模型库大的话差距直接看得到。

❓ 常见问题

Q:我还在用 ollama create 做 GGUF 转换,怎么办?
A:换 llama.cpp 的 convert 脚本做 safetensor 转换和量化,转换完的模型文件照常导入 Ollama 运行。

Q:typical_p 废弃后我的脚本会报错吗?
A:已有 GGUF 模型 retain 支持,运行不受影响。只有新建模型时这个参数不能再设置。

Q:v0.34.0 的 ChatGPT Desktop 集成有变化吗?
A:没有,集成功能照常可用,这次补丁不涉及。

写在最后

补丁版没什么可兴奋的,但 /api/tags 从 3.1 秒到 294 毫秒这种优化,恰恰是模型库大了之后最需要的。你本地装了几个模型?评论区报个数。

🔗 GitHub:v0.34.1 Release

#Ollama #本地大模型 #MLX


⏰ 发布:2026-09-13

⭐ 版本:v0.34.0(2026-09-05 发布)

🆓 费用:免费开源

这版最值得注意的是方向:Ollama 的本地模型现在能直接接进 ChatGPT Desktop 用了。订阅了 ChatGPT 又想跑开源模型的,两条路终于并成一条。另外 Apple Silicon 上的结构化输出快了不少。

📦 v0.34.0 - 2026年9月5日

这次更新一句话:本地模型接入 ChatGPT Desktop,结构化输出在 Apple Silicon 上提速,工具搜索和响应压缩对齐 OpenAI 客户端规范。

🔥 更新内容

1. 在 ChatGPT Desktop 里用 Ollama 模型

macOS 上打开 Ollama 应用完成设置后,ChatGPT Desktop 里可以直接选本地模型。云端订阅和本地开源模型在一个界面里切换,工作流不用搬来搬去。数据不出本机这点,对隐私敏感的场景依然成立。

2. Apple Silicon 结构化输出提速

JSON Schema 约束解码的性能做了优化,跑 Qwen、gemma 这类本地模型输出 JSON 时等待时间明显缩短。M 系列芯片用户感知最直接。

3. 工具搜索与响应压缩

新增 OpenAI 兼容客户端的工具搜索(tool search)和响应压缩(response compaction)支持。工具定义多、上下文长的 agent 场景,token 消耗降下来。

✅ 适合哪些人

✅ ChatGPT 订阅用户:本地模型直接进桌面客户端,敏感问题切本地模型处理

✅ M 系列Mac 用户:结构化输出提速,本地跑 JSON 任务更顺

⚠️ Windows / Linux 用户:ChatGPT Desktop 集成目前从 macOS 的 Ollama 应用入口设置

🛠️ 快速上手

升级到 v0.34.0 后,从 macOS 的 Ollama 应用里完成 ChatGPT Desktop 集成设置:

# macOS brew 用户
brew upgrade ollama

# 验证版本
ollama --version   # 0.34.0

装好后打开 Ollama 应用,按提示把本地模型接入 ChatGPT Desktop,然后在客户端模型列表里就能看到它们。

❓ 常见问题

Q:我的对话数据会上传吗?
A:走 Ollama 本地模型的对话在你自己的机器上推理,数据不出本机;切回云端模型的部分照常走 OpenAI。

Q:需要 ChatGPT 订阅吗?
A:ChatGPT Desktop 客户端本身可用,具体模型可用性以你自己的 OpenAI 账号权限为准。

Q:MLX 引擎还在吗?
A:在。v0.33.3 引入的 MLX 相关能力和缓存统计都保留,这次是在它之上继续优化。

写在最后

本地模型进 ChatGPT Desktop 是个信号:客户端大战打到「谁开放的兼容性更强」这个阶段了。你本地跑哪个模型?评论区说说。

🔗 GitHub:https://github.com/ollama/ollama

#Ollama #本地大模型 #ChatGPT



⏰ 发布:2026-09-05

⭐ 版本:v0.33.3

🏷 费用:免费开源

🦙 Ollama v0.33.3 让 gemma4 在 MLX 引擎上支持了图像和音频输入,本地多模态玩法更全了。另外补上了提示缓存的 token 统计,也修正了 GGUF 模型自带默认参数不生效的问题。Apple Silicon 用户这次受益最大。

📦 v0.33.3 - 2026年9月2日

📅 发布日期:2026年9月2日 | 🏷 来源:GitHub Releases

🔥 这次更新了什么?

1. gemma4 多模态登陆 MLX:在 Apple Silicon 的 MLX 引擎上,gemma4 现在能同时处理图像和音频。之前想本地跑多模态得依赖 CUDA 或者 llama.cpp 路线,Mac 用户的选择更多了。

2. 提示缓存 token 统计:API 响应会报告缓存的提示 token 数。做应用的人可以算清楚缓存到底省了多少,重复前缀的 prompt 成本一目了然。

3. 尊重 GGUF 模型默认参数:模型文件里定义的默认参数(比如温度、上下文长度)现在会被采用,不用每个模型手动调一遍。

4. 引擎更新:MLX、MLX-C 和 llama.cpp 底层同步升级,稳定性和性能常规跟进。

✅ 适合哪些人?

Mac / Apple Silicon 用户 — MLX 引擎多模态支持,gemma4 能看图听音频了
基于 Ollama 做应用的开发者 — 缓存 token 可见,成本能算了
⚠️ NVIDIA 显卡用户 — 多模态新增只在 MLX 引擎,CUDA 路线无变化

🛠️ 快速上手

# 升级 Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
# 期望: ollama version 0.33.3

Mac 上试试多模态:

ollama run gemma4
>>> 这张图里有什么? /图片拖入终端

❓ 常见问题

Q: 缓存 token 统计在哪里看?
A: API 响应的字段里直接返回,/api/generate 和 /api/chat 都支持。

Q: 我没设置参数,模型行为会变吗?
A: 如果模型作者在 GGUF 里写了默认参数,行为可能和之前不同。显式传参不受影响。

写在最后

v0.33.3 的重点是 Mac 侧的多模态补齐。gemma4 加上图像和音频之后,本地跑「能看能听」的模型不再是 NVIDIA 用户的专利。

🔗 官方:GitHub Release

#Ollama #gemma4 #MLX #多模态 #本地AI


发表评论