⏰ 发布:2026-09-19
⭐ 版本:v0.34.2(2026-09-16 发布)
🆓 费用:免费开源
v0.34 系列第二个补丁版。新用户第一次跑 ollama 命令会有设置向导了,macOS 和 Windows 桌面版多了个直达 Apps 页面的链接,另外修掉了 MLX 投机解码跑长文时内存一直涨的老毛病。
📦 v0.34.2 - 2026年9月16日
一句话:首次运行有向导,ollama://apps 直达桌面 Apps 页,MLX 投机解码内存问题修复。
🔥 更新内容
1. 首次运行设置向导
第一次运行 ollama,会先出设置界面:登录账号,或者跳过继续本地用。设置完成的状态在 macOS 和 Windows 上和桌面应用共享,命令行、桌面端认同一个状态,不用各配一遍。对刚装完的新用户来说,少了到处翻文档的环节。
2. ollama://apps 直达桌面 Apps 页面
macOS 和 Windows 上新增 ollama://apps,终端、浏览器或者脚本里触发一下,桌面应用的 Apps 页面直接打开。写教程放跳转链接、自己收藏个快捷入口,都比截图指路方便。
3. MLX 投机解码内存修复
Apple Silicon 上用 MLX 投机解码(speculative decoding)跑长生成,内存占用会持续增长,这次修掉了。跑长文档、长代码任务的用户建议升级,别让一条长任务把内存吃穿。
4. llama.cpp 更新
底层 llama.cpp 常规升级,跟上游保持一致。
✅ 适合哪些人
✅ 刚装 Ollama 的新用户:首次运行有向导,登录或本地继续一步到位
✅ macOS / Windows 桌面版用户:ollama://apps 一键直达 Apps 页面
✅ 开投机解码跑长任务的 Apple Silicon 用户:内存膨胀修了,建议尽快升
🛠️ 快速上手
# macOS brew 用户
brew upgrade ollama
# Linux 一键脚本
curl -fsSL https://ollama.com/install.sh | sh
# 验证版本
ollama --version # 0.34.2
# 直达桌面 Apps 页面(需装桌面版)
open "ollama://apps" # macOS
# Windows:Win+R 运行框输入 ollama://apps
升完先跑一句 ollama --version 确认版本,再试试 ollama://apps 通不通。
❓ 常见问题
Q:ollama://apps 在 Linux 上能用吗?
A:不行,这个链接目前只支持 macOS 和 Windows 的桌面应用。Linux 用户继续用命令行就好。
Q:装了 v0.34.2,v0.34.1 的提速还在吗?
A:在。补丁版是累积的,模型库查询提速、MLX 转正这些都保留,直接升到最新就行。
Q:MLX 投机解码是什么,我要开吗?
A:用小模型给大模型打草稿的加速技术,Apple Silicon 上能明显加快生成。这次修复针对的是它跑长任务时的内存问题,已经在用的建议升级。
写在最后
这版改动不大,方向倒是清楚的:命令行和桌面应用在往一块儿并,设置状态共享、URL 直达都是同一个思路。你平时敲命令多还是点桌面应用多?评论区聊聊。
🔗 GitHub:v0.34.2 Release
#Ollama #本地大模型 #MLX
⏰ 发布:2026-09-17
⭐ 版本:v0.34.1(2026-09-15 发布)
🆓 费用:免费开源
这是 v0.34 系列第一个补丁版,改动集中在维护上:MLX 转正式功能、大模型库的接口查询从 3.1 秒压到 294 毫秒、废弃 typical_p 参数。想升级的可以跟着升,不急的等下个功能版也行。
📦 v0.34.1 - 2026年9月15日
一句话:MLX 从实验转正,大模型库查询快了 10 倍,参数清理规范化。
🔥 更新内容
1. MLX 模型创建转正,GGUF 转换回归专业工具
MLX safetensors 的 ollama create 不再是实验特性。代价是另一头收紧了:GGUF 模型自己做 safetensor 转换和量化,以后要交给 llama.cpp 官方工具链。Ollama 里的模型创建专注 MLX 一条线,转换类需求拆出去。
2. 模型库查询提速 10 倍
官方测试数据:模型装得多的时候,/api/tags 冷查询从 3.1 秒降到 294 毫秒。几十上百个模型的库,列表加载从"卡一下"变成即点即出。模型能力(capabilities)字段的报告方式也统一了。
3. 重复 token 检测阈值放宽
触发重复检测的门槛从少量重复提高到 100 个连续 token。OCR 这类场景里表格、编号本来就有大量重复内容,之前容易被误杀截断,这次误报会少很多。
4. 废弃 typical_p 参数
新建模型不能再设置 typical_p;已有的 GGUF 模型继续支持,不受影响。这个采样参数在社区里用得少,属于例行清理。另外 MLX 和 llama.cpp 底层库常规升级。
✅ 适合哪些人
✅ 模型装了很多的用户:/api/tags 提速 10 倍,管理界面不再卡顿
✅ 做 OCR / 批量文档处理的:重复内容误判截断的问题缓解
✅ Apple Silicon 用户:MLX 模型创建正式可用,内存管理也有优化
⚠️ 用 typical_p 的少数用户:新模型设不了了,已有模型不受影响
🛠️ 快速上手
# macOS brew 用户
brew upgrade ollama
# Linux 一键脚本
curl -fsSL https://ollama.com/install.sh | sh
# 验证版本
ollama --version # 0.34.1
# 感受一下 /api/tags 提速
time curl -s http://localhost:11434/api/tags > /dev/null
升级后用 time 跑一次 /api/tags,模型库大的话差距直接看得到。
❓ 常见问题
Q:我还在用 ollama create 做 GGUF 转换,怎么办?
A:换 llama.cpp 的 convert 脚本做 safetensor 转换和量化,转换完的模型文件照常导入 Ollama 运行。
Q:typical_p 废弃后我的脚本会报错吗?
A:已有 GGUF 模型 retain 支持,运行不受影响。只有新建模型时这个参数不能再设置。
Q:v0.34.0 的 ChatGPT Desktop 集成有变化吗?
A:没有,集成功能照常可用,这次补丁不涉及。
写在最后
补丁版没什么可兴奋的,但 /api/tags 从 3.1 秒到 294 毫秒这种优化,恰恰是模型库大了之后最需要的。你本地装了几个模型?评论区报个数。
🔗 GitHub:v0.34.1 Release
#Ollama #本地大模型 #MLX
⏰ 发布:2026-09-13
⭐ 版本:v0.34.0(2026-09-05 发布)
🆓 费用:免费开源
这版最值得注意的是方向:Ollama 的本地模型现在能直接接进 ChatGPT Desktop 用了。订阅了 ChatGPT 又想跑开源模型的,两条路终于并成一条。另外 Apple Silicon 上的结构化输出快了不少。
📦 v0.34.0 - 2026年9月5日
这次更新一句话:本地模型接入 ChatGPT Desktop,结构化输出在 Apple Silicon 上提速,工具搜索和响应压缩对齐 OpenAI 客户端规范。
🔥 更新内容
1. 在 ChatGPT Desktop 里用 Ollama 模型
macOS 上打开 Ollama 应用完成设置后,ChatGPT Desktop 里可以直接选本地模型。云端订阅和本地开源模型在一个界面里切换,工作流不用搬来搬去。数据不出本机这点,对隐私敏感的场景依然成立。
2. Apple Silicon 结构化输出提速
JSON Schema 约束解码的性能做了优化,跑 Qwen、gemma 这类本地模型输出 JSON 时等待时间明显缩短。M 系列芯片用户感知最直接。
3. 工具搜索与响应压缩
新增 OpenAI 兼容客户端的工具搜索(tool search)和响应压缩(response compaction)支持。工具定义多、上下文长的 agent 场景,token 消耗降下来。
✅ 适合哪些人
✅ ChatGPT 订阅用户:本地模型直接进桌面客户端,敏感问题切本地模型处理
✅ M 系列Mac 用户:结构化输出提速,本地跑 JSON 任务更顺
⚠️ Windows / Linux 用户:ChatGPT Desktop 集成目前从 macOS 的 Ollama 应用入口设置
🛠️ 快速上手
升级到 v0.34.0 后,从 macOS 的 Ollama 应用里完成 ChatGPT Desktop 集成设置:
# macOS brew 用户
brew upgrade ollama
# 验证版本
ollama --version # 0.34.0
装好后打开 Ollama 应用,按提示把本地模型接入 ChatGPT Desktop,然后在客户端模型列表里就能看到它们。
❓ 常见问题
Q:我的对话数据会上传吗?
A:走 Ollama 本地模型的对话在你自己的机器上推理,数据不出本机;切回云端模型的部分照常走 OpenAI。
Q:需要 ChatGPT 订阅吗?
A:ChatGPT Desktop 客户端本身可用,具体模型可用性以你自己的 OpenAI 账号权限为准。
Q:MLX 引擎还在吗?
A:在。v0.33.3 引入的 MLX 相关能力和缓存统计都保留,这次是在它之上继续优化。
写在最后
本地模型进 ChatGPT Desktop 是个信号:客户端大战打到「谁开放的兼容性更强」这个阶段了。你本地跑哪个模型?评论区说说。
🔗 GitHub:https://github.com/ollama/ollama
#Ollama #本地大模型 #ChatGPT
⏰ 发布:2026-09-05
⭐ 版本:v0.33.3
🏷 费用:免费开源
🦙 Ollama v0.33.3 让 gemma4 在 MLX 引擎上支持了图像和音频输入,本地多模态玩法更全了。另外补上了提示缓存的 token 统计,也修正了 GGUF 模型自带默认参数不生效的问题。Apple Silicon 用户这次受益最大。
📦 v0.33.3 - 2026年9月2日
📅 发布日期:2026年9月2日 | 🏷 来源:GitHub Releases
🔥 这次更新了什么?
1. gemma4 多模态登陆 MLX:在 Apple Silicon 的 MLX 引擎上,gemma4 现在能同时处理图像和音频。之前想本地跑多模态得依赖 CUDA 或者 llama.cpp 路线,Mac 用户的选择更多了。
2. 提示缓存 token 统计:API 响应会报告缓存的提示 token 数。做应用的人可以算清楚缓存到底省了多少,重复前缀的 prompt 成本一目了然。
3. 尊重 GGUF 模型默认参数:模型文件里定义的默认参数(比如温度、上下文长度)现在会被采用,不用每个模型手动调一遍。
4. 引擎更新:MLX、MLX-C 和 llama.cpp 底层同步升级,稳定性和性能常规跟进。
✅ 适合哪些人?
✅ Mac / Apple Silicon 用户 — MLX 引擎多模态支持,gemma4 能看图听音频了
✅ 基于 Ollama 做应用的开发者 — 缓存 token 可见,成本能算了
⚠️ NVIDIA 显卡用户 — 多模态新增只在 MLX 引擎,CUDA 路线无变化
🛠️ 快速上手
# 升级 Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
# 期望: ollama version 0.33.3
Mac 上试试多模态:
ollama run gemma4
>>> 这张图里有什么? /图片拖入终端
❓ 常见问题
Q: 缓存 token 统计在哪里看?
A: API 响应的字段里直接返回,/api/generate 和 /api/chat 都支持。
Q: 我没设置参数,模型行为会变吗?
A: 如果模型作者在 GGUF 里写了默认参数,行为可能和之前不同。显式传参不受影响。
写在最后
v0.33.3 的重点是 Mac 侧的多模态补齐。gemma4 加上图像和音频之后,本地跑「能看能听」的模型不再是 NVIDIA 用户的专利。
🔗 官方:GitHub Release
#Ollama #gemma4 #MLX #多模态 #本地AI