2026 年 8 月最值得关注的 AI 模型:按用途看本月变化
整理 2026 年 8 月日常聊天、编程、图片、视频、语音转写与本机运行模型的重要变化,说明发布日期、使用入口,以及哪些值得你试一试。

已经有一个用得顺手的 AI 助手,还需要追新模型吗?要看它能否解决你眼下的问题。8 月值得留意的变化,包括日常聊天更新、编程工具里增加的选择、更细的图片与视频编辑控制,以及在自己电脑上运行助手的新方案。
先按用途选,名单就会短很多。 已经使用 ChatGPT,先留意 GPT-5.6 的更新;经常写代码,可以看看 Gemini 3.7 Flash 和 DeepSeek-V4-Pro;需要做宣传素材,则重点关注 Imagine Image 2.0,以及 FLUX 3 Video、Gemini Omni 1.1 Flash 提供的视频控制。
这是第一期「AI 模型月报」,覆盖 2026 年 8 月 1—31 日的模型发布和重要开放使用变化,资料核查于 9 月 8 日。我们根据公开文档挑选值得试用的对象,没有进行多模型实测。下文入口以发布时的说明为依据,当前账号、地区与套餐条件可能不同。
先找与你的工作有关的一类
| 你要做什么 | 优先关注 | 这次值得看的变化 |
|---|---|---|
| 日常写作、整理资料 | GPT-5.6 Sol / Luna 八月更新 | 原来使用的聊天体验可能已经改变 |
| 写代码、完成多步任务 | Gemini 3.7 Flash、DeepSeek-V4-Pro | 模型更新和新的接入选择 |
| 修改宣传图片 | Imagine Image 2.0 | 选定区域和参考图编辑 |
| 制作短视频 | FLUX 3 Video、Gemini Omni 1.1 Flash | 关键帧、续接和预览控制 |
| 把语音变成文字 | Gemini 3.5 Transcribe | 分别处理实时语音和已有录音 |
| 在自己电脑上运行助手 | Muse Glimmer | 开放权重,并给出本机运行条件 |
各项的发布依据和限制见下文。使用模型开发应用的读者,还可以留意 Grok 4.6、Muse Spark 1.2、GLM-5.3-Flash 和 Qwen3.8-Flash-Next。
日常聊天:先确认你用的 GPT-5.6 是哪个版本
OpenAI 在 8 月 6 日的系统卡中介绍了面向 ChatGPT 的 GPT-5.6 Sol 和 Luna 八月版本:Free、Go 用户获得新的默认模型,Plus、Pro 用户获得更新后的 Sol,并可通过滑杆调整回答投入的思考程度。该次发布时,Codex 和 ChatGPT Work 仍使用七月版本。
所以,听到“GPT-5.6 变好了”,还要看是在什么产品里、哪个版本。别人用 ChatGPT 得到的结果,不能直接说明你在编程工具里使用的同名模型也有同样表现。
对普通用户来说,这次更新最实际的意义,是先把过去没做好的任务重新试一次,再决定是否需要增加订阅。假设你正在筹备一场小型活动,手上有活动说明、人数上限和确认日期。让助手写一封简短邀请函,再检查日期和人数是否保留。文案更顺了,却改错了这两项,后面仍然要返工。
编程:多了哪些值得比较的选择?
这一轮编程模型越来越强调 Agent,也就是让模型借助软件读取文件、调用工具、连续完成多个步骤。真正影响使用体验的,是模型与工具配合后,能否把修改做完、少留问题。
Gemini 3.7 Flash:适合加入重复任务的对照
Google 在 8 月 13 日发布 Gemini 3.7 Flash,重点介绍编程和 Agent 工作。开发者可通过 Gemini API、Google AI Studio 等入口使用;发布说明中的个人用户入口是 Gemini Spark,面向支持地区的 Pro、Ultra 订阅用户。
官方同时给出了持续到 2026 年底的 API 优惠价:每百万输入 token 0.75 美元,每百万输出 token 3.75 美元。token 是文本处理的计量单位。这是 API 用量价格,不能当成聊天订阅费,也不是完成一项工作的全部费用。
如果你经常处理类似文档或代码任务,想同时比较费用与修改量,可以把它加入候选。沿用活动例子,给它一个明确的小问题:报名表的人数检查多放进了一个名额。检查上限是否准确、错误提示是否合适,并记录重试和审查时间。单价低,但总改不对,也不划算。
DeepSeek-V4-Pro:名字没换,模型已经更新
DeepSeek 的官方更新日志记录,V4-Pro 正式版在 8 月 13 日更新到 App、网页和 API。开发者仍使用 deepseek-v4-pro 这个模型名;本次更新还说明了 Responses API 兼容和可调思考程度。
已经使用 DeepSeek 的读者,可以拿保存过的任务重新比较。API 名称没有变化,不代表行为没有变化。记录测试日期和设置,后面才知道两次结果究竟对应什么。
同一日志还记录了 8 月 21 日上线 API 的 V4-Flash-Vision-Exp。它是用于视觉理解的实验模型,可以作为读取截图等视觉材料的候选;它不负责生成图片,正式依赖之前也应先验证实验版本是否适合自己的任务。
Grok 4.6 与 Muse Spark 1.2:连同工具一起看
Grok 4.6 于 8 月 12 日发布,公布的入口包括 Grok Build、Cursor 和 API。如果你现有的工具已经提供它,就多了一个方便比较多文件修改的选择。厂商强调它能持续处理较长任务,可以据此设计试用,但不能直接推断它在你的项目里更可靠。
Meta 在 8 月 5 日同时推出了 Muse Spark 1.2 和 Muse Code beta。前者是模型,后者是由它驱动的终端编程工具。工具里的常驻后台 Agent 和中断恢复机制,属于运行它的软件;换一个地方调用模型,不会自动获得这些功能。
比较时,要么比较两套完整的编程工具,要么固定工具环境,只更换模型。工具权限、重试方式不同,也会改变结果,不能把所有差距都算到模型头上。
图片:Imagine Image 2.0 值得试的是“改得准不准”
Imagine Image 2.0 在 8 月 7 日上线,作为 Grok 网页和移动端新的 Quality Mode,API 名称为 grok-imagine-image-2.0。发布说明介绍了选区编辑、移除背景和多参考图编辑等功能。
如果经常需要修改宣传素材,这些功能值得试。拿一张有权使用的活动场地图,只要求改变横幅的颜色,同时保留房间、家具和标识。查看结果时,既看改动有没有完成,也看不该动的部分是否被改了。官方对精确编辑的描述,不能代替这一步检查。
图片上需要出现活动信息时,再逐字核对日期、人名和文案。也可以只生成画面,最后用排版工具放入确认过的文字。模型强调文字表现,并不意味着可以省去校对。
视频:先看能控制什么,再看演示有多漂亮
已经想好具体镜头时,8 月的两项变化尤其值得关注:一个开放了视频生成能力,另一个增加了续接和修改手段。
FLUX 3 Video:视频生成正式开放
Black Forest Labs 在 8 月 4 日开放 FLUX 3 Video,可通过自家 API 和部分合作平台使用。初始版本介绍了最长 20 秒、原生音频、关键帧、视频续接和草稿模式;其中 HD 输出与通过放大得到的 Full HD 有明确区别。
它的试用价值在于,你能更具体地规定镜头如何发展。比如从已经确认的场地图开始,只做一次幅度较小的运镜。检查房间是否仍然可辨认,镜头是否到达要求的位置。如果画面很有气势,却凭空多出一扇门,就没有完成原来的要求。
Gemini Omni 1.1 Flash:已有片段还能怎样改?
Google 的 8 月 27 日开发者更新介绍了场景延长、首尾帧控制、低分辨率预览和 4K 放大,可通过 Google AI Studio 中的 Gemini API 使用。
如果你有明确的起始画面和结束画面,或已有一段可用视频需要接着生成,可以把它列为候选。与 FLUX 比较时,重点看你需要的过渡是否保住了主体,同时固定声音、时长和输出设置。放大到 4K 不等于原生生成 4K;把片段接长,也不等于一次生成全部时长。
转写:Gemini 3.5 Transcribe 把实时语音和录音分开处理
Google 在 8 月 26 日发布 Gemini 3.5 Transcribe,分别提供实时流式和预录音频入口。后者支持区分说话人和词级时间戳;发布说明还介绍了自定义词汇,以及清理停顿、自我纠正等口语现象的能力。
这适合把口述笔记整理成可读文稿。但使用前要先决定:你要保留原话,还是整理说话者最后表达的意思?
仍以活动筹备为例,口述中可能出现“订周二,抱歉,是周三”。整理后的计划应采用纠正后的日期;逐字记录则需要保留这段原话。先确定要求,再比较结果。人名、日期和纠正内容,都应回到录音核对,不能只看文字是否通顺。
发布说明中的说话人区分支持最多三人,更多人仍属于实验能力。录制多人讨论时,这个限制比笼统的“转写质量更好”更能影响选择。
本机与开放模型:先确认自己能不能运行
Muse Glimmer:本期最直接面向本机使用的候选
Meta 在 8 月 10 日发布 Muse Glimmer,介绍它是一款面向本地 Agent 的 300 亿参数模型,权重采用 Apache 2.0 许可。官方解释了量化,也就是压缩模型数值表示,并给出了围绕 24 GB 或 32 GB 内存容量设计的配置说明。
如果“模型必须在自己电脑上运行”是明确需求,它值得关注。可以从公告中的模型下载和部署文档开始,核对包含运行时工作内存在内的完整要求,不能只看下载文件有多大。
本地模型只是助手的一部分。要判断整个操作是否留在设备上,还要检查使用它的应用和连接的工具,不能仅凭模型在本机就下结论。
GLM 与 Qwen:开发者值得看,关注理由不同
Cloudflare 的 8 月 26 日更新确认 GLM-5.3-Flash 已在 Workers AI 提供多模态输入支持,需要 Workers 付费套餐或预付的 AI Gateway 额度。对已经使用该平台的团队,它增加了一种部署选择。型号里有 Flash,并不能说明它适合在笔记本上运行。
Qwen3.8-Flash-Next 则更适合放在架构观察中。八月公告及架构论文说明,这次提前发布是为了让社区在 Qwen4 之前评估架构变化。做模型部署和适配的读者可以关注;它不是 Qwen4 正式发布,普通聊天用户也不必因此急着更换工具。
选一个新候选,试一项真实要求
不需要把整张名单都试一遍。挑一项经常做的工作,保留原始输入,用当前工具和一个相关的新候选做对照。运行前,先写下什么错误会让结果不能用。
活动材料里的要求,可以是日期不能变、报名人数不能超限、场地不能被改样,或口述纠正必须处理准确。记录模型与产品、日期、设置、错误、修改时间和实际费用,留下那个让你少返工、能把事情做完的选择。
参考资料
- OpenAI 八月系统卡:ChatGPT 八月版本与七月部署版本的区别。
- Gemini 3.7 Flash与 DeepSeek 更新日志:发布日期、使用入口和开发者变化。
- Grok 4.6与 Muse Spark 1.2 / Muse Code:编程模型发布及配套工具。
- Imagine Image 2.0:图片生成与编辑控制。
- FLUX 3 Video与 Gemini Omni 1.1 Flash:视频开放使用与创作控制。
- Gemini 3.5 Transcribe:实时和预录音频转写,以及说话人数限制。
- Muse Glimmer:本机部署、权重与硬件说明。
- Workers AI 上的 GLM-5.3-Flash:平台接入和使用条件。
- Qwen3.8-Flash-Next 公告及架构论文:架构预览的目的和范围。







