凌晨两点我把八个模型的更新都翻了一遍,最后只改了一行配置

2026-08-14舍予基业来源:公众号「舒毅讲AI」
凌晨两点我把八个模型的更新都翻了一遍,最后只改了一行配置
梳理本周八大模型更新,指出编程与智能体工作流正从选最聪明模型转向选最划算接力手,帮开发者与创业者降低API成本、优化架构。

昨晚有个做外贸独立站的朋友发消息问我:现在模型一天一个样,我做自动客服和商品描述生成,到底该把预算押在哪家?

他说他刚被上个月的API账单吓一跳。同一批请求,换个模型端点,价格能差出四倍,效果还看不出四倍的差距。

我回了句:你先别急着换,明天我帮你看看。放下手机,我把这周几个大模型的更新铺开,一个一个过。过完已经快凌晨两点,最后我只改了一行配置文件。

这行配置的背后,是我对这轮更新的一个判断:编程和智能体工作流,正在从“选一个最聪明的模型”变成“选一组最划算的接力手”。

OPC创业者和coding开发者真正该盯的,已经不是模型参数多大了,而是哪家把缓存成本、上下文窗口、工具调用稳定性这三件事同时做扎实了。

DeepSeek这周的动静,比很多人意识到的更大。

DeepSeek-V4-Pro-0813在硅基流动Day-0首发,1M上下文,三档推理强度可调,MIT开源。定价是输入每百万token 1.32美元、输出3.96美元,缓存命中只有0.44美元。

0.44美元这个数,值得所有做多轮对话和智能体工作流的团队拿笔记下来。

我们给客户做OPC业务流程拆解的时候,最大的隐性成本往往不是生成,而是重复读取。一个订单处理智能体,每轮对话都要重新读一遍订单、客户历史、库存规则。如果缓存命中的价格能做到未命中的三分之一,那架构上就该故意把高频上下文设计成可缓存、可复用的结构。

这意味着你的提示词工程思路要变。过去大家拼命压缩提示词省钱,现在更该想的是:哪些上下文应该沉淀下来,让下一次调用直接命中缓存。

DeepSeek Harness的开发者预览版也在同一周出来,MIT开源,核心是“一切皆插件”。模型、工具、技能、沙箱、UI都能自由替换。这个思路,说白了就是把模型当发动机,车身和轮子全让开发者自己挑。

对coding开发者这很关键。别再把业务逻辑写死在某个模型的调用格式里。插件化的智能体框架,等于给未来留了一条换模型的退路。今天DeepSeek便宜,明天别的模型出的编程能力更强,换就是了,伤不到骨架。

阿里千问这周干了件挺务实的事。

Qwen3.8-MAX开始加持“真·办公助理”,方向不再是聊天,而是能真正接管办公场景里的具体任务。同时开放的Qwen3.8-2.4T-A95B模型权重,2.4T MoE、激活95B、原生256K上下文。

千问开放平台8月10日上线,四天超200家伙伴申请入驻,顺丰、天鹅到家、贝壳、联想、菜鸟都进来了。

看到这个名单,我第一反应是:千问在抢的不是模型调用量,是场景入口。

物流、房产、本地生活、理财,这些是OPC创业者最常蹲的行业。平台把智能体创建和接入的链路打短,创业者可以直接把能力接到千问APP里,省掉从零做分发的成本。

如果你做的是面向本地商家的工具型产品,现在最该做的就是去千问开放平台看一圈入驻条件。别把时间全花在自建App和找流量上,有现成的生态位先占住。

MiniMax推音乐生成,这件事看着跟coding没关系,其实关系很大。

MiniMax-Music3输入歌词和音乐描述,生成最长五分钟完整歌曲,输出32kHz立体声WAV,内部用了8B参数的全局语言模型负责长程语义和结构。

这个技术路线值得coding开发者注意:它不是靠堆算力做更“像”的声音,而是把歌曲的结构理解交给语言模型,再分层生成。这个思路迁移到代码生成领域,就是先让模型理解项目的结构和依赖关系,再逐层生成实现。

过去我们做代码生成,太执着于“一次生成整段正确代码”。Music3的分层思路提醒了一件事:结构对了,细节差一点也能改;结构错了,细节再漂亮也是废的。做AI编程工具的人,可以把精力多放一些在仓库级上下文和依赖图上,而不是只优化单文件补全。

Grok 4.6这周也出来了。

xAI在Grok 4.5基础上,重点强化长时运行智能体和复杂交互式视觉能力。官方说,在Artificial Analysis的九项综合指标上追平了GPT-5.6 Sol。

“长时运行智能体”这个词,OPC创业者要当回事。很多业务流程不是一问一答,是一个智能体要连续跑几十分钟甚至几小时,中间随时响应环境变化。Grok这轮押的正是这个方向。

如果你的业务涉及监控、巡检、长时间任务跟踪,Grok 4.6可以放进候选名单测一测。但别急着迁移,先把长时任务拆成可检查的中间步骤,用哪个模型都得这么干。

Gemini 3.7 Flash的定价,这周让不少人重新按了计算器。

距3.6 Flash发布才三周,Gemini 3.7 Flash输入$0.75、输出$3.75,价格是上一代的一半,主打编程和智能体。

三周砍一半价格,这个节奏说明Google Cloud在大规模推理成本上有了真东西,不是靠补贴压价。

Google Sheets canvas也在同一周出来,用自然语言把表格变成交互式仪表盘和迷你应用。这个和OPC创业者离得很近:大量中小商户的数据都躺在表格里,他们不会写SQL,但他们会说话。

能把表格变成可发布链接的小应用,就是OPC创业者手里最直接的获客钩子。 拿客户的真实表格做个demo,比讲十页PPT管用。

OpenAI这周的更新,我给GPT那栏记了两个点。

一个是API服务层级Ultrafast,由Cerebras提供算力,跑GPT-5.6 Sol的速度最高提升14倍,输出每秒750 token。另一个是首款AI硬件的细节曝光:冰球大小、甜甜圈造型、无屏音箱,预计2027年,售价300到400美元。

Ultrafast这个,对交互式编程场景是实打实的利好。Cursor这类工具里,用户等补全的时间直接决定体感。如果每秒750 token能稳定维持,那“模型很快”这个体验差异会重新洗牌一部分开发者的工具选择。

硬件的事,2027年才来,现在不用太激动。但方向值得关注:OpenAI在把交互从屏幕往空间里挪。等它真出来了,OPC创业者可能又要面对一个新的分发场景。

Claude Code这周更新到了v2.1.232,默认启用subagent forking。

配图

子代理可以继承完整对话和提示缓存,非队友代理默认后台运行。还修了Windows权限绕过和嵌套git仓库信任继承这些安全漏洞。

这个更新最实在的价值是:一个主代理可以同时派出多个子代理干活,每个子代理都带着完整上下文。 对做代码审查、测试生成、多文件重构的coding团队来说,这是能直接省时间的。

但安全修复那栏也提醒了:模型和工具链越强,权限边界就越重要。你是要效率,但别把仓库密钥和服务器权限一锅端地交给代理。我们给OPC客户做落地时,权限最小化这条线,从来不让步。

豆包这周的新闻点,藏在汽车里。

一汽-大众ID. AURA T6开始盲订,确认接入火山引擎豆包大模型,智能座舱合作从燃油车延伸到纯电。

座舱场景离大部分OPC创业者有点远,但信号很清楚:豆包在往车载设备、实体终端这些“非键盘场景”里扎。这意味着未来几年,模型的交互会越来越多地发生在没有屏幕、没有键盘的场合。

做OPC工具的团队,早晚要面对一个问题:如果用户不在电脑前,你的智能体还能服务他吗?现在不用动手做,但这个变量要放在路线图里。

微软这周把Copilot的Mico下线了,转岗去学习平台。

这个黄色小团子去年10月才上线,不到一年退场。微软AI CEO之前说它是为了给聊天机器人“身份感”。

我不觉得这是坏事。AI产品的人格化和卖萌,救不了没有真实任务完成能力的助手。 Mico的退场,说明微软也承认了这一点。OPC创业者别在角色人设上过度投入,用户真正付费的是把事办成,不是陪聊。

过完全部更新,我把朋友的那个外贸站点的模型路由方案重新看了一遍。

最后改的那一行配置,是把默认端点从某个高价高智商的模型,换成了“缓存命中优先”的DeepSeek端点,触发器设在:当请求的上下文重复度超过阈值时,自动走这个路由。

就一行,其他的都没动。但下次他想再省,只需要调阈值,不用改业务逻辑。

这就是当下这波更新的真实温度:牌桌上的玩家都在往编程和智能体压注,但对OPC创业者来说,真正的护城河不是你押中了哪个模型,而是你的系统能不能随时换掉任何一个模型。

路由、缓存、插件化、权限边界,这几件事现在比模型本身更值得花时间。

模型更新是别人的,架构是自己的。


AI 应用模型选型智能体工作流成本优化

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。