GPT-6.1把ChatGPT变成智能体平台那天,我盯着Codex云端跑了三小时——这周大模型圈值得开发者重新排一遍优先级
从DevDay说起:GPT-6.1 Sol与Agents API,把"聊天框"改
DevDay 那晚我做了件挺分裂的事:一边盯着直播看 OpenAI 往外丢东西,一边让 Codex 在云端跑一个重构任务。三小时后直播结束,任务也跑完了,我才反应过来——我盯了三年的那个"聊天框",已经不是聊天框了。
OpenAI 这次一口气放了二十多项更新,但真正值得开发者重排优先级的,就三件事:GPT-6.1 Sol、Ultrafast、Agents API(外加云端 Codex)。
先看模型分层。GPT-6.1 Sol 扛旗舰位置,Ultrafast 单独做成速度档——Codex 里最高 8 倍加速,300 tokens/秒,API 里 6 倍。这组数字有意思的地方不在"快",而在它被拆出来单独定价。当生成速度从几十 token/秒跳到 300,一批原本不成立的场景就成立了:整段函数实时补全、agent 边推理边改文件、把代码审查塞进每一次 CI 提交。延迟是 agent 落地最硬的关键变量,OpenAI 清楚得很,所以它把速度当成一层产品能力来卖。
然后是 Agents API 和云端 Codex。Codex 全面支持云端离线运行,这件事的分量比发布会的掌声大得多——"AI 写代码"从你本地的一个会话,变成了可以挂着跑、可以排队、可以并行的真实工作负载。发布清单里还有一条低至 150 毫秒响应的多模态决策 API,这个延迟区间,是冲着实时交互和嵌入式场景去的,不是给人慢慢聊天用的。
还有 Dots——一个 24/7 持续推进工作的常驻智能体形态;ChatGPT Space 把聊天、文件、简报、任务收进同一个工作空间;Plugins 和 Marketplace 补生态。再叠加 ChatGPT 登录集成,你可以在 Notion 这类第三方工具里直接消耗 ChatGPT 额度,以及那个 500 美元/月的新 Pro 档。
这几条线拼起来,指向很清楚:ChatGPT 正从"你问它答"的工具,变成"你派它干活"的平台。模型、速度、代理、工作空间、分发渠道,一次补齐。
对开发者来说,关键变量换了。过去我们比谁答得准,现在要问谁能把活干完——任务编排、上下文压缩、失败重试、成本和延迟的平衡,这些才是真活儿。一个能自己跑三小时的 Codex,和一个只在你打字时才存在的对话框,是两种完全不同的生产资料。
这也是我最近跟企业老板聊得最多的一点:模型谁都能调,难的是把一堆 agent 编成一支能接手真实业务的队伍——所谓"老板的第一支 AI 战队",拼的从来不是单点能力,而是调度与流程。DevDay 把这层需求从"可选"推成了"必须"。
如果你还在用老眼光评估 ChatGPT,这周该把优先级表重排一遍了。
Claude的九月31项更新,藏着一个被低估的信号:Agent开始学会"自己管上
OpenAI那边一口气砸下二十多项更新,所有人都在聊入口。Anthropic这边安静得多——九月Claude Platform推了31项更新,没有发布会,没有demo视频,只有一页changelog。
把31项翻完,我看到的信号只有一个:Agent开始学会"自己管上"。
先说两条最容易被当成"工程细节"划过去的更新。9月14日,Claude上线了可程式化压缩对话的beta——由应用自己决定什么时候整理历史内容,保留近期对话,以及符合条件的思考状态。9月22日,工具可以在对话途中定义,工具和参数结构能动态加进去。
单看都很底层。放在一起,指向的是同一件事:上下文从"你喂多少它吃多少",变成"它自己决定留什么、扔什么";工具从"开工前配齐",变成"跑到一半缺什么补什么"。
过去一年,大家比的是模型能不能调用工具。可真正把Agent扔进生产环境的人知道,卡点从来不在这。跑十分钟很惊艳,跑三小时就开始丢线索、烧token,然后在某个环节悄悄跑偏。你让它写代码、查文档、改配置、等CI,每一步都对,合起来就是不对——因为它不记得自己为什么走到这儿。
这31项里,模型能力、上下文管理、成本控制、人工监督是被放在一条线上的。这个排序值得关注。它没有先秀能力再补运维,而是把"长时间执行的Agent工作流"直接当作产品设计的核心。
这跟OpenAI形成了有意思的对照。GPT-6.1 Sol、Agents API、云端Codex,是把入口铺开,让所有人都能上手做Agent;Anthropic反过来,在解决"上手之后怎么办"。两条线不冲突,但优先级不一样。
我更在意后者。落地的关键变量不是智力天花板,是可靠性下限。上个月盯着Codex在云端跑了三个小时,最后让我紧张的,不是它写错代码,是我不知道它还剩下多少上下文预算、下一步会不会忘掉前面定过的约束。
我们给企业搭东西时,老板问的第一句往往不是"哪个模型最强",而是"它跑起来谁盯着、一个月烧多少钱"。舍予AI智能体的定位是老板的第一支AI战队——真要让这支战队自己上班,底层就得有这套自我管理:自己压上下文,自己找工具,自己把成本框住,关键时刻把人叫回来。
Anthropic不擅长讲故事。但这次它讲的方向是对的。
Agent的下一场竞争,不在能不能干活,在能不能一直干下去。
豆包、Qwen、DeepSeek、Kimi、GLM、MiniMax:国产模型的"

国内这六家,我越来越不愿意一个个排座次。
豆包、Qwen、DeepSeek、Kimi、GLM、MiniMax——过去一年大家默认的比法是"谁更强",但这个比法本身已经落后了。把这一周海内外放在一起看,真正的变化是:GPT-6.1 Sol 和 Agents API 把"智能体平台"做成了入口,Codex 能上云、Ultrafast 把速度分层;Claude 那 31 项更新几乎全在解决"长时间跑的 Agent 怎么被管住";Gemini 4 Argon 往长周期深度推理上压。
海外在定义工作的形态。国内在做另一件同样重要、但不太上头条的事:把这件事的单位成本,打到能规模化的位置。
这才是国产模型这一轮的关键变量。
我不打算在这里给六家贴"谁适合干什么"的标签,因为答案取决于你自己的场景——任务是不是高频、结构化、容错率高;上下文有多长;一次调用等三秒你能不能忍。这些问题每周都在变。
但有一件事我可以确定:把国产模型当成"海外模型的备胎",是这一轮最贵的认知错误。
真实能跑起来的落地场景,通常长这样——贵的那一档负责拆解、规划和难判断,便宜快的那一档负责执行、批量和重复。前者是 GPT-6.1 Sol、Claude、Gemini 4 这类前沿模型,后者就是国内这几家。这不是降级,是分工。你不可能让一台 F1 赛车去送外卖,也不该让送外卖的车去跑排位。
我们自己给客户交付的时候,舍予AI智能体的定位是"老板的第一支 AI 战队"。这个说法背后是一套很朴素的判断:老板要的从来不是某一个最强模型,而是一支各司其职、成本可控、随时能换人的队伍。
所以这周我的建议只有三条,都很具体:
- 用你自己的任务跑一次实测。挑 20 条真实请求,同时打两到三个模型,记延迟、单次成本和失败率。榜单给不了你这个数字。
- 把工作流拆成"可并行"和"必须串行"两堆。可并行的部分大胆用便宜快的模型跑批,串行的关键节点留给前沿模型。省下来的钱,够你多试几个场景。
- 架构上留一个多模型入口。VS Code 这类工具已经把多模型编排做进了日常工作流,别把业务焊死在某一家 API 上——这一轮迭代太快,任何一家的价格和能力曲线,三个月后都不是今天的样子。
回头看整周:OpenAI 把 ChatGPT 变成智能体平台,Claude 让 Agent 学会自己管自己,Gemini 往长周期推理走,国内六家把成本曲线继续往下压。这些拼图指向同一件事——模型会越来越像水电。
真正值得开发者重排的,从来不是六个模型谁排第一,而是你打算把多少工作,交给机器去跑。