同一个千问,换条协议就不认了——9月这波更新,考的是接口账本

2026-09-22舍予基业来源:公众号「舍予AI智能体」
同一个千问,换条协议就不认了——9月这波更新,考的是接口账本
从9月AI更新看模型调用协议差异、代理化调研、对齐披露与榜单变化,帮一人公司和智能体开发者按任务选端点、算清接口成本,避免走错入口。

老周:

今天周二,照例把摊子铺开。

翻了一圈,新模型发布的动静不大。

这反而是好事。说明这个月大家把劲使在了别的地方。而我今天读完最想说的一句话是:决定你 AI 工作流跑不跑得动的,已经不是模型本身,是你走哪个入口。

一、同一家公司的同一个模型,换个协议就不支持多轮检索了

阿里云百炼更新联网搜索说明:agent 策略能多轮检索并整合内容,但 MiniMax-M2.1、Kimi-K2-Instruct 不支持;qwen3.8-max、qwen3.8-flash 在 Chat Completions 下不支持,须走 Responses API 的 web_search;启用后只返回搜索来源,每次额外收费。

这份文档我看了三遍。

倒不是因为它写得多复杂,而是因为它特别诚实地承认了一件事:同一个模型,通过不同协议调用,能力是不一样的。

qwen3.8-max 在 DashScope 协议下不支持 searchstrategy: agent。但你换成 Responses API、挂上 websearch 工具,同样的模型就能做多轮检索。模型没变,变的是你从哪个门进。

再说 agent 策略本身。它会反复调用搜索、把多轮结果整合完再回答你,听起来很美。但文档里写得很清楚:启用 agent 策略时只支持返回搜索来源,其他联网功能一律不可用,而且每次调用额外收费。

这三句话放到一起,对一人公司就是一道很实际的算术题。

以前我们选模型,想的是"哪个更聪明"。现在你得往前想一步:我这条链路,到底要几轮检索?要不要来源链接?能不能接受每次调用多花一笔?

想清楚这三个问题,你自然会知道该走哪个端点。想不清楚,表现就是"AI 答得挺流畅,但我要的东西一个没给"——然后你以为是模型不行,其实是门走错了。

对我们做智能体的来说,这个坑踩一次就够了。所以舍予给客户做第一支 AI 战队的时候,第一步从来不选模型,而是拿一张纸把任务拆成三列:要不要实时信息、要不要看图看视频、要不要多轮检索。三列的答案直接对应到该用哪个端点、哪个协议。这张表是我们自己被账单教出来的,比任何模型排行榜都好使。

二、Gemini 把"查资料"做成了一个能自己跑的代理

Gemini API 列出两类代理模型:computer use 能"看见"数字屏幕并执行点击、输入、浏览;Deep Research 自主规划多步骤研究,从数百个来源取信息,生成标注出处的互动报告,另有 Deep Research Max。

两条放一起看,方向就出来了:模型正在从"回答你"变成"替你去跑一趟"。

computer use 那种能力,本质上是在替你操作软件。Deep Research 那种,是替你跑完整个调研流程,最后交一份能点开每一条出处的报告。

一人公司最贵的成本从来不是算力,是研究时间。选品、比价、看竞对财报、判断一个供应商靠不靠谱——这些活儿占掉的不是一小时,是一整个下午,而且做完人已经废了。

这里有个关键变量,我得说透:出处标注既是它的卖点,也是责任的位移。

报告里每一条都能点开,意味着你没法再拿"AI 说的"当借口。以前你用 AI 查资料,错了可以怪它;现在它把来源摊在你面前,错在你没点开看。

这不是坏消息。对一人公司来说,这意味着你终于可以把"调研"这项能力外包出去,同时把"判断"这项能力牢牢攥在自己手里。判断力才是你真正卖钱的东西。

三、OpenAI 开始给自己的模型出"体检报告"

OpenAI 9月16日发布模型未对齐报告架构,同步公布六份报告,说明过去六个月观察到的意外或令人关注的模型行为;此前披露零散、频率不理想,新架构意在观察到问题后尽快公布。

这条我看了很久。

它不性感,没有参数,没有跑分。但它可能是这个月最有分量的一条。

过去我们交付一个智能体给客户,客户迟早会问一句:"它会不会瞎来?"

以前这个问题没法答。你知道模型有概率做出你没预期的事,但你说不出它会在什么场景下做、做过几次、有没有人记录。现在至少有了公开台账。建一个新架构,把观察到的未对齐个案尽快披露出来,哪怕还没解释清楚、还没缓解——这本身就是在给自己建信用。

落到落地场景上,这对做 2B 的人有两个直接影响。

第一,交付清单里应该多一项:异常行为记录与回滚机制。不是"我们的 AI 不会出错",而是"它出错的时候,我们知道,也能退回上一步"。这话客户听得进去。

第二,选模型的时候,"有没有对齐披露"正在变成一项可以横向比较的指标。就像你选云服务会看它的可用性公告一样——敢公开发异常的,反而更值得押。

四、榜单上那根向下的箭头

OpenCode 一份模型使用排名:glm-5.3-flash(2.7T,智谱约 25%)、deepseek-v4-pro(628B,约 14%)、gpt-5.6-luna(497B,OpenAI 约 12%)、qwen3.8-flash(282B,-33%)等。

配图

先看总量级的反常识:排在前面被大量调用的,不是参数最大的那几个。2.7T 的 glm-5.3-flash 和 628B 的 deepseek-v4-pro 位置靠前,说明大家用脚投票的时候,看的不是"强不强",是"干我这活划不划算"。

那根 -33% 的箭头,我不敢乱下结论。可能是一次版本切换,可能是价格调整,也可能是某个大客户换了方案。排名的片段说明不了因果。

但有个判断我敢下:模型的排名是给投资人看的,你的清单该由你的任务定。

一人公司最忌讳的就是"跟着热门换模型"。你换一次,提示词要调、工具调用要重测、成本要重算,折腾两天,回到原点。真正该做的是反过来的——先把自己的活儿分成几类,每类钉死一两个模型,然后每季度看一次要不要动。

五、荡开一笔:模型正在离开屏幕

中科院自动化所:磐石·科学基础大模型 2.0 于 7 月 17 日发布,主打通专"双轮驱动";8 月 28 日入选北京市首批 AI 用于科学研究典型案例;其串番茄采摘机器人 8 月 3 日获 2026 智慧农业创新大赛冠军。

这条看起来跟一人公司没什么关系,我还是放进来了。

因为它说明模型在往两个方向走:一是往科研这种深水区走,二是往番茄棚这种物理世界走。真到了这一步,判断标准就从"谁回答得好"变成"谁在具体场景里不出错"。

你的行业如果还没被专用模型认真碰过,那可能就是窗口。等它被碰过了,你连入场的位置都难找。

说回那张账本

今天这五条新闻,我读下来只有一个共同的底色:模型的能力边界,正从"参数"迁移到"接口"和"披露"。

同代模型,协议不同,能力不同;同一份榜单,参数大不代表被用得多;同一件事,有人拿它当玩具,有人拿它当外包出去的调研部。

对一人公司来说,这意味着你的竞争力不在"你用不用 AI",而在"你懂不懂它的门在哪"。

这个月值得做的一件事:把手头所有 AI 流程拿出来,一条一条问——这条链路要不要实时信息、要不要多模态、要不要多轮检索、出错了我怎么退。四个问题答完,你会发现自己省下的不是时间,是一堆本来会白花的钱。

周二就这样。老周,回聊。

(小字提醒)本文所引内容均来自 2026 年 9 月 16 日之前公开的文档、公告与榜单片段,其中模型排名数据仅为片段摘录,不构成完整统计,也不代表任何机构的官方结论;所列模型能力、收费与支持范围可能随平台更新而变化,请在动手接入前以各家最新官方文档为准。涉及具体选型与成本测算的,建议先小流量跑一轮再决定。

AI应用智能体开发API选型一人公司

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。