豆包砍了对话团队,书生-S2 给了模型一张"记忆卡"

2026-09-23舍予基业来源:公众号「舍予AI智能体」
豆包砍了对话团队,书生-S2 给了模型一张"记忆卡"
从豆包收缩对话团队、书生-S2可插拔记忆等新闻切入,说明通用对话正在贬值、垂直行业能力在升值,并给出小团队写「记忆卡」、抽薄模型层、先试最贵电话的具体落地做法。

这几天后台被问得最多的,不是哪家模型又跑分第一。是一个很实在的焦虑:通用对话这条船,是不是要沉了。

先给结论——船没沉,是码头在换。

这周几条新闻摆在一起看,线索挺清楚:"什么都能聊"在贬值,"只懂你这行"在升值。

"我那个什么都能聊的助手,还要不要接着做?"

先把两条摆一起。

据9月22日科技媒体的当日大新闻汇总,豆包开始收缩对话团队。
同期,微信内测"小微AI社交":两个AI助手先行沟通,用户最后拍板决策。

第一条不用过度解读。一个团队调整,证明不了什么。

但把第二条放旁边,味道就出来了。

微信那个内测,真正的信号不是"AI帮你聊天",是AI开始代表某一方的立场去谈。两个助手在中间来回,人只在最后点头。

这意味着什么?"会聊天"不值钱了。值钱的是你替我守的那条线——报价不能让到哪、交期最多几天、哪些话打死不能说。

通用助手的问题从来不是能力不够,是它没有立场。它不属于任何人,所以它替谁都不划算。

一人公司尤其要想清楚这件事。你拼不过大厂的通用对话,但你可以做"只懂建材外贸退货规则的那一个",做"只懂宠物殡葬流程的那一个"。窄,才有岗位。宽,只是个功能。

功能是按次计费的,岗位是可以按月收钱的。

"书生-S2 那个'可插拔记忆',听起来很学术,跟我三个人小团队有啥关系?"

关系大了。这是本周最值得关注的一条技术线。

9月13日,上海人工智能实验室在浦江创新论坛发布书生-S2,397B参数开源,通用能力居开源第一梯队,数学推理达到 Gemini 3.1 Pro 等顶尖闭源模型水平,并与昇腾生态做了协同优化。
关键设计是 Memory Decoder:专业领域知识通过独立记忆模块学习,不修改主模型参数就能接入。生物领域实测,挂上 Intern-MemDec-4B 后,Biology-Instructions 平均分从 56.92 提到 60.32,接近跨代提升的幅度。

翻译成人话:以前你想把行业知识塞进模型,路只有一条——微调。贵、慢。行业规则一变,你得重来一遍,还可能把模型原有的通用能力搞坏。

现在模型变成了"基座+插件",专业知识这块可以像插硬盘一样换。

这条对我们的启发,不在于书生-S2 本身好不好用,而在于你的护城河该放哪儿

我们自己给客户搭"第一支AI战队"时有个土规矩:动模型之前,先花两天写一份"记忆卡"。

卡上不写技术,只写人话——客户这行的行话怎么讲、报价的底线在哪儿、哪三句话不能承诺、退货口径怎么定、老客户和新客户的话术差在哪。

这份卡是客户自己脑子里掏出来的,网上搜不到。写完再选模型。Claude 也好、DeepSeek 也好、Qwen 也好,谁便宜谁稳定用谁。

为什么这么做?模型三个月一换代,客户脑子里的规矩,三年不变。把资产放在记忆卡上,不放在模型ID上,这才是小团队扛得住迭代的方式。

书生-S2 这次把"可插拔记忆"做进开源基座,等于告诉我们:这个思路,方向是对的。

顺带一提,阿里千问升级版蓄势待发,平头哥新一代AI芯片"真武V900"算力约为上一代3倍。国内基座这一侧的供给,还在加码。

"Kimi K3 上了 Amazon Bedrock,我们这种小团队是不是也得琢磨出海、上别人的货架?"

先看新闻。

9月21日,月之暗面确认,AWS 旗下 Amazon Bedrock 接入开源大模型 Kimi K3,全球企业开发者可直接调用,此前传言的海外云厂商收入分成合作正式落地。Bedrock 也是 Anthropic、OpenAI 重要的云渠道。
同期,Mistral AI 完成30亿欧元融资,估值升至213亿欧元,三星电子领投。
Anthropic 发布 Claude Opus 5.5,在多数企业任务上表现接近 Fable 5.1,成本显著低于 Opus 5,未来几周还将扩充 Sonnet 和 Haiku。

配图

这几条放一起,说的是同一件事:渠道和价格,正在同时重排。

我的建议很直接:绝大多数一人公司不用急着出海。但必须做一件事——别把业务焊死在一个模型上

从Bedrock到各家云市场,模型正在变成标准货架上的商品。商品的特点是什么?会被比价、会换供应商、会调价、会下架。你今天调的那个接口,明年可能涨价,也可能改名。

如果你的产品逻辑写在提示词里、写死在某个模型ID上,那你不是在做产品,是在替别人扛库存。

做法很朴素:调模型的地方抽薄薄一层,配置化。切模型的时候改一行配置,不改业务代码。这层东西不性感,但它是你明年还活着的保险。

关键变量从来不是"谁最强",是"谁在明年这个时候,还是这个价"。

"道理都懂,我一个人,这周先干哪件?"

给你两个立刻能动的地方。

OpenAI 将全双工语音模型 GPT-Live-1 引入 API,语音会话定价每分钟 0.05 美元,可同时听与说,适用于电话客服等场景。
另一边,Grok 4.7 发布;GPT-6 Astra 需求超预期,OpenAI 临时暂停每月200美元 Pro 订阅的新用户注册。
而 AI 编程公司 Cognition AI 完成20亿美元 E 轮融资,估值480亿美元,年化收入从4.92亿美元增至近9亿美元。

语音这条,是本周最容易被低估的落地场景。每分钟5美分,意味着"一通电话值多少钱"第一次能被老老实实算出来。电话回访、预约确认、到期提醒这类活,过去不敢自动化,是因为算不清账。现在能算了。

但别一上来就全量替换。先挑最贵的那一通电话试。哪个客户的单子最大、哪种回访最影响复购,就先做那一类。两周就能看出账是不是真的能算平。

第二条,Cognition 那条融资,资本投的不是"AI能写代码",是"AI写代码能收到钱"。同样的逻辑压到你头上:你手上哪个环节,客户是愿意按月付钱的?找到它,把你那份"记忆卡"往上贴。

算力在紧、钱在往能算清的活上走——这就是当前的风向。

<small>本文所引信息均来自公开报道整理,仅为行业观察,不构成模型选型或投资建议。各模型价格、上线时间与可用区域请以官方文档为准;仍在使用书生-S2-Preview-397B 的朋友注意,该版本将于2026年10月31日下线,记得把调用名改过来。企业接入与数据处理请自行评估合规与安全边界。</small>

AI应用一人公司垂直行业门店经营

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。