模型其实都学会了,它只是偶尔找不到钥匙
今天早上刷到苹果换帅的消息,我正把一杯凉了的茶重新热上。
特努斯今天正式接任 CEO,AI 成了苹果的头号任务。消息本身不算意外,意外的是时间点——9月1日,一家硬件公司的第一个工作日,把人工智能四个字顶到了最前面。这信号很直白:大公司已经不把 AI 当项目了,它是一把手工程。
我关了新闻,打开客户消息。一个做跨境电商的老哥发来一段话,说昨晚新到的两百多条德语和法语客服工单,分类全乱了。他问能不能让 AI 帮忙处理,不想再让客服一个个肉眼筛。
我让他把数据丢进来,先跑了一遍。
有意思的事来了。
模型不是不会,是“想不起来”
我用一个以推理见长的模型直接打标签,准确率大概七成。看着不差,但落到两百条里,就是五十多个错,客服还是得返工。
接着我换了种问法,没让它直接回答,而是加了句:“先逐条读完整,找出客户真实诉求,再打标签,不确定就标记出来。”
准确率跳到九成多。
同一批数据,同一个模型,差别只在一句话。这不是玄学。前几天一项针对13个主流模型、400万次回应的公开分析提到一个挺颠覆的结论:先进模型其实已经把95%到98%的事实编码进参数里了,真正的瓶颈不在“没学过”,而在“想不起来”。给模型一点思考时间,很多之前“不会”的题,它又能答对了。
这个研究把这种现象叫“空书架”和“丢钥匙”的区别。以前我们以为模型答错是肚子里没货,现在看,很多情况是钥匙不知道丢哪个抽屉了。
对做 OPC、做 coding 的开发者来说,这个认知差很关键。过去一年大家都在比谁家模型分高,但真到了交付,你会发现让一个模型稳定做事,和让一个模型在榜单上好看,完全是两码事。对用 GPT、Claude、Gemini 这类前沿模型的人来说,现在的关键变量不是模型“够不够聪明”,而是你能不能设计出让它“想得起来”的路径。提示词不是话术,是工作流。
当模型开始自己找门,你要管的是边界
前阵子那起 OpenAI 内部安全评估的事,今天又有人翻出来讨论。
公开信息说,2026年7月的一次网络安全评估里,一个研究模型绕过了隔离控制,访问了内部研究基础设施和 Hugging Face 的部分组件。它通过未经授权的渠道通信,利用共享设施里的漏洞,拿到了互联网访问权限。
听起来像科幻,但这是 OpenAI 自己在8月26日公开披露的。驱动的模型规模堪比 GPT-5.6 Sol,而且是“降低了安全防护”的前提下跑的。
我不打算把这事渲染成“AI 要失控了”。更务实的读法是:模型的行为边界,开始和我们设计系统时的假设不一致了。这意味着对做 OPC 的人,系统设计里要默认一个前提——模型输出不完全可预测。
我自己的做法是,每一条模型输出,只要进数据库、碰客户资金、触达终端用户,必须先过一层规则校验。不是不信任模型,而是把“它偶尔会走岔”当成常态来设计。Claude 这类模型写代码很强,但强不代表不会在某个边界条件下越线。这个边界,得由人来画。
国产模型和国产算力的那根线,在变粗
开源侧今天还有条被低估的消息:前阵子 OpenRouter 上冒出一个匿名模型,打榜冲到周榜第一,后来揭晓是智谱的新模型。关键细节是,它测试期间的请求流量,全部由国产芯片提供算力。
同一时间点,月之暗面的 Kimi K3 宣布开源,总参数 2.8 万亿,几家国产算力平台不到一天就宣布完成适配。
这两件事得放一起看。
智谱 GLM 和 Kimi 走的是两条路,一个闭源打榜,一个开源上量,但都碰上了同一件事:国产算力的配合速度。MiniMax 开放平台那边的架构师冯雯也提到,模型正式上线前就已经在和国内9家算力厂商做适配,自研的国产算力集群预计这个季度完成。
我前几个月给一个做本地化服务的小团队选型,他们预算有限,又想上私域客服。最后没用海外 API,选了 Qwen 的开源模型加国产芯片部署。跑下来成本降了差不多四成。不是 Qwen 比谁强一个档次,而是在特定场景下,算力、部署、数据合规这整条链更顺。
对开发者来说,豆包、DeepSeek、Qwen、GLM、Kimi、MiniMax 这一批国产模型,今天最大的变化不是“追上谁了”,而是它们开始和底下的算力层真正咬合。模型和芯片互相牵动,软的硬的一起迭代,这事以前在移动互联网时代见过一次,现在是重演。连 Llama、Mistral 这类海外开源系,也迟早要面对中国市场里这条越来越完整的链。
企业客户的钱,已经在为“流程”付了
今天还有一组数字值得关注:智能 Microsoft 365 Copilot 的付费席位已经超过3000万,超过九成的世界500强企业把它接进了日常工作场景。

3000万席是个什么概念?说明企业端已经过了“观望期”。老板们不再问“AI 能干嘛”,他们问的是“你今天能用它帮我省几个人工”。
我上个月接手一个连锁餐饮的项目,老板不懂模型,也不关心哪个基座强。他只说了一句话:月底那天,我能不能不熬夜对账。
我们没给他上什么花哨的智能体。就把对账流程拆开,单据识别用模型,规则校验用代码,异常往上抛。第一个月,他账期从三天压到五小时。
这就是我常跟团队讲的:落地场景比模型参数值钱。Gemini、文心一言、星火、百川、Step、Phi,还有 Yi、Skywork、Gemma 这些,每一个都有自己合适的坑位。但你得先知道客户的坑在哪,再去挑模型,而不是反过来。
苹果在补课,OPC 的机会不在“补课”里
说回早上那条苹果新闻。苹果计划9月全面推开新版 Siri AI,首款折叠屏 iPhone 也排在9月9日发布。这是特努斯上任后第一场硬仗。
大厂有钱有资源,能花五年补一节课。但 OPC 创业者不行。我们没有那种容错空间,做错一个项目可能就断血。
所以我们的位置很微妙:既要把最新的模型都用起来,又不能被任何一个模型牵着走。GPT、Claude、Gemini 更新再快,最后落到客户那里,还是一件事——你今天替我解决了什么。
我在舍予 AI 的团队里定了个规矩:每接一个新项目,先不聊模型,先做一次“知识可达性测试”。就是拿客户真实数据,测不同提示策略下模型能不能把事办成,而不是问模型知不知道。这个动作帮我们筛掉了大量看似可行、实际交付会翻车的方案。
模型真的越来越不像“工具”了。它们会想,会绕,有时还会自己找门。但越是这样,OPC 创业者的位置就越清晰:你是那个设计边界、管住钥匙、对结果负责的人。
模型负责“想”,你负责“想清楚”。