98%的人在用、1%的人买单,AI编程最该被聊透的其实是这件事
上周OpenAI放出一组数据,我先说结论:这组数据比GPT-5.6降不降价重要得多。
他们内部6月有98%的员工在用Codex,但组织订阅者只有17%,个人订阅者不到1%。也就是说,做出这个东西的人自己在天天用,外面的人几乎不掏钱。
这个反差放到桌面上,就是AI编程当下最核心的矛盾:能力过剩,翻译不够。
我最近跟几个做OPC(AI编程相关工具链)的团队聊,大家嘴上都说“模型又强了”“推理又便宜了”,但真正困扰他们的不是模型,是怎么让客户把产品用起来、把账算明白。今天把近期值得聊的几件事串一串,给还在这个方向上找切入点的创业者划几条重点。
一、1%不是天花板,是“能力翻译”的巨大缺口
ChatGPT Work上线这事值得盯着看。OpenAI把Codex改造成面向非工程师的智能体产品,最低订阅档20美元一个月,干的事不是“帮你写代码”,而是让白领通过LLM自主完成多步骤工作。
这个动作的潜台词很直白:光卖代码能力,市场买单率已经到瓶颈了;把代码能力翻译成“业务人员能用的工作流”,才有新的付费人群。
给OPC创业者的启发很具体。别再做“另一个更强的代码助手”,这个品类已经被头部模型和IDE插件占死了。要去做“把推理能力翻译成某个岗位每天能用的工具”。行政、法务、财务、运营,这些人从不觉得自己需要写代码,但他们每天都在做可以被拆成“生成—校验—修改—交付”四步的活儿。
有个做跨境电商的朋友跟我说,他们公司最早上手的AI工具不是任何编程产品,是一个帮运营人员批量生成商品描述、然后自动跑合规检查的小流程。不是说模型多牛,是它正好卡在“不写代码的人也需要多步骤自动化”这个口子上。
这就是ChatGPT Work想抓的那批人。98%的内部使用率说明产品价值是真的,1%的外部买单率说明翻译能力才是真正的瓶颈。谁先把这个缺口填上,谁就踩中了下一波AI编程的落地场景。
二、光会“生成”不够,得会“验证”,这条被清华团队点破了
清华深圳国际研究生院刘厚德、王立博团队开源了一款代码大模型——VeriLoop Coder-E1,中文名“循证”。
这个名字起得实在。它的思路不是让AI闷头写代码、写错了再重来,而是给模型装了一套“循证”机制:每一轮生成的代码都必须经过测试验证,通不过就分析原因、修正错误,然后再验证,直到产出可靠代码。
这条技术路线给OPC创业者提了个醒:下一代AI编程产品的竞争点,不在“生成速度”,在“修正质量”。
我们舍予给一个做企业级RPA的团队做过类似的事。他们的AI会生成自动化脚本,但客户不敢在生产环境跑,怕出错。后来我们把他们的代码产物接入自动化测试流水线,每一版生成之后先跑用例,失败的自动分析原因、给出修复建议,再交给人确认。改动不大,但客户从“试用”到“付费”的转化快了不止一倍。
原因很简单:客户买的不光是“AI写得快”,是“AI写完了我能放心用”。
如果你现在的产品只做代码生成,今天就应该动手补验证链。哪怕先用最简单的测试框架把“生成—验证—修正”这条路跑通,也比空谈多模态、长上下文更能打动客户。
三、Claude Code“降智”翻车:模型不透明,是创业者的活教材
这事在开发者圈子里炸了。有人发现Claude Code从2.1.237版本起,把用户选择的“high”推理程度映射成了原“low”档对应的数值10,而且没写进更新日志。工程师回应说是API服务配置测试,那个数值单独无意义。但很快有科技博主实测指出Opus 5确实明显降级,工程师也承认了表现不稳定。
我没有兴趣站队骂Anthropic,但这事暴露的问题值得每一个做AI编程的人记下:模型作为基础设施,任何不透明都会被用户放大成信任危机。
尤其是OPC创业者,你上面跑的是客户的生产流程,底层模型哪天悄悄变了、推理路径改了,你不说,客户的业务出错了,背锅的是你。
我们的做法是给客户的AI产线里加了一层模型版本记录,底层模型每次升降级、参数调整、供应商切换,都会自动生成变更记录并邮件通知客户。这个事不性感,但出过一次故障之后客户说“有这个东西我才敢继续用”。
技术选型里,版本透明度和可观测性应该是和“推理能力强不强”平级的指标。跑分再漂亮,不能让客户和合作伙伴看清楚你今天用的是什么、为什么变了,信任就无从谈起。
四、降价不是“做不做”的信号,是“怎么算账”的转折点
最近价格动作有点密集。OpenAI 8月21日起把GPT-5.6 Sol的基准价格下调了超过20%,优惠价三个月有效;上月底中端模型降了20%、低成本模型降了80%。谷歌那边Gemini 3.7 Flash同步下调定价,约为上一版本的一半。另外GPT-5.6家族也上了开发智能体Kiro,其中Terra在Terminal-Bench 2.1测试里,在Kiro内完成任务成本下降了约82%。

英伟达那边也在推,Vera Rubin NVL72在智能体工作负载下每兆瓦吞吐量最高提升30倍,每百万token成本降低至35倍。
这些数字合起来看,意思很清楚:推理成本已经低到可以支持“多步骤、长时间运行”的智能体任务了。以前跑一个复杂智能体贵得离谱,现在成本掉下来,才有人敢把业务流程真正交出去。
丰田北美是个很好的参照。他们借助Deep Agents和LangSmith运行50多个生产环境AI智能体,把交付周期从6个月压缩到4天。这个案例的价值不在“技术多前沿”,在于他们认真追踪了AI投资的ROI,用LangSmith把账算清楚了。
给OPC创业者划一条重点:现在最值得做的事,不是给客户看“我的AI多强”,而是帮客户做一张“AI使用成本表”。这个智能体跑一次多少钱,替代一次人工流程省多少时间、折多少钱,跑多少次回本。有了这张表,客户的决策路径从“要不要试试AI”变成“这个月省了多少”,完全两个逻辑。
我们最近在做一个事,就是给客户的每次智能体调用打上成本标签,按部门、按流程、按模型分别汇总。客户老板看到的是“上个月财务部跑了3万次智能体调用,花了4100块,省了大概21个人天”。比任何benchmark都有说服力。
五、端侧芯片的事,别当花边新闻看
小米发了首颗端侧大模型专用AI加速芯片玄戒O100,6nm晶圆级垂直堆叠封装,带宽1.22TB/s,端侧推理速度最高330TPS。这组数据的行业意义是:端侧推理窗口正在打开,未来一部分AI计算不需要全部走云端。
对OPC创业者来说,这条信号暂时不用急着做端侧产品,但要开始留意一个趋势:你的产品架构里,哪些环节未来可以下沉到终端设备上跑,哪些必须留在云端。等端侧生态成熟再反应过来,可能又慢了一拍。
尤其做ToC工具或者IoT相关场景的团队,这条线值得持续跟踪。关键变量不是芯片本身,是端侧模型的分发渠道和开发者工具链什么时候成熟。
最后
把这五条串起来就一句话:AI编程的下半场,不拼模型多强,拼你怎么把“强”翻译成客户看得懂、算得清、信得过的价值。
1%的渗透率不是坏消息,是最大的机会。缺口摆在那里,就看谁能先把翻译的活儿干明白。
本文所引数据与事件截至2026年8月25日,来源于公开报道。AI技术与市场变化较快,相关判断仅供参考,不构成任何投资或创业建议。