OPC 开发者的模型工具箱,9条我8月底重新理的清单
OPC 开发者的模型工具箱,9条我8月底重新理的清单
这两天我把 OpenCode 的模型使用排名翻出来重新看了一遍。
不是看热闹,是真金白银的调用数据。看完我只有一个感觉:OPC 创业者选模型这件事,已经不能靠订阅哪个会员来应付了。模型格局每两周就动一次,今天你多花三成推理成本,明天竞品就敢把报价压到你成本线下面。
我把 8 月末这个节点上,做 OPC、做 coding 该重新理的模型工具箱,理成 9 条。有的条目重,有的两三句就够,按需取用。
1. 别跟厂商发布会走,跟 OpenCode 的真实调用数据走
OpenCode 8 月 26 日更新的数据里有个细节,我单独拎出来说一下。
会话平均成本已经落到 $0.0210,单次会话 token 量还在涨,到了 4.5M。模型单价降得快,但开发者把更多活儿塞进去了。缓存比例打到 96%,这是关键变量。
产品选型时,先把 OpenCode 这类公开数据里的真实使用量拉出来看,别只看跑分。
同一个推理任务,选缓存命中率高的模型,单次会话成本能差出一个量级。现在 qwen3.7-plus、minimax-m3、glm-5.3 都在榜单靠前,价格带压得很低。独立开发者省下的每一分钱,都是净利。
2. 开源权重模型往本地挪,Apple 这波硬件把端侧路铺开了
Apple 新发布的 Mac Studio,搭载 M5 Ultra,支持最高 512GB 统一内存、1.2TB/s 内存带宽,官方说法是可以完全在设备端运行大型 LLM。四台集群还能拿到 3 倍分布式推理速度。还有首款 2nm 芯片 M6,多线程性能比 M5 提升 1.2 倍。
这不是给果粉看的参数。
对 coding 开发者来说,把含敏感逻辑的代码辅助任务尽量往本地开源模型挪。你自己写的核心模块,不该过第三方 API。OpenWorker 新版就在做这件事:harness 完全开源,支持本地跑开源权重模型,安全团队可以审计有没有后门。
我的判断:端侧推理会变成 OPC 的一个安全选项,不只是省钱选项。
3. Claude 把记忆统一到 Cowork,这是协作型 Agent 的信号
Claude 这条我单独说。聊天和 Claude Cowork 的记忆统一了,用户在任何一边都能调用此前积累的上下文,Memory 设置里按主题查看、编辑、删除。健康、信仰这类敏感话题默认不存,识别号、犯罪记录这些始终不保存。
产品层面看,Anthropic 在把 Claude 往「长期协作者」推,不是「一次性问答工具」。
给 coding 开发者的启发:做需要多轮上下文沉淀的开发工具,记忆管理的颗粒度和可编辑性,是用户愿不愿意长期用的分水岭。上下文别堆成一团,让用户翻不动也改不了。
4. OpenAI 在给「超级个体」补管理后台,这不是巧合
OpenAI 给 ChatGPT Work 和 Codex 推出了 Admin 插件。管理员可以在单一对话里查看工作区活动、管理成员权限、调整用量、审批支出。官方数据,这套内部工作流已经解决了约 45% 的工单量。
我读到这条时,脑子里接上 CCF YOCSEF 总部 8 月 25 日那个论坛主题:超级个体的崛起,如何改变组织边界与社会治理?
结论很清楚:一个人调度多个 AI Agent 去完成产品、研发、营销、客服,企业边界不再由人数界定,而由能力、责任和风险链条重新界定。Admin 插件表面是给管理员用,实际是在给「一个人带一堆 Agent」的形态补基础设施。
OPC 的拐点不在模型再强多少,在管理成本能不能降下来。
5. 推理芯片战开打,你该做的是重新签一份调用合同
OpenAI 发布了自研推理芯片 Jalapeño。官方口径是更快、更节能、更高吞吐量、更低延迟。
这件事的影响不在今天,在未来 6 个月的推理价格曲线。OpenAI 自己下场做芯片,对推理成本的掌控力会更强,对外 API 定价弹性也会更大。
如果你现在按量调用 API,别一次签死年框。留出三个月一谈的空间。等芯片带来的价格下调传导到 API 层,你的报价往下走,毛利反而可能更厚。
6. Google 把垂直预测模型开源,通用之外的落地场景在变清晰
Google AI 发了 WeatherNext 气旋预测模型,能同时预测风暴路径、强度和规模。2025 飓风季实战里,它提前五天预测飓风 Melissa 在牙买加五级登陆,是美国国家飓风中心第一次实时用 AI 模型。代码和权重已开源。

对 OPC 的启发就一句:别再只盯着通用大模型找场景。
气象、农业、供应链这类有明确时序数据、明确预测目标的垂直问题,恰恰是小团队能扎进去的地方。CCF YOCSEF 哈尔滨 8 月 21 日那场论坛,聊的就是大数据和大模型怎么成为农业新质生产力。这类方向不缺需求,缺的是能往下钻的人。
7. 小模型和「够用就好」路线,正在吃掉一批中型项目的预算
榜单上几个新面孔,muse-spark-1.2-contributor、nemotron-3-ultra、hy3、mimo-v2.5-pro,有的新上榜,有的增长很猛。
开发者正在做组合:主力模型干重活,小模型干高频低难度的活。好处是成本/会话能压到 $0.02 附近,缓存命中率还高。
把产品里 80% 的低难度调用按「够用就好」拆出来,接小模型。剩下的重活再走大模型。这是成本结构优化,不是抠门。
8. 超级个体的真正门槛,不是模型,是责任边界
回到 CCF YOCSEF 总部那个论坛。里面有一句我很认同:能力越集中于个人,认责越难。
这句话很冷,但点在要害上。
OPC 状态下,你一个人产出的东西出了问题,责任链条就断在你这儿。AI Agent 犯的每个错,最后签字的是你。所以做 OPC 不是把活儿都交给 Agent,而是自己要留一份可审计的过程。OpenWorker 这种开源 harness 之所以值得看一眼,就因为它把「无后门、可审计」当成卖点。以后「可审计性」会从加分项变成准入门槛。
9. 舍予 AI 智能体这条,我说句实话
我们在舍予 AI 智能体内部有一个认知:老板的第一支 AI 战队,不是配一堆模型 API,而是帮他理清「哪些活该交给 Agent、哪些活必须留人」。
我自己在 OpenCode 上观察到的数据,跟 8 月 25-26 日这版排名基本一致:缓存做得好的团队,会话成本可以压到 4.5M token 只要两美分左右。这数字放三个月前,很多人不信。
最后说一句:别把模型选型当信仰。它在变,工具箱就得跟着变。今天这份清单适合 8 月末的窗口期。下个月,不知道哪个模型又会跳出来。