把模型揣进兜里:7B、一张3090,还有一个小老板的算盘

2026-09-13舍予基业来源:公众号「舍予AI智能体」
把模型揣进兜里:7B、一张3090,还有一个小老板的算盘
从百川7B开源与3090微调切入,结合图像编辑、算力短缺和模型榜单洗牌,说明小团队应把固定流程固化成本地小模型,别押注单一模型。

周日晚上,孩子睡了,我泡了杯茶,把这周的模型新闻清单从头翻到尾。

翻到一半停下了。不是被哪个榜单数字吓住——那玩意儿每周都在换人坐庄——是被一句特别旧的话绊了一下。

有人在梳理"百模大战"的来路,写到6月15日那天,百川智能把Baichuan-7B的模型文件、配置和代码直接挂到了GitHub上。同一天,就有外部开发者开始讨论:怎么在RTX 3090这种高端消费级显卡上继续微调它。

就这一句,我看了两遍。

一张万把块钱的卡,一个能被个人改动的模型。这事儿放在满屏"万亿参数""榜一易主"的新闻里,安静得像没发生过。

一、不是每张牌都得是最贵的那张

先把那条线捋清楚。6月2日,一场公开活动上,北京师范大学新闻传播学院院长张洪忠说,"国内现在是'百模大战'"。到6月13日,360智脑正式发布,"正式加入'百模大战'"这句话已经能直接出现在权威新闻的标题里。

那阵子所有人都在比谁的参数大、谁的榜单高,"炉火"也好,"百模"也好。而百川那条线的标题叫——《基础大模型其实不需要那么多》。

这句话放到今天看,味道更长了。

对OPC创业者来说,这里的机会不在"我也训一个模型",那是有钱有卡的人干的事。机会在于:当7B这个量级的模型能被一张消费级显卡微调,就意味着某一段业务流程可以从"租"变成"有"。

你每天要处理的那些固定动作——客户咨询的分类,一批票据的字段抽取,某个行业术语的翻译习惯——不再需要每次去调云端接口、按token付费。固化成一个属于你自己的小模型,跑在你自己的机器上就行。

大模型负责"什么都懂",小模型负责"只干这一件"。后者的单价,可以低到接近电费。

二、图像2.5里藏着的那半个下午

再看OpenAI这条。ChatGPT图像2.5上线,官方给的几个数字:每周用户通过ChatGPT图像和API生成超过30亿张图;和图像2.0相比,生成延迟最多减少50%。

我更在意的是它强调的三件事。

一是多轮编辑的一致性——你改到第八版,第一版定下的主体和风格还在;二是针对性编辑——只改你指定的那部分,其余细节、构图、品牌调性不动;三是新功能Sketch,直接在ChatGPT里画个草图当参考,输入@Sketch就能用,还有海报、商品这类模板可以直接起手。API这边给了两个新模型,GPT-Image-2.5 Flare主打质量、编辑和速度,Sunburst精度更高、生成更慢。

"只改指定部分"这六个字,听着平淡,其实是很多小团队真正卡住的地方。

做过电商详情页的都知道,客户一句"logo再往左一点",之前的死法是:整张重做。重做一次十分钟,改五轮就是一下午。

给OPC的一句话:图像类工具的价值,接下来不在"能不能生成",而在"改一版要多少钱、多少时间"。你去盘一下自己手里那些反复返工的素材——商品图、菜单、朋友圈海报、投标用的示意图——哪一个能靠"只改一处"省下半天,那半天就是你多出来跑客户的时间。

三、上游还在喊缺,你的成本假设该改了

第三条来自9月10日的2026中国联通合作伙伴大会。沐曦股份创始人陈维良在演讲里说得很直白:从需求侧来说,现在还有极大的算力短缺。

同一周,9月9日到11日在第27届中国国际光电博览会上,思瑞浦拿出了一整套面向光通信的方案:覆盖800G/1.6T可插拔高速光模块、适配硅光和EML两条技术路线,还有CPO/NPO共封装光学、ELSFP外置光源的量产级配套,以及OCS全光交换成套控制和相干光模块、EDFA光放大的全链路方案。其中CPO/NPO和ELSFP这两套完整方案,均已完成客户验证,帮客户压缩研发周期。

普通人看这条会觉得跟自己没关系。但把它和上一条"算力短缺"摆在一起看,逻辑就很清楚了:产业最上游的钱和产能,正在往"更快、更密的连接"上砸,而且已经走到客户验证这一步。

说明什么?说明单位算力的紧张,大概率不是一两个季度的事。

别把商业模型建立在"token会一直更便宜"这个假设上。

我们做舍予AI智能体(老板的第一支AI战队)落地时,有个雷打不动的第一步:先跟老板把一天的动作数一遍,然后分三堆。

  • 每天重复几十次、答案基本固定的,交给模板和本地跑的小模型,不联网也不花钱;
  • 每周几次、需要点判断的,交给大模型;
  • 真要老板自己拍板的,谁也不交。

这个"数一遍"的动作,比选哪家模型重要得多。选错了模型,下个月换就行;没数过动作,你会一直用最贵的模型干最便宜的活。

四、榜前三周换一轮,所以别押单一模型

最后一条是我每周都会看的调用量。

配图

OpenRouter的数据测算,8月31日到9月6日这一周,全球大语言模型总调用量115万亿token,周比增长1.77%;中国大模型的周调用量连续十九周超过美国,保持全球第一。

单看模型排名,腾讯混元Hy4 preview冲到榜首,单周14.7万亿token,周比暴增379%。而前一周还排第三的小米MiMo-V2.5、排第九的Google Gemini 3.7 Flash,最新一周都掉出了前面的位置。全球前五里,四款来自中国。

两周,两个位置易主。

给OPC的一句话:调用量榜单现在是一周一次的洗牌。你唯一不该做的事,就是把身家押在某一个模型上。

具体怎么做?把模型调用封装成薄薄一层接口,业务逻辑写在上面,模型参数放在下面当零件。今天这个便宜用这个,明天那个更强换那个,换的时候你只改一行配置,不改整个产品。

这不是技术洁癖,这是保命。

说回"兜里"这两个字

写到这里,茶凉了。

我把这条新闻线索重新看了一遍:一边是百模大战里那些必须最大的牌,一边是有人在6月15日把7B的文件扔上GitHub,当天就有人在3090上试它。

两条线,两种活法。

大公司得往大里做,那是他们的赛道。一个小老板、一个人的公司,恰恰相反——你需要的不是更强的模型,是更近的模型:近到跑在你自己的机器上,近到你改了哪一行你自己清楚,近到不用算这次调用花了多少钱。

模型是租的还是买的不重要,重要的是哪一段活儿,你能把它揣进兜里。

下周同一时间,我接着给你翻新闻。

——你的同行

<small>小字提醒:本文涉及的事件

AI应用小模型落地门店经营OPC创业

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。