为了教机器人端个盘子,有人一天重复了一百遍
在华东某个机器人训练场里,一个“00后”训练师正对着一只机械臂反复说:“拿起桌上浅蓝色盘子,放在白色托盘上。”
她一天要重复这个动作上百次。
抓取、平移、放下。再做一遍。再录一条。仅这一个零件分拣任务,训练场已经攒了三四万条数据。
这事听着跟OPC没什么关系。但我在看这条消息的时候,脑子里冒出来的第一个念头是:机器人做这么简单的动作,都要喂几万条高质量数据;你的店、你的公司、你天天在做的重复决策,给AI喂过几条?
这个问题,可能比“现在哪个模型最强”更值得琢磨。
中国信通院那份《具身智能训练场研究报告》给了一个数字:截至2026年6月底,全国建成启用的具身智能训练场超过70家,在建或规划46家。
我去翻了翻《中国新闻周刊》对世界机器人大会的报道,有个细节很说明问题。以前机器人厂商参展,比的是跳多高、跑多快。今年变了,焦点让位给了“教机器人干活”的数据采集展位。
一批不造整机、不训大模型、只做数据基础设施的公司第一次集中亮相。北京人形机器人创新中心的夏华林说得挺直白:“现在的具身智能机器人相当于十年前的自动驾驶。”
意思是,真正的瓶颈不在算法,在数据。
北京那个全国规模最大的人形机器人训练中心,150台真机、40种不同构型的机器人、近百台无本体虚拟设备同步采集。夏华林管这叫“矩阵式采集”。数据采集组组长付金珑说了一个变化:以前机器夹取物体,没夹住可以重试一两次,只要最终完成就算合格数据。现在不行了。动作必须一次成功、流畅自然,稍有迟疑或抖动,整条视频作废。
看到这儿我就笑了。这不就是老板们常说的话吗?“以前做错了还能改,现在客户根本不给你第二次机会。”
机器人行业正在从“能不能动”进化到“动得对不对”。这中间差出来的东西,叫高质量数据。
有一个数据挺有冲击力:一家对数据质量要求极高的客户,去年在全国考察一圈,最后选回北京这个训练中心。今年不光复购,数据采购量翻了10倍以上。
10倍。复购。
这说明什么?说明高质量数据不是一锤子买卖,用过的人会持续加码。这对做AI落地服务的团队来说,是一个相当明确的信号。
再看模型层。阿里云帮助文档里更新的信息:通义千问团队的Qwen3.5已经在2026年2月发布,397B-A17B,门控Delta网络加稀疏MoE,在推理、编程、智能体、视觉理解上全面超过前代。Qwen3-VL也把视觉智能体操作图形界面、视觉编程这些能力往前推了一大步。
智谱GLM-5.1也在4月中旬上线,744B参数,200K上下文,主攻长程任务。
这些数字翻译成一句人话:大模型做“脑力活”的能力,月月在涨。
但问题恰恰就在这儿。
我在舍予AI智能体服务一群OPC老板的过程中,反复看到同一种错位:老板们焦虑的是“我是不是该换个更强的模型”,但真正卡脖子的,往往是“我这边根本没有可用的业务数据”。
有一个做餐饮连锁的客户,最开始来找我们,是听说AI能自动回复差评。我们没先给他接模型,先花了两周时间,把他过去两年的进货单、排班表、门店巡检照片、客户投诉记录逐条清洗、打标、入库。
这事极其枯燥。比“00后”训练师录机械臂还枯燥。
但三个月后,他那个后台已经能做一件让我都有点意外的事:某家门店的食材损耗率连续三天异常,系统能自动比对进货量和出餐量,再结合当天天气和商圈人流,判断出是后厨备餐流程出了问题,而不是采购过量。
这个能力,不是某个旗舰模型自带的开箱技能。它是被这个老板自己两年经营数据“喂”出来的。
所以你问我,今天这堆大模型新闻里,最值得OPC关注的是什么?
我的答案不是哪个模型又登顶了,是DeepSeek那条看起来最不起眼的调整:从2026年8月23日起,周末全天统一按低谷价计费。
这条新闻放在机器人训练场和GLM-5.1旁边,太容易划过去了。但它的信号其实很清晰:模型能力趋于同质化之后,算力成本开始按“闲时”定价。这意味着,过去只有大厂玩得起的批量数据清洗、私有知识库构建、高频调用,现在一个OPC也能负担。
腾讯混元3上线第一周,Token调用量比上一代涨了68倍。日均词元调用量突破500万亿,中国大模型站稳第一梯队。
这些数字都在说同一件事:用得起的门槛在塌,用得好的门槛在升。

机器人训练场那条新闻里有个细节我印象很深。数据采集负责人郑鑫说:“机器人做什么,取决于喂给它什么数据。用旁观视角的数据训练,看到的是动作外在形态,却无法感知执行者的内在决策。”
我把这句话改一下,送给正在观望AI的OPC:
你的AI能做什么,取决于你喂给它什么数据。只喂通用公开知识,它永远只能给你“看起来对”的答案;把你自己生意里隐藏的决策逻辑喂进去,它才开始替你把活儿干了。
模型不用追最新。数据必须从今天开始攒。
合肥那个数据采集预训练场,83台机器人,在30多个复刻场景里天天实训。老板们回自己店里看看,你的“训练场”在哪?
可能就是你手机相册里拍了从没整理的门店照片。可能就是财务电脑里几十个合并了又拆开、拆开又合并的Excel。可能就是从没被记录下来的“老张来拿货先赊着”。
这些都是数据。但没经过清洗、打标、入库的数据,就像那个“00后”训练师录废的视频:内容在,价值为负。
写到这儿,我其实想给所有OPC一个特别具体的建议。
这周别急着评测新模型。你花一个小时,把自己生意里“每天都在重复、但从来没人记录”的那个环节写下来。
是催货款的话术?是排班的逻辑?是供应商砍价的套路?是判断一个客户值不值得接着跟的直觉?
写下来。先写下来。
模型的事情交给模型厂商去卷。你唯一要想清楚的,是当模型能力越来越不是门槛的时候,你手里有没有别人拿不走的数据资产。
这不是讲道理。这是机器人训练场用了过去一年时间,花了几十万条数据验证出来的事。
本文提及的模型版本、参数及发布时间均来自公开资料及品牌方文档,截至2026年8月30日。模型迭代快,具体能力与计费以各平台官方最新说明为准。文中客户案例已做脱敏处理,不构成对任何产品效果的承诺。