五个岗位换了人

2026-09-19舍予基业来源:公众号「舒毅讲AI」
五个岗位换了人
把一周模型动态整理成一张岗位排班表,讲清 Claude、Qwen、GPT、Kimi、DeepSeek 等模型各自适合顶替哪个岗位、值到哪一步,帮一人公司想明白该把哪件事交给谁。

周六上午,我把这一周的模型动态过了一遍。没做成更新日志,做成了排班表。

一个人开公司,最缺的不是工具,是"岗位"。你既是销售,又是交付,还是运维,最后所有事都堆到你一个人身上。模型能替你分担——前提是你得先想清楚:这个岗,谁在值,值到哪一步。

先摆一条最硬的背景。

9 月 17 日华为全联接大会,汪涛给了一组数:中国每日推理 Token 已经涨到 500 万亿左右,2030 年会到百万万亿级;10 万卡集群里,集群内通信能吃掉训练时间的 40% 以上,而 4K 超节点组成的 10 万卡集群,MFU 比 8 卡服务器版本提升 2.75 倍。

翻译成人话:推理量在暴涨,算力效率在被重新分配,模型单价往下走的动力是真的。这是一个人公司眼下最大的红利窗口。

落地这件事也不是 PPT 了。同期的服贸会上,中通说已有超 3500 台无人配送车在全国 260 多个城市投用,每天送包裹超 870 万件;德勤的人在那儿说,AI 正从点状应用走向平台化、体系化。

下面是这张排班表。

有的岗位这周换了人,有的没换,但职责得重写一遍。

1. Claude:合规岗,开始有分级权限了

Anthropic 上线了生命科学验证计划测试版,此前保密的 Mythos 模型第一次对专业群体解禁——认证科学家可以问过去 Claude 会拒绝的生物学问题。

计划分两种授权:标准使用覆盖多数日常科研,可授权团队、每年续期,适配 Mythos 5.1 等模型;高风险使用会移除所有安全限制,只针对单个研究项目、每六个月续期,目前向 Opus 5 和 Sonnet 5 开放。安全机制是"离线监控 + 共同责任",权限跟申报用途绑定,数据保留 30 天、严格隔离、不用于训练。眼下只对企业版、团队版开放,个人 Pro 和 Max 还不能申请。

这条新闻真正的看点是那套权限设计,不是模型能力本身。

给 OPC 的建议:做垂直行业(医疗、法律、财税)的 AI 产品,客户第一句问的不会是"你模型多强",而是"我的数据去哪了、谁能看、留多久、会不会拿去训练"。先写一页数据说明,比多加十个功能管用。

你自己交付的 agent 也要分级——能改客户数据的,和只能读的,不该共用同一个 key。

2. Qwen:前台兼调度,终于带回滚了

阿里云百炼升级了智能体应用(Agent 1.0),零代码就能把大模型跟外部工具、知识库接起来,核心能力包括知识库(RAG)、插件、MCP、长期记忆;新增版本管理:草稿、线上版本、历史回滚。

模型侧,Qwen3.8 Max/Flash 和开源系列支持多模态输入,得走多模态接口;联网搜索的 agent 策略可以多次调用搜索工具做多轮检索,但要求流式调用,而且每次额外收费。

对一个人的公司,版本管理是救命功能。

你没有 QA,回滚就是你的 QA。具体做法:每次动 prompt 或者知识库,先在百炼里存一版线上快照再改。举个例子——客服 agent 周五改了语气,周一发现它把退款政策答错了,一键回到上一版,比你在对话历史里翻半天快得多。

同属阿里体系还有一条信号:达摩院和浙大一院等机构做的通用医疗影像模型 DAMO RADAR 登上了《科学》,面向腹部增强 CT,一次能识别超 146 种病症。垂直场景里,"能进顶刊"正在变成一种能力背书。做行业的 OPC 要意识到:你选的赛道越窄,越需要这种能拿出去给人看的硬证据。

3. GPT:主理人的位置,不该只坐一个人

有分析者在节目里提到,GPT 6 Astra 最近"全面追上",甚至可能影响到 Anthropic 原本计划在 9 月劳动节后启动的 IPO 节奏。这是个评论,不是官方公告。

但它提醒你一件事:头部模型的位置是有轮换的。

给 coding 开发者的建议:别把架构赌在单一供应商身上。你的资产是 prompt、工作流和评测集,不是那个 API key。

做法很简单,在调用层加一个薄适配层:主模型加一个兜底模型,超时或者报错自动切。例子:批量跑数据清洗时主模型限流,自动切备用,任务不中断。半小时的活,省的是明天的整个晚上。

4. Kimi 和 MiniMax:机动岗,插头不对就是不通

配图

这条来自阿里云百炼的文档细节:联网搜索的 agent 策略明确写着,MiniMax-M2.1、Moonshot-Kimi-K2-Instruct 以及角色扮演类模型不支持。同一份文档里,qwen3.8-max、qwen3.8-flash 等几个快照版本,在 Chat Completions 协议下也不支持这个策略,得改用 Responses API 的 web_search 工具。

这不是谁强谁弱的问题,是插头对不对得上的问题。

选型建议:动手写代码前,先翻一遍接口文档里的"不支持"列表,比看测评榜有用。你要做联网多轮检索的场景,先拿十行脚本把目标模型的调用姿势跑通,再谈效果。

5. Gemini:长文本岗,别把上下文当数据库

据公开资料,Gemini 系列一直把长上下文和多模态作为主线。这条路线对 OPC 的诱惑很大——多少人幻想过"把整个知识库塞进去就完事"。

建议:先去写 20 条评测用例,再决定要不要上 RAG。拿你真实业务的 20 个问题,一条一条问,记录哪几条答错、错在哪。20 条过了再上生产。

上下文长不等于检索准,这是两件事,混在一起会让你在客户面前翻车。

6. DeepSeek:夜班算力岗,负责把成本压下去

DeepSeek 起家就走 MoE 加推理成本控制这条线,这条路线的价值在批处理场景最明显。

建议:把"夜里跑、明天看"的任务交给它。日志归类、批量文案初稿、长文档摘要,这类活不要求秒回,只要求便宜和稳。

在线交互用你最熟的一两个模型,离线批处理用便宜的。一个人公司的毛利,往往就是从这种分工里省出来的。

7. Llama 和 Mistral:离线岗和出海合规岗

据公开资料,Llama 系列的价值一直很明确:权重开放,能私有化部署,能塞进自己的机器;Mistral 则在欧洲合规和高效小模型上站得比较稳。Gemma、Phi

AI 应用一人公司模型选型效率工具

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。