OpenAI DevDay砸出GPT-6.1和全天候智能体:Codex变成常驻员工,订阅用户却没有席位

OpenAI把2026年的DevDay办成了一场发布会。10月第一场开发者大会,GPT-6.1、Codex规模化开放、全天候智能体三张牌一起打出。整场活动的信息量不小,方向却出奇一致:模型不再只是回答问题的聊天框,公司要的是能长时间自己干活的智能体。

GPT-6.1:三档分层,Agent能力摆在第一位

GPT-6.1没有走单一旗舰路线,直接分成三档:GPT-6.1、GPT-6.1 Pro、GPT-6.1 mini。参考此前GPT-5.6的定价体系(Sol、Terra、Luna三档,API编程成本最高差5倍),这次的分层思路延续了旗舰主打推理、小模型主打性价比的策略。

变化在能力重心。GPT-5.6 Sol把视觉检测mAP从13.8拉到46.2,重心放在感知端。GPT-6.1把重心挪到了Agent执行:多步工具调用、长时间任务规划、出错后自主恢复。行业媒体的解读很一致——OpenAI在为接下来的智能体产品铺底座。

OSWorld这个基准最能说明问题。此前GPT-6 Astra拿过72.6%的成绩登顶计算机操作榜,Claude Computer Use在GA时跑出83.4%。GPT-6.1的目标就是在这类真实电脑操作评测上继续往上顶。模型比的是谁能真正替人操作软件,而不是谁能把对话聊得更漂亮。

Codex规模化开放:智能体站上了DevDay的C位

Codex在这个DevDay上获得了最大篇幅。OpenAI把它定位成规模化开放的核心工程产品,用户可以同时派出多个智能体并行处理任务,每个智能体跑在不同的沙箱环境里,互不干扰。

这条产品线最近几个月一直在加速。Anthropic推出了Claude Code Projects,一个常驻对话指挥多个编程Agent;GitHub搞出了Agent HQ,让多智能体并行开发落地;Manus回归后发布了2.0版本,还带上了一个全天候智能体Cue。编程智能体已经从单人辅助工具变成团队协作基础设施。

数字同样在说话。Anthropic调研500位技术领袖,86%的组织已经脱离AI编程的试验期;谷歌云3466人的调研显示70%的企业Agent进入生产环境;Sonar的调查给出另一个侧面——42%的代码由AI生成,96%的开发者不敢直接签字批准上线。产能上来了,信任还没跟上。

全天候智能体:把AI从会话变成岗位

这场大会最值得琢磨的关键词是”全天候”。智能体不再等你打开窗口提问,而是7×24小时挂着,监控数据源、处理邮件队列、盯住部署流水线,出事了主动汇报。

企业侧的数据印证了这个方向。AI Agent办公场景调研显示41%的企业一年内回本,57%的企业已经部署。IDC和浪潮信息的报告则预测22亿Agent即将上线,算力结构随之重构——推理算力需求正在超过训练。

LangChain的Agent状态报告从另一个角度泼了冷水:企业智能体项目平均需要绕过2.6个里程碑才能达到生产级标准。全天候智能体听起来美好,背后是权限管理、沙箱隔离、可观测性三座大山。阿里云刚刚开源的Agent Sandbox、LangSmith和Langfuse争夺的可观测性市场,都是在给这座大山修路。

200美元套餐回归:订阅用户坐在了观众席

热闹之外有个扎心的细节。DevDay同期,OpenAI宣布重新开放200美元的Pro套餐,结果在社交媒体上被骂惨了——GPT-6.1和全天候智能体这套组合,普通订阅用户拿到的席位相当有限。

这件事折射出智能体时代的商业矛盾。智能体执行任务要消耗真实算力,一个跑几小时的多步Agent任务,Token消耗可能是普通对话的几十倍。国盛证券的拆解报告显示,头部厂商单次深度Agent任务的综合成本在2-8美元区间,订阅费再厚也扛不住无限量的全天候运行。

厂商的解法无非两条:按量计费的API走成本加成,订阅制设置用量天花板。Claude Code刚因为额度缩水17%挨过骂,OpenAI这次被喷也不冤。智能体越能干,边际成本越难摊薄,这个矛盾会伴随整个2027年。

开发者该怎么接招

三条建议,按优先级排。

第一,把GPT-6.1 mini放进成本敏感的Agent工作流。参考DeepSeek V4 Flash用1/30成本跑出90%能力的实测账本,小模型干杂活、旗舰模型啃硬骨头的路由策略,能砍掉40%-75%的推理成本。

第二,尽早给全天候智能体配好安全护栏。OWASP的报告显示提示词注入攻击暴增340%,安全研究机构记录的ClawHavoc事件里,13.5万台实例被投毒。智能体常驻在线,攻击面同步扩大。

第三,盯住OSWorld、SWE-bench这类基准的迭代。选型时别听发布会叙事,直接看真实任务完成率的月度变化。Claude Sonnet 5.5用一半价格逼近Opus 5.5的例子说明,中端模型的性价比曲线每月都在改写。

DevDay给出的信号很清楚:2026年的AI竞赛,比的是谁的智能体能稳定替人干活。模型能力只是入场券,工程化和成本控制才是决赛圈的内容。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号