2026年8月26日,OpenAI正式把o3从ChatGPT移除。90天缓冲期从5月28日开始算,到今天就剩最后一天。如果你的工作流还挂在o3上,明天起对话会自动切到GPT-5.4 Thinking。API用户暂时不受影响,可谁也不想等官方再发一条退役通知才动手。
推理模型这件事,2026年已经从”哪家最强”变成了”怎么选才省钱”。参数越堆越大的故事讲完了,测试时计算(test-time compute)成了新的主旋律。模型在回答前先”想”一会儿,简单问题想100个token,复杂证明想1万个token。成本跟着问题难度走,账单也就跟着波动。
三个模型,三种活法
OpenAI o3把推理能力推到了新高度。AIME数学竞赛96.7%,GPQA博士级科学题87.7%,SWE-bench真实软件工程任务71.7%,Codeforces竞技编程评分2727。FrontierMath研究级数学拿到25.2%,比o1的约2%翻了12倍。3月那波降价把API价格从10/40美元砍到2/8美元每百万token,降幅80%。
o3有个让人头疼的毛病。提示词里图片丢了,它有86.7%的概率自信地给出错误答案。GPT-5在同样情况下只有9%。迁移之前,先把你工作流里的多模态输入检查一遍,别让这个坑跟着你迁过去。
DeepSeek R1走的是另一条路。671B参数的MoE架构,每个token只激活37B,纯强化学习训练出来的推理能力,没用大量人工标注的CoT数据。API价格0.55/2.19美元每百万token,比o3便宜约96%。中文数学和代码任务上表现尤其强。完全开源,权重和训练细节都公开,企业可以自己部署,数据不出机房。
Gemini 3 Pro手握200万token上下文窗口,在更难的ARC-AGI-2上创下新纪录。多模态推理是它的强项,长文档处理几乎没对手。
一张账单看懂该用谁
o4-mini每百万token 0.55美元,o3-mini 1.10美元,o3 2美元,o3-pro 20美元。DeepSeek R1 0.55/2.19美元。价格差出36倍,能力差距远没这么大。实操建议很清晰:
- 简单推理(基础数学、常规逻辑)→ DeepSeek R1,0.55美元搞定,没必要多花钱。
- 中等推理(代码调试、多步分析)→ o4-mini,1.10美元,性价比的最佳位置。给o4-mini配上Python解释器,AIME 2025能跑到99.5%。
- 复杂推理(架构决策、安全审查、难bug)→ o3中等档或Claude Opus 4.8高推理档。该花的钱得花。
- 科学相邻推理、预算敏感 → Gemini Deep Think高推理档,单token成本比o3低。
- 想要最便宜托管或自己部署 → DeepSeek V4 Flash,0.14美元每百万token,32B权重能自托管。
Router架构:省钱的正确姿势
别再让旗舰模型跑杂活。McKinsey和多家咨询公司的数据指向同一个结论:用Router架构分流任务,简单活交给DeepSeek R1或Gemini 3 Flash,复杂活留给o3,总API成本能砍掉60%到80%,质量还能守住95%以上。
这套逻辑和传统LLM的固定成本完全不同。传统模型不管问题难不难,每次推理消耗的资源差不多。推理模型的成本和问题复杂度正相关。做任务分级,简单任务不推理,复杂任务深推理,账单自然下来。
数据主权是另一道必答题。DeepSeek的数据走中国服务器,受数据安全法约束。敏感场景要么用开源权重私有部署,要么选数据不落地的Gemini或o3方案。
迁移清单:今天就能动手
- 盘点你挂在o3上的ChatGPT工作流,明天起会自动切到GPT-5.4 Thinking。
- API用户暂时安全,可GPT-5用50%到80%更少的输出token就能超过o3,趁早测一遍迁移效果。
- 把多模态输入流程查一遍,别让丢图问题跟着你迁过去。
- 上Router架构,按任务难度分流,别让20美元的o3-pro跑翻译。
- 中文推理任务试一把DeepSeek R1,账单能差出一个数量级。
o3下架是个信号。推理模型市场已经分化成三层:顶级推理留给o3、o4和Claude,性价比交给o4-mini和DeepSeek R1,长上下文和多模态是Gemini的地盘。ARC-AGI-2上o3只拿2.9%,人类60%,这个数字比任何跑分都诚实。选模型看你的任务落在哪一层,别被单一”最强”标签绑架。把钱花在刀刃上,才是2026年用推理模型的正确姿势。
苏公网安备32010502011527号
发表回复