9月19日,上海大模型公司阶跃星辰发布了Step 5 Preview。版本命名直接跳过Step 4.X,进入第五代。总参数600B,稀疏MoE架构,每次推理激活27B。官方同步宣布:10月15日模型权重正式开源。
发布48小时内,开发者社区已经炸开了锅。原因很朴素:这个体量的模型,跑分打平了4.7倍于自己的对手。
跑分:小个子打出大块头的战绩
第三方评测机构Artificial Analysis给出综合智能指数44分。
几个参照物摆在一起看。2.8万亿参数的Kimi K3,同样44分。智谱GLM-5.3和Claude Opus 5,并列45分。DeepSeek V4.1 Flash是40分,V4 Pro是36分。
600B打平2.8万亿,距离第一梯队只差1分。阶跃星辰也凭这一战跻身AA榜单全球开源模型前三。
编程场景的数据更能说明问题。重负载编程测试Terminal-Bench 4.0,Step 5 Preview拿到33.3%,逼近GPT-5.6 Terra。这项测试考察长程规划:模型要在终端里连续执行几十步操作,中间任何一步出错都可能满盘皆输。
Agents’ Last Exam的CLI子集同样有均衡表现。这类基准模拟真实开发环境,难度远高于常规代码补全测试。
定价:7分差距,8倍价差
国际API定价:每百万输入token收1美元,输出收2.7美元。
拿Claude Opus 5最高推理档位做对比,智能指数差7分,同样任务的成本差出约8倍。Step 5 Preview单任务成本约0.71美元。
输出速度接近每秒100个token。长代码生成不用干等,交互式开发的体感接近本地模型。
国内用户另有更便宜的入口:49元起步的Token套餐。个人开发者的试错成本被压到了一杯咖啡的价位。
架构:MoE加原生多模态
Step 5 Preview的架构要点有三个。
总参数600B,激活参数27B。推理时只点燃一小部分专家网络,这是速度和成本同时压下来的根源。
上下文窗口256K。一份中型代码库、一次完整的报错日志,都能整段塞进去。
原生多模态,支持图片和视频理解。做数据管道的开发者不用再拼接多个模型:一个API调用,代码、界面截图、日志截图混排的任务直接处理。
官方点名的三个优化方向:复杂软件工程任务、专业知识工作、金融领域。金融是阶跃的传统强项,长文档理解和数值推理场景表现突出。做量化、做风控的团队可以重点关注。
Python开发者三步上手
入口有三个,按投入成本从低到高排。
第一步,官方Studio。studio.stepfun.com注册即送免费额度,网页直接对话测试。
第二步,API调用。模型标识step-5-preview-b,兼容OpenAI SDK格式,几行Python就能跑通:
“`python
from openai import OpenAI
client = OpenAI(
base_url=”https://api.stepfun.com/v1″,
api_key=”你的API Key”
)
resp = client.chat.completions.create(
model=”step-5-preview-b”,
messages=[
{“role”: “user”, “content”: “用pandas读取CSV并输出各列缺失率”}
]
)
print(resp.choices[0].message.content)
“`
第三步,等开源。10月15日权重开放后,本地部署、微调、蒸馏、二次开发全部解锁。
一个建议:先拿自己的真实任务跑。跑分只代表平均水位,你的业务代码库、你的日志格式、你的领域术语,才是决定模型好不好用的真正变量。
冷静看:三个待验证的问题
第一,Preview标签说明这还不是最终版。正式发布前,能力边界可能调整,生产环境接入要留好回退路径。
第二,算力储备存疑。有分析指出,阶跃后续可能面临算力紧张。低价加高速度,对推理集群的压力不小,高峰期限流是常见剧本。
第三,生态位拥挤。600B这个档位,前面有GLM-5.3、Kimi K3两座大山,旁边有DeepSeek V4系列的价格压制。开源之后能否靠社区生态拉开差距,看10月15日之后的下载量和衍生模型数量。
写在最后
44分、0.71美元、100 tokens/s,Step 5 Preview把”够用的智能”和”便宜的价格”同时摆上了桌。
编程任务重的团队,值得花一个下午,用免费额度做一轮自己的评测。10月15日开源日,才是这场牌局真正的摊牌时刻。
苏公网安备32010502011527号
发表回复