阶跃星辰 Step 5 Preview:6000 亿参数、每百万输入 1 美元,而权重承诺放在 10 月 15 日

阶跃星辰于 9 月 20 日开放 Step 5 Preview 的 API,这是一款面向长程 agent 任务的稀疏 MoE 模型,总参数约 6000 亿、每 token 激活约 270 亿(激活占比 4.5%),上下文窗口 100 万 token,支持文本与图像输入。架构上它没有加宽而是加深,采用 92 层的窄深 Transformer,官方说法是更深的层堆能在长 prefill 中为隐式多跳推理提供更长的信息路径;训练侧强调 on-policy 长程强化学习与训练-推理在 MoE 路由上的位级对齐,工程侧包括负载感知调度、MTP-3 推测解码、FP8 MoE 与 KV 缓存卸载。定价为每百万输入 token 1.00 美元、每百万输出 token 2.70 美元,推理 token 按输出计费;同价位段的中位数分别是 1.88 与 10.00 美元。第三方评测方面,Artificial Analysis 给出智能指数 44 分(该价位段中位数 24),在其 653 个模型中排名第 27,输出速度 99.8 token/秒,首 token 延迟 2.96 秒;同样 44 分的 Kimi K3(max)相比,其单任务成本约低 65%,在 Terminal-Bench 4.0 上为 33% 对 13%。公司称开源权重将于 2026 年 10 月 15 日发布,但发布当日 Hugging Face 仓库 stepfun-ai/Step-5-Preview-BF16 内只有一个 .gitattributes 文件,没有权重、许可、模型卡或配置。另需注意两处口径差异:该模型在智能指数评测中生成了 1.6 亿 token,而中位数为 9200 万;开发者工具里流传的一份第三方配置写的是 35 万上下文与 6.4 万输出上限,与官方的 100 万说法不一致。

单价便宜,不等于每个任务便宜

这是这条里最实用的一点,也是最容易被价目表带偏的一点。 每百万输入 1 美元、输出 2.70 美元,确实明显低于同价位段的中位数(1.88 与 10.00)。但在 Artificial Analysis 的智能指数评测里,它一共生成了 1.6 亿 token,而参评模型的中位数是 9200 万——**话多了将近一倍。**推理 token 又按输出计费,于是单价上省下的那部分,会被多出来的输出量吃掉相当一块。 所以评估这类模型的正确口径是「完成一个你自己的典型任务,一共花了多少钱」,而不是比价目表。好在这件事很容易自己测:拿三到五个你真实在跑的任务跑一遍,把总 token 数和总费用记下来,比任何横向榜单都准。 同一份评测里另一组数字倒是实打实的:Terminal-Bench 4.0 上 33% 对 Kimi K3 的 13%。这是目前最能支持「它确实是按长程 agent 任务调出来的」这个说法的外部数据,而且这类终端任务基准很难靠话多刷上去。

10 月 15 日那个日期,才是这条真正的看点

公司说开源权重 10 月 15 日发。而在发布当天,Hugging Face 上的 stepfun-ai/Step-5-Preview-BF16 仓库里只有一个 .gitattributes——没有权重、没有许可、没有模型卡、没有配置。 这不是指控,是把话说准:**目前「开源权重」是一个待兑现的承诺,不是已交付的事实。**在 10 月 15 日之前,把它当成一个 API 模型来评估是唯一稳妥的做法。 到那天要看两件事,缺一不可:权重有没有真的放出来,以及**放出来的是什么许可**。这两件事必须分开看——本站今天另一条正好提供了现成的对照:Qwen-Image-2.1 权重照放,但许可从 Apache 2.0 退成了仅限研究,商用得另谈。所以「开权重」和「能商用」从来不是同一件事,到时候要去读的是那份许可文件,不是发布公告的标题。 同一周、同一个国家的两家公司,在开放度上走向相反的方向,本身就值得记一笔。

架构选择:押深度而不是宽度

技术上值得单独记的是那个 92 层的窄深结构,以及 4.5% 的激活比例——6000 亿总参数里每 token 只激活 270 亿。 公司给的理由很明确:更深的层堆在长 prefill 中为隐式多跳推理提供更长的信息路径。翻译过来就是,它赌的是长上下文里「一步套一步」的推理,而不是单次调用的知识广度。早期评测的分布和这个取向是吻合的——据知乎上的一些早期评测,它在科学类代码上表现较好,而在事实性知识和复杂文档处理上有短板。 这就给出了一个清晰的选型建议:**如果你的场景是长时间跑一条工具链、中间要反复读自己前面的输出,它值得一试;如果是要求事实准确的问答或长文档理解,先拿自己的题测过再说。** 最后是那处口径出入:官方说上下文 100 万,而开发者工具里流传的一份第三方配置写的是 35 万上下文、6.4 万输出上限。官方公告没有提输出上限。真要用长上下文的人,别信任何一方的数字,自己灌到极限试一次。

via: Artificial Analysis 的 Step 5 评测页Pandaily 报道DataStudios 报道Orca Router 对开源权重承诺的分析