单价便宜,不等于每个任务便宜
这是这条里最实用的一点,也是最容易被价目表带偏的一点。 每百万输入 1 美元、输出 2.70 美元,确实明显低于同价位段的中位数(1.88 与 10.00)。但在 Artificial Analysis 的智能指数评测里,它一共生成了 1.6 亿 token,而参评模型的中位数是 9200 万——**话多了将近一倍。**推理 token 又按输出计费,于是单价上省下的那部分,会被多出来的输出量吃掉相当一块。 所以评估这类模型的正确口径是「完成一个你自己的典型任务,一共花了多少钱」,而不是比价目表。好在这件事很容易自己测:拿三到五个你真实在跑的任务跑一遍,把总 token 数和总费用记下来,比任何横向榜单都准。 同一份评测里另一组数字倒是实打实的:Terminal-Bench 4.0 上 33% 对 Kimi K3 的 13%。这是目前最能支持「它确实是按长程 agent 任务调出来的」这个说法的外部数据,而且这类终端任务基准很难靠话多刷上去。
10 月 15 日那个日期,才是这条真正的看点
公司说开源权重 10 月 15 日发。而在发布当天,Hugging Face 上的 stepfun-ai/Step-5-Preview-BF16 仓库里只有一个 .gitattributes——没有权重、没有许可、没有模型卡、没有配置。 这不是指控,是把话说准:**目前「开源权重」是一个待兑现的承诺,不是已交付的事实。**在 10 月 15 日之前,把它当成一个 API 模型来评估是唯一稳妥的做法。 到那天要看两件事,缺一不可:权重有没有真的放出来,以及**放出来的是什么许可**。这两件事必须分开看——本站今天另一条正好提供了现成的对照:Qwen-Image-2.1 权重照放,但许可从 Apache 2.0 退成了仅限研究,商用得另谈。所以「开权重」和「能商用」从来不是同一件事,到时候要去读的是那份许可文件,不是发布公告的标题。 同一周、同一个国家的两家公司,在开放度上走向相反的方向,本身就值得记一笔。
架构选择:押深度而不是宽度
技术上值得单独记的是那个 92 层的窄深结构,以及 4.5% 的激活比例——6000 亿总参数里每 token 只激活 270 亿。 公司给的理由很明确:更深的层堆在长 prefill 中为隐式多跳推理提供更长的信息路径。翻译过来就是,它赌的是长上下文里「一步套一步」的推理,而不是单次调用的知识广度。早期评测的分布和这个取向是吻合的——据知乎上的一些早期评测,它在科学类代码上表现较好,而在事实性知识和复杂文档处理上有短板。 这就给出了一个清晰的选型建议:**如果你的场景是长时间跑一条工具链、中间要反复读自己前面的输出,它值得一试;如果是要求事实准确的问答或长文档理解,先拿自己的题测过再说。** 最后是那处口径出入:官方说上下文 100 万,而开发者工具里流传的一份第三方配置写的是 35 万上下文、6.4 万输出上限。官方公告没有提输出上限。真要用长上下文的人,别信任何一方的数字,自己灌到极限试一次。
via: Artificial Analysis 的 Step 5 评测页、Pandaily 报道、DataStudios 报道、Orca Router 对开源权重承诺的分析