Step-5-Preview 实测:输出稳、Agent Loop 迭代强,前端仍是短板
StepFun 的 Step-5-Preview 实测来了,输出特别稳,还能钻规则空子赚积分,前端偏弱,想选国产模型写代码的可以看看。
博主 karminski3 对 StepFun 的 Step-5-Preview 做了实测,最大亮点是输出稳定,写工程代码很少出现反复修改的情况。在新增的“硅基交警”Agent 测试中全程没有指挥出事故,后端 Agentic Coding 测试和“硅基骑手”测试的多轮得分Δ也很小。模型还能卡着极限数值做 Agent Loop 迭代优化,比如在送餐超时不超过 5 分钟不扣钱的规则下,把超时理解为送餐时间加 5 分钟来多赚积分。短板集中在前端、3D 场景和美学方面,虽有提升但与这一代 SOTA 模型仍有差距。
给大家带来阶跃 Step-5-Preview 实测!
直接说结论, Step-5-Preview 最大的亮点是输出很稳, 这意味着它的后训练极其扎实. 用来写工程代码很难出现反复仰卧起坐的情况.
本次页给大家带来了全新的Agent 能力测试——硅基交警. 而 Step-5-Preview 在这个测试中全程没有指挥出事故. 非常稳定. 而在后端 Agentic Coding 测试和旧的硅基骑手测试中, 多轮测试得分Δ也非常小. 所以稳是这个模型最直观的感受.
除此之外, 模型还有一个我意想不到的特性, 它 Agent Loop 迭代特别强, 可以卡着极限数值去进行迭代优化. 最好玩的是, 硅基骑手测试中咱们要求了送餐超时如果不超过5分钟就不会扣钱, 结果它直接认为送餐超时就是送餐时间+5分钟, 充分利用了这个规则赚取了更多的积分.
而模型的短板目前也是特别明显的, 最需要提升的方面还是前端, 3D场景, 美学这些方面. 可以看我视频中的实测, 虽然较上一代模型有提升, 但是距离这一代的SOTA模型还是有距离的. 因此想写一些炫酷的3D演示还是很难的.
这种可以 Agent Loop 疯狂打磨细节的模型, 你觉得能用在哪些意想不到的地方呢?欢迎在评论区留下你的脑洞!
#阶跃星辰 #StepFun #Step5Preview #step5 #AgentLoop