@omarsar0: StepFun 的新 Step 5 Preview 模型令人印象深刻!有机会提前测试了一下。我一直在将它作为编程代理进行测试…

X AI KOLs Following 模型

摘要

StepFun 的新 Step 5 Preview 模型作为编程代理进行了测试,展示了与 GLM 5.3 等模型相当的性能,并在长期任务中表现出色,这得益于其有效的停止机制。

StepFun 的新 Step 5 Preview 模型令人印象深刻! 有机会提前测试了一下。 我一直在将它作为编程代理进行测试。 它在成本与能力的帕累托前沿上。 这是一个非常强大的模型,可与 GLM 5.3、Kimi K3 等媲美,而且价格极具竞争力。 值得在你常用的编程代理中尝试。 我在一个最小测试环境中测试了它,看看它与 GLM 5.3 的比较如何。 以下是我的结果。 总体而言,它非常有效,感觉像是一个我可以用于各种编码任务的模型。一个突出的行为是它知道何时停止,这使得它在长期任务中比同类其他模型更有效。 我给了它和 GLM 5.3 两个真实任务,在同一个代码库的同一个提交上。首先,一个 bug,数字过滤器在小数和负数时静默返回零行。然后是一个需要新路由、权限控制和后台任务监督器重构的功能。 两个模型都正确完成了两个任务。所有保留测试都通过了,没有回归,而且两者都没有弱化现有测试来达到目的。 Step 5 Preview 完成了任务,检查了其工作,并宣布自己完成。两次都是。GLM 5.3 两次都写出了正确的代码,然后继续运行直到步骤限制结束。 两个模型都没有收到后续提示或重试。两者都有零修复轮次,所以第一次交付就是两个任务的最终交付。 对于 bug,Step 5 Preview 写了更短的补丁,与 Datasette 维护者在真实提交中使用的方法相同。它还主动添加了自己的测试。 基于此,我会在无人值守的智能体运行中优先选择它,当清晰的完成信号比速度更重要时,用于不熟悉代码库的 bug 修复,以及长上下文工作。 关于长上下文,我本周早些时候对它进行了单独测试。我生成了大约 368K 令牌的假事件票证,并在其中隐藏了五个线索,这些线索共同解释了一次中断。当我询问根本原因时,它在约 90 秒内找到了所有五个线索并正确地连接了它们。 感谢 StepFun 团队合作完成这篇文章。
查看原文
查看缓存全文

缓存时间: 2026/09/22 07:43

StepFun 推出的 Step 5 Preview 模型令人印象深刻!

有机会提前进行了测试。

我将其作为编程代理进行了评估。

该模型在成本与能力之间达到了帕累托最优前沿。

这是一款非常强大的模型,与 GLM 5.3、Kimi K3 等模型相当,而且价格极具竞争力。

值得在您常用的编程代理中尝试。

我在一个最小测试环境中测试了它,以比较其与 GLM 5.3 的表现。

以下是我的测试结果。

总体而言,它非常高效,感觉是一款我能用于各种编程任务的模型。其中一个突出表现是它懂得何时停止,这使得它在处理长期任务时比同类模型更高效。

我在同一个代码库的同一提交版本中,让它和 GLM 5.3 分别处理两个真实任务。首先是一个错误,数值过滤器在筛选小数和负数时会静默返回空结果集。然后是一个新功能需求,需要添加新路由、权限控制,并重构后台任务监督器。

两个模型都正确完成了两个任务。所有保留测试均通过,没有回归问题,并且都没有为了通过测试而削弱现有测试。

Step 5 Preview 完成任务后,会检查自己的工作,并宣布完成。两次都是如此。

GLM 5.3 两次都写出了正确的代码,然后继续执行,直到达到步骤限制才结束运行。

两个模型都没有收到后续提示或重试请求。两者都没有进行修复轮次,因此在两个任务上首次交付即为最终交付。

对于那个错误,Step 5 Preview 编写了更简短的补丁,与 Datasette 维护者在实际提交中使用的方法相同。它还主动添加了测试用例,无需额外要求。

基于此,我会在以下场景优先选择它:需要明确完成信号比速度更重要的无人值守代理运行;在不熟悉的代码库中修复错误;以及处理长上下文任务。

关于长上下文处理,本周早些时候我进行了单独测试。我生成了约 36.8 万 token 的虚构事件工单,并在其中隐藏了五条线索,共同解释一次系统故障。当我询问根本原因时,它在约 90 秒内找到了所有五条线索并正确关联起来。

感谢 StepFun 团队与我们合作完成这篇评测文章。

相似文章

@liulicheng10: 为我们的成就感到骄傲!

X AI KOLs Following

StepFun推出Step 5 Preview,一款新的旗舰AI模型,专注于智能代理工作,在软件工程和金融领域具有前沿级别性能,具备600B参数规模。

StepFun 3.7 Flash

Reddit r/LocalLLaMA

StepFun 发布了 Step 3.7 Flash,这是一个高效的多模态模型,针对真实世界的智能体任务进行了优化,具有改进的编码基准(SWE-Bench Pro、Terminal-Bench)并兼容多种智能体框架。