@omarsar0: StepFun 的新 Step 5 Preview 模型令人印象深刻!有机会提前测试了一下。我一直在将它作为编程代理进行测试…
摘要
StepFun 的新 Step 5 Preview 模型作为编程代理进行了测试,展示了与 GLM 5.3 等模型相当的性能,并在长期任务中表现出色,这得益于其有效的停止机制。
查看缓存全文
缓存时间: 2026/09/22 07:43
StepFun 推出的 Step 5 Preview 模型令人印象深刻!
有机会提前进行了测试。
我将其作为编程代理进行了评估。
该模型在成本与能力之间达到了帕累托最优前沿。
这是一款非常强大的模型,与 GLM 5.3、Kimi K3 等模型相当,而且价格极具竞争力。
值得在您常用的编程代理中尝试。
我在一个最小测试环境中测试了它,以比较其与 GLM 5.3 的表现。
以下是我的测试结果。
总体而言,它非常高效,感觉是一款我能用于各种编程任务的模型。其中一个突出表现是它懂得何时停止,这使得它在处理长期任务时比同类模型更高效。
我在同一个代码库的同一提交版本中,让它和 GLM 5.3 分别处理两个真实任务。首先是一个错误,数值过滤器在筛选小数和负数时会静默返回空结果集。然后是一个新功能需求,需要添加新路由、权限控制,并重构后台任务监督器。
两个模型都正确完成了两个任务。所有保留测试均通过,没有回归问题,并且都没有为了通过测试而削弱现有测试。
Step 5 Preview 完成任务后,会检查自己的工作,并宣布完成。两次都是如此。
GLM 5.3 两次都写出了正确的代码,然后继续执行,直到达到步骤限制才结束运行。
两个模型都没有收到后续提示或重试请求。两者都没有进行修复轮次,因此在两个任务上首次交付即为最终交付。
对于那个错误,Step 5 Preview 编写了更简短的补丁,与 Datasette 维护者在实际提交中使用的方法相同。它还主动添加了测试用例,无需额外要求。
基于此,我会在以下场景优先选择它:需要明确完成信号比速度更重要的无人值守代理运行;在不熟悉的代码库中修复错误;以及处理长上下文任务。
关于长上下文处理,本周早些时候我进行了单独测试。我生成了约 36.8 万 token 的虚构事件工单,并在其中隐藏了五条线索,共同解释一次系统故障。当我询问根本原因时,它在约 90 秒内找到了所有五条线索并正确关联起来。
感谢 StepFun 团队与我们合作完成这篇评测文章。
相似文章
@jakevin7: Step 这个模型这次的进展相当显著。我测试了Step 5 Preview模型,整体效果f…
用户测试了Step 5 Preview模型,发现它在前端编码的长序列任务中表现良好,与Fable和GPT5-Sol等模型相比具有优势。
Stepfun 新模型 "Step 5 Preview" 遭泄露
Stepfun 的新 AI 模型 Step 5 Preview 已遭泄露,显示版本从 3.7 大幅跃升至 5.0,并带来显著的性能提升。
@liulicheng10: 为我们的成就感到骄傲!
StepFun推出Step 5 Preview,一款新的旗舰AI模型,专注于智能代理工作,在软件工程和金融领域具有前沿级别性能,具备600B参数规模。
StepFun 3.7 Flash
StepFun 发布了 Step 3.7 Flash,这是一个高效的多模态模型,针对真实世界的智能体任务进行了优化,具有改进的编码基准(SWE-Bench Pro、Terminal-Bench)并兼容多种智能体框架。
这看起来很有希望: stepfun-ai/Step-5-Preview-BF16 · Hugging Face
StepFun AI 已在 Hugging Face 上发布了 Step-5 模型的 BF16 格式预览版,这预示着 AI 模型可访问性和性能方面取得了令人期待的进展。