你实际在生产环境中运行的是哪个推理模型?
摘要
一位从业者寻求关于 o3、Claude extended thinking、Gemini 2.5 Pro 和 Ring 2.6 1T 等推理模型在生产环境中的代理任务上的真实反馈,质疑 Ring 的双推理强度模式在实际表现与基准测试之间的差异。
我需要为生产环境中的代理工作选择一个推理模型。常见的候选显而易见(o3、Claude extended thinking、Gemini 2.5 Pro),但我也在关注 Ring 2.6 1T,它有两种推理强度模式——high 用于快速的多步代理循环,xhigh 用于更困难的问题。双模式方法吸引了我,因为并非每次代理调用都需要最大推理深度。但我找不到关于它的实际反馈。基准测试确实存在(PinchBench 87.60,Tau2-Bench Telecom 95.32),但我不相信基准测试能告诉我在实际的多步代理任务中,它如何处理混乱的中间状态。在实际中,high/xhigh 的划分效果如何?速度差异是否明显?在较长的代理运行中是否保持稳定?
相似文章
你更愿意调整一个模型的推理深度,还是在两个模型之间切换?
这是对使用单个可调深度的万亿参数推理模型(如 Ring-2.6-1T)与在多个专用模型之间切换这两种方案的权衡思考,探讨哪种方法对代理工作流更简洁或更具成本效益。
人工理性的谜题:探究大型推理模型中的生成-评估差距
本文研究了大型推理模型(LRMs)中的生成-评估差距,发现尽管它们能近乎完美地生成解决方案,但由于答案确认偏差,它们无法稳健地评估推理过程。
JetBrains/Mellum2-12B-A2.5B-Thinking
JetBrains releases Mellum2-12B-A2.5B-Thinking, an open-source Mixture-of-Experts reasoning model with 131k context length, trained with RLVR for explicit chain-of-thought reasoning.
监控内部独白:探针轨迹揭示推理动态
本文介绍了一种通过分析探针轨迹(即概念概率在生成token上的演变)来监控大型推理模型推理过程的方法。该方法利用隐藏表示中的时间特征和信号处理特征,更好地预测未来模型行为,通过最大池化达到了高达95%的AUROC。
对于AI智能体,较重的推理预算应该优先用在何处:行动之前、状态变化之后,还是最终解释之前?
关于AI智能体中推理预算分配位置的讨论,引用了拥有高/极高推理努力模式的万亿参数模型Ring-2.6-1T。