标签
文章认为,许多AI智能体工作流将每个任务都路由到前沿模型,浪费了资金,并建议对简单、结构化的任务使用更便宜的模型层级,同时将更困难的任务升级。文章提供了一个成本比较,显示分层方法可节省高达75%的费用。
UpliftBench is a benchmark paper showing that disagreements between uplift modeling evaluations often stem from metric choice rather than model quality, identifying specific mismatches between ranking metrics and deployment objectives across several dataset families.
作者认为前沿大语言模型已经达到了“足够好”的智能门槛,因此现在选择模型时更看重速度而非原始智能,并举例说像GLM5.2和DeepSeek V4 Flash这样快速的开源权重模型已成为日常主力。
Manifest解释了为何弃用其LLM路由器,认为模型路由会引入不可预测性、破坏行为一致性,且无法仅凭提示词推断其复杂性,因此对大多数用例而言,缓存和审慎的模型选择更为有效。
本文以SEED和SEED-IV数据集上的DGCNN为例,研究了评估协议如何影响EEG情绪识别中报告的准确率。研究表明,受试者相关(subject-dependent)、跨受试者(subject-disjoint)和跨会话(cross-session)评估回答的是不同问题,而检查点选择(checkpoint selection)和测试集重用可能会虚增准确率。
谷歌宣布了 Gemini API 中托管代理的更新,包括默认使用 Gemini 3.6 Flash 模型、用于工具调用审计的环境钩子、预算控制、定时触发器和免费层级访问。
GitHub Copilot 现在使用提示缓存、工具搜索和自动模型选择(HyDRA)来降低成本并提高效率,实现了 3.3 倍的节省,同时与 OpenRouter Auto 的解决率相匹配。
Runway 发布了 Media Router,这是一款偏好优化路由器,可根据用户定义的成本、质量或延迟标准自动选择最佳视频、图像或音频模型,无需手动挑选模型。该产品已在 Runway Dev 中上线。
Ramp 正在开源其内部 LLM 路由器,该路由器能根据每个请求自动选择最佳模型,以优化成本和性能。
本文讨论了在Codex中针对不同任务类型选择GPT-5.6 Sol、Terra或Luna变体的方法。
探讨独立开发者是否应该依赖单一AI模型处理所有任务,或者考虑使用多个专用模型。
DevinX 现在支持本地会话的完整模型选择,包括 Sol、Fable 5、GLM、Kimi 以及自适应成本平衡选项,外加推理努力控制。
一篇文章描述如何通过切换到需要更少推理时间的模型,而不是专注于解码速度,将AI智能体响应延迟降低1.7倍
一位拥有64GB显存的开发者分享了他使用unsloth版Qwen 3.5 122b-a10b模型进行编码的偏好,并向社区征求推荐。
比较了 Qwen 3.6 27B 和 Qwen 3.5 35B 模型在 AI 智能体应用中的使用情况,讨论了它们的性能和适用性。
文章讨论了AI模型诞生的随意性,提出从物理学模型中获得灵感并建立备选模型资料库,将选模型过程工程化的想法。
作者分享说,他不再比较AI模型,转而专注于工作流设计,结果输出质量反而提升了。他认为对于大多数实际用例,工作流比模型选择更具杠杆效应。
本文探讨了AI智能体中每提示词模型路由的挑战,质疑是否有人真正有效解决了这个问题。文章指出,当前实践依赖直觉,固定费率计划降低了优化压力,而分流层本身也可能带来额外成本。
提出ARIADNE,一种无需训练、适配器无关的路由框架,通过在嵌入空间中测量输入与适配器特定质心的接近度,在推理时选择最优的PEFT适配器,在23个任务上恢复了97.44%的上限性能。
本文系统评估了InferBERT框架中分类模型选择对因果不良药物事件检测的影响,发现领域特定预训练(BioBERT)优于简单模型及Med-LLaMA等大型语言模型。