标签
SCX Router 引入了一个基于GLiClass的轻量级模型选择工具,该工具使用解码器-KV分类器和任务本体来路由LLM任务,优化速度、成本和质量,无需自回归生成。
作者正在开发Agent-PGO,这是一个工具,可以分析AI代理的执行,动态地为不太关键的任务替换更便宜的模型,同时通过评估基准保持质量。
本文提出EEG-AS,一种算法选择框架,通过重建行为实现在多个EEG基础模型之间的实例级选择,从而提高神经解码性能。
本文提出一种递归公式,用于使用 Normalized Maximum Likelihood 模型高效计算具有聚类结构的向量的随机复杂性,将时间复杂度从多项式降低到线性。
本文详细介绍了 ChatGPT Work 的功能和特点,这是 OpenAI 开发的一款强大AI工具,仅面向付费用户,重点介绍了其基于云的服务,例如代码执行和模型选择。
Atlas Cloud的Creator Central包含Model Explorer,这是一个工具,可同时在多个AI模型上运行提示,以简化开发者在模型选择和测试方面的工作。
初创公司通过利用更智能的模型选择、推理和工具调用,学习如何使用GPT-5.6构建经济高效的AI代理来处理复杂工作。
文章认为,许多AI智能体工作流将每个任务都路由到前沿模型,浪费了资金,并建议对简单、结构化的任务使用更便宜的模型层级,同时将更困难的任务升级。文章提供了一个成本比较,显示分层方法可节省高达75%的费用。
UpliftBench is a benchmark paper showing that disagreements between uplift modeling evaluations often stem from metric choice rather than model quality, identifying specific mismatches between ranking metrics and deployment objectives across several dataset families.
作者认为前沿大语言模型已经达到了“足够好”的智能门槛,因此现在选择模型时更看重速度而非原始智能,并举例说像GLM5.2和DeepSeek V4 Flash这样快速的开源权重模型已成为日常主力。
Manifest解释了为何弃用其LLM路由器,认为模型路由会引入不可预测性、破坏行为一致性,且无法仅凭提示词推断其复杂性,因此对大多数用例而言,缓存和审慎的模型选择更为有效。
本文以SEED和SEED-IV数据集上的DGCNN为例,研究了评估协议如何影响EEG情绪识别中报告的准确率。研究表明,受试者相关(subject-dependent)、跨受试者(subject-disjoint)和跨会话(cross-session)评估回答的是不同问题,而检查点选择(checkpoint selection)和测试集重用可能会虚增准确率。
谷歌宣布了 Gemini API 中托管代理的更新,包括默认使用 Gemini 3.6 Flash 模型、用于工具调用审计的环境钩子、预算控制、定时触发器和免费层级访问。
GitHub Copilot 现在使用提示缓存、工具搜索和自动模型选择(HyDRA)来降低成本并提高效率,实现了 3.3 倍的节省,同时与 OpenRouter Auto 的解决率相匹配。
Runway 发布了 Media Router,这是一款偏好优化路由器,可根据用户定义的成本、质量或延迟标准自动选择最佳视频、图像或音频模型,无需手动挑选模型。该产品已在 Runway Dev 中上线。
Ramp 正在开源其内部 LLM 路由器,该路由器能根据每个请求自动选择最佳模型,以优化成本和性能。
本文讨论了在Codex中针对不同任务类型选择GPT-5.6 Sol、Terra或Luna变体的方法。
探讨独立开发者是否应该依赖单一AI模型处理所有任务,或者考虑使用多个专用模型。