model-selection

标签

Cards List
#model-selection

我们是否默认过度配置了AI智能体?

Reddit r/AI_Agents · 3天前

文章认为,许多AI智能体工作流将每个任务都路由到前沿模型,浪费了资金,并建议对简单、结构化的任务使用更便宜的模型层级,同时将更困难的任务升级。文章提供了一个成本比较,显示分层方法可节省高达75%的费用。

0 人收藏 0 人点赞
#model-selection

UpliftBench: Revealing Outcome-Regime and Objective Mismatch in Uplift Evaluation

arXiv cs.LG · 2026-08-04 缓存

UpliftBench is a benchmark paper showing that disagreements between uplift modeling evaluations often stem from metric choice rather than model quality, identifying specific mismatches between ranking metrics and deployment objectives across several dataset families.

0 人收藏 0 人点赞
#model-selection

我现在(主要)根据速度而非智能来挑选模型

Lobsters Hottest · 2026-08-02 缓存

作者认为前沿大语言模型已经达到了“足够好”的智能门槛,因此现在选择模型时更看重速度而非原始智能,并举例说像GLM5.2和DeepSeek V4 Flash这样快速的开源权重模型已成为日常主力。

0 人收藏 0 人点赞
#model-selection

大家都在构建LLM路由器,我们却弃用了自己的

Hacker News Top · 2026-07-31 缓存

Manifest解释了为何弃用其LLM路由器,认为模型路由会引入不可预测性、破坏行为一致性,且无法仅凭提示词推断其复杂性,因此对大多数用例而言,缓存和审慎的模型选择更为有效。

0 人收藏 0 人点赞
#model-selection

EEG情绪识别中的评估协议与跨受试者泛化

arXiv cs.LG · 2026-07-31 缓存

本文以SEED和SEED-IV数据集上的DGCNN为例,研究了评估协议如何影响EEG情绪识别中报告的准确率。研究表明,受试者相关(subject-dependent)、跨受试者(subject-disjoint)和跨会话(cross-session)评估回答的是不同问题,而检查点选择(checkpoint selection)和测试集重用可能会虚增准确率。

0 人收藏 0 人点赞
#model-selection

Gemini API 托管代理:3.6 Flash、钩子等更多功能

Google AI Blog · 2026-07-28 缓存

谷歌宣布了 Gemini API 中托管代理的更新,包括默认使用 Gemini 3.6 Flash 模型、用于工具调用审计的环境钩子、预算控制、定时触发器和免费层级访问。

0 人收藏 0 人点赞
#model-selection

@github: 每次 Copilot 会话中更多部分用于有效工作,因此你的积分更耐用,使用方式不变。Prom…

X AI KOLs Timeline · 2026-07-27 缓存

GitHub Copilot 现在使用提示缓存、工具搜索和自动模型选择(HyDRA)来降低成本并提高效率,实现了 3.3 倍的节省,同时与 OpenRouter Auto 的解决率相匹配。

0 人收藏 0 人点赞
#model-selection

Runway 推出生成式媒体 AI 路由器(2 分钟阅读)

TLDR AI · 2026-07-24 缓存

Runway 发布了 Media Router,这是一款偏好优化路由器,可根据用户定义的成本、质量或延迟标准自动选择最佳视频、图像或音频模型,无需手动挑选模型。该产品已在 Runway Dev 中上线。

0 人收藏 0 人点赞
#model-selection

Ramp Router 声称可将AI成本降低高达30%

Reddit r/ArtificialInteligence · 2026-07-21

Ramp 正在开源其内部 LLM 路由器,该路由器能根据每个请求自动选择最佳模型,以优化成本和性能。

0 人收藏 0 人点赞
#model-selection

@pvncher: https://x.com/pvncher/status/2077708372363624894

X AI KOLs Following · 2026-07-16 缓存

本文讨论了在Codex中针对不同任务类型选择GPT-5.6 Sol、Terra或Luna变体的方法。

0 人收藏 0 人点赞
#model-selection

大多数独立开发者只用一个模型处理所有事情。这真的是正确的选择吗?

Reddit r/AI_Agents · 2026-07-14

探讨独立开发者是否应该依赖单一AI模型处理所有任务,或者考虑使用多个专用模型。

0 人收藏 0 人点赞
#model-selection

@_markfenner: 今天的 Devinmaxxing: 从口袋里挑选模型。DevinX 现在支持本地会话的完整模型选择…

X AI KOLs Following · 2026-07-12 缓存

DevinX 现在支持本地会话的完整模型选择,包括 Sol、Fable 5、GLM、Kimi 以及自适应成本平衡选项,外加推理努力控制。

0 人收藏 0 人点赞
#model-selection

通过切换到思考更少的模型,将我的智能体响应延迟降低1.7倍——而不是解码更快的模型

Reddit r/AI_Agents · 2026-07-11

一篇文章描述如何通过切换到需要更少推理时间的模型,而不是专注于解码速度,将AI智能体响应延迟降低1.7倍

0 人收藏 0 人点赞
#model-selection

开发们 - 你有64GB显存 - 你用什么模型写代码?

Reddit r/LocalLLaMA · 2026-06-30

一位拥有64GB显存的开发者分享了他使用unsloth版Qwen 3.5 122b-a10b模型进行编码的偏好,并向社区征求推荐。

0 人收藏 0 人点赞
#model-selection

Qwen 3.6 27B 还是 Qwen 3.5 35B 用于 AI 智能体?

Reddit r/AI_Agents · 2026-06-30

比较了 Qwen 3.6 27B 和 Qwen 3.5 35B 模型在 AI 智能体应用中的使用情况,讨论了它们的性能和适用性。

0 人收藏 0 人点赞
#model-selection

@snowboat84: 你有没有发现,AI里模型的诞生其实相当随意?拿语言模型举例子:先是RNN,再到LSTM,某天突然说Transformer效果好就全换上,后来又拆成Encoder和Decoder,一会儿说BERT一桶浆糊,一会儿又说GPT可以有涌现能力,S…

X AI KOLs Timeline · 2026-06-26 缓存

文章讨论了AI模型诞生的随意性,提出从物理学模型中获得灵感并建立备选模型资料库,将选模型过程工程化的想法。

0 人收藏 0 人点赞
#model-selection

我几个月前就不再比较模型了。我的输出质量反而提升了。

Reddit r/AI_Agents · 2026-06-24

作者分享说,他不再比较AI模型,转而专注于工作流设计,结果输出质量反而提升了。他认为对于大多数实际用例,工作流比模型选择更具杠杆效应。

0 人收藏 0 人点赞
#model-selection

有没有人真正有效地解决了每提示词模型路由问题,还是我们都在靠直觉判断?

Reddit r/AI_Agents · 2026-06-18

本文探讨了AI智能体中每提示词模型路由的挑战,质疑是否有人真正有效解决了这个问题。文章指出,当前实践依赖直觉,固定费率计划降低了优化压力,而分流层本身也可能带来额外成本。

0 人收藏 0 人点赞
#model-selection

ARIADNE:推理时适配器动态选择的无关路由

arXiv cs.AI · 2026-06-18 缓存

提出ARIADNE,一种无需训练、适配器无关的路由框架,通过在嵌入空间中测量输入与适配器特定质心的接近度,在推理时选择最优的PEFT适配器,在23个任务上恢复了97.44%的上限性能。

0 人收藏 0 人点赞
#model-selection

模型选择在因果推断中的关键作用:基于InferBERT框架的药物警戒分类模型比较分析

arXiv cs.LG · 2026-06-17 缓存

本文系统评估了InferBERT框架中分类模型选择对因果不良药物事件检测的影响,发现领域特定预训练(BioBERT)优于简单模型及Med-LLaMA等大型语言模型。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈