你最强的模型可能不是最佳的工具调用者
摘要
本文认为,工具调用的可靠性往往不与模型能力成正比;较小的模型在遵循模式和格式规范方面可能超越较大的模型,这表明原始能力并非选择工具调用模型的唯一因素。
上周看到一个7B模型在遵循工具模式方面比一个一线模型还要干净,这让我想起工具调用的可靠性很少与原始能力挂钩。人们为智能体选择最大、最聪明的模型,认为能力越强意味着工具调用越可靠。但往往相反。工具调用主要是格式纪律,遵循模式而不随意添加字段,这与推理是不同技能。更大的模型往往在需要它保持枯燥的地方更具创造力,结果正是它发明了一个字段或用散文包裹JSON。因此,排行榜上领先的模型回答的问题与你将其接入工具时所问的问题不同。正在运行智能体的各位,你们是根据能力选择工具模型,还是测量过每个模型在自己工具上的有效调用率?
相似文章
@_jasonwei: 当语言模型首次开始良好使用工具时,我曾同情那种认为无需扩大语言模型规模(lang…)的叙述。
作者认为,虽然工具使用使较小的语言模型能够有效执行任务,但较大的模型在速度、可靠性和内化知识方面仍然至关重要,强调在人工智能领域持续扩展规模的必要性。
智能体的工具调用部分远比我们通常指向的模型简单
本文介绍了一个专为AI智能体工具调用设计的48M参数模型的开发。该模型使用语法确保有效的JSON输出,并且开源,可在特定API目录上进行定制。
最好的模型是你真正能运行的模型
文章认为,最好的AI模型不一定是最强大的,而是能够实际部署并高效运行的模型,强调要考虑现实中的约束,如成本和硬件需求。
我们是否高估了模型智能,低估了工作流质量?
文章认为,令人印象深刻的AI与无用的AI之间的区别往往不在于模型本身,而在于围绕它的工作流——上下文、记忆、工具访问和编排。它表明,工作流架构可能成为比原始模型能力更重要的竞争优势。
@rohanpaul_ai:Meta新论文显示,小模型可能并非规模预测效果不佳,或许只是未获得充分调优。研究发现……
Meta最新论文显示,小型模型能够准确预测缩放规律,但需要更全面的超参数调优。研究发现,缩放规律在参数量约400万时开始显现,通过恰当调优其特征会变得更加清晰。