标签
SLCA-GRPO 引入段锁定信用分配,通过解耦优势估计和使用层级奖励来改善工具调用代理的强化学习,从而实现更快的收敛和更高的准确性。
TwinCheck 是一种推理时验证策略,通过使用基于证据的负孪生比较来增强有状态工具智能体,显著提升了如BFCL V4等基准测试中的任务成功率。
OpenAI 已在 ChatGPT Voice 中添加了工具调用支持,使其能够使用插件,如电子邮件、日历和 Slack,由 GPT-6 Astra、Sol 和 Luna 驱动。
文章探讨了更小的量化模型是否正在成为本地AI应用的首选,强调了它们在VRAM使用、性能和功能(如工具调用)之间的平衡。
CMU offers a new fall 2026 course on AI Agents taught by Daniel Fried and Graham Neubig, covering topics like tool calling, reinforcement learning training, and human-computer interaction.
文章讨论了AI代理的验证模式,以确保可靠性,建议的技术包括分离执行者和验证者、强制结构化输出,以及使用证据上限来防止幻觉和不当行为。
这项对照研究比较了监督微调和强化学习方法在不同数据集和模型规模下训练工具调用代理的表现,发现SFT结合LoRA在分布内表现最强,而RL在跨数据集迁移中略有优势。
Thariq认为,由于改进的模型能力和MCP的无状态设计,MCPs在AI工具调用方面优于CLIs,而bash和沙箱仍适用于代码生成和执行。
Ruby UTCP 是一个开源库,它为 Ruby 应用程序和 AI 代理提供了一种标准方式,通过各种协议发现和调用工具。它支持 12 种传输,并包括流式传输、身份验证和 OpenAPI 发现等功能。
Needle 3 是一款针对移动设备和可穿戴设备等边缘设备优化的紧凑AI基础模型,在一个8-29 MB的文件中提供工具调用、结构化提取和文本嵌入功能。
作者认为,对于大多数AI集成,模型上下文协议(MCP)优于命令行界面(CLI),理由是改进了工具调用和无状态性。
Google DeepMind 展示了如何使用其 3.8 Live Extended Thinking 模型作为编程导师,具备升级的推理能力、接近实时的视觉理解、97种语言的自动检测,以及在后台调用工具而不干扰聊天的功能。
文章询问是否有比Qwen3.5 4B更好的小型AI模型,用于构建快速的本地助手,重点是在保持速度的同时改进对话、推理、多语言支持和工具调用等能力。
Jenny 是一款免费、开源的 Electron 桌面应用,用于运行本地 LLM,支持工具调用、回滚和 IDE 功能,作为一个独立项目开发了超过 1.5 年。
Occamy-1.0是一个成本效益高的开源AI模型,专为协作代理设计,在复杂多步骤任务中表现出色,并与更大型的前沿系统具有竞争力,同时保持广泛的代理能力。
Needle 2 是一个开放的、45M 参数 AI 模型,用于工具调用和结构化提取,优化后可在浏览器中以 14MB 运行,并通过受约束采样保证 JSON 输出。
CAST是一个批判感知的训练框架,通过从稀疏结果生成结构化的动作级别理由来提高LLM代理的可靠性,在工具调用基准测试中超越了GPT-OSS-120B。
本文介绍了ARK的开发,这是一个用于AI代理的运行时监督层,通过与LangGraph代理和OpenAI模型测试,通过拒绝不合规的工具调用来执行约束,并促进模型重新规划。
这篇来自freeCodeCamp的教程解释了如何设计模式、验证输出,并处理故障,以从LLMs中可靠地提取结构化数据,涵盖了约束输出、重试循环和流式处理等技术。
这篇文章描述了一项实验,表明通过设置一个略高于边界的数值阈值,GPT-5.6 Sol可以持续在工具调用前停止,所有25对测试都展示了预期行为。