tool-calling

标签

Cards List
#tool-calling

SLCA-GRPO: 解决工具调用强化学习中的跨段信用分配错误

arXiv cs.AI ↗ · 19小时前 缓存

SLCA-GRPO 引入段锁定信用分配,通过解耦优势估计和使用层级奖励来改善工具调用代理的强化学习,从而实现更快的收敛和更高的准确性。

0 人收藏 0 人点赞
#tool-calling

TwinCheck:基于证据的负孪生验证,用于有状态工具智能体

arXiv cs.AI ↗ · 昨天 缓存

TwinCheck 是一种推理时验证策略,通过使用基于证据的负孪生比较来增强有状态工具智能体,显著提升了如BFCL V4等基准测试中的任务成功率。

0 人收藏 0 人点赞
#tool-calling

@kentcdodds:语音模式中的工具调用支持是必然且出色的

X AI KOLs Following ↗ · 2天前 缓存

OpenAI 已在 ChatGPT Voice 中添加了工具调用支持,使其能够使用插件,如电子邮件、日历和 Slack,由 GPT-6 Astra、Sol 和 Luna 驱动。

0 人收藏 0 人点赞
#tool-calling

真诚提问:更小的量化模型是否正在成为本地AI的最佳选择?

Reddit r/LocalLLaMA ↗ · 6天前

文章探讨了更小的量化模型是否正在成为本地AI应用的首选,强调了它们在VRAM使用、性能和功能(如工具调用)之间的平衡。

0 人收藏 0 人点赞
#tool-calling

@shao__meng: Weekends are perfect for settling down to systematically learn foundational knowledge CMU Fall Latest Course 11-768: AI…

X AI KOLs Timeline ↗ · 6天前 缓存

CMU offers a new fall 2026 course on AI Agents taught by Daniel Fried and Graham Neubig, covering topics like tool calling, reinforcement learning training, and human-computer interaction.

0 人收藏 0 人点赞
#tool-calling

对于调用工具或自动化的代理,你们在使用哪些验证模式?

Reddit r/AI_Agents ↗ · 6天前

文章讨论了AI代理的验证模式,以确保可靠性,建议的技术包括分离执行者和验证者、强制结构化输出,以及使用证据上限来防止幻觉和不当行为。

0 人收藏 0 人点赞
#tool-calling

SFT 还是 RL 用于工具调用代理?一项跨数据、方法和规模的对照研究

arXiv cs.CL ↗ · 2026-09-17 缓存

这项对照研究比较了监督微调和强化学习方法在不同数据集和模型规模下训练工具调用代理的表现,发现SFT结合LoRA在分布内表现最强,而RL在跨数据集迁移中略有优势。

0 人收藏 0 人点赞
#tool-calling

@trq212:相关讨论- 我认为,如果目标仅仅是可靠的工具调用,bash已不再是唯一必需的工具,但沙箱加bash…

X AI KOLs Timeline ↗ · 2026-09-16 缓存

Thariq认为,由于改进的模型能力和MCP的无状态设计,MCPs在AI工具调用方面优于CLIs,而bash和沙箱仍适用于代码生成和执行。

0 人收藏 0 人点赞
#tool-calling

Ruby UTCP

Product Hunt ↗ · 2026-09-16 缓存

Ruby UTCP 是一个开源库,它为 Ruby 应用程序和 AI 代理提供了一种标准方式,通过各种协议发现和调用工具。它支持 12 种传输,并包括流式传输、身份验证和 OpenAPI 发现等功能。

0 人收藏 0 人点赞
#tool-calling

Cactus-Compute/needle3

Hugging Face Models Trending ↗ · 2026-09-16 缓存

Needle 3 是一款针对移动设备和可穿戴设备等边缘设备优化的紧凑AI基础模型,在一个8-29 MB的文件中提供工具调用、结构化提取和文本嵌入功能。

0 人收藏 0 人点赞
#tool-calling

@trq212: 我没想到事情会这样发展,但我认为对于大多数集成来说,MCP比CLI更好。模型已经…

X AI KOLs Timeline ↗ · 2026-09-15 缓存

作者认为,对于大多数AI集成,模型上下文协议(MCP)优于命令行界面(CLI),理由是改进了工具调用和无状态性。

0 人收藏 0 人点赞
#tool-calling

@GoogleDeepMind: 观看我们如何使用 3.8 Live Extended Thinking 担任编程导师。两款模型均具备:升级推理能力、接近实时的视觉理解……

X AI KOLs ↗ · 2026-09-15 缓存

Google DeepMind 展示了如何使用其 3.8 Live Extended Thinking 模型作为编程导师,具备升级的推理能力、接近实时的视觉理解、97种语言的自动检测,以及在后台调用工具而不干扰聊天的功能。

0 人收藏 0 人点赞
#tool-calling

是否存在比Qwen3.5 4B更好的小型模型,用于快速的本地AI助手?

Reddit r/LocalLLaMA ↗ · 2026-09-14

文章询问是否有比Qwen3.5 4B更好的小型AI模型,用于构建快速的本地助手,重点是在保持速度的同时改进对话、推理、多语言支持和工具调用等能力。

0 人收藏 0 人点赞
#tool-calling

经过一年多的业余时间,Jenny 应用终于完成了!

Reddit r/LocalLLaMA ↗ · 2026-09-07

Jenny 是一款免费、开源的 Electron 桌面应用,用于运行本地 LLM,支持工具调用、回滚和 IDE 功能,作为一个独立项目开发了超过 1.5 年。

0 人收藏 0 人点赞
#tool-calling

Occamy-1.0:开源帕累托前沿35B协作智能模型

Hugging Face Daily Papers ↗ · 2026-09-04 缓存

Occamy-1.0是一个成本效益高的开源AI模型,专为协作代理设计,在复杂多步骤任务中表现出色,并与更大型的前沿系统具有竞争力,同时保持广泛的代理能力。

0 人收藏 0 人点赞
#tool-calling

@cactuscompute: Needle 最不为人知的秘密不是函数调用。它是结构化提取。长文本输入 → 有效 JSON 输出。小巧…

X AI KOLs Timeline ↗ · 2026-09-01 缓存

Needle 2 是一个开放的、45M 参数 AI 模型,用于工具调用和结构化提取,优化后可在浏览器中以 14MB 运行,并通过受约束采样保证 JSON 输出。

0 人收藏 0 人点赞
#tool-calling

CAST:用于训练可靠长程工具调用代理的批判感知监督

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

CAST是一个批判感知的训练框架,通过从稀疏结果生成结构化的动作级别理由来提高LLM代理的可靠性,在工具调用基准测试中超越了GPT-OSS-120B。

0 人收藏 0 人点赞
#tool-calling

我在真实的LangGraph代理周围添加了一个运行时监督器——它在执行前拒绝了一个工具调用,模型重新规划了

Reddit r/AI_Agents ↗ · 2026-08-29

本文介绍了ARK的开发,这是一个用于AI代理的运行时监督层,通过与LangGraph代理和OpenAI模型测试,通过拒绝不合规的工具调用来执行约束,并促进模型重新规划。

0 人收藏 0 人点赞
#tool-calling

@freeCodeCamp: 获取你的应用程序真正能信任的结构化数据可能很棘手。在这篇教程中,Vineeth解释了如何设计模式…

X AI KOLs Timeline ↗ · 2026-08-29 缓存

这篇来自freeCodeCamp的教程解释了如何设计模式、验证输出,并处理故障,以从LLMs中可靠地提取结构化数据,涵盖了约束输出、重试循环和流式处理等技术。

0 人收藏 0 人点赞
#tool-calling

我成功让GPT-5.6 Sol在工具调用前停止 - 25/25次(自己试试)

Reddit r/ArtificialInteligence ↗ · 2026-08-28 缓存

这篇文章描述了一项实验,表明通过设置一个略高于边界的数值阈值,GPT-5.6 Sol可以持续在工具调用前停止,所有25对测试都展示了预期行为。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈