tool-calling

标签

Cards List
#tool-calling

在4GB笔记本GPU(RTX 3050 Ti)上的本地智能体工作空间:tok/s 以及小型模型在调用工具、构建制品和RAG时遇到的困难

Reddit r/LocalLLaMA ↗ · 2026-07-25

作者在4GB RTX 3050 Ti笔记本GPU上对Bike4Mind工作空间内的本地Qwen模型进行了基准测试,发现采用Q4_K_M量化的2B模型是适配VRAM的最佳选择,达到了96 tok/s。较小的模型在工具选择、需要多个模型的制品生成以及导致模型切换开销的RAG嵌入方面存在困难。

0 人收藏 0 人点赞
#tool-calling

阻止AI内容生成代理虚构数值的技巧:将允许列表作为工具提供,而非提示中的一行文字

Reddit r/AI_Agents ↗ · 2026-07-25

一种防止AI内容生成器虚构数值的实用技术:将允许列表作为模型可调用的工具/函数提供,而不是以纯文本形式嵌入提示中。

0 人收藏 0 人点赞
#tool-calling

我使用RTX Pro 6000 (96GB)对Laguna-S-2.1和Qwen3.5-122B进行了我的私有智能体评估。这是我所测试过的最快的100B+模型,且工具调用能力最佳,但在压力下会编造事实。

Reddit r/LocalLLaMA ↗ · 2026-07-21

在RTX Pro 6000上对Laguna-S-2.1与Qwen3.5-122B的评估显示,它是所测试过的最快的100B+模型,工具调用能力最佳,但在压力下容易编造事实。

0 人收藏 0 人点赞
#tool-calling

@Alacritic_Super: 需要一款不需要强大硬件就能运行的高性能本地大语言模型?来看看 Qwythos-9B。• 9B 参数 • 1M 令牌上下文 • 原生工具调用…

X AI KOLs Timeline ↗ · 2026-07-20 缓存

Qwythos-9B 是一款拥有 9B 参数、支持 1M 令牌上下文和原生工具调用的本地大语言模型,提供 GGUF 格式,适用于 Ollama、llama.cpp 和 LM Studio。其在关键基准测试中的表现显著超越其基础模型 Qwen3.5-9B。

0 人收藏 0 人点赞
#tool-calling

不再信任代理声称的操作,改为信任执行回执。

Reddit r/AI_Agents ↗ · 2026-07-16

讨论了AI代理中一个常见的失败模式:模型声称已执行工具调用但实际并未触发。主张在生产环境中信任执行回执而非代理叙述,以确保可靠性。

0 人收藏 0 人点赞
#tool-calling

@MiaAI_lab: 运行更高效的 Gemma 4 31B IT NVFP4,轻松获得更强的智能体推理与工具调用能力 • 256k 上下文 • MTP • …

X AI KOLs Timeline ↗ · 2026-07-16 缓存

MiaAI Lab 发布了一份指南,用于通过 vLLM 以 NVFP4 量化方式运行 Google 的 Gemma 4 31B IT,支持 256k 上下文、MTP 推测解码、智能体推理、原生工具调用以及图像/视频支持。

0 人收藏 0 人点赞
#tool-calling

Google 正在更新 Gemma 4 的聊天模板,大幅修复工具调用并减少“惰性”,在 Hopper GPU 上启用 Flash Attention 4,同时提供关于如何操作及改进其视觉能力的交互式指南!

Reddit r/LocalLLaMA ↗ · 2026-07-15 缓存

Google 更新了 Gemma 4 的聊天模板,显著修复了工具调用,减少了惰性,在 Hopper GPU 上启用了 Flash Attention 4,并发布了交互式视觉指南。这些更新现已可在 Hugging Face 上获取。

0 人收藏 0 人点赞
#tool-calling

完全本地化的自主代理。

Reddit r/AI_Agents ↗ · 2026-07-15

Helix-agi 是一个自主代理框架,使用后台脉冲系统和微型 RAG 进行记忆,旨在完全本地运行于小型模型上。开发者讨论了工具调用方面的挑战,并寻求合作。

0 人收藏 0 人点赞
#tool-calling

GLM-5.2-Int4-Int8 在 8× GB10 上:约 1,200 t/s 预填充,33–54 t/s 平均解码

Reddit r/LocalLLaMA ↗ · 2026-07-14 缓存

描述了在 8 节点 DGX Spark (GB10) 集群上使用定制 vLLM 分支部署和基准测试量化后的 GLM-5.2-Int4-Int8Mix 模型,实现了约 1,200 t/s 的预填充和约 35 t/s 的解码,支持 MTP 工具调用。

0 人收藏 0 人点赞
#tool-calling

GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF

Hugging Face Models Trending ↗ · 2026-07-13 缓存

GnLOLot 发布了 MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking 模型的 GGUF 量化版本。该模型是一个 10 亿参数的思考模型,基于 Fable 5 数据微调,相比 V1 版本在工具调用/函数调用方面有所改进,旨在通过 llama.cpp 及兼容运行时进行本地部署。

0 人收藏 0 人点赞
#tool-calling

Meet GPT-5.6

Reddit r/singularity ↗ · 2026-07-09 缓存

OpenAI 发布 GPT-5.6 系列模型,每个 token 提供更多智能、更强方向一致性,并引入程序化工具调用、子代理委托和全新推理级别,显著提升自主开发效率。

0 人收藏 0 人点赞
#tool-calling

多教师同策略蒸馏中的行为杠杆失衡

arXiv cs.CL ↗ · 2026-07-09 缓存

本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。

0 人收藏 0 人点赞
#tool-calling

Qwen3.5 122B 是最好的吗?

Reddit r/LocalLLaMA ↗ · 2026-07-09

一位用户分享了他们在复杂工具调用任务中比较多个大语言模型(Qwen、Gemma)的经验,认为 Qwen3.5 122B 最可靠,同时批评了较小的 MoE 模型不稳定。

0 人收藏 0 人点赞
#tool-calling

@jakevin7: Maka 的活跃贡献者越来越多了!感谢每个贡献者!!! Make Builder 群聊现在每天特别活跃,大家都在努力做各种功能。 ◯ 大幅度优化 UI 和设计,做页面治理 ◯ 重构架构,实现流式输出,并且让其和工具调用的代码分开,实现模块…

X AI KOLs Following ↗ · 2026-07-08 缓存

Maka是一个本地优先的桌面AI工作台,近期活跃贡献者增多,团队正在优化UI、重构架构、设计Memory和Agent FS接口,并新增多项Agent能力,旨在提供可观测、可控、可持续恢复的Agent体验。

0 人收藏 0 人点赞
#tool-calling

开源模型正以约1.5倍于前沿模型的速度缩小与GPT/Claude/Gemini的编码差距,且在去污染基准测试中,一个27B模型已经击败了Claude Opus 4.8 [实时仪表盘 + 分析]

Reddit r/singularity ↗ · 2026-07-08

一个实时仪表盘和统计分析显示,开源编码模型正以1.5倍的速度缩小与闭源模型的差距,一个27B模型已经在去污染基准测试中超越了Claude Opus。工具调用可靠性仍然是主要瓶颈。

0 人收藏 0 人点赞
#tool-calling

为AI智能体提供自然语言工具的显著效果:一项跨14个模型验证NLT性能的重复研究

arXiv cs.CL ↗ · 2026-07-07 缓存

这项重复研究独立验证了自然语言工具(NLT)框架在14个模型和8,560次试验中的有效性,结果显示,与结构化工具调用相比,NLT将工具调用准确率提高了14.9个百分点,并将关键错误减少了93%,其中较小模型和推理模型的收益最为显著。

0 人收藏 0 人点赞
#tool-calling

Forethought:基于神经符号基元编程的可验证推理

arXiv cs.AI ↗ · 2026-07-07 缓存

Forethought 是一种神经符号推理系统,它将推理视为由符号与神经基元组合成的显式、可验证的程序。该系统可将基础模型准确率相对提升约 30%,使小模型在保持模型无关性与可审计性的同时,达到甚至超越前沿模型。

0 人收藏 0 人点赞
#tool-calling

Show HN: 我用Swift构建了LangGraph

Hacker News Top ↗ · 2026-07-06 缓存

Swarm是一个用于构建代理工作流和多智能体系统的Swift框架,具备类型安全的工具调用、持久化检查点以及对多种LLM提供商的支持。

0 人收藏 0 人点赞
#tool-calling

在生产环境中,你们如何在代理执行错误工具调用之前捕获它们?

Reddit r/AI_Agents ↗ · 2026-07-06

关于在AI代理执行到生产环境之前检测和防止错误工具调用策略的讨论。

0 人收藏 0 人点赞
#tool-calling

@yibie: 推荐这篇文章,Flask 作者 Armin Ronacher 追踪 Pi 的 bug 发现了一个让人不安的事实:新版 Claude 模型(Opus 4.8、Sonnet 5)的工具调用在退化——不是变好了,是变差了。而且他找到了根因:RL…

X AI KOLs Timeline ↗ · 2026-07-04 缓存

Flask 作者 Armin Ronacher 发现新版 Claude 模型(Opus 4.8、Sonnet 5)的工具调用能力退化,根因是 RL 后训练过度适配 Claude Code 的工具 schema,导致替代工具 schema 越来越难以正确生成。文章揭示了模型在特定工具调用场景下性能不升反降的现象,对 agent 开发有重要警示。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈