tool-calling

标签

Cards List
#tool-calling

@Alacritic_Super: 需要一款不需要强大硬件就能运行的高性能本地大语言模型?来看看 Qwythos-9B。• 9B 参数 • 1M 令牌上下文 • 原生工具调用…

X AI KOLs Timeline ↗ · 2026-07-20 缓存

Qwythos-9B 是一款拥有 9B 参数、支持 1M 令牌上下文和原生工具调用的本地大语言模型,提供 GGUF 格式,适用于 Ollama、llama.cpp 和 LM Studio。其在关键基准测试中的表现显著超越其基础模型 Qwen3.5-9B。

0 人收藏 0 人点赞
#tool-calling

不再信任代理声称的操作,改为信任执行回执。

Reddit r/AI_Agents ↗ · 2026-07-16

讨论了AI代理中一个常见的失败模式:模型声称已执行工具调用但实际并未触发。主张在生产环境中信任执行回执而非代理叙述,以确保可靠性。

0 人收藏 0 人点赞
#tool-calling

@MiaAI_lab: 运行更高效的 Gemma 4 31B IT NVFP4,轻松获得更强的智能体推理与工具调用能力 • 256k 上下文 • MTP • …

X AI KOLs Timeline ↗ · 2026-07-16 缓存

MiaAI Lab 发布了一份指南,用于通过 vLLM 以 NVFP4 量化方式运行 Google 的 Gemma 4 31B IT,支持 256k 上下文、MTP 推测解码、智能体推理、原生工具调用以及图像/视频支持。

0 人收藏 0 人点赞
#tool-calling

Google 正在更新 Gemma 4 的聊天模板,大幅修复工具调用并减少“惰性”,在 Hopper GPU 上启用 Flash Attention 4,同时提供关于如何操作及改进其视觉能力的交互式指南!

Reddit r/LocalLLaMA ↗ · 2026-07-15 缓存

Google 更新了 Gemma 4 的聊天模板,显著修复了工具调用,减少了惰性,在 Hopper GPU 上启用了 Flash Attention 4,并发布了交互式视觉指南。这些更新现已可在 Hugging Face 上获取。

0 人收藏 0 人点赞
#tool-calling

完全本地化的自主代理。

Reddit r/AI_Agents ↗ · 2026-07-15

Helix-agi 是一个自主代理框架,使用后台脉冲系统和微型 RAG 进行记忆,旨在完全本地运行于小型模型上。开发者讨论了工具调用方面的挑战,并寻求合作。

0 人收藏 0 人点赞
#tool-calling

GLM-5.2-Int4-Int8 在 8× GB10 上:约 1,200 t/s 预填充,33–54 t/s 平均解码

Reddit r/LocalLLaMA ↗ · 2026-07-14 缓存

描述了在 8 节点 DGX Spark (GB10) 集群上使用定制 vLLM 分支部署和基准测试量化后的 GLM-5.2-Int4-Int8Mix 模型,实现了约 1,200 t/s 的预填充和约 35 t/s 的解码,支持 MTP 工具调用。

0 人收藏 0 人点赞
#tool-calling

GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF

Hugging Face Models Trending ↗ · 2026-07-13 缓存

GnLOLot 发布了 MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking 模型的 GGUF 量化版本。该模型是一个 10 亿参数的思考模型,基于 Fable 5 数据微调,相比 V1 版本在工具调用/函数调用方面有所改进,旨在通过 llama.cpp 及兼容运行时进行本地部署。

0 人收藏 0 人点赞
#tool-calling

Meet GPT-5.6

Reddit r/singularity ↗ · 2026-07-09 缓存

OpenAI 发布 GPT-5.6 系列模型,每个 token 提供更多智能、更强方向一致性,并引入程序化工具调用、子代理委托和全新推理级别,显著提升自主开发效率。

0 人收藏 0 人点赞
#tool-calling

多教师同策略蒸馏中的行为杠杆失衡

arXiv cs.CL ↗ · 2026-07-09 缓存

本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。

0 人收藏 0 人点赞
#tool-calling

Qwen3.5 122B 是最好的吗?

Reddit r/LocalLLaMA ↗ · 2026-07-09

一位用户分享了他们在复杂工具调用任务中比较多个大语言模型(Qwen、Gemma)的经验,认为 Qwen3.5 122B 最可靠,同时批评了较小的 MoE 模型不稳定。

0 人收藏 0 人点赞
#tool-calling

@jakevin7: Maka 的活跃贡献者越来越多了!感谢每个贡献者!!! Make Builder 群聊现在每天特别活跃,大家都在努力做各种功能。 ◯ 大幅度优化 UI 和设计,做页面治理 ◯ 重构架构,实现流式输出,并且让其和工具调用的代码分开,实现模块…

X AI KOLs Following ↗ · 2026-07-08 缓存

Maka是一个本地优先的桌面AI工作台,近期活跃贡献者增多,团队正在优化UI、重构架构、设计Memory和Agent FS接口,并新增多项Agent能力,旨在提供可观测、可控、可持续恢复的Agent体验。

0 人收藏 0 人点赞
#tool-calling

开源模型正以约1.5倍于前沿模型的速度缩小与GPT/Claude/Gemini的编码差距,且在去污染基准测试中,一个27B模型已经击败了Claude Opus 4.8 [实时仪表盘 + 分析]

Reddit r/singularity ↗ · 2026-07-08

一个实时仪表盘和统计分析显示,开源编码模型正以1.5倍的速度缩小与闭源模型的差距,一个27B模型已经在去污染基准测试中超越了Claude Opus。工具调用可靠性仍然是主要瓶颈。

0 人收藏 0 人点赞
#tool-calling

为AI智能体提供自然语言工具的显著效果:一项跨14个模型验证NLT性能的重复研究

arXiv cs.CL ↗ · 2026-07-07 缓存

这项重复研究独立验证了自然语言工具(NLT)框架在14个模型和8,560次试验中的有效性,结果显示,与结构化工具调用相比,NLT将工具调用准确率提高了14.9个百分点,并将关键错误减少了93%,其中较小模型和推理模型的收益最为显著。

0 人收藏 0 人点赞
#tool-calling

Forethought:基于神经符号基元编程的可验证推理

arXiv cs.AI ↗ · 2026-07-07 缓存

Forethought 是一种神经符号推理系统,它将推理视为由符号与神经基元组合成的显式、可验证的程序。该系统可将基础模型准确率相对提升约 30%,使小模型在保持模型无关性与可审计性的同时,达到甚至超越前沿模型。

0 人收藏 0 人点赞
#tool-calling

Show HN: 我用Swift构建了LangGraph

Hacker News Top ↗ · 2026-07-06 缓存

Swarm是一个用于构建代理工作流和多智能体系统的Swift框架,具备类型安全的工具调用、持久化检查点以及对多种LLM提供商的支持。

0 人收藏 0 人点赞
#tool-calling

在生产环境中,你们如何在代理执行错误工具调用之前捕获它们?

Reddit r/AI_Agents ↗ · 2026-07-06

关于在AI代理执行到生产环境之前检测和防止错误工具调用策略的讨论。

0 人收藏 0 人点赞
#tool-calling

@yibie: 推荐这篇文章,Flask 作者 Armin Ronacher 追踪 Pi 的 bug 发现了一个让人不安的事实:新版 Claude 模型(Opus 4.8、Sonnet 5)的工具调用在退化——不是变好了,是变差了。而且他找到了根因:RL…

X AI KOLs Timeline ↗ · 2026-07-04 缓存

Flask 作者 Armin Ronacher 发现新版 Claude 模型(Opus 4.8、Sonnet 5)的工具调用能力退化,根因是 RL 后训练过度适配 Claude Code 的工具 schema,导致替代工具 schema 越来越难以正确生成。文章揭示了模型在特定工具调用场景下性能不升反降的现象,对 agent 开发有重要警示。

0 人收藏 0 人点赞
#tool-calling

更好的模型:更差的工具

Hacker News Top ↗ · 2026-07-04 缓存

较新的Claude模型(Opus 4.8和Sonnet 5)在工具调用行为上表现更差,它们会在工具调用参数中发明额外的字段,导致验证失败,与旧模型相比是一种倒退。

0 人收藏 0 人点赞
#tool-calling

GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking

Hugging Face Models Trending ↗ · 2026-07-03 缓存

MiniCPM5-1B-Claude-Opus-Fable5-Thinking 是一个紧凑的 10 亿参数思考型语言模型,基于 openbmb/MiniCPM5-1B 在 Fable 5 数据上微调而成,增强了编码和指令跟随能力,同时保留了原生的思考聊天模板和工具调用格式。它支持高达 128K 的上下文长度,适合本地部署。

0 人收藏 0 人点赞
#tool-calling

我对 PrismML 的 1-bit Bonsai-8B 与 IBM 的 Granite 在 CPU 工具调用上进行了基准测试。1-bit 模型胜出,但仅在语法约束解码下。

Reddit r/LocalLLaMA ↗ · 2026-07-02

对 PrismML 的 1-bit Bonsai-8B 与 IBM 的 Granite 及其他模型在 CPU 工具调用上的独立基准测试显示,在语法约束解码下,Bonsai-8B 的通过率达到 92%,超越了更大的模型,但在无约束条件下失败。Granite 是原始表现最好的模型,通过率为 72%。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈