tool-calling

标签

Cards List
#tool-calling

GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking

Hugging Face Models Trending ↗ · 2026-07-03 缓存

MiniCPM5-1B-Claude-Opus-Fable5-Thinking 是一个紧凑的 10 亿参数思考型语言模型,基于 openbmb/MiniCPM5-1B 在 Fable 5 数据上微调而成,增强了编码和指令跟随能力,同时保留了原生的思考聊天模板和工具调用格式。它支持高达 128K 的上下文长度,适合本地部署。

0 人收藏 0 人点赞
#tool-calling

我对 PrismML 的 1-bit Bonsai-8B 与 IBM 的 Granite 在 CPU 工具调用上进行了基准测试。1-bit 模型胜出,但仅在语法约束解码下。

Reddit r/LocalLLaMA ↗ · 2026-07-02

对 PrismML 的 1-bit Bonsai-8B 与 IBM 的 Granite 及其他模型在 CPU 工具调用上的独立基准测试显示,在语法约束解码下,Bonsai-8B 的通过率达到 92%,超越了更大的模型,但在无约束条件下失败。Granite 是原始表现最好的模型,通过率为 72%。

0 人收藏 0 人点赞
#tool-calling

@seclink: LongCat-2.0 发布 & 全新推出计费服务 ​ LongCat-2.0的核心特性如下: 万亿参数,1M超长上下文:原生工具调用与多步推理,稳定承载长上下文 Agent 任务。 卓越的 Coding 能力:在代码生成、代码理解与自动…

X AI KOLs Following ↗ · 2026-07-01 缓存

LongCat-2.0 模型发布,具有万亿参数和1M超长上下文,支持原生工具调用与多步推理,代码能力突出,同时推出Token资源包和按量计费的API计费服务。

0 人收藏 0 人点赞
#tool-calling

InternScience/Agents-A1 · Hugging Face

Reddit r/LocalLLaMA ↗ · 2026-06-30 缓存

Agents-A1 是 InternScience 推出的 35B 参数混合专家(MoE)智能体模型,通过长程轨迹缩放和多教师多领域蒸馏技术,在与 GPT-5.5 和 DeepSeek-V4-pro 等前沿规模系统的对比中展现出具有竞争力的性能。

0 人收藏 0 人点赞
#tool-calling

@MiaAI_lab: 如果你主要使用本地大模型进行Hermes风格的智能体循环,这可能会让你惊讶:Qwen 3.6 35B 实际上 *击败* 了 Dee…

X AI KOLs Timeline ↗ · 2026-06-29 缓存

根据MiaAI Lab的基准测试,Qwen 3.6 35B 在工具密集型和编码相关工作流上优于DeepSeek v4 Flash。

0 人收藏 0 人点赞
#tool-calling

@rohanpaul_ai:该模型("Owl Alpha")专为代理工作负载设计:工具调用、多步推理、长上下文执行…

X AI KOLs Following ↗ · 2026-06-28 缓存

Owl Alpha 是一款专为代理工作负载设计的新模型,涵盖工具调用、多步推理、长上下文执行、代码生成、自动化工作流及 DevOps 任务等场景。

0 人收藏 0 人点赞
#tool-calling

@MiaAI_lab: Qwopus 3.6-27b Coder 我收到很多请求让我测试它,于是我进行了测试。我运行了与其他模型相同的测试。它…

X AI KOLs Timeline ↗ · 2026-06-27 缓存

MiaAI Lab 测试了 Qwopus 3.6-27b Coder,发现在工具调用和代码生成方面表现不如 Qwen 3.6 27b 和 35b,且 HTML 演示出现故障。

0 人收藏 0 人点赞
#tool-calling

@timseyde: 小飞象的第一步 — LFM2.5-230M 使用 @nvidia SONIC 提供的预训练技能执行多步工具调用。同样的…

X AI KOLs Following ↗ · 2026-06-25 缓存

Liquid AI 的 LFM2.5-230M 模型在 Unitree G1 机器人上展示了多步工具调用能力,完全在 NVIDIA Jetson Orin 设备端运行,充当技能选择层。

0 人收藏 0 人点赞
#tool-calling

@AYi_AInotes: 说个反常识的判断, 80% 的 Agent 生产崩溃,跟模型智商没半毛钱关系, 基本都死在上下文溢出、工具调错、子代理失控上, 2026 年真正的分水岭在 Harness 和 Loop,不是模型啊, 兄弟@wizardly_ai 这篇工程…

X AI KOLs Timeline ↗ · 2026-06-25 缓存

这篇文章指出80%的AI Agent生产崩溃并非模型智商问题,而是由上下文溢出、工具调错、子代理失控引起。作者强调2026年的分水岭在于Harness(办公室制度、安保系统)和Loop(自动循环机制),而非模型本身。

0 人收藏 0 人点赞
#tool-calling

开放权重大模型中的约束代价:结构化输出约束下工具调用抑制的实证研究

arXiv cs.CL ↗ · 2026-06-25 缓存

本文识别并分析了开放权重大模型在同时启用工具调用和JSON模式约束时出现的'工具抑制'现象,提出了约束优先级反转假设以及一种名为'透明两遍执行'的缓解策略。

0 人收藏 0 人点赞
#tool-calling

@cwolferesearch: 什么是智能体?定义可以很简单:它只是一个在智能体循环中运行的LLM。为了使其…

X AI KOLs Timeline ↗ · 2026-06-24 缓存

清晰地定义了AI智能体为智能体循环中的LLM,涵盖LLM骨干、指令、工具、环境等组件,以及上下文管理和记忆等额外细节。

0 人收藏 0 人点赞
#tool-calling

Qwen3.6 27B 在 vLLM 中的表现比在 llama.cpp 中更差

Reddit r/LocalLLaMA ↗ · 2026-06-24

一名用户报告称,Qwen3.6-27B 模型在使用 llama.cpp 时比使用 vLLM 表现更好且更可靠,并指出尽管进行了大量配置,vLLM 仍出现工具调用错误和“被切除脑叶”的行为。

0 人收藏 0 人点赞
#tool-calling

Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF

Hugging Face Models Trending ↗ · 2026-06-20 缓存

Jackrong 发布了 Qwopus3.6-27B-Coder-Compat-MTP-GGUF,这是 Qwopus3.6-27B-Coder 模型的 GGUF 量化版本,并扩展了聊天模板,以提升与工具使用运行时及 OpenAI 兼容的代理框架的互操作性。

0 人收藏 0 人点赞
#tool-calling

@PatrickToulme: 本周我在本地部署了GLM 5.2,使用OpenCode工具链与Claude Opus进行了对比。底线:这是一个真正的前沿……

X AI KOLs Following ↗ · 2026-06-20 缓存

GLM 5.2 是一个前沿的开源编程模型,在编程任务上的表现接近 Claude Opus,具备出色的工具调用、规划和本地部署能力,且完全免费。

0 人收藏 0 人点赞
#tool-calling

@cevenif: 用苹果电脑跑本地大模型的朋友,有个工具值得盯上——Rapid-MLX。它在 M 系列芯片上的推理速度比 Ollama 快 2 到 4 倍,因为它是直接基于苹果的 MLX 框架开发的,对芯片架构的压榨更彻底。 几个关键点: KV 缓存裁剪加…

X AI KOLs Timeline ↗ · 2026-06-18 缓存

Rapid-MLX 是一个针对苹果 M 系列芯片优化的本地大模型推理工具,基于 MLX 框架开发,推理速度比 Ollama 快 2 到 4 倍,支持多种模型、工具调用及 OpenAI API 兼容接口。

0 人收藏 0 人点赞
#tool-calling

LedgerAgent:面向政策合规工具调用代理的结构化状态

Hugging Face Daily Papers ↗ · 2026-06-18 缓存

LedgerAgent 是一种面向客服代理的方法,通过维护独立的账本来记录任务状态,从而在工具调用过程中提升政策合规性与状态管理能力。在四个领域中,该方法相比标准方法平均 passk 指标均有提升。

0 人收藏 0 人点赞
#tool-calling

@haider1: GLM 5.2 感觉像是开放权重模型的 opus 4.5 时刻,真正让我印象深刻的是在长时间、多步骤的…

X AI KOLs Following ↗ · 2026-06-17 缓存

GLM 5.2 标志着开放权重模型的一个重要里程碑,展示了在长多步骤任务中强大的上下文保留能力以及更可靠的工具调用。

0 人收藏 0 人点赞
#tool-calling

Kimi K2.7 Code:1万亿参数MoE,每百万token仅0.95美元,MIT许可证,MCP工具调用性能超越Opus 4.8

Reddit r/AI_Agents ↗ · 2026-06-17

Moonshot AI 发布了专注于编程的开放式权重模型 Kimi K2.7 Code,拥有1万亿参数和384个专家,性能在MCP工具调用上超越Opus 4.8,成本仅为十分之一。

0 人收藏 0 人点赞
#tool-calling

企业级智能体路由的扩展:退化、诊断与恢复

arXiv cs.CL ↗ · 2026-06-17 缓存

本文研究了在企业生产力助手中,当智能体数量从10个扩展到110个时,路由准确性的退化情况,发现F1值下降了16–23个百分点。论文诊断了检索差距和混淆差距,并展示了基于嵌入的短列表方法可以恢复10–11个百分点的F1值。

0 人收藏 0 人点赞
#tool-calling

你最强的模型可能不是最佳的工具调用者

Reddit r/AI_Agents ↗ · 2026-06-17

本文认为,工具调用的可靠性往往不与模型能力成正比;较小的模型在遵循模式和格式规范方面可能超越较大的模型,这表明原始能力并非选择工具调用模型的唯一因素。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈