tool-calling

标签

Cards List
#tool-calling

@modal: @Alibaba_Qwen 和 @alibaba_cloud 的 Qwen3.8-2.4T-A95B 现已登陆 Modal。配备自定义 DFlash 推测器…

X AI KOLs Following ↗ · 2026-08-13 缓存

阿里巴巴 Qwen 和阿里云的 Qwen3.8-2.4T-A95B 现已登陆 Modal,配备基于工具调用密集型数据训练的自定义 DFlash 推测器和完整的 1M 上下文窗口。

0 人收藏 0 人点赞
#tool-calling

@ma_sc_:我一直在测试除官方支持的14种语言之外的许多其他语言,结果真的非常令人惊讶。……

X AI KOLs Following ↗ · 2026-08-12 缓存

一位用户分享了在多种语言上测试Liquid AI新推出的LFM2.5-VL-3B视觉语言模型的惊人结果,指出其视觉能力很强,但指令跟随能力低于预期;Liquid AI宣布该模型能够读取屏幕、文档,并将物体定位到坐标。

0 人收藏 0 人点赞
#tool-calling

可操作的幻觉检测:将潜在不确定性转化为智能体批判

arXiv cs.LG ↗ · 2026-08-12 缓存

本文介绍了 Latent Critic,一种轻量级 LoRA 适配器,它通过将 Transformer 的残差流重构为局部自然语言反馈,实时检测幻觉智能体行为,达到 0.966 的 AUROC,并支持自我纠正。

0 人收藏 0 人点赞
#tool-calling

Show HN: Needle2:面向手机、可穿戴设备、智能家居和机器人的14MB智能体LLM

Hacker News Top ↗ · 2026-08-10 缓存

Cactus Compute 发布 Needle 2,这是一个45M参数的智能体LLM,压缩为14MB二进制文件,适用于手机、可穿戴设备、智能家居和机器人,在树莓派5上实现每秒500+ tokens,运行内存仅28MB。

0 人收藏 0 人点赞
#tool-calling

Needle 2:面向手机、可穿戴设备、智能家居和机器人的 14MB 智能体 LLM。

Reddit r/LocalLLaMA ↗ · 2026-08-10

Cactus 发布了 Needle 2,这是一款面向手机、可穿戴设备、智能家居设备和机器人的 14MB 智能体 LLM,在低端硬件上实现快速推理,并支持结构化提取和微调。

0 人收藏 0 人点赞
#tool-calling

@svpino:我一直在测试Kimi K3,天哪,这是世界上见过的最好的开放权重模型。它是一个2.8T参数的…

X AI KOLs Timeline ↗ · 2026-08-05 缓存

Santiago Valdarrama 报道称,Kimi K3 是他测试过的最好的开放权重模型,一个2.8T参数的视觉模型,支持工具调用和推理,并拥有1M上下文窗口。

0 人收藏 0 人点赞
#tool-calling

2.6B 参数模型支持工具调用和 128K 上下文,现可在手机上以 30 tok/s 运行

Reddit r/LocalLLaMA ↗ · 2026-08-04

Liquid AI 发布了 LFM2.5-2.6B,这是一个 2.69B 参数模型,支持 128K 上下文和工具调用,专为多步骤智能体工作流优化,可在手机上以 30 tok/s 运行,Q4_K_M GGUF 文件约 1.67GB。不过,与更大的模型相比,其在编码和知识密集型任务上仍然较弱。

0 人收藏 0 人点赞
#tool-calling

Deploy local agents everywhere with LFM2.5-2.6B

Hugging Face Blog ↗ · 2026-08-04 缓存

Liquid AI releases LFM2.5-2.6B, a compact agentic model designed for on-device deployment, supporting tool calling and multi-step workflows with efficient inference on CPUs and GPUs.

0 人收藏 0 人点赞
#tool-calling

在我的组织构建了一个完整的 HITL 系统

Reddit r/AI_Agents ↗ · 2026-08-04

作者分享了为企业级 agent 平台构建 human-in-the-loop 审批系统的经验,强调审批步骤必须是一个真正的阻塞暂停,参数可编辑,并且拒绝/编辑结果应是一等公民,同时询问其他人如何构建 agent 暂停机制。

0 人收藏 0 人点赞
#tool-calling

OoO-Spec:用于快速工具调用的无序语义推测

arXiv cs.CL ↗ · 2026-08-04 缓存

介绍了 OoO-Spec,一种通过小型辅助模型以无序方式计算语义槽位来加速 LLM 工具调用的方法,相比自回归解码实现了最高 5.34 倍的加速,并在多个目标和基准测试中超越了现有的草稿模型方法。

0 人收藏 0 人点赞
#tool-calling

nvidia/NVIDIA-NemotronLabs-VoiceChat-11B · Hugging Face(全双工)

Reddit r/LocalLLaMA ↗ · 2026-08-03 缓存

NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款开放的端到端全双工语音模型,可实现实时对话式AI,轮转延迟约450毫秒,支持打断(barge-in)和实时工具调用,是首款支持工具调用的开放全双工模型。

0 人收藏 0 人点赞
#tool-calling

@jakevin7: deepseek flash确实强啊,来感受一下这个长程能力。agentic能力现在强太多了。 甚至他自己发现了harness里面 agent swarm 的 tool call,并且做好了拆分和安排。 这个是提示词里面没有的,它自己发现…

X AI KOLs Following ↗ · 2026-07-31 缓存

作者称赞 DeepSeek Flash 的长程和 agentic 能力大幅增强,能够自动发现并组合使用 harness 中的 subagent swarm 工具调用。

0 人收藏 0 人点赞
#tool-calling

分数持平,失败放大:误差预算如何掩盖量化LLM智能体的损害

arXiv cs.LG ↗ · 2026-07-31 缓存

本文研究了关于4位权重量化对LLM智能体几乎无损的说法,表明虽然整体基准分数持平,但量化放大了现有的工具调用失败(例如幻觉),这些失败被基准的误差预算所掩盖。作者建议报告每通道错误率以及在缩小预算下的成功率,以揭示被掩盖的损害。

0 人收藏 0 人点赞
#tool-calling

来自蚂蚁集团的 AntLing-3.0-flash 已通过 OpenRouter 在 OpenClaw 上线

Reddit r/openclaw ↗ · 2026-07-30

蚂蚁集团的 AntLing-3.0-flash 模型现已通过 OpenRouter 在 OpenClaw 上线,只需设置模型 ID 即可。它支持 256K 上下文,针对长周期工具调用进行了 RL 训练,仅提供 API,且到 8 月 3 日前免费。

0 人收藏 0 人点赞
#tool-calling

Go LLM SDK:面向流式、工具调用AI后端的统一接口(附带前端React库)

Hacker News Top ↗ · 2026-07-30 缓存

Grafana 发布了一款面向 Go 语言的 AI SDK,提供统一的 API 用于 LLM 调用、流式传输、工具执行及结构化输出,并内置与 Vercel 的 AI SDK React 前端的兼容性。

0 人收藏 0 人点赞
#tool-calling

我构建了一个GBNF语法编译器,使8B模型能够可靠地调用工具——以下是它的工作原理(深度解析)

Reddit r/LocalLLaMA ↗ · 2026-07-29

一位开发者用Rust为llama.cpp构建了一个GBNF语法编译器,该编译器强制遵循工具调用的JSON模式,使小型模型(如8B参数)能够可靠地调用工具。该系统每次调用时将语法限制为仅匹配的工具,提高了可靠性。

0 人收藏 0 人点赞
#tool-calling

如果你运行多模型智能体循环,你在哪里划分廉价节点/昂贵节点的界限?

Reddit r/AI_Agents ↗ · 2026-07-26

作者分享了一种降低多模型智能体循环成本的策略:使用廉价快速的执行器处理重复节点,并使用强大的规划器进行高层推理,同时分享了在OpenRouter上使用Ling-3.0-flash的经验。

0 人收藏 0 人点赞
#tool-calling

在4GB笔记本GPU(RTX 3050 Ti)上的本地智能体工作空间:tok/s 以及小型模型在调用工具、构建制品和RAG时遇到的困难

Reddit r/LocalLLaMA ↗ · 2026-07-25

作者在4GB RTX 3050 Ti笔记本GPU上对Bike4Mind工作空间内的本地Qwen模型进行了基准测试,发现采用Q4_K_M量化的2B模型是适配VRAM的最佳选择,达到了96 tok/s。较小的模型在工具选择、需要多个模型的制品生成以及导致模型切换开销的RAG嵌入方面存在困难。

0 人收藏 0 人点赞
#tool-calling

阻止AI内容生成代理虚构数值的技巧:将允许列表作为工具提供,而非提示中的一行文字

Reddit r/AI_Agents ↗ · 2026-07-25

一种防止AI内容生成器虚构数值的实用技术:将允许列表作为模型可调用的工具/函数提供,而不是以纯文本形式嵌入提示中。

0 人收藏 0 人点赞
#tool-calling

我使用RTX Pro 6000 (96GB)对Laguna-S-2.1和Qwen3.5-122B进行了我的私有智能体评估。这是我所测试过的最快的100B+模型,且工具调用能力最佳,但在压力下会编造事实。

Reddit r/LocalLLaMA ↗ · 2026-07-21

在RTX Pro 6000上对Laguna-S-2.1与Qwen3.5-122B的评估显示,它是所测试过的最快的100B+模型,工具调用能力最佳,但在压力下容易编造事实。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈