tool-calls

标签

Cards List
#tool-calls

既然智能体现在能采取实际行动(不仅生成文本),人们是如何应对智能体AI安全的?

Reddit r/AI_Agents · 2026-07-13

讨论当AI智能体不仅能生成文本还能采取实际行动(例如更新记录、调用API)时出现的新安全挑战,探索所需的基础设施,如限定范围的身份、策略层和操作日志。

0 人收藏 0 人点赞
#tool-calls

我的智能体不停撒谎,于是我让它们展示工作过程

Reddit r/AI_Agents · 2026-07-02

作者描述构建了一个‘门控’,记录工具调用并验证AI智能体回答中的声明是否对应实际日志条目,迫使智能体展示其工作过程,从而减少幻觉回答。

0 人收藏 0 人点赞
#tool-calls

AI代理的工具调用是否应在执行前进行检查?

Reddit r/AI_Agents · 2026-06-24

讨论AI代理的工具调用是否应在执行前进行检查,探讨安全性和验证方面的考虑。

0 人收藏 0 人点赞
#tool-calls

@tli104: 新论文:"Self-Compacting Language Model Agents" 语言模型代理会构建冗长的推理和工具调用轨迹。随着轨…

X AI KOLs Timeline · 2026-06-23 缓存

新论文提出自压缩语言模型代理,该类代理可自行决定何时清理其推理和工具调用轨迹,以避免积累错误和过时信息。

0 人收藏 0 人点赞
#tool-calls

gpt-5.5 通过 codex 运行时会在对话轮次中静默丢弃工具调用——有人遇到类似情况吗?

Reddit r/openclaw · 2026-06-21

用户报告称,通过 codex agentRuntime 使用 gpt-5.5 时,在较短的对话轮次中,工具调用会被静默丢弃,导致模型虽生成文本但无响应。该问题为 gpt-5.5 特有,切换至 deepseek/deepseek-v4-pro 即可解决,表明可能存在回归故障。

0 人收藏 0 人点赞
#tool-calls

@xdotli: ICYMI Nanbeige 4.1,一个由中国Indeed发布的3B模型,性能优于Qwen3-30b-A3b + Qwen 3.5 4b。它可以完成长…

X AI KOLs Timeline · 2026-06-20 缓存

Nanbeige 4.1,一个来自中国Indeed的3B模型,在需要600+工具调用的任务上性能优于更大的Qwen模型。

0 人收藏 0 人点赞
#tool-calls

构建AI代理工具调用的开源执行层

Reddit r/AI_Agents · 2026-06-15

介绍Faramesh,一个开源运行时执行层,用于AI代理工具调用,在操作执行前检查策略,提供超越可观测性或LLM评判的解决方案。

0 人收藏 0 人点赞
#tool-calls

Kimi K2.7 Code 务实胜过炫技

Reddit r/AI_Agents · 2026-06-12

Kimi 发布了 K2.7 Code,这是一款专注于编程的 AI 模型,其基准测试成绩提升,且思考令牌使用量降低 30%。它更强调在长代码循环和智能体工具集成中的实际性能,而非炫目的分数。

0 人收藏 0 人点赞
#tool-calls

@NathanWilbanks_: 这就是真正的AGI循环的样子:6+小时智能体运行时间 2.4亿+ tokens 86%+缓存命中率 500+工具调用 花费125美元 …

X AI KOLs Timeline · 2026-06-08 缓存

一个名为Annie的AI智能体自主将一份宝可梦红宝石GBA ROM重新编译成一个完整的混合WASM重编译器和GBA运行时,完成了一项通常需要专家团队数月、花费数万美元的任务。

0 人收藏 0 人点赞
#tool-calls

你的代理失败不是因为模型,而是因为没人构建一个停止按钮

Reddit r/AI_Agents · 2026-06-08

文章认为,AI代理在生产中的主要失败点并非模型本身,而是缺乏基础设施,如停止按钮、账单监控以及工具调用的可追溯性。

0 人收藏 0 人点赞
#tool-calls

我的智能体在凌晨3点给老板发了邮件——防止危险工具调用的两行人工审核防护

Reddit r/AI_Agents · 2026-06-05

本文介绍了一种简单的模式,将AI智能体工具分为安全与危险两类,将发送邮件、删除文件等危险操作路由到人工审批节点,以防止意外执行。

0 人收藏 0 人点赞
#tool-calls

为什么你的智能体在温度0时仍会给出不同的答案?

Reddit r/AI_Agents · 2026-06-04

将温度设置为0并不能保证智能体中的工具调用具有确定性,原因在于批处理推理会导致浮点数归约顺序发生变化,从而引发token翻转,并在负载下产生不同的动作。

0 人收藏 0 人点赞
#tool-calls

@Designarena: 宣布在Design Arena上推出Agentic Game Development——我们最新的多文件、多轮评估。抢先看…

X AI KOLs Following · 2026-06-01 缓存

Design Arena宣布推出Agentic Game Development,这是一种新的多文件、多轮评估,可访问资产目录、内置库(如Howler和Tween.js),并扩展了用于精灵生成和资产发现的工具调用。

0 人收藏 0 人点赞
#tool-calls

@cursor_ai: 自动审查模式现已在 Cursor 中可用。它允许代理以更少的批准提示和更安全的执行来运行工具调用…

X AI KOLs Following · 2026-05-29 缓存

Cursor 发布了自动审查模式,该模式允许代理以更少的批准提示执行工具调用,同时保持安全。

0 人收藏 0 人点赞
#tool-calls

当我最终对智能体的工具调用进行监控时,成本分解让我感到惊讶。几点经验教训。

Reddit r/AI_Agents · 2026-05-25

作者分享了监控AI智能体工具调用的经验教训,揭示了像web_search这样的工具可能占支出的约50%,并强调了追踪p95延迟以及按工作流或客户归因成本的重要性,以避免意外。

0 人收藏 0 人点赞
#tool-calls

LLC: 轻量级 OpenWebUI 替代方案 - 现已支持聊天转换器和自定义工具调用

Reddit r/LocalLLaMA · 2026-05-20

LLC 是 OpenWebUI 的轻量级替代品,用于运行本地大语言模型。最新 v0.6 版本新增了聊天转换器以导入 OpenWebUI 历史记录,以及支持用户自定义工具调用的功能。

0 人收藏 0 人点赞
#tool-calls

有人昨天觉得GPT5.5变笨/变懒了吗?

Reddit r/openclaw · 2026-05-12

一位运行多个代理的用户报告称,升级到GPT-5.5后,模型突然在执行工具调用方面能力下降,更倾向于给出建议而非实际执行,推测OpenAI可能在进行限流以管理负载。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈