标签
Perplexity 开源了 Numbat,这是一套安全套件,用于监控在员工笔记本电脑和工作站上运行的 AI 编程代理,检测并阻止危险的代理行为。
一份在消费级GPU上运行本地AI的实用指南:将大型云端模型作为架构师,与较小的本地模型作为子代理配对,使用OpenRouter和Hermes等工具。
DarwinX 通过自然选择式的种群搜索进化 LLM 智能体框架,模型权重保持冻结,在不做基准特定修补的情况下,提升了多个基准测试上的验证性能。
LangChain发布了Deep Agents v0.7,这是一个更精简的智能体框架,通过移除默认系统提示、精简工具描述以及将TodoListMiddleware设为可选,将基础输入令牌减少了65%,并在多个模型上验证了性能相当。
JarvisHub是一个开放框架,专为画布原生多模态创意代理设计,它将可编辑画布作为用户工作区,实现可检查和可编辑状态下的长周期创意自动化。
TRL 现在通过 OpenEnv 集成开箱即用地支持在 agent harness 上进行训练,支持使用 opencode 等 harness 进行训练。
Harness Handbook 为AI智能体框架提供了行为级手册,将系统行为与可验证的代码证据关联,使框架可理解、可审计、可编辑。
Harness Handbook是一种以行为为中心的表示,通过静态程序分析和LLM辅助从智能体harness代码库中合成,帮助开发者和编码智能体定位实现特定行为的代码。它引入了行为引导的渐进式披露(BGPD),引导智能体从高层描述到相关实现细节,提高了定位准确性和编辑计划质量。
Cline 的代理工具集现已通过 ACP 支持集成到 JetBrains Air 中,用户可直接在应用内驱动编码任务。Air 的最新版本还增加了 Java 语言支持及添加多种代理的功能。
Helix-agi 是一个自主代理框架,使用后台脉冲系统和微型 RAG 进行记忆,旨在完全本地运行于小型模型上。开发者讨论了工具调用方面的挑战,并寻求合作。
作者讨论了构建六个AI智能体工具框架的过程,并强调需要一个专用数据库来追踪智能体的执行、状态和学习成果,而不仅仅是依赖可观测性工具。
OpenSquilla 发布 v0.5.0,通过智能路由和多模型集成实现性能超越 Fable5 并降低 67% 成本;同时新增 MetaSkills 和 Coding mode 功能。
Glean 的工程博客详细介绍了他们的新代理框架,该框架通过代码执行实现 100% 程序化工具调用,与标准工具调用相比,减少 24% 的 Token 使用量。该框架通过工具截断和沙箱文件系统管理上下文,适用于长时间运行的复杂工作流。
一位开发者讲述了一位前Anthropic工程师的神秘提示(“检查你的分数”)如何引导他创建了一个由文件和命令(例如CLAUDE.md、init.sh、feature_list.json等)组成的工具集,用于评估和改进Claude AI代理的性能,最终将这个提示变成了实用的工具。
Flask 作者 Armin Ronacher 发现新版 Claude 模型(Opus 4.8、Sonnet 5)的工具调用能力退化,根因是 RL 后训练过度适配 Claude Code 的工具 schema,导致替代工具 schema 越来越难以正确生成。文章揭示了模型在特定工具调用场景下性能不升反降的现象,对 agent 开发有重要警示。
作者比较了三个开源 AI 代理工具——Pi、Goose 和 OpenCode,认为它们运行在 AI 代理栈的不同层次:Pi 是代理框架/工具包,Goose 是本地工作台/编排面,OpenCode 是编码优先的代理。
一份精心整理的关于人工智能编码代理的约束工程资源合集,包括一个课程、一个Python工具(tau-ai)、以及来自Anthropic和LangChain的博客文章。