标签
Oodle在Hacker News上推出Agent可观测性服务,提供每百万跨度10美元的Agent追踪,帮助AI原生团队检测静默失败并提高可靠性。
这篇推文讨论了自学作为竞争护城河的概念,强调了浏览器活动和代理痕迹是关键数据来源,并介绍了AG-UI——一个用于捕获用户与代理交互以改进产品的开放标准。
本文讨论了一种构建自我学习型智能体的方法,通过结合智能体追踪与浏览器内用户活动,利用AG-UI协议捕获并应用学习成果,使产品在使用中不断改进,从而构建商业护城河。
Arize Phoenix宣布新增追踪搜索功能,以处理日益长且复杂的代理追踪,允许用户跨追踪进行搜索,并查看span的调用堆栈。
一篇论文提出了一种机制,通过安全地将混乱的日常工作转化为学习数据来改进企业智能体,采用数据代理和控制层,AREAL2.0 展示了从真实交互轨迹进行在线强化学习。
Morph Reflexes 利用共享主干上的多头分类器,从智能体轨迹中提供快速、廉价的语义信号,实现对生产智能体的可扩展监控。
Skill-DisCo 是一个框架,它将可重用的程序化技能从成功的智能体轨迹中提炼出来,并将其编译成可调用、可执行的程序。在 ALFWorld 和 WebArena 上的实验表明,该框架提高了成功率并减少了智能体的回合数。
本文实证分析了基于LLM的程序修复智能体中代码执行的成本效益,发现执行被大量使用但往往不加区分,限制执行可以在对修复成功影响最小的情况下节省大量成本。
SelfCompact是一种脚手架方法,让语言模型自主决定何时以及如何压缩长智能体轨迹,相比固定间隔方法,在减少token成本的同时实现了更好的性能。
快速执行 `hf sync` 命令可同步智能体会话轨迹,确保永不丢失,并可在不同机器间使用。
Harrison Chase宣布了一个用于检测生产环境代理追踪问题的后训练模型,声称其准确性达到SOTA水平,而成本仅为前沿模型的1/10到1/100。
LangChain工程师详细介绍了他们如何为SmithDB从头构建自定义倒排索引,以支持对存储在对象存储中的大容量代理轨迹进行全文搜索和JSON过滤,尽管负载巨大,仍实现了400ms的中位延迟。
介绍RedAct,一个通过选择性编辑敏感细节同时保留审计证据来保护智能体轨迹免受程序性技能泄露的框架,并附带用于评估的CapTraceBench基准。
TRL 现在支持对来自各种来源(如 Claude Code、Codex、OpenClaw 和 Pi)的智能体轨迹进行模型微调,这正朝着训练智能体模型的标准化栈迈进。
介绍推理原语诱导(Reasoning Primitive Induction)方法,该方法从成功的ReAct轨迹中挖掘,将重复出现的推理动作聚类为类型化的伪工具,在基准测试上比原始智能体高出数十个百分点。
已发布用于在 Hugging Face Hub 上渲染 Agent Traces 的新文档页面。
一个名为teich的库可以将代理轨迹转换为有监督微调(SFT)数据集,简化了AI训练的数据集准备。
ZenithDB是一款新的开源Rust数据库,专为存储和查询AI智能体跟踪而设计。通过在压缩过程中将同一跟踪的所有跨度放在同一个位置,它在10亿行数据上实现了亚毫秒级的跟踪获取延迟,并内置了全文搜索和延迟物化功能。