标签
AgentLens 是一个新的开源基准测试,用于评估编码智能体,它评估交互的完整轨迹,包括指令遵循、工具使用、错误恢复等,使用形式化验证和LLM编写的审查。
本文提出 TIE,一种面向 Masked Diffusion Language Models 的知识融合框架,通过追踪置信度动态来识别可靠解码轨迹,并在模型间迭代传输部分去噪序列,从而提升推理任务的生成质量。
作者分享了尝试多种Agent Memory实现后的心得,认为只有严格限制长度的条目级记忆(如Hermes)和基于轨迹沉淀的技能进化两种方法比较有用,其他图谱类或卡片类的方法效果不佳。
Nvidia发布了一个2.6B开源世界模型,能够从单张图片、文本提示和轨迹生成可控世界,并在单个GPU上运行。
文章讨论了随着AI智能体运行时间延长至数天和数百步,传统可观测性方法失效,提出基于轨迹的可观测性驱动开发(ODD)来监控和调试长时间运行的智能体,并介绍了Honeycomb平台的相关实践。