trajectory

标签

Cards List
#trajectory

AgentLens: 面向编码智能体评估的生产评估轨迹审查

arXiv cs.AI · 2026-07-09 缓存

AgentLens 是一个新的开源基准测试,用于评估编码智能体,它评估交互的完整轨迹,包括指令遵循、工具使用、错误恢复等,使用形式化验证和LLM编写的审查。

0 人收藏 0 人点赞
#trajectory

现在谁主导解码?追踪 Masked Diffusion Language Models 集成中的可靠轨迹

Hugging Face Daily Papers · 2026-06-15 缓存

本文提出 TIE,一种面向 Masked Diffusion Language Models 的知识融合框架,通过追踪置信度动态来识别可靠解码轨迹,并在模型间迭代传输部分去噪序列,从而提升推理任务的生成质量。

0 人收藏 0 人点赞
#trajectory

@9hills: 尝试了多种Agent Memory实现,只有两种我觉得还有点用: 1. Hermes 这种严格限制长度的条目级记忆和会话召回,用来解决个人助理所需的记忆。但是这种和Coding没关系。 2. 根据轨迹沉淀 skill 和 skill 进化…

X AI KOLs Timeline · 2026-05-25 缓存

作者分享了尝试多种Agent Memory实现后的心得,认为只有严格限制长度的条目级记忆(如Hermes)和基于轨迹沉淀的技能进化两种方法比较有用,其他图谱类或卡片类的方法效果不佳。

0 人收藏 0 人点赞
#trajectory

@itsPaulAi: 哇哦,Nvidia刚刚发布了一个2.6B开源世界模型,你可以将单张图片、文本提示和轨迹转化为…

X AI KOLs Timeline · 2026-05-15 缓存

Nvidia发布了一个2.6B开源世界模型,能够从单张图片、文本提示和轨迹生成可控世界,并在单个GPU上运行。

0 人收藏 0 人点赞
#trajectory

From Spans to Trajectories: Observability for Long-Running Agents

YouTube AI Channels · 2026-06-27 缓存

文章讨论了随着AI智能体运行时间延长至数天和数百步,传统可观测性方法失效,提出基于轨迹的可观测性驱动开发(ODD)来监控和调试长时间运行的智能体,并介绍了Honeycomb平台的相关实践。

1 人收藏 1 人点赞
← 返回首页

提交意见反馈