agent-performance

标签

Cards List
#agent-performance

K-Bench:评估模型在真实科学代理请求中的性能

arXiv cs.AI · 15小时前 缓存

论文介绍了 K-Bench 01,一个用于评估 AI 代理在真实科学请求中性能的基准,揭示了没有模型能持续达到可接受性能的阈值,过度声明是常见的失败模式。

0 人收藏 0 人点赞
#agent-performance

@LiorOnAI:智能体性能现在依赖于动态环境中的强化学习,具有逼真的状态转换、反馈循环和长期目标。

X AI KOLs Following · 2026-06-25 缓存

这条来自Lior的推文讨论了强化学习中动态环境下的智能体性能,同时强调了PatronusAI由GreenfieldVC领投的5000万美元B轮融资,用于开发AI模拟和评估。

0 人收藏 0 人点赞
#agent-performance

@harvey: 基于法律实践领域的推理时模型路由显著提升了智能体性能。其他类型的……也是如此。

X AI KOLs Following · 2026-06-25 缓存

Harvey 正在尝试推理时模型路由和混合智能技术,以提高法律任务中智能体的性能,既展现了前景也揭示了风险。

0 人收藏 0 人点赞
#agent-performance

厌倦了每次会话都要重新配置你的智能体?正在构建记忆系统来解决这个问题?这里有一份指南,告诉你设计系统时需要考虑的一些要点。

Reddit r/AI_Agents · 2026-06-25

探讨了AI智能体记忆系统如何常常忽略工作记忆等关键认知过程,将其与顺行性遗忘症进行类比,并为更有效的解决方案提供设计指导。

0 人收藏 0 人点赞
#agent-performance

模型是CPU,不是整台电脑——为什么智能体性能的提升,框架与模型升级同等重要

Reddit r/AI_Agents · 2026-06-09

文章认为,对于智能体性能而言,框架(模型周围的系统)与模型本身同等重要,并引用了多项基准测试和实验的证据。

0 人收藏 0 人点赞
#agent-performance

昨天我看到一篇关于 δ-mem 并与 openclaw 集成的新研究论文

Reddit r/openclaw · 2026-05-17

一篇关于 δ-mem 的新研究论文在与 openclaw 集成后,将智能体响应质量提升了 7-32%。该项目目前仅适用于 mlx 和 Qwen3:4b,但预计会推出其他模型的适配器。

0 人收藏 0 人点赞
#agent-performance

PREPING: 无需任务的智能体记忆构建

Hugging Face Daily Papers · 2026-05-11 缓存

提出了PREPING,一个在没有任何任务特定经验之前,通过提议者引导的合成实践来构建智能体记忆的框架,实现了有竞争力的性能并降低了部署成本。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈