@ArizePhoenix: 对于智能体,活跃参数是你在延迟和成本上支付的东西,而智能体循环会重新发送上下文,重试工具调用……
摘要
Arize Phoenix 推出了M3,它增加了稀疏注意力和1M令牌上下文窗口,通过将长工具历史保留在上下文中来减少AI智能体的延迟和成本。
对于智能体,活跃参数是你在延迟和成本上支付的东西,而智能体循环会重新发送上下文、重试工具调用,并且运行时间长。M3 在此基础上增加了稀疏注意力和1M令牌窗口,使得长工具历史保留在上下文中,而不是被总结掉。
相似文章
你的智能体不贵,贵的是上下文窗口。算笔账
解释了为什么智能体 API 费用会随上下文长度呈二次方增长——因为每一轮都会重新读取完整历史,并分享了一些实用技巧,比如让工具结果过期、缩小工具 schema、压缩上下文来降低成本。
MiniMax M3:稀疏注意力如何让长程智能体变得实用(11分钟阅读)
MiniMax M3通过稀疏注意力保持上下文成本可预测且低廉,使500KToken的上下文在质量损失极小的情况下实现显著的速度提升,从而让长程智能体变得实用。
在持久化代理内存实现后,你们如何处理活动上下文?
本文讨论了在长期运行的AI代理工作流中管理活动上下文的挑战,重点关注上下文保留与效率和成本之间的平衡,并寻求社区的实际解决方案。
@rohanpaul_ai:长期运行的智能体并不只是需要更大的上下文窗口。关键在于它们需要学会判断哪些信息值得保留在上下文中……
ContextPilot通过细粒度强化学习,教会AI代理主动管理上下文,通过专注于需要保留的信息,提升了长上下文基准测试的表现。
@lateinteraction: 智能体通常将部分上下文外部化:在编码智能体中的仓库,在RAG中的语料库,以及在RLM中的用户提示。N…
Joshua Gu的新研究表明,AI智能体在管理其上下文窗口中的一个小缓冲区作为外部上下文的缓存时表现更好,这挑战了将上下文完全推出提示符的常见做法。