标签
一个精选的推文串,涵盖了三篇引人注目的人工智能论文:用于高效长上下文推理的MiniMax Sparse Attention、用于自我改进智能体框架的Self-Harness,以及用于衡量智能体经济价值的Agents' Last Exam基准测试。
本文介绍了自我束具(Self-Harness),一种新的范式,其中基于LLM的智能体能够迭代地改进自身的操作束具——包括提示、工具和控制流程——无需人类工程师或更强大的外部智能体,在多个模型上取得了显著的性能提升。