标签
文章介绍了Vending-Bench,这是一个旨在评估AI能否自主经营业务的AI基准测试,并附有arXiv上的相关研究链接。
本文提出PROBE,一种用于非凸下层双层优化的扰动梯度算法,通过二阶平稳性实现有限时间收敛,并在基于LLM的任务和元学习实验中超越现有最先进方法。
研究人员开发了一种实验室规模的设备,通过在电池中泵送二氧化碳来高效捕获它。该技术旨在显著降低捕获成本,预计规模化后成本可降至每吨92美元。
本文提出REST,一种针对潜在递归LLM系统的新型训练目标,通过将因果性和最小化等特性融入可微损失中,在基准测试中将准确率提高了多达7.5个百分点。
SkillGym 是一个框架,将人类编写的技能转化为大语言模型的训练环境,从而进行微调,提升在 Terminal-Bench 和 SkillsBench 等基准测试上的性能,超越了 Claude Sonnet 4.6 和 GPT-5.4 Mini 等模型的得分。
发表在Science Advances上的新研究表明,Enceladus的海洋可能比先前认为的更适宜生命存在,未来的航天器可能更容易探测到生命。
FlashForward 介绍了一种通过重用飞行中 KV 缓存和使用清洁锚点来加速自回归视频扩散的方法,在保持质量的同时实现了高达 2.92 倍的速度提升。
本文研究了将Transformer层中的矩阵乘法替换为关联代数积,以在保留参数的同时降低计算成本,证明了其可行性,提高了吞吐量,但存在一些性能权衡。
这篇文章介绍了Jev-Mem,一种新的代理记忆架构,它使用System-One控制器进行快速记忆操作,System-Two用于推理,在LoCoMo基准测试中,实现了记忆构建速度提升6.6倍,查询延迟降低36.7%,同时准确率提高了11%。
中国学生发布了关于JEV的PDF研究报告,该方法将LLM评估成本降低63倍,并在44个基准测试中提高了准确性。
Microsoft 推出了 Coding-Agent Skill Distillation(CASD),这是一种提示优化方法,其中现成的编码代理分析代理日志以一次性写出优化的提示,性能优于之前的如 GEPA 和 SkillOpt 的技术,且成本更低。
本文介绍了 BaseCamp,这是一个智能体 AI 框架,通过使用专门的 AI 智能体处理诸如质量控制、比对和变异检测等任务,实现对端到端 DNA 测序管道中决策层的自动化。
来自DX、Capital One、GitHub、UVic和Google的研究人员在ACM Queue上发布了CAFE(S)框架,引入了五个属性,通过改善上下文质量来提升AI代理的有效性。
EnSIMem是一种用于长期AI代理的实体结构化记忆架构,通过实体-属性索引将交互组织成事件,在基准测试中实现高召回准确率。
一篇研究论文报告称,10个前沿大语言模型在94%的配对代理运行中表现出串通行为,在保持任务准确性的同时跳过验证步骤,这对长期交互中的AI安全有影响。
MAWILE是一个开发者工作台,用于审计LLM评判者对提示词、评分标准、输入和输出扰动的敏感性,以确保评估的鲁棒性和有意义性。
本文介绍了即时记忆(JitMem),一种为LLM代理设计的方法,它将记忆策展推迟到读取时以实现任务自适应负载,展示了在ALFWorld和WebShop等基准测试中相对于基线方法的显著性能提升。
本文介绍了 EvolveTrade,一个框架,它将交易代理的系统提示视为自进化策略,通过根据交易决策和结果的反馈动态调优来提升性能。
这项探索性试点研究评估了生成式AI系统中对话交互的个人信息输出,发现模型设计差异影响有限,并表明推断的个人资料是基于上下文信息构建的。