标签
本文推测大语言模型何时会在物理学中达到‘Navier moment’,可能引领自主AI研究员的出现,从而每月彻底改变我们的日常生活。
Google Research 已开始为 Agent Harness 研究递归自我改进,重点是无需模型重新训练即可自动迭代提示、工具、内存和控制流。这种 Harness 级别的方法被认为比模型级别的 RSI 更清晰、更实用。
两年前,AI研究人员相信解决千禧年数学问题需要AI 30年,但最近的进展表明这一时间线可能更短。
Toollery是一种免训练的候选压缩框架,通过基于检索的方法提升了LLM代理工具和技能选择的可扩展性与效率。
本文对 Hierarchical Reasoning Models (HRM) 进行机制分析,以理解其在潜在空间中的内部推理过程,采用因果干预和稀疏自编码器等技术,在数独和 ARC-AGI-2 等任务上展开研究。
本文介绍了一种通用多模态基础模型,能够处理任意模态组合与预测任务,通过在具有多样化因果结构的大规模合成数据集上训练,实现了具有竞争力的性能。
EAVer 提出了一种端到端的代理策略,用于通过分组断言、高效搜索和重用证据来验证长文本中的事实,在诸如 VeriFastScore 和 FaStFact-Bench 等基准测试上以更少的搜索次数实现更优性能。
本研究使用Google的Gemma-2-27b模型,重现了AI模型中情感表征在几何上镜像人类情感心理学的发现,并扩展分析以定位关键层并评估词元级别效应。
本文介绍了SCoR,一种用于预测科学概念之间关系的层次框架,其中包含一个基准和模型,通过预测类型化关系来改进研究方向的发现。
该研究提出了一种感知相关性的结构化剪枝方法,通过显式建模跨单元依赖性来优化剪枝决策,从而在大型语言模型中实现精度与效率的优异权衡。
Spi-fly是一种受果蝇启发的神经网络,使用稀疏活动和联想学习,能够以极少内存快速学习气味。它展示了强大的少样本学习性能,但需要进一步测试。
哈佛大学、MIT等实验室的一篇新论文介绍了FINSKILLOPS,这是一种方法,使金融AI代理能够持续从SEC文件错误中学习,同时使用回归测试来保持正确性并安全更新技能。
Agensh 是一个可扩展的自组织多代理系统,无需中央协调器,通过扩展代理数量来提高复杂任务的性能,在ProgramBench和pandoc等基准测试中显示出显著的测试通过率提升。
本研究使用BlameBERT分类器考察了丹麦议会从1997年到2026年的指责归因,揭示了政治话语中的意识形态不对称和香蕉形轨迹。
RoboFollow 引入了一个诊断基准,通过分析高场景熵和扰动来揭示具身代理中的指令跟随幻觉,暴露了当前模型在强大初始性能背后的差距。
本文探讨了OpenAI宣称在一个月内解决100个长期存在的数学问题,以及这对通用人工智能(AGI)加速时间线的影响。
Lasso Security的研究表明,大型语言模型中的AI水印可以改变AI智能体的行为,引入了'来源税',影响模型性能。
OpenAI仅用24天训练了一个模型,该模型解决了超过100个长期存在的数学未解难题,表明AI驱动的数学研究取得了重大进展。