标签
arXiv 从 Simons Foundation International、Siegel Family Endowment 和 XTX Markets 获得了 1720 万投资,以支持其运营。
一项研究发现,在与数学相关的arXiv论文中,公开的AI使用率在六个月内从1.39%显著增加到14.09%。
本文首次提出在具有p-adic参数的机器学习模型中,使用Berkovich仿射线进行连续梯度下降优化的方法,以实现如模算术等任务的有效学习。
本文区分了将AI与人类偏好对齐和与人类行为对齐,表明偏好对齐可能会降低拟人性,并在当前对齐方法中建立图灵测试差距。
论文介绍了Self-Organizing Agent Teams (SAT),一种让AI智能体学习可重用策略以协作和共同推理的方法,与个体智能体和基线方法相比,在数学和物理基准测试上实现了更高的准确率。
本文介绍了Memory of Memory (MoM),一个用于LLM代理记忆的框架,它在到达时提交当前值,同时保留被置换的值作为出处,从而提高准确性并减少陈旧的答案。
本文介绍了FrontierMath Erdős,这是一个包含68个开放性Erdős问题的基准测试,用于使用Lean证明助手评估数学领域的AI模型,旨在解决当前AI研究演示中的不足。
本文研究了LLM评判者之间的误差相关性如何降低共识的统计独立性,表明共同的错误可能使一致意见看起来比实际更强,导致在高达28%的情况下得出错误结论,并提出使用可信样本来估计和考虑这些依赖性。
本文改编自Music Lab实验,研究社会影响如何影响AI智能体对科学论文的选择,发现社会信息减少了关注的量与广度,同时增加了社群间的差异。
Austrian Academy of Science 与 Mistral 和 Sail Reply 合作发布了 Apollo,这是首个针对古希腊语的高级大型语言模型,旨在通过预测缺失词汇帮助学者修复破旧的莎草纸碎片。
本文介绍了PAGE,一种分区感知的门控KV-Cache淘汰方法,它使用标量度量预测输入类别,仅在安全时应用淘汰,从而减少大语言模型中的精度损失。
ZoAQ 提出了一种自适应零阶优化方法,通过重用过去的查询来减少评估次数,在合成任务中节省了43-48%的查询,并在黑盒攻击中实现了高成功率。
这篇1996年的论文介绍了Lifestreams,一种用于将个人数字数据组织成连续、可搜索流的存储模型。
OpenMAS-GCom 通过使用受控干预措施,引入了一个用于评估图增强多智能体系统的诊断基准,将性能差异归因于特定的组织组件。
AutoRecLab是一个基于Python的自主系统,可以从自然语言提示自动化推荐系统实验,使用检索增强生成(RAG)、静态验证和树搜索来生成和验证可执行代码。
本文探讨使用多模态LLM为时间序列异常检测生成领域特定的特征池,研究表明,一个简单的统计处理流程在基准数据集上能够达到与先进预训练模型相当的性能。
本文综述了无损压缩算法与机器学习之间的关联,介绍了一种设计框架,该框架使基于压缩的方法能与传统基线相媲美,并在恶意软件分类中尤为有效。
本文介绍DENSE,一种将AI智能体执行轨迹蒸馏为基于证据的快捷树以实现自我优化的方法,在Terminal-Bench上无需事后结果标签即可实现性能提升。
SAGE 是一个模式引导的系统,使用大型语言模型通过结构化评分标准并链接证据来自动化资助评审,并采用人在回路验证以提高准确性。
本文介绍了ScriptMoE,一种用于一体化多语言场景文本识别的脚本感知混合专家架构,以及TextMuSS-10M合成数据集,在基准测试中取得了最先进的准确率。