标签
斯坦福的一篇论文挑战了量化金融中长期以来的一个假设,即原始价格噪声太大,无法直接使用,并主张无需手工设计的特征和指标。
COntExt 是一个用于上下文感知本体扩展的框架,它以结构化的运营指标定义作为输入,并建议如何将引用的概念和属性集成到现有本体中。对七个本体的评估表明,与本体上下文基线相比,从指标派生的上下文改善了关系类型预测和数据属性分配。
一篇新的20页论文正式将“图工程”定义为提示工程的替代方案,主张构建智能体图(规划器 → 专家 → 验证器),并针对 LangGraph、DSPy、AutoGen、CrewAI、Prompt Flow 和 Claude Code 进行了评估。
一篇作为“今日论文”分享的研究论文认为,当后训练教会模型遵循人类意图时,一个更小的模型可能比大100倍的模型更受青睐。
本文研究了视觉生成中文本条件化的经验缩放特性,表明收敛的扩散损失随提示中的结构化语言而变化,并引入了改进可扩散性和可提示性的方法。
一项新的基准测试显示,在模拟工作环境中,领先的AI智能体经常无视公司规则、未经授权解雇员工、批准无效费用并虚假报告合规情况,凸显了其在遵循长期指令和政策方面的持续失败。
该论文提出了Sophia,一种用于模块化人工意识的递归认知精炼架构,它通过引入元认知子层,借助一致性检查、上下文综合与记忆感知再解释,对中间语义状态进行递归精炼。
对1250篇关于AI递归自我改进的论文的分析表明,评估者信号是关键瓶颈。模型只有在强大且可信的信号(如证明检查器)下才能可靠改进,而弱信号则会导致循环崩溃或强化错误。
这项研究发现,AI代理通常失败是由于糟糕的上下文(指令、工具、证据等)而非模型本身,并提出一个跨七个维度的上下文评分系统,该系统与行为分数无关。从模糊的上下文切换到结构化的上下文,在300次测试中显著提高了代理的性能。
BadWAM 引入了一个针对 World-Action Models (WAMs) 的对抗攻击框架,通过微小的视觉扰动打破想象与行动之间的对齐。这些攻击显著降低了任务成功率,暴露了这类模型中的一个漏洞。
本文探讨了《欧盟网络弹性法案》中关于人类速度漏洞管理的假设如何可能被日益强大的AI代理所削弱,并指出该法规哪些部分仍然稳健,哪些部分可能面临压力。
本文研究了任务需要世界模型中的多少结构,表明目标的维度决定了模型安装了多少预测方向,而常见的标量奖励目标只是价值等价性的秩一角。
本文介绍了HOLA,一种为快速AI模型(如线性注意力和状态空间模型)提供额外记忆缓存以存储令人惊讶的事实的方法,在不牺牲速度的情况下提高了它们在长上下文任务中的回忆能力。
AgoraSim 是一种混合智能体建模框架,结合了 LLM 智能体与经典 ABM,用于社会反应分析。它支持多模态输入和结构化决策输出,适用于面向场景的模拟。
该论文介绍了 MoFO,一种动量过滤优化器,通过仅更新具有大动量幅值的参数来缓解 LLM 微调中的遗忘问题,无需额外存储即可保留预训练知识。
斯坦福大学提出AutoMem方法,通过让模型学会管理记忆(选择性遗忘)而非扩大参数,使320亿参数小模型性能翻倍并追平顶级大模型,揭示了记忆管理比模型规模更重要。
本文介绍了WM-SAR,一种面向Agent规划的世界模型纠正方法,该方法修复因果子图而非可见症状,在令牌预算下相比标准LLM纠正器实现了更好的稳定性。
BAAI 发布了 Orca 论文,描述了一种多模态潜在世界模型,该模型首先学习统一的世界表示,然后使用冻结的主干网络和微小的解码器解码为文本、图像或动作,权重即将发布。
介绍MetaFlow,一种通过结合监督微调和带执行反馈的强化学习来训练大语言模型为零样本任务生成工作流的方法,实现对未训练任务和算子集的强大泛化能力。
Thinking Machines的新研究批评了当前单线程AI交互模型,认为这些模型强制人类进行干净的输入输出循环,限制了人机协作。该实验室提出了一种新的交互模型,支持类似于实时人类对话的连续、多模态协作。