标签
来自哈佛大学和UIUC的研究人员发现了第三个预训练轴,将样本效率提高了6.2倍,并将GenAI生成速度提高了250倍。
本文提出了一种可扩展、领域无关的自动化 LLM 评估框架,该框架利用多个 LLM 的成对比较和 Elo 评分系统来近似专家判断,从而减少人工干预的需求。
Jenova AI 的 Survey Design Consultant 工具通过 Tourangeau 认知模型分析问题、推荐经过验证的量表并确保最佳长度,从而提升调查质量。
本文认为,基于可复制上下文的LLM防护措施无法可靠地确保安全性,提出了在有用能力、可靠安全性和开放访问之间的安全三难困境,并建议将可信凭证作为补充机制。
一组用于学术研究工作流的Claude Code技能,包括文献综述、博士论文提案,以及带有矢量方程和引用的高保真学术幻灯片。
OpenAI推出ChatGPT for Academic Researchers,为10万名研究人员免费提供包括GPT-5.6 Sol Pro在内的前沿模型,以加速科学发现,并承诺到2027年投入2.5亿美元。
本文提出了EGTA,一种面向同声传译的基于证据的术语自适应框架,该框架选择性地使用文档特定术语来改进罕见词的翻译,在无需全模型微调的情况下,在命名实体和缩写召回率方面取得了显著提升。
本文提出通过中间层激活的学习加权和将指令提示压缩为单个激活向量,准确率下降低于2%,并揭示了对LLM激活空间结构的洞察。
本文通过一个使用离线强化学习训练的Harness MDP,将LLM Agent周围的执行框架形式化为一个可学习的控制层,展示了在多个领域中的验证行为和最终质量的改进。
介绍了ACPO,一种用于大型语言模型强化学习的token级信用分配框架,利用细粒度替代熵提升数学和编码基准的推理性能,优于DAPO、GTPO、SAPO等强基线。
Claude Science是一款科研早期调研工具,可自动检索、去重、聚类文献并生成研究地图和趋势报告,对探索新领域很有帮助。
一个免费的开源工具,利用 OpenAlex 数据库分析 Zotero 图书馆中的引用关系,并生成关联的 Obsidian 笔记。
提出了一种名为 Proxy-KD 的新方法,通过代理模型从黑盒大型语言模型(如 GPT-4)中蒸馏知识到较小的模型,超越了传统的黑盒和白盒知识蒸馏技术。
本文提出CASOP(上下文感知优化流水线合成与评估框架),用于仓库订单履约中优化流水线的上下文感知合成与评估,支持从模块化仓库中自动构建有效的算法流水线。
本文评估了LLM在静力学问题上的表现,发现虽然纯文本问题处理得较好,但引入图表和多步推理后准确率下降,表明模型在持续应用视觉信息方面存在困难。
提出了DD-Elo,一种通过漂移扩散模型整合步级数据以加速技能评估和评级适应的国际象棋评级系统,同时保持与传统Elo的一致性。
本文提出对万维网进行原则性重新设计,以适应AI代理作为主要中介,涉及访问权限、速率限制和标准化代理标识,从而超越以人为中心的假设。
介绍R2D-RL,一个强化学习环境,通过共享内存通信将RoboCup 2D足球模拟服务器与基于Python的多智能体强化学习工作流连接起来,支持全场和基于场景的训练,可配置对手和奖励塑造。
本文介绍如何使用Obsidian结合Codex/CC等AI工具构建学术文献管理系统,实现文献自动分类、查重、生成wiki页面和学术工具箱,并分享阅读文献和提升学术能力的方法。
DeepPaperNote 是一个开源工具,可自动将学术论文转换为结构化的Obsidian笔记,处理元数据、图表和笔记生成,以支持深度阅读。