标签
Taste-Bench 是一个基准测试,评估大型语言模型在长时任务中决策分叉处选择最佳路径的能力,使用来自软件工程和机器学习研究的轨迹,排行榜显示当前顶级模型如 GPT-5.6 Sol 达到 59.7% 的准确率。
本文诊断了代码级自主研究循环中的算法模式崩溃,并提出多样性感知提案采样(DAPS)作为一种轻量级缓解措施,以保持语义多样性并提高泛化能力。
Data-DPO是一种面向目标模型的LLM监督微调数据选择方法,通过单步探测学习数据偏好,并结合质量分数和多样性,在Vision-Flan和LLaVA-CoT数据集上超越了基线方法。
The paper proposes Invertible Logits Transformation (InvLT), a post-hoc calibration method that applies a learnable scalar MLP element-wise to logits, preserving accuracy while correcting nonlinear miscalibration more flexibly than temperature scaling.
本文揭示了前沿大语言模型由于位置编码的限制而在精确复制任务上表现困难,并提出 2D-RoPE 方法,将文本组织为二维网格以实现完美复制,在合成数据和大规模预训练中展现出优势。
介绍了递归式 Harness 自我改进(RHI),这是一种通过成对反馈迭代优化 AI 智能体提示级别 Harness 规范的方法,能够在多种机器学习研究任务上将性能提升高达 60%,并将推理成本降低高达 60%。
一篇博客文章,反思成为机器学习研究员的过程,与禅修进行类比,强调阅读、构建、专注于基础以及不追求基准的重要性。
本研究论文提出了一种用于在生成采样中强制执行硬约束的自适应校正调度方法,证明与末端或逐步投影方法相比,该方法能够改善成本-精度边界。
本文介绍了 Toeplitz MLP Mixer(TMM),这是一种新型架构,它用 Toeplitz 矩阵乘法取代注意力机制,从而在保持高信息保留率和训练效率的同时实现更低的计算复杂度。
本文提出了显著性感知正则化量化校准(SARQC),这是一个统一的框架,通过添加正则化项以保持权重接近度,从而改善大语言模型(LLM)的训练后量化(PTQ),提升泛化能力和性能。
本文介绍了 CaRE,一种新颖的持续学习框架,它使用双层路由混合专家机制,能够有效处理涉及 300 多项任务序列的类增量学习。
本文提出了 AnisoAlign 框架,该框架通过应用各向异性几何校正来解决多模态模型中的模态间隙问题,从而实现有效的非配对模态对齐。
MIT CSAIL及其他机构的研究人员推出了CompreSSM技术,该技术通过在训练早期移除不必要的组件来压缩状态空间AI模型,从而在不牺牲性能的情况下实现更快的训练速度和更小的模型体积。