machine-learning-research

标签

Cards List
#machine-learning-research

大型语言模型在决策分叉中的表现如何?(GitHub Repo)

TLDR AI ↗ · 昨天 缓存

Taste-Bench 是一个基准测试,评估大型语言模型在长时任务中决策分叉处选择最佳路径的能力,使用来自软件工程和机器学习研究的轨迹,排行榜显示当前顶级模型如 GPT-5.6 Sol 达到 59.7% 的准确率。

0 人收藏 0 人点赞
#machine-learning-research

深入差异:诊断与缓解代码级自主研究循环中的算法模式崩溃

arXiv cs.CL ↗ · 2026-09-02 缓存

本文诊断了代码级自主研究循环中的算法模式崩溃,并提出多样性感知提案采样(DAPS)作为一种轻量级缓解措施,以保持语义多样性并提高泛化能力。

0 人收藏 0 人点赞
#machine-learning-research

Data-DPO: 用于LLM后训练中目标模型数据选择的直接偏好优化

arXiv cs.LG ↗ · 2026-08-19 缓存

Data-DPO是一种面向目标模型的LLM监督微调数据选择方法,通过单步探测学习数据偏好,并结合质量分数和多样性,在Vision-Flan和LLaVA-CoT数据集上超越了基线方法。

0 人收藏 0 人点赞
#machine-learning-research

Invertible Logits Transformation for Accuracy-Preserving Post-Hoc Uncertainty Calibration

arXiv cs.LG ↗ · 2026-08-12 缓存

The paper proposes Invertible Logits Transformation (InvLT), a post-hoc calibration method that applies a learnable scalar MLP element-wise to logits, preserving accuracy while correcting nonlinear miscalibration more flexibly than temperature scaling.

0 人收藏 0 人点赞
#machine-learning-research

前沿语言模型难以完成精确复制:文本在二维视角下更胜一筹

arXiv cs.CL ↗ · 2026-07-20 缓存

本文揭示了前沿大语言模型由于位置编码的限制而在精确复制任务上表现困难,并提出 2D-RoPE 方法,将文本组织为二维网格以实现完美复制,在合成数据和大规模预训练中展现出优势。

0 人收藏 0 人点赞
#machine-learning-research

递归式 Harness 自我改进

arXiv cs.AI ↗ · 2026-07-20 缓存

介绍了递归式 Harness 自我改进(RHI),这是一种通过成对反馈迭代优化 AI 智能体提示级别 Harness 规范的方法,能够在多种机器学习研究任务上将性能提升高达 60%,并将推理成本降低高达 60%。

0 人收藏 0 人点赞
#machine-learning-research

禅与机器学习研究的艺术(11分钟阅读)

TLDR AI ↗ · 2026-06-16 缓存

一篇博客文章,反思成为机器学习研究员的过程,与禅修进行类比,强调阅读、构建、专注于基础以及不追求基准的重要性。

0 人收藏 0 人点赞
#machine-learning-research

通过自适应校正调度在生成采样中强制执行约束

arXiv cs.LG ↗ · 2026-05-13 缓存

本研究论文提出了一种用于在生成采样中强制执行硬约束的自适应校正调度方法,证明与末端或逐步投影方法相比,该方法能够改善成本-精度边界。

0 人收藏 0 人点赞
#machine-learning-research

Toeplitz MLP Mixer 是低复杂度、信息丰富的序列模型

arXiv cs.LG ↗ · 2026-05-11 缓存

本文介绍了 Toeplitz MLP Mixer(TMM),这是一种新型架构,它用 Toeplitz 矩阵乘法取代注意力机制,从而在保持高信息保留率和训练效率的同时实现更低的计算复杂度。

0 人收藏 0 人点赞
#machine-learning-research

面向大语言模型的显著性感知正则化量化校准

arXiv cs.AI ↗ · 2026-05-08 缓存

本文提出了显著性感知正则化量化校准(SARQC),这是一个统一的框架,通过添加正则化项以保持权重接近度,从而改善大语言模型(LLM)的训练后量化(PTQ),提升泛化能力和性能。

0 人收藏 0 人点赞
#machine-learning-research

通过双层路由混合专家模型将持续学习扩展至 300 多项任务

Hugging Face Daily Papers ↗ · 2026-05-08 缓存

本文介绍了 CaRE,一种新颖的持续学习框架,它使用双层路由混合专家机制,能够有效处理涉及 300 多项任务序列的类增量学习。

0 人收藏 0 人点赞
#machine-learning-research

各向异性模态对齐

Hugging Face Daily Papers ↗ · 2026-05-08 缓存

本文提出了 AnisoAlign 框架,该框架通过应用各向异性几何校正来解决多模态模型中的模态间隙问题,从而实现有效的非配对模态对齐。

0 人收藏 0 人点赞
#machine-learning-research

新技术让AI模型边学边瘦、边学快

MIT News — Artificial Intelligence ↗ · 2026-04-09 缓存

MIT CSAIL及其他机构的研究人员推出了CompreSSM技术,该技术通过在训练早期移除不必要的组件来压缩状态空间AI模型,从而在不牺牲性能的情况下实现更快的训练速度和更小的模型体积。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈