标签
The Turing Post 的一条推文,推荐亚历山大·荣格(Alexander Jung)的著作《Machine Learning: The Basics》,称其是一本紧凑的复习指南,涵盖数据–模型–损失框架,包括假设空间、模型选择、经验风险最小化(ERM)、正则化、概率模型、聚类、联邦学习、隐私与可解释性。
这篇arXiv论文介绍了CohortHijack,一种鲁棒性审计方法,通过从单细胞查询队列中移除非目标细胞,来测试在不改变目标细胞表达谱的情况下,注释工具可能如何被操纵。研究表明,在保留目标细胞的同时,结构化移除和搜索策略可以改变主流流程中的精炼标签,从而将查询队列组成识别为一个攻击面。
Introduces Fast Evidential Rule Learning (FERL), a method for interpretable classification that produces evidential outputs and can abstain when uncertain, with theoretical stability guarantees and strong empirical results across tabular and concept-bottleneck benchmarks.
这篇arXiv论文提出了一种形状约束的预测建模方法,用于估计连续流纳米药物生产中的纳米颗粒尺寸和分散度,从而减少对大量实验筛选的需求。
本文介绍了PMOT,一种基于连续归一化流的通用p-代价最优传输势流框架,具有理论上零损失精确性,并在合成和高维基准测试上取得了有前景的结果。
This position paper argues that many LLM failures stem from evaluating outputs independently and proposes a self-consistency framework that treats diverse techniques as special cases of consistency optimization.
Introduces Quantum-Structured World Models (QSWMs), a quantum-inspired framework for predictive world modeling with structured latent states, and evaluates them on elementary cellular automata against classical baselines.
本文使用美国地质调查局(USGS)流域尺度数据,系统评估了包括TabPFN基础模型在内的15种机器学习模型在野火后泥石流预测中的表现,发现TabPFN取得了最佳性能(威胁评分为0.637),并且合成数据增强能改善大多数模型的性能。
本文介绍了MS-MLB,这是一个开放机器学习基准,利用公开的GSE17048队列,从全血RNA表达数据中对多发性硬化症进行分类。它提供了一个可重复、受泄漏控制的评估流程,并报告梯度提升(Gradient Boosting)为表现最佳的方法。
本文提出DoctorAgents,一种智能体AI框架,利用专门的LLM智能体对小型、异质性临床时序数据集进行端到端机器学习流程的迭代生成、验证与优化,性能优于成熟的AutoML基线方法。
Otter是一个1530万参数的人类国际象棋AI,通过在马亚2的基础上增加对棋局历史和时间压力的条件化移动预测,以更少的参数实现了比Maia 2更高的准确性。它在来自Lichess对局的61亿个局面位置上训练,表明将国际象棋视为一种具有时间感知的序列活动可以改善对人类对弈的预测。
The paper investigates whether guideline-based categorical encodings of continuous predictors can replace continuous inputs in stroke outcome prediction models without sacrificing accuracy, finding comparable performance in most treatment cohorts.
Proposes Woodpecker Distillation, a weak-to-strong training framework that uses weak probe models to identify and repair local reasoning bugs in stronger models via contrastive local interventions, improving performance on math reasoning benchmarks.
提出将反事实可恢复性作为在线策略蒸馏中基于结果的决策变量,表明基于可恢复性进行选择性监督的方法在 AIME 和 GPQA 基准测试上优于仅依赖散度的方法。
本文介绍了一种基于条件扩散模型的概率集成模型,用于实时海啸淹没预报,与确定性预警相比,该模型提供了不确定性量化。利用2011年东北地区海啸数据进行验证,结果表明生成式AI可以将海啸预报从确定性方法转变为概率方法。
本文介绍了 ArborEnum,这是首个无需二值化即可在连续特征上精确枚举决策树 Rashomon 集的算法,同时提供了松弛近似和任意时间近似,这些近似方法可在保持近乎完美召回率的同时实现数量级的加速。
本文介绍了用于格拉斯曼流形上可扩展核机器的随机特征映射,利用有界秩一投影来近似旋转不变的Grassmannian核,并降低计算和内存成本。
本文比较了五种用于阿片类药物使用障碍预测的EHR诊断编码特征选择方法,发现NTK敏感性在准确性和稳定性之间提供了最佳平衡,而LLM引导的选择补充了额外的临床相关信号。
介绍了LiNC,一种轻量级噪声校正方法,通过学习逐样本可信度参数,利用高斯混合模型区分干净标签和噪声标签,在高标签噪声下的医学影像数据集上实现了稳健的准确率提升。
这项初步研究应用全卷积神经网络自动检测透射谱中的中子共振,实现了约93%的分类准确率,但未能泛化到未见过的同位素。作者建议未来工作应使用更大的数据集并融入物理信息特征。