来自 arXiv 的文章
本文研究了表格基础模型(TFMs)如 TabPFN、TabICL、TabDPT 和 TabFM 是否能够产生与任何联合分布一致的预测。结果表明,所有被评估的 TFM 在分类和回归任务中均违反了边际化一致性和分解一致性,从而对其贝叶斯推断的主张提出了质疑。
本文提出了一种将不确定性统一定义为逐点后验风险的方法,并引入了一个有理论支持的基准,利用半合成数据集直接计算神谕认知不确定性和偶然不确定性,从而超越代理任务实现细粒度评估。
本文提出了 OG-SPR,一种无模型视觉强化学习算法,它将潜在自预测与观测预测相结合,学习具有动力学感知的表示,从而在 DeepMind Control Suite 任务上提高了样本效率。
本文介绍了THBKG,一个时间异构生物医学知识图谱,涵盖11万实体和1110万条边,带有逐年证据时间戳,旨在仅使用决策时可用的证据来预测进入II期试验的靶点-疾病对是否会推进到III期。基于图谱的方法优于直接证据基线,尤其是在缺乏直接证据的配对中,作者将其作为持续更新的资源发布。
这篇arXiv论文研究了简单的线性变换是否能在九个异构文本嵌入模型之间转换表示,发现共享结构和可迁移性共同取决于架构、训练目标、池化方法和数据分布,对普遍潜在兼容性的观念提出了挑战。
BioM-JEPA 引入了一种联合嵌入预测架构,通过预测图连接基因块而非单个基因来学习单细胞表示,在扰动响应任务中展现出更高的效率和下游性能。
这篇arXiv论文介绍了CohortHijack,一种鲁棒性审计方法,通过从单细胞查询队列中移除非目标细胞,来测试在不改变目标细胞表达谱的情况下,注释工具可能如何被操纵。研究表明,在保留目标细胞的同时,结构化移除和搜索策略可以改变主流流程中的精炼标签,从而将查询队列组成识别为一个攻击面。
Presents FormBharo, a voice agent that uses LLMs with rule-based controls to fill structured forms over phone calls for low-literacy Hindi-speaking users in India, piloted with ARMMAN. The paper also introduces FormVoiceAgentBench, a benchmark of 3,760 multi-turn conversation tests, and shows that end-to-end evaluation is necessary since component-level performance does not predict full form completion.
EpiBench 是一个新的闭卷、基于序列的基准,用于评估 LLMs 在五项抗体药物发现任务中对表位的理解程度,结果发现当前模型能捕获部分信号,但在抗体特异性推理方面存在困难。
本文综述了使用LLM生成的合成数据进行临床沟通处理的研究,并展示了13个案例研究,涵盖EMS报告、护士交接等场景,表明合成数据能够助推临床NLP系统的构建。
本文提出了FALM-PINN,一种用于物理信息神经网络的交替Levenberg-Marquardt训练框架,该框架使用傅里叶增强特征来解决谱偏差和表示-系数耦合问题,在高频和非线性偏微分方程上实现了最多低两个数量级的误差。
This paper introduces MERIT, a training-free agent that uses causal episodic memory of past repair outcomes to improve subsequent Text-to-SQL generations, boosting execution accuracy on Spider and BIRD benchmarks.
本文对事后分析方法(随机森林替代模型、LIME、PCA)在检测聚类结果中的结构化模式方面进行了比较评估,使用注入模式的人工合成数据集。研究发现,没有一种方法能持续检测所有模式类型,凸显了现有可解释性工具的不足。
MACRO is a framework that learns task-specific execution routes over frozen LLM layers using Markov chain-based routing, improving reasoning accuracy without modifying model weights. It outperforms prior routing approaches while reducing search time significantly.
Introduces Synthetic Query Probing (SQP), a reference-free method for learning mappings between similarity score distributions across embedding models, enabling threshold portability in RAG systems. Experiments show systematic score distortions and isotonic regression as the best calibration approach.
Introduces Fast Evidential Rule Learning (FERL), a method for interpretable classification that produces evidential outputs and can abstain when uncertain, with theoretical stability guarantees and strong empirical results across tabular and concept-bottleneck benchmarks.
一篇研究论文,提出了一种排序学习框架,用于为GPU加速的量子电路模拟选择高效张量网络收缩计划,该框架使用从GPU测量中训练的梯度提升排序器。
本文介绍了 MameLoshnLM,这是首个开源的 8B 参数意第绪语语言模型,同时还包括 Oytser 预训练语料库和 Kashes 评估基准。研究表明,在高质量意第绪语数据上进行持续预训练的表现优于通用多语言模型,凸显了专门进行低资源语言建模的价值。
本文提出在不执行昂贵 Rollout 的情况下预测 LLM 智能体的任务难度,在 17 个智能体基准上研究该问题,并表明 token 级熵是一种有用的预测信号。
本文介绍了TSR框架,该框架将社交对话分解为战略规划和语言执行两个阶段,以及LHRL-VGR,一种带有方差门控奖励的强化学习算法。使用该方法对Qwen2.5-7B智能体进行微调,在SOTOPIA基准上的目标完成率超过GPT-4o基线7.32%。