标签
该推文宣布 Interspeech 2026 在悉尼开幕,重点介绍了将展示2场关于语音语言模型与对话语音识别的教程和19篇论文。
C5R建立了一个完全由AI模型GPT-6 Astra运营的研究设施,实现了跨多个科学学科的实验的自主设计、执行和观察。
NVIDIA 和斯坦福开发了一个对比语言模型 (CLM),将人工智能中的决策制定视为一个检索问题,通过缓存动作嵌入,与现有系统如 Jev 相比,实现了最高 9 倍的延迟降低。
FB-GDM 引入了一种用于高维线性逆问题的全贝叶斯引导扩散方法,消除了针对每个任务的超参数调优,并展示了相对于现有技术的稳健性能提升。
PixelJev被介绍为一种原生图像决策接口,使用小型开放多模态模型将图像、指令和候选集映射到结构化选择。该研究表明,在Pets等基准测试中,自适应提高了准确性,并突出了校准和泛化方面的挑战。
本文提出一种基于LLM的统一转换框架,该框架能够实现自主智能系统中行为树与有限状态机之间自动且语义一致的转换,提升可扩展性与可维护性。
本文介绍SkillPivot,一个偏差引导的框架,用于LLM智能体的技能自我进化,通过对比从共同前缀出发的失败和成功轨迹来改进技能。
本文介绍了MI-SARSA,这是一种强化学习算法,通过引入互信息正则化在认知约束下平衡策略复杂性和响应时间,从而建模有限理性。
本文提出了Slicing-Graphing-Alignment (SGA) 方法,用于量化时间序列基础模型中多步预测的不确定性,展示了优越的性能并揭示了一个经验缩放规律。
本文提出了VINTAGE-TS,这是一种考虑修订的时间序列基础模型适配方案,它能区分观测时间与信息可用时间,并提供了一个用于评估数据修订下预测表现的框架。
本文提出DEEPO,一种双阶段强化学习优化方法,通过解决从奖励到参数更新的纠正链中的弱点,以减少多模态大语言模型中的幻觉。
该论文介绍了CARE,这是一个针对扩散模型的条件感知表示正则化框架,通过基于条件相似性动态调节特征分布来提高样本质量和训练效率。在经验上,它在类别到图像和文本到图像任务中显著降低了FID并加快了收敛速度。
本文介绍了TW3Cast,一个时间序列预测系统,它使用基于轻度微调基础模型的冻结路由器,在GIFT-Eval基准上取得顶尖性能,且无需代理或语言模型
ModularSQL引入运行时防护措施,以解决Text-to-SQL系统中的多重性盲点,通过低开销检测和纠正多重性错误,提高生产环境中的执行安全性。
本文通过生成顺序干预评估了视觉-语言推理中解释与模型预测之间的因果联系,发现需要更大的模型进行理由优先推理,而答案优先生成能减少格式相关的错误。
本文提出了主动无任务蒸馏(ATD),这是一种仅通过单一词汇回复对与任务无关的提示进行提示,从而将能力从教师模型转移到学生模型的方法,旨在探究后训练的行为痕迹。
一个人宣布加入 @amilabs 在巴黎担任技术员,并表示相信这个团队将帮助AI更好地理解现实世界。