标签
一个人宣布加入 @amilabs 在巴黎担任技术员,并表示相信这个团队将帮助AI更好地理解现实世界。
首届'Mathematics in the Age of AI'研讨会在NYU Courant举行,现场爆满,Tristan Buckmaster的演讲探讨了Euler方程在平滑强迫下的突破性进展。
本文探讨了Dynamic Abliteration,这是一种非破坏性方法,通过PyTorch前向钩子使用多层engram引导,在运行时抑制类似Qwen3-4B的开放权重大语言模型的拒绝行为,而不永久改变模型权重。
今天,我们为视觉语言模型 (VLM) LFM2.5-VL-3B 发布了一个实验性的 DSpark 草稿模型,它增加了一个推测解码路径,以实现更快的推理速度,同时内存成本最小。
研究发现,GPT-4能对空提示产生空响应,而GPT-3.5不能;跨供应商研究证实其他模型也有类似行为,并引入了一个开源工具来控制EOS令牌行为。
Jeff Dean 强调了使用大鼠神经元进行计算的研究,以及 BioComputingCo 与 Amazon 合作将这项技术带给客户。
本文提出 LWCal,这是一种仅使用CPU的事后校准方法,适用于表格分类器,能够处理噪声校准标签而无需干净数据,实验表明其在校准误差和评分指标上有所提升。
本文研究了提示中的编辑框架如何影响LLM在数据分析中的事实性和语气反应,发现事实错误在特定场景中出现,而语气转变更为常见。
本文介绍了NAF-Bench,用于研究大型语言模型对指定否定语义的遵守情况。研究发现,像o4-mini这样的前沿模型表现良好,而开源模型则滞后。建议通过求解器委托或微调来改进。
本综述论文回顾了脑语言解码的发展,将神经活动转化为语言输出,用于交流恢复和科学研究,涵盖任务、方法、评估及未来方向。
论文介绍了 Emergi-PersonaOS,这是一个基于心理学的角色代理操作系统,通过三层角色表示以及信念更新和经验发展的机制,实现情境适应和可控进化。
PRISM-VLM 是一个多维度鉴别性基准,评估紧凑型视觉语言模型在七个维度上的表现,包括任务质量和行为鲁棒性,与单维度基准相比,能提供更可靠的区分和洞察。它旨在发布一个开放流程,供社区改进AI评估方法。
PotARCin是一个多维度基准,它扩展了ARC,用于评估五个维度上的抽象推理技能,表明标准评估可能无法完全捕捉AI模型的真实能力。
本文研究了针对客户支持大语言模型的微调策略,比较了在多个模型家族中的多任务训练、顺序更新和模型合并。研究得出结论,多任务全量微调是最稳健的默认选择,而专业模型在任务外性能下降,并且需要可靠的路由。
本文提出了大规模AI推理中上下文表示的原理化方法,引入了R3Con,它优于基线方法,并使较小模型能够以更低成本达到与较大模型相当的性能。
本研究探讨大语言模型是否内部按主题或方法组织数学推理,发现方法是关键组织原则的证据,挑战了传统的基准测试方法。
本文量化了事实核查得分的提升如何在答案准确性和证据质量之间进行分配,使用了训练后的DeBERTa检查点和LLM在多个基准测试中。
本文提出AV-GRPO,一个用于联合音视频生成的模态锚定强化学习框架,相比现有方法,提高了生成质量、语义对齐和跨模态同步性。
本文介绍了ExplorationBench,这是一个用于评估AI系统在可验证外星世界中探索能力的基准测试,通过提供可执行规则并防止从预训练数据中回忆,以应对科学发现中的挑战。