ai-research

标签

Cards List
#ai-research

@tommiekerssies: 我已加入 @amilabs 在巴黎担任技术员!AI尚未真正理解现实世界。我坚信…

X AI KOLs Following ↗ · 昨天 缓存

一个人宣布加入 @amilabs 在巴黎担任技术员,并表示相信这个团队将帮助AI更好地理解现实世界。

0 人收藏 0 人点赞
#ai-research

@NYU_Courant:昨天首届'Mathematics in the Age of AI'研讨会现场座无虚席,Tristan Buckmaster出席!Pro…

X AI KOLs Following ↗ · 昨天 缓存

首届'Mathematics in the Age of AI'研讨会在NYU Courant举行,现场爆满,Tristan Buckmaster的演讲探讨了Euler方程在平滑强迫下的突破性进展。

0 人收藏 0 人点赞
#ai-research

Dynamic Abliteration: 通过engram引导的非破坏性拒绝行为抑制

Hacker News Top ↗ · 昨天 缓存

本文探讨了Dynamic Abliteration,这是一种非破坏性方法,通过PyTorch前向钩子使用多层engram引导,在运行时抑制类似Qwen3-4B的开放权重大语言模型的拒绝行为,而不永久改变模型权重。

0 人收藏 0 人点赞
#ai-research

使用 LFM2.5-VL-DSpark 加速视觉语言模型

Hugging Face Blog ↗ · 昨天 缓存

今天,我们为视觉语言模型 (VLM) LFM2.5-VL-3B 发布了一个实验性的 DSpark 草稿模型,它增加了一个推测解码路径,以实现更快的推理速度,同时内存成本最小。

0 人收藏 0 人点赞
#ai-research

从GPT-3.5到GPT-4有什么变化?相同的提示。GPT-3.5:0/30 空响应。GPT-4:30/30。自己运行试试。

Reddit r/ArtificialInteligence ↗ · 2天前

研究发现,GPT-4能对空提示产生空响应,而GPT-3.5不能;跨供应商研究证实其他模型也有类似行为,并引入了一个开源工具来控制EOS令牌行为。

0 人收藏 0 人点赞
#ai-research

@JeffDean:你知道吗?你可以从真实大鼠神经元的计算中学到有趣的东西!我喜欢 @AlexKsendzovsky 和……

X AI KOLs Timeline ↗ · 2天前 缓存

Jeff Dean 强调了使用大鼠神经元进行计算的研究,以及 BioComputingCo 与 Amazon 合作将这项技术带给客户。

0 人收藏 0 人点赞
#ai-research

对比语言模型

Hacker News Top ↗ · 2天前

本文可能介绍了对比语言模型的研究,探讨对比学习技术在语言模型开发中的应用。

0 人收藏 0 人点赞
#ai-research

LWCal:针对含噪声校准标签的表格分类器的损失加权校准

arXiv cs.LG ↗ · 2天前 缓存

本文提出 LWCal,这是一种仅使用CPU的事后校准方法,适用于表格分类器,能够处理噪声校准标签而无需干净数据,实验表明其在校准误差和评分指标上有所提升。

0 人收藏 0 人点赞
#ai-research

压力下的报告:在LLM统计分析中区分事实性和语气谄媚

arXiv cs.AI ↗ · 2天前 缓存

本文研究了提示中的编辑框架如何影响LLM在数据分析中的事实性和语气反应,发现事实错误在特定场景中出现,而语气转变更为常见。

0 人收藏 0 人点赞
#ai-research

并非所想:大型语言模型能否遵循指定的否定语义?

arXiv cs.AI ↗ · 2天前 缓存

本文介绍了NAF-Bench,用于研究大型语言模型对指定否定语义的遵守情况。研究发现,像o4-mini这样的前沿模型表现良好,而开源模型则滞后。建议通过求解器委托或微调来改进。

0 人收藏 0 人点赞
#ai-research

脑语言解码:任务、信号、方法、评估、实际应用及其他

arXiv cs.CL ↗ · 2天前 缓存

本综述论文回顾了脑语言解码的发展,将神经活动转化为语言输出,用于交流恢复和科学研究,涵盖任务、方法、评估及未来方向。

0 人收藏 0 人点赞
#ai-research

Emergi-PersonaOS:一个用于情境适应和可控进化的角色代理操作系统

arXiv cs.AI ↗ · 2天前 缓存

论文介绍了 Emergi-PersonaOS,这是一个基于心理学的角色代理操作系统,通过三层角色表示以及信念更新和经验发展的机制,实现情境适应和可控进化。

0 人收藏 0 人点赞
#ai-research

PRISM-VLM:一个面向紧凑型视觉语言模型的多维度鉴别性基准

arXiv cs.CL ↗ · 2天前 缓存

PRISM-VLM 是一个多维度鉴别性基准,评估紧凑型视觉语言模型在七个维度上的表现,包括任务质量和行为鲁棒性,与单维度基准相比,能提供更可靠的区分和洞察。它旨在发布一个开放流程,供社区改进AI评估方法。

0 人收藏 0 人点赞
#ai-research

PotARCin:抽象推理任务技能获取的多维度评估

arXiv cs.AI ↗ · 2天前 缓存

PotARCin是一个多维度基准,它扩展了ARC,用于评估五个维度上的抽象推理技能,表明标准评估可能无法完全捕捉AI模型的真实能力。

0 人收藏 0 人点赞
#ai-research

一个适配模型能胜任一切吗?客户支持大语言模型的微调策略选择

arXiv cs.CL ↗ · 2天前 缓存

本文研究了针对客户支持大语言模型的微调策略,比较了在多个模型家族中的多任务训练、顺序更新和模型合并。研究得出结论,多任务全量微调是最稳健的默认选择,而专业模型在任务外性能下降,并且需要可靠的路由。

0 人收藏 0 人点赞
#ai-research

把握关键:大规模推理的原理化上下文表示

arXiv cs.CL ↗ · 2天前 缓存

本文提出了大规模AI推理中上下文表示的原理化方法,引入了R3Con,它优于基线方法,并使较小模型能够以更低成本达到与较大模型相当的性能。

0 人收藏 0 人点赞
#ai-research

LLMs中的数学推理按方法组织,而非主题

arXiv cs.AI ↗ · 2天前 缓存

本研究探讨大语言模型是否内部按主题或方法组织数学推理,发现方法是关键组织原则的证据,挑战了传统的基准测试方法。

0 人收藏 0 人点赞
#ai-research

当事实核查得分提高时发生了什么?训练后验证器与LLM中的证据和答案归因分析

arXiv cs.CL ↗ · 2天前 缓存

本文量化了事实核查得分的提升如何在答案准确性和证据质量之间进行分配,使用了训练后的DeBERTa检查点和LLM在多个基准测试中。

0 人收藏 0 人点赞
#ai-research

AV-GRPO:基于模态锚定的解耦扩散强化学习,用于联合音视频生成

Hugging Face Daily Papers ↗ · 2天前 缓存

本文提出AV-GRPO,一个用于联合音视频生成的模态锚定强化学习框架,相比现有方法,提高了生成质量、语义对齐和跨模态同步性。

0 人收藏 0 人点赞
#ai-research

ExplorationBench:衡量AI系统在可验证外星世界中的探索能力

Hugging Face Daily Papers ↗ · 2天前 缓存

本文介绍了ExplorationBench,这是一个用于评估AI系统在可验证外星世界中探索能力的基准测试,通过提供可执行规则并防止从预训练数据中回忆,以应对科学发现中的挑战。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈