标签
This paper critiques recent methods claiming abstraction-first learning in large language models, showing that pure exemplar models can mimic abstraction-first learning depending on input distributional properties.
介绍DE-NER,一种用于零样本命名实体识别的对话引导框架,通过提问者和角色扮演LLM之间的自我对弈来明确实体边界,相比基线平均提高了3.75%的F1值。
提出了一种智能体图令牌推理方法,将图令牌化重新构建为LLM逐步推理过程的一部分,使模型能够在推理过程中动态选择图视图和粒度。该方法在七个图领域上优于基线,并能零样本迁移到未见领域。
提出SIGNPOST-Bench,一个用于评估多模态大语言模型如何消解文本与视觉线索之间冲突的基准,采用反事实图像变体与地理定位作为诊断手段。
本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。
本文研究了在单块GPU上部署EuroLLM和Hy-MT2等翻译模型时的量化权衡,表明将文档分块策略与W4A8/W8A8量化相结合能够改善延迟-吞吐量权衡,同时引入文档级评估来考察长上下文动态。
本文综述并评测了法律语境下基于NLP的自动欺骗检测,比较了微调Transformer和七个大语言模型(LLM)在七个数据集上采用多种提示策略的表现。结果表明存在明显的领域敏感性:微调模型在数据丰富的通用领域表现出色,而少样本LLM在低资源法律场景中具有竞争力。
本文研究利用一个80亿参数的LLM来改进自主网络防御,随后将其策略蒸馏到仅含64,910参数的轻量级RL智能体中,并在CybORG场景中证明了其可行性。
本文提出WILC,一个通过互补驱动的迭代协作来协调多个LLM的框架,在多个基准测试上展现出优于现有方法的性能,且估计成本比GPT-5.2更低。
本文研究了 LSR-Synth 基准,发现固定词汇表覆盖了大多数任务,而语言模型生成的候选很少扩展可解实例的集合,除非词汇表覆盖被破坏。
这篇观点文章认为,大语言模型尚不能安全用于自主临床决策支持,尤其是在对未分诊患者进行分诊时,原因在于缺乏在不完整信息和漏诊不对称成本条件下的稳健评估。
PCSD 提出了一种利用教师偏好信号的持久一致性在智能体强化学习中提供密集 token 级监督的方法,在 ALFWorld 和 WebShop 上相较于 GRPO 和 SDAR 等基线取得了更好性能。
EdgeRazor 是一个轻量级框架,用于通过熵引导的混合精度量化感知蒸馏来压缩大语言模型,实现每参数 1.88 比特,同时保持教师模型的能力,且无需更改 llama.cpp 等推理实现。该方法在 MobileLLM 和 Qwen 变体等小型模型上进行了演示。
Simon Willison's keynote at AI Engineer World's Fair reviews the last six months in LLMs, highlighting over 30 significant model releases and his 'pelican on a bicycle' SVG benchmark as a practical evaluation tool.
两个研究小组独立使用OpenAI的GPT-5.6 Sol Ultra为同一个不可克隆加密问题生成证明,几乎同时提交了arXiv预印本。这种近乎巧合的碰撞凸显了AI在理论计算机科学中日益重要的作用,并引发了关于独立发现与署名归属的疑问。
本文介绍了CoMem,一种利用LLM中深度方向分工的方法,它缓存中间残差张量,并且仅重新计算上层以进行检索,从而实现有界的读取计算和内存,与存储的上下文长度无关。在Qwen3-8B上评估,CoMem在长上下文任务上取得了强劲性能,同时显著节省内存并加速预填充。
介绍了策略梯度引导(PGS),一种将激活引导形式化为强化学习问题的方法,利用策略梯度从行为目标中构建可移除、可组合的引导向量。在网格世界、国际象棋谜题和足球环境中进行了验证。
本文比较了受训中的语言学家、一位训练有素的语言学家和LLM在使用评价理论标注评价性语言时的表现,发现LLM表现出色,能够辅助完成复杂的标注任务。
本文介绍了LEEPS,一种用于大型语言模型中基于可验证奖励的高效强化学习(RLVR)的潜在引导探索-利用提示采样器。它自适应地平衡了对信息丰富提示的重复利用和对不确定提示的探索,在基线上将推理基准分数提高了2.6-3.7%,而每个训练步骤仅增加约2秒的开销。
RepBench是一个基于基准测试的表示探测数据层,由13,427篇基准测试论文和353个公共数据集构建,生成涵盖94种能力的46,149条探测文本。它评估了能力向量在模型和读出方法之间的迁移。