large-language-models

标签

Cards List
#large-language-models

Exemplars in Disguise: Pure Exemplar Models Mimic Abstraction-First Learning

arXiv cs.CL · 5天前 缓存

This paper critiques recent methods claiming abstraction-first learning in large language models, showing that pure exemplar models can mimic abstraction-first learning depending on input distributional properties.

0 人收藏 0 人点赞
#large-language-models

DE-NER:通过大型语言模型的对话引导实现零样本命名实体识别

arXiv cs.CL · 5天前 缓存

介绍DE-NER,一种用于零样本命名实体识别的对话引导框架,通过提问者和角色扮演LLM之间的自我对弈来明确实体边界,相比基线平均提高了3.75%的F1值。

0 人收藏 0 人点赞
#large-language-models

智能体图令牌推理

arXiv cs.LG · 5天前 缓存

提出了一种智能体图令牌推理方法,将图令牌化重新构建为LLM逐步推理过程的一部分,使模型能够在推理过程中动态选择图视图和粒度。该方法在七个图领域上优于基线,并能零样本迁移到未见领域。

0 人收藏 0 人点赞
#large-language-models

SIGNPOST-Bench:多模态大语言模型中文本-视觉冲突消解基准

Hugging Face Daily Papers · 5天前 缓存

提出SIGNPOST-Bench,一个用于评估多模态大语言模型如何消解文本与视觉线索之间冲突的基准,采用反事实图像变体与地理定位作为诊断手段。

0 人收藏 0 人点赞
#large-language-models

当教师误导:虚假信号感知的在线策略蒸馏

Hugging Face Daily Papers · 5天前 缓存

本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。

0 人收藏 0 人点赞
#large-language-models

研究机器翻译高效推理部署中的量化权衡

arXiv cs.CL · 6天前 缓存

本文研究了在单块GPU上部署EuroLLM和Hy-MT2等翻译模型时的量化权衡,表明将文档分块策略与W4A8/W8A8量化相结合能够改善延迟-吞吐量权衡,同时引入文档级评估来考察长上下文动态。

0 人收藏 0 人点赞
#large-language-models

欺骗语义:法律领域欺骗检测与通用领域最先进方法的基准测试

arXiv cs.CL · 6天前 缓存

本文综述并评测了法律语境下基于NLP的自动欺骗检测,比较了微调Transformer和七个大语言模型(LLM)在七个数据集上采用多种提示策略的表现。结果表明存在明显的领域敏感性:微调模型在数据丰富的通用领域表现出色,而少样本LLM在低资源法律场景中具有竞争力。

0 人收藏 0 人点赞
#large-language-models

将大型语言模型的知识蒸馏至面向自主网络作战的轻量级强化学习智能体

arXiv cs.LG · 6天前 缓存

本文研究利用一个80亿参数的LLM来改进自主网络防御,随后将其策略蒸馏到仅含64,910参数的轻量级RL智能体中,并在CybORG场景中证明了其可行性。

0 人收藏 0 人点赞
#large-language-models

利用互补驱动的迭代协作发挥LLM群体的智慧

arXiv cs.AI · 6天前 缓存

本文提出WILC,一个通过互补驱动的迭代协作来协调多个LLM的框架,在多个基准测试上展现出优于现有方法的性能,且估计成本比GPT-5.2更低。

0 人收藏 0 人点赞
#large-language-models

LSR-Synth 中的库可达性:反记忆化设计如何改变符号发现的度量

arXiv cs.AI · 6天前 缓存

本文研究了 LSR-Synth 基准,发现固定词汇表覆盖了大多数任务,而语言模型生成的候选很少扩展可解实例的集合,除非词汇表覆盖被破坏。

0 人收藏 0 人点赞
#large-language-models

真实世界临床护理中的推理:为什么大语言模型尚不能安全用于自主临床决策支持

arXiv cs.AI · 6天前 缓存

这篇观点文章认为,大语言模型尚不能安全用于自主临床决策支持,尤其是在对未分诊患者进行分诊时,原因在于缺乏在不完整信息和漏诊不对称成本条件下的稳健评估。

0 人收藏 0 人点赞
#large-language-models

PCSD:智能体强化学习中自蒸馏的持久一致性

Hugging Face Daily Papers · 6天前 缓存

PCSD 提出了一种利用教师偏好信号的持久一致性在智能体强化学习中提供密集 token 级监督的方法,在 ALFWorld 和 WebShop 上相较于 GRPO 和 SDAR 等基线取得了更好性能。

0 人收藏 0 人点赞
#large-language-models

[论文] EdgeRazor:一种基于混合精度量化感知蒸馏的大语言模型轻量级框架

Reddit r/LocalLLaMA · 6天前

EdgeRazor 是一个轻量级框架,用于通过熵引导的混合精度量化感知蒸馏来压缩大语言模型,实现每参数 1.88 比特,同时保持教师模型的能力,且无需更改 llama.cpp 等推理实现。该方法在 MobileLLM 和 Qwen 变体等小型模型上进行了演示。

0 人收藏 0 人点赞
#large-language-models

@karpathy: More on the pelican on the bicycle test from @simonw: https://simonwillison.net/2025/Jun/6/six-months-in-llms/… I uploa…

X AI KOLs · 2026-08-02 缓存

Simon Willison's keynote at AI Engineer World's Fair reviews the last six months in LLMs, highlighting over 30 significant model releases and his 'pelican on a bicycle' SVG benchmark as a practical evaluation tool.

0 人收藏 0 人点赞
#large-language-models

AI助力同一密码学问题产生两个证明

Reddit r/ArtificialInteligence · 2026-07-31 缓存

两个研究小组独立使用OpenAI的GPT-5.6 Sol Ultra为同一个不可克隆加密问题生成证明,几乎同时提交了arXiv预印本。这种近乎巧合的碰撞凸显了AI在理论计算机科学中日益重要的作用,并引发了关于独立发现与署名归属的疑问。

0 人收藏 0 人点赞
#large-language-models

理解在早期完成:大型语言模型中的深度分工及其用于无界上下文记忆

arXiv cs.CL · 2026-07-31 缓存

本文介绍了CoMem,一种利用LLM中深度方向分工的方法,它缓存中间残差张量,并且仅重新计算上层以进行检索,从而实现有界的读取计算和内存,与存储的上下文长度无关。在Qwen3-8B上评估,CoMem在长上下文任务上取得了强劲性能,同时显著节省内存并加速预填充。

0 人收藏 0 人点赞
#large-language-models

策略梯度引导:来自行为目标的干预

arXiv cs.LG · 2026-07-31 缓存

介绍了策略梯度引导(PGS),一种将激活引导形式化为强化学习问题的方法,利用策略梯度从行为目标中构建可移除、可组合的引导向量。在网格世界、国际象棋谜题和足球环境中进行了验证。

0 人收藏 0 人点赞
#large-language-models

人类与LLM标注中的挑战:以评价性语言为例

arXiv cs.CL · 2026-07-31 缓存

本文比较了受训中的语言学家、一位训练有素的语言学家和LLM在使用评价理论标注评价性语言时的表现,发现LLM表现出色,能够辅助完成复杂的标注任务。

0 人收藏 0 人点赞
#large-language-models

LEEPS:基于潜在引导的探索-利用提示采样,用于大型语言模型的高效RLVR

arXiv cs.CL · 2026-07-31 缓存

本文介绍了LEEPS,一种用于大型语言模型中基于可验证奖励的高效强化学习(RLVR)的潜在引导探索-利用提示采样器。它自适应地平衡了对信息丰富提示的重复利用和对不确定提示的探索,在基线上将推理基准分数提高了2.6-3.7%,而每个训练步骤仅增加约2秒的开销。

0 人收藏 0 人点赞
#large-language-models

RepBench:将基准测试编译为大语言模型的能力表示

arXiv cs.CL · 2026-07-31 缓存

RepBench是一个基于基准测试的表示探测数据层,由13,427篇基准测试论文和353个公共数据集构建,生成涵盖94种能力的46,149条探测文本。它评估了能力向量在模型和读出方法之间的迁移。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈