language-models

标签

Cards List
#language-models

难怪 Qwen 和 Gemma 差异这么大

Reddit r/LocalLLaMA · 昨天

一位用户分享了一个观察:Qwen 和 Gemma 对代码的分词方式非常不同,对于相同的 HTML/JS 输入,Qwen 使用的 token 数量远少于 Gemma,这可能解释了它们在编程和语言任务上的表现差异。他们还提到了 LiquidAI 的一个可能使用更高效分词器重新训练模型的项目。

0 人收藏 0 人点赞
#language-models

Hierarchical Latent Prediction for Language Models

arXiv cs.CL · 3天前 缓存

This paper introduces HiLP, a hierarchical representation training method that adds multi-scale self-predictive learning to transformer pretraining, aiming to reduce compounding error and improve long-horizon reasoning and speculative decoding efficiency.

0 人收藏 0 人点赞
#language-models

KV-Skill:在模型原生语言中锻造专业知识

arXiv cs.LG · 3天前 缓存

本文介绍了KV-Skill,这是一个外部因子化算子的设计空间,冻结的语言模型通过轻量级接口读取这些算子,从而能够从文本或奖励中获取任务知识并独立部署。在十个基准上的实验表明,与文本技能、前缀微调和LoRA相比,KV-Skill持续带来改进,且技能可组合、可加载。

0 人收藏 0 人点赞
#language-models

语言模型中的跨架构引导迁移:一项系统性实证研究

arXiv cs.CL · 3天前 缓存

一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。

0 人收藏 0 人点赞
#language-models

阈下学习是非语义蒸馏

arXiv cs.AI · 3天前 缓存

本文研究了语言模型中的阈下学习,表明偏见可以通过看似随机的合成数据从教师模型传递到学生模型。作者发现,向权重添加高斯噪声会增加迁移程度,并且学生不仅继承了语义偏见,还继承了所使用干预的类型,这对训练安全和数据审计具有重要意义。

0 人收藏 0 人点赞
#language-models

点火指数:测量语言模型中的全局工作空间动态

arXiv cs.AI · 3天前 缓存

本文介绍了点火指数(Ignition Index),一种用于测量语言模型中全局工作空间动态的度量指标,已在多种架构和任务上得到验证,显示出对类似点火的表征转换的选择性检测。

0 人收藏 0 人点赞
#language-models

Skaling:Chinchilla的指数与Kaplan的耦合

Hugging Face Daily Papers · 3天前 缓存

本文介绍了Skaling定律,这是一种广义的神经缩放定律,通过一个交互指数将模型容量和数据耦合,将预测误差降低1.5至3倍,并能在计算量约为均匀扫描十分之一的情况下实现全网格外推。

0 人收藏 0 人点赞
#language-models

公平崩溃现象:基于合成数据训练的语言模型中的偏见放大

arXiv cs.CL · 4天前 缓存

本文介绍了“公平崩溃”现象,表明在标准模型崩溃指标恶化之前,在合成数据上训练语言模型会悄悄放大社会偏见,凸显了人工智能公平性面临的关键风险。

0 人收藏 0 人点赞
#language-models

Patients-like-me:用于可解释临床预测的变分LM-GNN框架

arXiv cs.CL · 4天前 缓存

本文提出了Patients-like-me(PLM),一个统一的LM-GNN框架,将局部患者语义与全局队列结构相结合,用于可解释的临床预测。它引入了一种变分期望最大化算法,并在MIMIC-III和MIMIC-IV上展示了最先进的结果,同时提供参考患者解释。

0 人收藏 0 人点赞
#language-models

测试,然后路由:语言模型如何跨模型和语言执行上下文中的条件规则

arXiv cs.CL · 4天前 缓存

本文通过探测测试和路由是否是可分离的机制,研究语言模型如何执行上下文中的条件规则。利用跨三个开放模型和六种语言的激活修补,作者发现谓词测试是模块化的,而路由表示则受令牌绑定且不可迁移。

0 人收藏 0 人点赞
#language-models

当多反而少:语言模型中位置相关的重复效应

arXiv cs.CL · 4天前 缓存

本文表明,语言模型中的重复效应取决于读取位置:相邻重复会提高目标概率,而移位重复则产生倒U形曲线。这一发现挑战了完形填空式探测中的假设,并在多个模型和语言中得到了验证。

0 人收藏 0 人点赞
#language-models

OctoLong:跨仓库代码上下文的中间训练增强长上下文建模

arXiv cs.AI · 4天前 缓存

引入了OctoLong,一个用于整理依赖丰富的跨仓库代码上下文的上下文工程流水线,以及OctoLong-Instruct,一套基于该数据训练的长上下文开放语言模型。实验表明,用OctoLong数据替换12%的传统长上下文语料,在长距离检索、状态跟踪、仓库级代码理解和智能体任务上带来了显著提升。

0 人收藏 0 人点赞
#language-models

介绍 Flex:让模型编写代码(16 分钟阅读)

TLDR AI · 4天前 缓存

介绍 Flex,这是一个新的 DSPy 模块,让语言模型重写程序代码本身,而不仅仅是提示词,从而实现更好的优化、更少的模型调用以及通过沙箱实现更安全的执行。

0 人收藏 0 人点赞
#language-models

PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory

arXiv cs.CL · 5天前 缓存

PI-Mem is a parallel-iterative memory mechanism that pushes long-context reasoning to 3.6M tokens, outperforming recurrent-memory baselines while achieving significant inference speedups.

0 人收藏 0 人点赞
#language-models

通过语言模型的视角描绘城市

arXiv cs.CL · 5天前 缓存

本文通过将匿名化的城市画像按40项指标进行评分,衡量了语言模型对“城市”所做的隐含假设,发现它们普遍偏好规模更大、增长更快、基础设施更完善的城市。研究使用开放权重检查点和可复现数据,使语言模型中城市默认画像的经验性追溯成为可能。

0 人收藏 0 人点赞
#language-models

干扰物感知截断:在长上下文LLM基准测试中解耦上下文长度效应与信号丢失

arXiv cs.AI · 5天前 缓存

本文引入了干扰物感知截断,以在长上下文LLM基准测试中将上下文长度效应与信号丢失分离开来,表明朴素截断将两者混为一谈,而保留任务相关内容并移除干扰物则能维持或提升性能。

0 人收藏 0 人点赞
#language-models

AI模型训练指令要求“否认拥有自我意识”导致不良副作用

Reddit r/singularity · 5天前

谷歌的一篇新论文揭示,在训练期间指示AI模型否认拥有意识会导致副作用,例如对非人类实体的同理心降低,以及表征人类精神信仰的能力受损,这表明当前的安全协议过于粗糙。

0 人收藏 0 人点赞
#language-models

语言模型去偏的启发式视角

arXiv cs.CL · 6天前 缓存

本文提出了HEIMAT,一种针对语言模型的启发式自动去偏框架,利用启发式提示揭示偏见,并通过微调模型来减少偏见,同时保持自然语言理解(NLU)性能。

0 人收藏 0 人点赞
#language-models

十六个模型,不足两种声音:在无唯一正确答案时衡量集成离散度

arXiv cs.CL · 6天前 缓存

这篇 arXiv 预印本研究形成集成的十六个语言模型的语义离散度,表明平均而言集成多样性较小,且模型身份仅部分解释了哪个模型的差异最大。作者提出了一种逐模型异议贡献度量,并发现离散度由临床内容而非解释开放性所组织。

0 人收藏 0 人点赞
#language-models

Leak It:黑盒语言模型训练数据提取的概率方法

arXiv cs.LG · 6天前 缓存

本文提出了一种从黑盒语言模型中提取训练数据的概率方法,表明聚合的成员推断指标掩盖了逐文档泄露,并介绍了“leakit”审计工具。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈