@rohanpaul_ai: 大型语言模型可能不需要人类风格的语言。即,未来的人工智能系统可能会通过使用密集的、模型可读的消息来节省上下文空间,而不是冗长的常规散文。
摘要
本文介绍了BabelTele,一种压缩写作风格,通过使用缩写、符号和多语言片段将文本长度减少72.1%,同时为LLM保留了99.5%的语义保真度,论证了人类可读性与机器可恢复性是可分离的。
查看缓存全文
缓存时间: 2026/06/26 10:10
LLMs 或许不需要人类风格的语言。
也就是说,未来的人工智能系统可能会使用密集的、模型可读的讯息来代替冗长的自然语言,以节省上下文空间。
作者提出了 BabelTele,一种压缩写作风格,可以混合缩写、符号、来自不同语言的片段以及非常规结构。
对于一个能力足够强的语言模型来说,这种风格仍然能够承载足够的信息结构来完成提问、保持记忆以及在智能体之间传递信息。
关键在于,人类可读性、自然语言流畅性与机器可恢复性是三种可以分离的属性。
人类语言之所以存在冗余,是因为人类需要节奏感、语法、上下文以及确认感。
而基于海量符号混合物训练出的模型,可能并不需要每次都依靠这些支撑结构。
论文中最有力的结果表明,BabelTele 能够在将文本压缩至原长度 27.9% 的同时,保留约 99.5% 的语义保真度。
链接 – arxiv. org/abs/2606.19857
标题:“LLMs Do Not Always Need Readable Language”
相似文章
LLM输出人性化是愚蠢的
一篇评论文章,认为通过提示指令将LLM输出人性化是一种错误的抽象——智能体应交换高保真数据,仅在最终边界压缩为人类友好的文本。
语言模型生成的小说在形式变化上呈现压缩
本文分析了与人类创作的小说相比,大语言模型生成的小说是否表现出压缩的形式变化。研究发现,尽管个体小说在风格上接近人类,但AI输出在句子结构、可读性和标点方面更为统一。
LLM的最佳使用方式会是什么样?
探讨一种推测性想法:通过适应LLM的原生通信模式(例如使用神经语)来优化人类与LLM的交互,而不是强迫它们适应人类语言。
小而足:通过LoRA适配器对AI编辑文本进行逐用户风格重写
本文介绍了InMyStyle,一个隐私优先的系统,它在小型语言模型(0.5B–7B)上使用LoRA适配器,无需显式提示即可将AI编辑过的文本重写为符合个人用户写作风格的文本。评估显示,不同模型规模下质量趋于平稳,表明紧凑型模型足以胜任此任务。
为什么不能训练LLMs用一种优化的AI语言而非英语来思考?
一个推测性的讨论,质疑为什么LLMs没有被训练使用优化的内部语言而非自然语言来思考,以及这是否能提高效率。