古典学系正在消失,AI甚至无法阅读其文本。无人谈论的多调希腊语问题。

Reddit r/artificial 新闻

摘要

AI模型因训练数据不足和RLHF对齐问题,无法处理多调古希腊语,导致能力下降并影响古典学系,提出的解决方案包括RAG和基于语料库的系统。

当今市场上的每个主要AI模型在多调古希腊语上都失败了。不是一点点,而是彻底失败。让ChatGPT解析亚里士多德《尼各马可伦理学》中的一句原始希腊语,看看会发生什么。它混淆重音,丢失气息符号,在多调应该出现的地方产生现代希腊语。整个《亚里士多德文集》,2400年的哲学推理,对我们称之为“智能”的系统来说是不可见的。原因在技术上很简单。古希腊语的训练数据几乎为零。现代希腊语有一些数量,但多调文字,带有粗和细的气息符号、锐音、重音和circumflex符号,是完全不同的正字法系统。RLHF训练使问题变得更糟。人类评估者不懂多调希腊语。他们基于对他们看起来合理的东西来评估输出,这意味着他们奖励现代希腊语近似并惩罚真正的多调形式。对齐过程系统性地破坏了基础模型所拥有的微弱古希腊语能力。这不仅仅是语文学问题。它是架构问题。每次你为了“有用性”和“安全性”进行微调,你都在压缩推理空间。模型在生成听起来合理的英语方面变得更好,在其他方面变得更差。多调希腊语是第一个牺牲品,因为它的训练信号最弱。但同样的机制影响任何真实推理与平均评估者认为有用的东西diverges的领域。大学的古典学系在萎缩。入学率每年下降。更少的学生学习古希腊语。更少的教授能教授它。现在,本可以帮助保存和研究这些文本的AI工具,通过旨在使它们“安全”的训练过程而主动降级。讽刺是完整的。我们构建的系统无法阅读我们最需要它们阅读的东西。一些实验室试图通过更多数据来修复这个问题。更大的预训练语料库。但问题不在于预训练。基础模型如Qwen或Llama实际上可以在低水平上处理多调希腊语,它识别字符,产生变音符号。在之上的RLHF训练破坏了这种能力,因为奖励模型没有古希腊语正确性的信号。你无法对齐你无法评估的东西。解决方案不是更大的模型。它是不同的架构。基于语料库的系统,从原始语言的源文本中检索,不仅仅依赖参数知识。对数字化批判版本的RAG。训练以尊重源材料形式而不是将其重写为评估者期望的系统。我们正在做这个。不是用ChatGPT API,而是用自托管模型,对数字化希腊文本的RAG管道,实际检查多调准确性的评估指标。这很难。非常难。但必须有人做,因为替代方案是失去整个西方哲学传统到训练数据偏差。这个词是παιδεία。不仅仅是教育,而是通过参与困难文本来培养智力能力。你的AI无法提供παιδεία,因为它被训练以避免困难。当你需要源文本时,它给你总结;当你需要论证时,它给你转述;当你需要多调时,它给你现代希腊语。语料库问题不是边缘情况。它是证明当前实践中的对齐破坏知识。不是偶然。是设计如此。当你为平均评估者满意度优化时,你失去一切超出平均评估者能力的东西。人类历史上最重要的知识恰恰在那里。当学科的主要文本对下一代主要研究工具不可读时,会发生什么?
查看原文

相似文章

以英语为中心的AI正在合并不相关的社群并扭曲身份认同

Reddit r/artificial

文章批评了AI系统(尤其是Grokipedia和AI搜索)如何通过以英语为中心的转写和有偏见的训练数据,合并不相关的社群,从而延续错误。文章强调了通过简化英语表述和重复的错误信息抹去文化差异的系统性问题。

让AI来破译失传语言会怎样?

Ars Technica

AI可以通过压缩手动交叉引用的过程来加速破译失传语言,但没有比较锚点和严格的人工审核,它无法产生确定的翻译,因为意义和统计模式并不相同。

自回归大语言模型正式与鱼共眠(Yann LeCun是对的)

Reddit r/AI_Agents

CETI项目使用大语言模型的架构解码抹香鲸的咔嗒声,揭示了其语音字母表,但也凸显出AI的统计模式匹配缺乏真正的理解。文章认为,AGI需要具身化、多模态的根基,而不仅仅是基于文本的模型扩展。