Ngram与世界知识——为什么我们只在构建编码模型?
摘要
作者讨论了AI模型需要更好的世界知识,利用N-gram技术将更多知识融入更小的模型,并质疑为什么开发更侧重于编码能力而非更广泛的世界知识。
这篇文章是由人类撰写的,如果您能以相应的方式对待它,我将不胜感激。谢谢。所以,我注意到人们对于开发尽可能好的编码和代理工具调用模型有着相当明显的兴趣,尤其是在较小尺寸、低于50千兆字节的模型中。然而,我发现,至少对于我的AI使用而言,如果我真的想摆脱大型提供商,我将需要一个比当前产品具有更好世界知识的模型。Qwen 3.8 27B对于许多事情来说是一个真正出色的模型。它高度智能,在设计应用程序、编码和在我的系统上工作方面非常出色。然而,与前沿技术相比,它的世界知识很差,尤其是在我必须运行它的Q4量化版本上。所以,这给我留下了一个问题。随着我们看到的新N-gram技术被集成到Qwen 3.8 Next中,并且预计将在未来模型中运行,为什么不能创建一个具有较小智力能力集但更丰富世界知识的模型呢?我理解目前大家都在优化以使尽可能智能的模型适应尽可能小的空间。但为什么我们不利用SSD给模型大量世界知识,使其在处理截图、多语言能力、做像素艺术或回答物理问题等方面做得更好呢?Ngram似乎是对“无法装入VRAM”问题的答案...Qwen 3.8 Next真的让我开阔了眼界,意识到这些模型的开发可能有一个完全不同的、更好的范式,至少对于许多用例来说如此。拥有一个相对智能且具有大量世界知识的模型可能比尽可能智能的模型更好...更不用说,这意味着模型的训练截止时间将变得不那么重要,因为它可以只制作一个新的ngram。显然,主要兴趣在于创建一个能够尽可能好地编码的模型,因为这将占据市场份额。但我很好奇是否有人在做这方面的工作,或者是否有人知道为什么这些事情不常发生。请告诉我为什么我错了,我怎么错了,以及在多少方面我错了,因为我确信那就是你真正想告诉我的,但至少我会学到一些东西,因为正如这篇文章所示,我根本不知道自己在说什么。谢谢,祝你有美好的一天 :) 编辑:我发现了这篇帖子,我想它提供了我所问的很多内容:https://www.reddit.com/r/LocalLLaMA/comments/1vzgtqf/ngram_vs_experts_explained/ 编辑2:这篇更好,推荐阅读。谢谢Reddit的建议:https://www.reddit.com/r/LocalLLaMA/comments/1w0198r/no_engrams_wont_let_you_run_1t_models_locally_it/
相似文章
@techNmak: 世界模型在AI智能体中是一个重要概念,但这个术语常常被解释得过于宽松。对于一个长时间运行的智能体来说…
这篇文章解释了AI智能体中世界模型的概念,强调了它们在跟踪演变状态和转变方面的作用,与上下文或记忆不同,并举了叙事世界模型用于长篇小说的例子。
@TIME:语言模型理解词语。世界模型能帮助AI理解世界本身。《时代》的Tharin Pillay与…
《时代》杂志强调世界模型是语言模型之外的AI理解的一步,介绍了在AMD的Advancing AI活动上与Odyssey的Oliver Cameron的对话。
世界模型与空间智能时代:超越语言的AI治理
斯坦福HAI探讨了AI中世界模型和空间智能的兴起,呼吁建立治理框架以应对超越语言处理的能力。
Code World Model:编程代理作为世界大脑
本文介绍了Code World Model,这是一个结合了用于推理和编码的语言模型与用于视觉渲染的视频模型,以开放式方式模拟持续世界演化的框架。
面向现实世界的人工智能:与Yann LeCun的对话(12分钟阅读)
Yann LeCun认为,大型语言模型缺乏真正的智能,因为它们不理解物理世界;他主张开发能够学习因果关系并为现实世界应用提供规划的“世界模型”。