现在瓶颈是压缩与记忆(以及一点输入过滤)
摘要
作者认为AI的瓶颈在于记忆和压缩,将LLMs与人类记忆效率进行比较,并建议改进工具集成以提高性能。
接下来是长篇大论,完全手打,给那些在乎的人看,甚至没有重新格式化。几周前我说视觉是最大的瓶颈之一,不久之后Astra发布,让我们很多人震惊,我有偏见但在我看来,它在视觉智能上远超5.6模型并非巧合。计算机在短期、中期、长期记忆方面都比人类“更好”。嗯,不,在几乎所有方面,它们的短期记忆都更好,但对于中期和长期记忆,它们并不更好,虽然在准确性上更胜一筹,但“成本”不高。“压缩”是一个权宜之计,258k令牌的上下文窗口也是如此。人类通常不会记住10秒前告诉他们的新电话号码,但可以在一个1000万令牌的代码库中工作10年后,记住针对安卓用户在特定主要版本9-10中出现的罕见错误大约在文件的20%处。人类的压缩/输入过滤/记忆的“负担”远小于LLM,并且在实践中仍然“更好”。如果你在放松看电视,心不在焉,几乎没注意,然后被迫重看同一集,它会感觉无聊,因为太熟悉了,尽管没有付出任何努力,你仍然能够以如此低的成本吸收这么多。我相信对于文本,这个问题非常可解决,并且将解锁极长视野、低成本的高质量工作,如果Astra能够“记住”。我们不会预先存储整个记忆,但我们也更高效地回忆它。在我看来,最合适的类比是LLM应该做什么,以更好地模仿人类的优点,同时保留LLM的优势:将上下文仅视为短期记忆,虽然比人类大100倍,但不是数百甚至数千倍。在我看来,10k上下文窗口对ASI来说绰绰有余,是的,我这个数字是瞎编的(有点,人类是NGI,而我认为我们上下文窗口的等价物最多是1k令牌)。相反,更依赖于廉价的“工具”调用,用于1.压缩 2.输入过滤 3.记忆。当前LLM部分和支持的最大问题区域(在我看来)用粗体表示:上下文窗口 ~= 人类未压缩+压缩的短期记忆,例如新电话号码、电影最后5分钟等。也许我会错,但LLM可以处理比我们多得多的未压缩“上下文窗口”,我不认为有必要压缩,它太便宜了,不用担心,而且我们越晚压缩,理论上压缩应该越相关,这是一个平衡,由于上下文在前,压缩在后,我认为它们的平衡与人类完全不同是没问题的,目的不是试图1:1复制人类,只是用他们作为灵感来克服限制。LLM CoT ~= 人类CoT,不,它们不完全相同,但足够接近,不会让已经很长的帖子变得臃肿。LLM输出 ~= 人类输出,同样的道理,它们都只是输出令牌,就像我们无论说话还是思考,至少对大多数人来说(大多数人有内心独白)。对话压缩 != 压缩,压缩是一个权宜之计,不如应该使用的。工具调用、grep、模糊搜索、语义搜索、around、awk等 ~= 略读,人类可以廉价地略读文件,这些工具还不错,但通过更多研究可以做得更好,我认为。源文件 != 长期记忆,只是读取它们的名字并在周围查看是一个权宜之计。code-map.md != 长期记忆,一个 hacky 的变通方法。我认为如果做得正确,你整个项目的潜在压缩、所有项目规则、所有全局规则、数十亿技能等可以“在”上下文中(而不是实际上全部在上下文中,更像是查找在那里,很容易“取出”必要的压缩信息,这些信息要么直接有用,要么立即指向正确的地方)。不是另一个Jev帖子,但我相信像Jev这样的工具实际上可以帮助缩小差距。廉价地决定什么“标签”对问题重要,然后工具可以在需要时自动更新上下文,并在不再需要时刷新它们。使用“标签”(可能在潜在空间中)和基于工具的自动上下文填充,当必要时,我真心相信你可以用一个小上下文窗口(包括当前加载的潜在知识)廉价地获得极高的能力。我没有多讨论输入过滤,但我们知道未缓存的输入读取不是免费的,我认为当压缩/记忆“解决”后,这相对容易得多,与其读取整个日志文件,不如使用廉价工具进行“失败|错误|问题”的语义搜索,并且不将任何不需要的内容包含在上下文中,这已经接近足够好了,它只是偶尔非常糟糕(比如Cursor执行一些命令,我不知道它抽什么风,尽管几乎没做什么,它在一个聊天中读取了1400万令牌,花了30美元的积分,显然至少Cursor没有正确保护LLM免受控制台输出的影响!)。所以我提到它较少作为真正的瓶颈,而是一个常见陷阱,即使是行业领导者也有改进空间。基本上归结为:SQL是愚蠢的但便宜且快,LLMs是昂贵且慢的但聪明,尝试更多利用像SQL这样的东西(或者有时字面上SQL)当它们适合时。但前沿实验室应该自己做,而不是插件。在我看来,他们应该真正挑战自己,拥有一个相对微小的上下文窗口,现在让它像现在一样工作良好。Jev当然在SQL之上,更聪明但和它一样便宜和快,但与SQL相比,对于适合SQL的任务,它极其慢且昂贵。人类是活生生的证明,可以廉价且相关地获取和回忆长期记忆,你可以主动尝试不记住某事,却无法不记住(我成功地几个月没想起我看到的一个人死亡的视频,写这个又让我想起了,一个悲伤但相关的例子,我的大脑“毫不费力”地“取出”了它)。一旦破解,我相信它们会轻松超越人类,因为我们的肉脑与比特相比极其不可靠。在我看来,这几乎是持续学习的解决方案,因为如果做得正确,那么有可能将每个有史以来的技能“存储”在每个工作者上,不意味着它不断向上下文添加成本,但当需要时,技能会自动进入上下文,这意味着它不会像现在这样重新发明轮子,而是应用它之前找到的解决方案。隐私是一个问题,越狱也是,所以遗憾的是可能无法随意允许用户的技能到达其他用户,但在概念上你可以,这意味着LLM会显得越来越聪明,当第1000个人问它做X时,它不会重新想怎么做,而是廉价、快速、准确地回忆一个为此目的“制作”的技能。虽然不是真正的持续学习,因为它不能真正变得更“聪明”,但在我看来人类可以(勉强,且极其缓慢)。但如果不限制廉价快速的“查找”被解决,用Astra级别的智能替换50%的白领工作似乎可行。我的意思是基本上自动化替换也是,而目前如果你想替换所有这些员工,你需要人来做指导和教LLMs关于公司等。相反,它可以安装在公司所有计算机上,吸收所需内容,并自动检测何时可以至少同样好地做同样的事情,当然更快。
相似文章
@Alacritic_Super: LLM推理的最大瓶颈不是算术运算,而是数据移动。一次乘加运算仅需…
一条科普线程,解释LLM推理的主要瓶颈是数据移动而非计算,并强调了量化、KV缓存优化和FlashAttention等减少内存流量技术的要点。
压缩即一切——关于长期AI记忆的论文
一篇主张压缩(而非更长的上下文窗口)才是长期AI记忆和关系连续性的关键基元的文章,并以计算中的算力与存储作类比。
受内存限制但不限于带宽:物理AI推理中批量1的LLM解码差距
本文研究了物理AI系统中批量1的LLM解码的性能差距,发现更快的内存带宽并没有按比例减少延迟,因为启动开销的存在,并且量化效率在不同硬件间差异显著。
@cHHillee: 在现代机器学习加速器中,浮点运算能力(FLOPS)已呈现爆炸式增长。然而,瓶颈往往不在于 FLOPS,而在于内存带宽…
Thinky 将人机交互带宽视为一个日益严峻的瓶颈,其状况类似于机器学习加速器中的内存带宽问题,并提出了针对这一局限性的解决方案。
你的观点是什么:瓶颈是否已从原始LLM能力转向Agent框架工程?
文章质疑AI的焦点是否已从原始LLM能力转向面向实际性能的Agent框架工程。