@lateinteraction:我对如今所谓的“LLM harnesses”的看法始于2019年底,当时@ChrisGPotts推荐我……
摘要
关于LLM harnesses的一种观点,追溯其起源至早期多步骤工具使用研究(如HotPotQA和GoldEn),并包含Christopher Potts对“仅靠LLM是否足够”这一争论的评论。
查看缓存全文
缓存时间: 2026/08/07 06:48
这种关于如今所谓的“LLM harnesses”的观点,最初是在2019年底开始在我脑海中形成的,当时@ChrisGPotts推荐我研究像@qi2peng2的HotPotQA和GoldEn这样的工作,这基本上是第一代使用神经语言模型进行多步工具使用的研究!https://t.co/62uJRfT8ML
Christopher Potts (@ChrisGPotts): 对我来说,这篇文章源于我/我们与那些预测LLM本身就能提供所有能力、不需要外部工具的人进行的许多讨论和辩论。你可以从这篇2021年由@lateinteraction、@matei_zaharia和我撰写的文章中更清楚地听到这一点:
相似文章
本地LLM伙伴
一位拥有45年经验的开发者正在构建一个本地优先的LLM框架,包含多智能体逻辑,即将在GitHub上开源,并向社区询问哪些功能能改善他们的本地LLM体验。
除了写作和编程,LLM为你做过的最有用的事情是什么?
一个讨论话题,询问人们实际采用的、非同寻常且实用的非写作、非编程的LLM使用案例。
迈向万能工具:设计直观、透明且精简的LLM控制框架
本文探讨了设计LLM控制框架的原则,旨在使其直观、透明且精简,借鉴Unix哲学以减少认知负荷并提高可靠性。
LLMs 并非你所认为的黑箱
一篇总结 Anthropic 2025 年关于机制可解释性论文的文章,表明 LLM 并非黑箱,电路追踪可以揭示多步推理和人类可识别的概念。
2025年:将LLM API集成到你的测试工具中;2026年:设计测试工具以便在你的Agent中运行
一个简短的预测:2025年工程师会将LLM API集成到他们的测试工具中,而2026年他们会设计测试工具以便在Agent中运行。