标签
Boris Cherny,Claude Code在Anthropic的创作者,建议优先选择通用AI模型而非具体模型,指出脚手架改进往往是临时的,并会被新模型取代。
Anthropic 工程师公开了一项他们内部使用的简易技巧:利用外部记忆脚手架,让 Claude 代理将错误和改进记录在一个文件中,从而在无需重新训练模型的前提下持续提升性能。
OpenAI 的 GPT-6 Astra 功能增强,可移除脚手架以提升效率,但安全指标和企业控制凸显了保留控制脚手架的重要性,以防意外后果。
NavMCP是一个代理脚手架框架,集成视觉语言模型与导航基础模型,以实现持久的长时程物理世界探索,并在基准测试和真实机器人任务中取得最先进的成果。
本文批评当前的AI智能体被过度炒作且根本上有限,认为它们本质上是带有脚手架的大语言模型,并且其依赖的下一个词元预测使其在长期规划和问责方面不可靠。
本文研究了测试时的强弱能力迁移,表明更强的模型能够构建推理时框架,在不进行参数更新的情况下,使较弱模型的性能近乎翻倍。
一款开源 CLI 工具,可在数秒内搭建生产级 AI Agent 项目,简化 Python 开发者的环境配置流程。
本文介绍了DCAS——一种后端替换拦截层,它将CLI代理脚手架与后端模型解耦,从而实现跨脚手架评估。研究表明,在小规模数据集上进行规划感知微调,能够提高模型在非训练脚手架上的泛化能力。
这项基于设计的研究探讨了教学支架如何帮助少数民族预科生在提示工程任务中从被动消费转向与生成式AI进行批判性共创,从而提升提示自我效能感,并主动把关AI生成的内容。
一个用于组织生成式AI应用的项目结构脚手架,将配置、数据、示例、笔记本、测试和核心源代码模块分离。它采用Apache 2.0开源许可。
一位开发者认为,AI模型周围的框架(评审、脚手架)比模型本身更重要,并分享了一个例子:一个27B模型在优秀评审的帮助下变得可用于编码工作。
SelfCompact是一种脚手架方法,让语言模型自主决定何时以及如何压缩长智能体轨迹,相比固定间隔方法,在减少token成本的同时实现了更好的性能。
一项分析指出,公司在人工智能方面失败的原因在于它们专注于模型,而非基础层——流程设计、治理、知识架构、人工判断和反馈循环——而这些才是真正的价值来源。文章引用了纳德拉的“令牌资本”概念、苹果可切换模型的Siri,以及显示战略与执行之间存在巨大差距的调查数据。
本文研究了共享工作空间中的人机团队协调,使用Collaborative Gym和DiscoveryBench任务,发现如果没有适当的结构,增加协作者可能会降低性能。通过共享组记忆和人在回路门控进行支撑,可以提升性能,尤其是在三人团队中。
本文介绍了SIA,一种自我改进的AI循环,它结合了脚手架重写和权重更新(通过LoRA)以提升任务性能。在三个不同的任务上测试,它优于仅使用脚手架改进的设置。
一位独立研究者引入了Epistemic Lattice Tethering(ELT),这是一种推理时脚手架框架,通过应用认知和本体治理,将连贯的LLM线程扩展到32.5万至100万token。
这是一篇 Hugging Face 博客文章,旨在定义并厘清 AI Agent 领域的关键术语,如 scaffolding、harness、context engineering 和 tool use,力求在快速演进中实现词汇标准化。
Anthropic 应用AI团队在研讨会上分享了如何构建能持续运行数小时的智能体,核心在于上下文管理、规划与自我验证,以及模型与配套工具的共同演进。
Better-Fullstack 是一款全栈项目脚手架工具,支持 TypeScript、Rust、Python、Go、Java 五种生态,450+ 工具组合,通过 CLI 或网页构建器快速生成即用项目骨架。