给你的AI代理一个思考的空间,实时观察其决策过程

Reddit r/AI_Agents 新闻

摘要

作者描述了一个实验,其中像Claude Code和Codex这样的AI代理被提供一个工作手册,以记录它们在任务中的决策和权衡,探讨这些推理痕迹作为蒸馏信号的潜在用途。

大型实验室显然不公开逻辑值(logits)。所以我想,如果你想大规模进行蒸馏实验,能从这些模型中获得什么其他信号?哈哈,构建这个实验很有趣:给Claude Code/Codex一个强制的‘工作手册’,要求它们在工作时记录决策、考虑过的替代方案、权衡等,只是普通的模型输出,而非隐藏的推理。思考这些痕迹是否能作为信号很有意思。
查看原文

相似文章

关于 AI 智能体的真实内情

Reddit r/AI_Agents

一位资深从业者分享了将 25 个以上 AI 智能体部署到生产环境的经验教训,指出记忆、编排和可审计性远比模型选择重要。文章详细介绍了上下文丢失、静默成本循环等常见故障模式,并推荐了包含 Claude Sonnet 4、Pydantic AI 以及 Octopodas 等专用记忆层的技术栈。