你现在到底在评估什么:提示词、上下文,还是整个框架?

Reddit r/AI_Agents 新闻

摘要

关于AI评估焦点的讨论,质疑从业者是在优化提示词、上下文还是整个框架,并指出正转向整体优化。

向关心评估的人提问。你现在主要想评估和优化什么?提示词?上下文?还是框架本身?我交谈的大多数人仍然将评估指向单个提示词。但我的看法是前沿已经转移:现在有趣的工作是闭环并优化整个上下文和/或框架,而不是孤立地调整提示词。有没有人已经在实践中这样做了?好奇你们的设置是什么样的,以及在哪些地方会出问题。
查看原文

相似文章

AI 工具问题的答案(2分钟阅读)

TLDR AI

文章认为,AI 工具服务于两个不同的目的——提供关于用户想要什么(意图)的上下文和如何实现它的指令(执行)——并且这两者会随着时间推移而价值变化:随着模型改进,执行指令的价值下降,而意图上下文的价值上升。

重新思考智能体工具框架进化的评估

Hugging Face Daily Papers

本文重新思考了智能体自动工具框架进化应如何评估,指出性能提升可能源于增加的计算量而非真正的改进,并且进化后的工具框架难以泛化到未见过的任务。