@omarsar0: 多模态提示显然是未来。我喜欢尝试与智能体交互的新方式。作为一名研究者……

X AI KOLs Following 新闻

摘要

一位研究员和工程师讨论了多模态提示对AI智能体的好处,解释了如何结合语音、屏幕标注和操作来提升智能体性能并减少挫败感。

多模态提示显然是未来。 我喜欢尝试与智能体交互的新方式。 作为一名研究员和工程师,我发现,提供给智能体的输入越丰富,我消费的输出越丰富,协作的总体结果就越好。 在这个小演示中,我阐述了我所说的多模态提示的含义,以及你何时会发现它有用。 它不仅仅是简单的文本提示,所以暂且称之为“任务”。它帮助我录制语音、标注屏幕、点击/鼠标操作等。 然后所有这些都被预处理并传递给智能体,以更高效地完成任务。智能体有高层次的提示,但如果有需要,它也有原始转录。因此,我自然也利用这一点来构建多模态技能,并在智能体往往难以处理的流程中复用这些技能。 这为我节省了大量时间。即使是较旧的模型也能更清晰地理解任务。过程中会引入一些噪声,但似乎并不影响性能。我还发现,这种新的提示方式减少了我与智能体之间令人沮丧的交互次数。 这是我思考已久的事情,因为我们将更多地转向多模态AI模型。因此,交互将随着模型能够原生处理多种模态而发展。目前,我在后台用另一个模型处理所有录制的任务,但认为未来所有内容都将被全能模型自然消费并非疯狂的想法。 所有这些录制的任务(你也可以将其视为丰富的标注数据集)都是我挖掘并随时间递归改进的东西,在某些情况下,我将其打包为可复用的工作流/模式/技能。 这个过程真正提升了我在各种工作中使用编码智能体的方式。我在网页开发、设计、工件创建、原型设计、研究、阅读、模拟、AI辅助写作等方面使用多模态提示。 所以这不仅仅是提示的问题。它更深入地理解并探索智能体做出正确决策所需的细节层次,以推动并最大化它们的能力。
查看原文
查看缓存全文

缓存时间: 2026/07/04 00:43

多模态提示无疑是未来。

我喜欢尝试与智能体交互的新方式。

作为一名研究人员和工程师,我发现给智能体的输入越丰富,我所获取的输出也越丰富,整体协作的效果就越好。

在这篇简短指南中,我介绍了多模态提示的含义以及何时使用它。

它不仅仅是简单的文本提示,因此我暂称之为“任务“。它可以帮助我录制语音、标注屏幕、记录点击/鼠标操作等。

然后所有这些都被预处理并传递给智能体,使其更高效地完成任务。智能体拥有高级提示,但如果有需要,它也能获取原始转录。因此,我自然也利用这一点来构建多模态技能,并在智能体容易遇到困难的工作流中重复使用。

这为我节省了大量时间。即使是较旧的模型也能更清晰地理解任务。过程中会引入一些噪声,但似乎不影响性能。我还发现这种新的提示方式减少了我与智能体交互中的挫败感。

这件事我已经思考了一段时间,因为我们将更多地转向多模态AI模型。因此,交互方式也会随着模型能够原生处理多种模态而演变。目前,我在后台用另一个模型处理所有录制的任务,但未来所有这一切都将被全能模型自然消化,这并非天方夜谭。

所有这些录制的任务(你也可以将其视为丰富的带标注数据集)都是我不断挖掘和递归改进的,在某些情况下,我还会将它们打包成可复用的工作流/模式/技能。

这个过程真正提升了我使用编码智能体完成各类工作的方式。我将多模态提示用于网页开发、设计、制品创建、原型设计、研究、阅读、模拟、AI辅助写作等等。

因此,这不仅仅是关于提示。它更深入地理解和探索智能体做出正确决策所需的确切细节,从而推动并最大化它们的能力。

相似文章