还有人厌倦了为了给AI代理准备数据而把各种工具拼凑在一起吗?

Reddit r/AI_Agents 产品

摘要

作者分享了为AI代理准备数据时拼凑工具的烦恼,并提出了一种更简单的方法:上传原始文件,用日常英语描述所需输出,即可获得干净、结构化、可供代理使用的数据。

我在构建代理时经常遇到这个问题。代理逻辑通常是最简单的部分。然后你会遇到现实世界的数据,如PDF、电子邮件、电子表格、扫描文档等,突然间你需要把OCR、解析器、LLM调用、正则表达式、模式验证和各种API拼凑在一起,只是为了获得可用的输入。我一直在尝试一种更简单的方法:原始文件 → 描述你想做什么 + 输出应该是什么样子 → 获得干净/结构化/经过验证的数据 → 交给代理。我不认为每个构建代理的人都应该成为数据工程师。对于大多数代理工作流,数据处理通常可以分为几类:清理/准备、分块、生成标签/标注、生成问答对。我的目标很简单:上传原始数据,选择任务,用日常英语解释你希望如何处理以及希望返回什么,然后它为你完成那些繁琐的数据管道工作。例如:电子邮件 + PDF → 提取客户/订单信息 → 验证 → 干净JSON → 代理。基本上,描述最终结果,而不是自己构建整个管道。有人也在处理这个问题吗?你们现在是怎么处理的?如果有人感兴趣,我很乐意让你免费试用。
查看原文

相似文章

生成更好训练数据的智能体(25分钟阅读)

TLDR AI

Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。