还有人厌倦了为了给AI代理准备数据而把各种工具拼凑在一起吗?
摘要
作者分享了为AI代理准备数据时拼凑工具的烦恼,并提出了一种更简单的方法:上传原始文件,用日常英语描述所需输出,即可获得干净、结构化、可供代理使用的数据。
我在构建代理时经常遇到这个问题。代理逻辑通常是最简单的部分。然后你会遇到现实世界的数据,如PDF、电子邮件、电子表格、扫描文档等,突然间你需要把OCR、解析器、LLM调用、正则表达式、模式验证和各种API拼凑在一起,只是为了获得可用的输入。我一直在尝试一种更简单的方法:原始文件 → 描述你想做什么 + 输出应该是什么样子 → 获得干净/结构化/经过验证的数据 → 交给代理。我不认为每个构建代理的人都应该成为数据工程师。对于大多数代理工作流,数据处理通常可以分为几类:清理/准备、分块、生成标签/标注、生成问答对。我的目标很简单:上传原始数据,选择任务,用日常英语解释你希望如何处理以及希望返回什么,然后它为你完成那些繁琐的数据管道工作。例如:电子邮件 + PDF → 提取客户/订单信息 → 验证 → 干净JSON → 代理。基本上,描述最终结果,而不是自己构建整个管道。有人也在处理这个问题吗?你们现在是怎么处理的?如果有人感兴趣,我很乐意让你免费试用。
相似文章
一个在工作中确实对我有帮助的AI智能体用例
作者分享他们发现AI智能体对于重复性的数据准备工作很有用,具体是使用Pandada来清理和标准化原始文件,从而减少手动工作和错误。
AI 智能体开始暴露出大多数工作流程原本就已支离破碎的事实
文章认为,AI 智能体揭示了企业工作流程实际上是多么缺乏结构和混乱不堪,暗示成功的自动化更多取决于整洁的系统和完善文档,而非先进的模型。
在开发 AI 智能体时,我意识到构建一个生产就绪的 AI 智能体不应当复杂。
作者回顾了构建 AI 智能体的经验,并主张创建生产就绪的智能体不应当过于复杂。
生成更好训练数据的智能体(25分钟阅读)
Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。
神经数据不再无聊:代理型AI在数据复用中的基准测试
本文对代理型AI系统在加载、理解和重新格式化碎片化的神经科学数据任务上进行基准测试,发现尽管代理在子任务上表现良好,但很少能实现完全无错误的端到端解决方案,人工监督仍然必要。