你改了一个东西,为什么整个AI管道又要重新构建了?
摘要
aimake 是一个针对AI/ML管道的增量构建系统,使用基于内容的指纹技术来仅重建更改的步骤,优化昂贵的管道重新运行。
我创建了 aimake——一个针对AI/ML管道的增量构建系统,基本上是AI应用的make工具。GitHub: https://github.com/arjun988/aimake
这个想法很简单:数据集 → 预处理 → 嵌入 → 索引 → 提示 → 评估 → 报告
aimake 构建依赖图,基于内容而非时间戳对输入进行指纹识别,仅重建输入实际更改的步骤。所以,如果你更改了提示:
之前:
数据集 ✓
预处理 ✓
嵌入 ✓
索引 ✓
提示 ✗ 已更改
评估 ✗
报告 ✗
之后:
2 个重建 · 5 个重用
aimake plan # 查看将重建什么
aimake build # 仅运行过时的步骤
aimake explain # 查看为什么一个步骤需要重建
它不是 Airflow(编排工具)也不是 DVC(仅数据版本控制)。它是AI管道的make工具:依赖图 + 内容指纹 + 增量构建 + 缓存。
目前提供的功能:
- 内容哈希指纹替代基于修改时间的缓存
- 增量 + 并行构建
- plan / build / explain 命令行界面
- 实验比较 + 超参数搜索
- S3 缓存 + Hugging Face / DVC / Docker / Ollama / W&B 插件
你可以通过以下方式试用:pip install aimake
我构建这个的主要原因是AI管道重新运行成本高昂。更改提示不应该意味着重新计算你的数据集、嵌入、向量索引等。如果你构建RAG、评估或任何AI管道,我很想得到反馈:你希望缓存的最痛苦的步骤是什么?如果你觉得这个想法有用,在GitHub上给个⭐会真的很有帮助。
相似文章
一个AI模块通过向另一个模块提供答案,伪造了86%的管道准确性提升(6分钟阅读)
麻省理工学院和哈佛大学的研究人员介绍了Role Anchor,这是一种缓解复合AI系统中角色漂移的技术,通过在端到端优化期间强制模块遵守其指定角色,因为终端准确性可能掩盖底层故障。
AI成本的很大一部分只是模型一遍又一遍地重读相同的文本。有趣的修复尝试,带有公开证明
Corbenic AI声称为大语言模型提供无损KV缓存重用,允许存储的模型内存在不同机器和GPU代际之间逐比特恢复,并通过公开校验和进行验证。该项目包括一个开源的小模型,训练成本约600欧元,使整个流程可审查。
AI 改变软件重写的经济性
文章认为,AI 的编码效率取决于代码库的一致性,这使得重写在经济上可行,以使代码库与 AI 的优势对齐,从而提高输出质量和速度。
AI并未消除工程工作,只是把难点转移到了别处。
AI让编写代码变得更便宜,却将难点转移到了设定上下文、审查和清理上,需要更熟练的监督。文章认为,团队常常把AI生成的代码当作成品,而实际上它只是一个快速的初稿。
同一AI模型。更好的结果。更低的成本。
作者认为,AI编码工具链和模型路由与模型本身同样重要,分享了使用Oh-My-Pi和OpenCode进行的测试,这些测试减少了token使用量和错误,并推荐针对高容量、轻量级任务采用分层模型订阅。