标签
OriginBlame 是一个记录级与令牌级的数据溯源系统,能够在 AI 训练数据管道中传播作者身份,从而为机器遗忘(machine unlearning)生成精确的遗忘集。它消除了数据集级系统导致的过度删除问题,并提升了遗忘效果。
一个用 Rust 编写的命令行 CSV 处理工具 'xan',能够快速、低内存地处理大型 CSV 文件,并自带表达式语言、终端可视化和社科分析扩展。
Ray 2.56已发布,包含Ray Data的稳定性改进以及Ray Serve的重构,以提升LLM服务的性能。
Ray 2.56 已发布,改进了 Ray Data、面向 LLM 的 Ray Serve、GPU 域感知放置组以及 Kubernetes 集成。
本技术指南介绍了如何使用 Python 和 Apache Spark 实现自定义查询语言(EHQL),重点在于使用 Lark 定义语法和解析。
DataClaw0提出了一种智能数据裁剪范式,利用可学习的数据处理来结构化高熵多模态流,通过在一个新型基准上进行SFT和GRPO实现了稳健的对齐。
xan 是一个用 Rust 编写的高性能命令行 CSV 处理工具,具备 SIMD 解析、并行计算和终端数据可视化功能。
Flatiron 是一个纯 Clojure 的列式分析库,用于内存表,具有类似 SQL 的 DSL,专为使用原始数组和批处理的高性能而设计。
Refiner是Macrodata Labs开发的开源引擎,用于将原始机器人和多模态数据转换为高质量训练数据集,支持本地和云端执行。
今天,Macrodata Labs 宣布成立,同时推出了 Refiner,一个用于处理机器人数据集的开源框架。该框架旨在帮助团队从演示和传感器数据中提取更多信号。
LOTUSPlan 是一个用于基于 LLM 的数据处理的新 API 和优化器,通过惰性执行和全局规划,可将成本降低最多 2.4 倍,准确率提升 4.6 倍。由伯克利和斯坦福开发,支持代理轨迹分析、RAG 和文档提取等任务。
一篇探讨读取屏幕的AI工具所引发的隐私顾虑的文章,质疑屏幕内容是否离开用户设备,并讨论了仅本地处理或明确披露的必要性。
了解如何设置并在本地使用 Common Crawl 数据进行网页数据处理任务。
DataLab 团队本周正在数千个 GPU 上编排 AI 模型,以处理约 10 亿页内容,彰显了显著的大规模文档处理能力。
OpenDataLoader-PDF 是一款开源 PDF 解析工具,在真实学术论文测试中达到 0.907 的高准确率,支持将复杂的 PDF 文档(含表格、公式、扫描件)高效转换为 Markdown 和 JSON,非常适合本地知识库和 RAG 应用。
开发者盛赞 ml-intern 工具,称其极大简化了模型/数据集发现、训练后迭代与数据处理流程。