data-processing

标签

Cards List
#data-processing

提取事实后不要丢弃原始对话

Reddit r/AI_Agents · 昨天

重要提示:提取事实后切勿丢弃原始对话数据,原始上下文可能对后续使用或分析有重要价值。

0 人收藏 0 人点赞
#data-processing

OriginBlame:面向AI训练数据集的记录级与令牌级数据溯源系统

arXiv cs.AI · 2026-07-16 缓存

OriginBlame 是一个记录级与令牌级的数据溯源系统,能够在 AI 训练数据管道中传播作者身份,从而为机器遗忘(machine unlearning)生成精确的遗忘集。它消除了数据集级系统导致的过度删除问题,并提升了遗忘效果。

0 人收藏 0 人点赞
#data-processing

@QingQ77: 一个用 Rust 写的命令行 CSV 处理工具("CSV 魔术师"),能极快、低内存地处理上 GB 的 CSV,并自带表达式语言、终端可视化以及词典统计、图论乃至抓取等社科向扩展。 https://github.com/medialab/…

X AI KOLs Timeline · 2026-07-12 缓存

一个用 Rust 编写的命令行 CSV 处理工具 'xan',能够快速、低内存地处理大型 CSV 文件,并自带表达式语言、终端可视化和社科分析扩展。

0 人收藏 0 人点赞
#data-processing

@robertnishihara:试试Ray 2.56!

X AI KOLs Following · 2026-06-30 缓存

Ray 2.56已发布,包含Ray Data的稳定性改进以及Ray Serve的重构,以提升LLM服务的性能。

0 人收藏 0 人点赞
#data-processing

@raydistributed: 我们刚刚发布了 Ray 2.56!这包括 - Ray Data 稳定性改进:减少对象存储溢出,自动 ba…

X AI KOLs Following · 2026-06-30

Ray 2.56 已发布,改进了 Ray Data、面向 LLM 的 Ray Serve、GPU 域感知放置组以及 Kubernetes 集成。

0 人收藏 0 人点赞
#data-processing

使用 Python 和 Apache Spark 实现自定义查询语言

Lobsters Hottest · 2026-06-23 缓存

本技术指南介绍了如何使用 Python 和 Apache Spark 实现自定义查询语言(EHQL),重点在于使用 Lark 定义语法和解析。

0 人收藏 0 人点赞
#data-processing

DataClaw0:从原始流中智能裁剪多模态数据

Hugging Face Daily Papers · 2026-06-19 缓存

DataClaw0提出了一种智能数据裁剪范式,利用可学习的数据处理来结构化高熵多模态流,通过在一个新型基准上进行SFT和GRPO实现了稳健的对齐。

0 人收藏 0 人点赞
#data-processing

在终端舒适地进行数据可视化

Lobsters Hottest · 2026-06-17 缓存

xan 是一个用 Rust 编写的高性能命令行 CSV 处理工具,具备 SIMD 解析、并行计算和终端数据可视化功能。

0 人收藏 0 人点赞
#data-processing

用于分析的纯 Clojure 列式数据库

Lobsters Hottest · 2026-06-12 缓存

Flatiron 是一个纯 Clojure 的列式分析库,用于内存表,具有类似 SQL 的 DSL,专为使用原始数组和批处理的高性能而设计。

0 人收藏 0 人点赞
#data-processing

Refiner:前Hugging Face预训练团队推出的机器人库

Reddit r/LocalLLaMA · 2026-06-11 缓存

Refiner是Macrodata Labs开发的开源引擎,用于将原始机器人和多模态数据转换为高质量训练数据集,支持本地和云端执行。

0 人收藏 0 人点赞
#data-processing

@gui_penedo:今天我们宣布成立 Macrodata Labs。过去几年,@HKydlicek 和我一直在将互联网的很大一部分转化为……

X AI KOLs Following · 2026-06-11 缓存

今天,Macrodata Labs 宣布成立,同时推出了 Refiner,一个用于处理机器人数据集的开源框架。该框架旨在帮助团队从演示和传感器数据中提取更多信号。

0 人收藏 0 人点赞
#data-processing

@lianapatel_: 非常兴奋地宣布我们发布了 LOTUSPlan,一个全新的 API 和优化器,用于更高性能的 LLM 驱动数据处理...

X AI KOLs Following · 2026-06-10 缓存

LOTUSPlan 是一个用于基于 LLM 的数据处理的新 API 和优化器,通过惰性执行和全局规划,可将成本降低最多 2.4 倍,准确率提升 4.6 倍。由伯克利和斯坦福开发,支持代理轨迹分析、RAG 和文档提取等任务。

0 人收藏 0 人点赞
#data-processing

对于能感知屏幕的AI,隐私问题不仅仅是“它看到了什么”,更是“它看到的内容去了哪里”。

Reddit r/ArtificialInteligence · 2026-05-29

一篇探讨读取屏幕的AI工具所引发的隐私顾虑的文章,质疑屏幕内容是否离开用户设备,并讨论了仅本地处理或明确披露的必要性。

0 人收藏 0 人点赞
#data-processing

@lhoestq: 你不知道你其实需要本地 Common Crawl

X AI KOLs Timeline · 2026-05-22 缓存

了解如何设置并在本地使用 Common Crawl 数据进行网页数据处理任务。

0 人收藏 0 人点赞
#data-processing

@VikParuchuri:本周我们将处理约 10 亿页内容。@datalabto 团队在跨数千个 GPU 编排我们的模型方面做出了令人惊叹的工作……

X AI KOLs Following · 2026-05-11 缓存

DataLab 团队本周正在数千个 GPU 上编排 AI 模型,以处理约 10 亿页内容,彰显了显著的大规模文档处理能力。

0 人收藏 0 人点赞
#data-processing

@rwayne: 太屌了学术论文搭本地知识库,瓶颈一直在 PDF 怎么干净转 md。OpenDataLoader-PDF 把这道题做到了 0.907 准确率 开源 PDF 解析榜第一全套 Apache 2.0。 200 篇真实论文测试集的关键数字 总分 0…

X AI KOLs Timeline · 2026-05-10

OpenDataLoader-PDF 是一款开源 PDF 解析工具,在真实学术论文测试中达到 0.907 的高准确率,支持将复杂的 PDF 文档(含表格、公式、扫描件)高效转换为 Markdown 和 JSON,非常适合本地知识库和 RAG 应用。

0 人收藏 0 人点赞
#data-processing

@cmpatino_:用了一段时间 ml-intern,它真的改变了我的工作流。它在以下方面特别强:- 模型/数据集发现……

X AI KOLs Following · 2026-04-21 缓存

开发者盛赞 ml-intern 工具,称其极大简化了模型/数据集发现、训练后迭代与数据处理流程。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈