data-pipeline

标签

Cards List
#data-pipeline

为客户构建了一个报告生成器代理,而模型只是其中最小的一部分

Reddit r/AI_Agents · 2026-08-21

为客户构建AI报告生成器揭示出大部分工作量用于数据标准化和模板化,而模型只是一个次要组件,强调了数据管道相对于生成的首要性。

0 人收藏 0 人点赞
#data-pipeline

@seclink: 强大 ... https://dyna.co/research/dyna-2-infrastructure… https://dyna.co/dyna-2

X AI KOLs Timeline · 2026-08-19 缓存

这篇文章详细介绍了在百万小时规模上训练Dyna-2 AI模型的基础设施和挑战,重点关注数据生命周期和GPU集群优化。

0 人收藏 0 人点赞
#data-pipeline

来自6.6万集播客的叙事语义地图

Reddit r/ArtificialInteligence · 2026-08-03

作者构建了一个流水线,将6.6万集播客转录,提取并聚类超过70万个观点到二维语义地图中,用于追踪投资叙事,并过滤掉AI生成的内容。

0 人收藏 0 人点赞
#data-pipeline

@freeCodeCamp: 生产级ETL管道需要保持可靠运行,即使数据混乱或API失败。在本手册中,Brookly…

X AI KOLs Timeline · 2026-07-31 缓存

这本freeCodeCamp手册教读者如何使用真实洪水数据在Python中构建生产级ETL管道,涵盖增量加载、类型强制转换、去重和幂等性。

0 人收藏 0 人点赞
#data-pipeline

@Sprytixl: ANTHROPIC首席工程师凭借一个8步将任意数据混乱转化为图谱的系统赢得120万美元奖金——原始混乱输入…

X AI KOLs Timeline · 2026-07-26 缓存

Anthropic首席工程师的8步流水线将混乱数据转化为自动更新的图谱,生产效率提升42%,并赢得120万美元奖金。

0 人收藏 0 人点赞
#data-pipeline

DataFlow-Harness:一个基于代码代理的落地平台,用于构建可编辑的LLM数据管道

Hugging Face Daily Papers · 2026-07-18 缓存

DataFlow-Harness 引入了一个平台,该平台引导LLM代理通过增量变更构建可编辑的基于DAG的数据管道,与脚本生成基线相比,实现了高通过率和降低成本。

0 人收藏 0 人点赞
#data-pipeline

UNIBROWSE:面向多模态浏览竞赛的数据到智能体框架

arXiv cs.CL · 2026-07-14 缓存

UniBrowse引入了一个统一的数据流水线,用于多模态BrowseComp任务,生成涵盖三种信息流模式的训练数据,在五个基准测试上达到最先进性能,超越GPT-5和Gemini模型。

0 人收藏 0 人点赞
#data-pipeline

构建智能体轨迹数据集的实用指南

Reddit r/AI_Agents · 2026-07-13

一份构建结构化智能体轨迹数据集的实用指南,用于训练使用工具的智能体,强调设计包含六个关键部分的轨迹的重要性,并将轨迹视为数据资产而非日志。

0 人收藏 0 人点赞
#data-pipeline

@CryptoTied: 卧槽!一个专为 LLM 优化的开源爬虫火了 Crawl4AI 是一个开源的 LLM-friendly Web Crawler & Scraper,目前 GitHub 上已有 72k+ stars。 它把网页内容转换成干净、结构化的 Mar…

X AI KOLs Timeline · 2026-07-10 缓存

Crawl4AI 是一个专为 LLM 优化的开源爬虫,可将网页内容转换为干净的结构化 Markdown,支持智能内容过滤、LLM 驱动提取、浏览器自动化等功能,适合 RAG 和 AI Agent 场景。

0 人收藏 0 人点赞
#data-pipeline

@IndieDevHailey: Crawl4AI:7万星开源神器,把网页秒变LLM能吃的干净Markdown! 再见付费爬虫!零API Key,几秒出结构化数据,专为RAG、Agent、数据管道而生。 超干净输出:智能去噪、表格/代码/引用全保留,LLM直接喂 真快:异…

X AI KOLs Timeline · 2026-07-10 缓存

Crawl4AI 是一个开源的网页爬虫工具,能将网页内容转换为干净的 Markdown 格式,专为 LLM 的 RAG、Agent 和数据管道设计。零 API Key,快速输出结构化数据。

0 人收藏 0 人点赞
#data-pipeline

PRX 第4部分:我们的数据策略

Hugging Face Blog · 2026-07-06 缓存

Photoroom 详细介绍了训练 PRX 的数据策略,包括组装多样化数据集、使用 VLM 重新生成描述,以及利用 Mosaic Data Shards 实现高效训练。

0 人收藏 0 人点赞
#data-pipeline

@pauliusztin_: 我曾以为将1,000,000份文档摄入AI记忆系统主要是个计算问题。但我一直被证明是错的……

X AI KOLs Timeline · 2026-07-04 缓存

作者讨论了将AI记忆摄入从数千份扩展到数百万份文档的架构,强调编排和并行性而非原始计算能力,并使用Prefect进行工作流管理。

0 人收藏 0 人点赞
#data-pipeline

OpenZL

Lobsters Hottest · 2026-06-27 缓存

OpenZL 是一个压缩库,能够为特定数据格式生成专门的压缩器,以高速实现高压缩比,适用于数据中心工作负载,如 AI 处理。

0 人收藏 0 人点赞
#data-pipeline

@XiaohuiAI666: 你的 RAG 实现方法是错误的! 传统 chunk 缺乏知识边界、版本信息和元数据,导致检索上下文缺失、版本混杂、权限控制困难。 作者提出的新方法以 IdeaBlock(问题-答案+治理字段)替代 chunk,实现结构化知识单元。 不改检…

X AI KOLs Timeline · 2026-06-22 缓存

作者提出以IdeaBlock(问题-答案+治理字段)替代传统chunk来改进RAG知识单元,已开源Blockify工具,可减少40倍语料、3倍token并提升2.3倍相关性。

0 人收藏 0 人点赞
#data-pipeline

机器人团队正在从头重建数据栈

Hacker News Top · 2026-06-21 缓存

机器人团队正在从头重建数据栈,以克服“数据层税”对机器人学习迭代和扩展的拖累,因为现有基础设施无法处理多速率和多模态数据。

0 人收藏 0 人点赞
#data-pipeline

ProfiLLM: 面向工业网约车调度的效用对齐智能用户画像

arXiv cs.AI · 2026-06-18 缓存

ProfiLLM 提出了一种智能LLM流水线,能够从平台级行为日志中生成效用对齐的用户画像,用于工业网约车调度,在滴滴的生产环境中实现了结果预测和GMV的显著提升。

0 人收藏 0 人点赞
#data-pipeline

Show HN:Artie – 实时数据复制到数据仓库,现已支持自助服务

Hacker News Top · 2026-06-10 缓存

Artie 是一款自助服务产品,用于将数据实时复制到数据仓库,提供亚分钟级延迟、精确一次投递,且无需管理 Kafka 或 DMS 基础设施即可轻松部署。

0 人收藏 0 人点赞
#data-pipeline

TinyFish Bigset 将文本提示转换为实时数据集(3分钟阅读)

TLDR AI · 2026-06-03 缓存

TinyFish Bigset 是一个开源的多智能体系统,可将自然语言提示转换为来自实时网络的结构化数据集,具备模式推断、自主研究代理和定时刷新功能。它通过 Docker 自托管运行,并基于 TinyFish 的搜索基础设施构建。

0 人收藏 0 人点赞
#data-pipeline

@wsl8297: 做 RAG / 数据智能体,最容易卡住的是这一步:怎么把一堆散落的文件,变成可追踪、可查询、可复用的数据集。 尤其是 S3 / GCS / Azure 里的 PDF、图片、日志、标注文件,规模一上来,管理和迭代就开始失控。 https:/…

X AI KOLs Timeline · 2026-06-02 缓存

DataChain 是一个 Python 库,为 S3、GCS 和 Azure 中的非结构化文件添加上下文层,将其转化为可版本化、可查询的带类型数据集,支持并行处理、增量更新和 Agent 工作流集成。

0 人收藏 0 人点赞
#data-pipeline

SmartDirector: 关键帧条件化的电影视频生成与叙事节奏控制

Hugging Face Daily Papers · 2026-05-27 缓存

SmartDirector是一个通过多关键帧增强视频生成的框架,旨在改善叙事结构和时间节奏,采用低分辨率生成和高分辨率优化的两阶段流程。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈