data-collection

标签

Cards List
#data-collection

我们关注错了问题!

Reddit r/artificial ↗ · 2026-07-05

作者认为,AI的真正危险不在于AI本身,而在于企业和政府可能利用它进行监控和行为控制,并倡导去中心化的开源替代方案。

0 人收藏 0 人点赞
#data-collection

BaRA: BFS与反思网络数据采集代理

arXiv cs.AI ↗ · 2026-07-02 缓存

BaRA是一个框架,用于站点级网络数据采集,结合了有界BFS遍历和基于历史的自反思,在链接发现和可下载提取方面优于现有方法。

0 人收藏 0 人点赞
#data-collection

让失败变得安全:一个用于开放网络数据收集的受约束、可验证的智能体框架

arXiv cs.AI ↗ · 2026-07-02 缓存

本文提出了一个用于开放网络数据收集的受约束、可验证的智能体框架,该框架将LLM的输出从自由格式的代码转换为类型化的JSON收集器配置,在80个任务上实现了零执行阶段LLM令牌和低延迟。

0 人收藏 0 人点赞
#data-collection

新闻事件的过程:关于灾害的基于文本的数据收集的自底向上和自顶向下方法的比较

arXiv cs.CL ↗ · 2026-07-02 缓存

本文比较了从新闻文章中收集灾害文本数据的自顶向下和自底向上方法,并以德国关于山体滑坡的新闻作为案例研究。

0 人收藏 0 人点赞
#data-collection

EVA-Client:面向真实机器人具身策略的统一数据采集、推理与部署框架

Hugging Face Daily Papers ↗ · 2026-07-02 缓存

EVA-Client 是一个开源框架,通过组件解耦架构与可检查的执行工作流,统一了真实机器人的策略部署、数据采集与评估流程。

0 人收藏 0 人点赞
#data-collection

印度家庭主妇通过家务劳动训练下一代人形机器人

Reddit r/ArtificialInteligence ↗ · 2026-06-29

印度家庭主妇通过做家务为人形机器人的训练做出贡献,为人工智能学习提供宝贵数据。

0 人收藏 0 人点赞
#data-collection

假设你正在构建一个基于整个网站训练的RAG聊天机器人。你将如何爬取整个网站

Reddit r/AI_Agents ↗ · 2026-06-28

关于如何爬取整个网站以训练RAG聊天机器人的讨论,涵盖策略与挑战。

0 人收藏 0 人点赞
#data-collection

互联网的‘请出示证件’时代将摧毁你的隐私

Hacker News Top ↗ · 2026-06-25 缓存

一篇评论文章指出,强制性的年龄验证法律(例如澳大利亚禁止16岁以下青少年使用社交媒体的规定)通过迫使用户向第三方提供身份证等敏感数据来威胁隐私,而该法律本身也被证明无效。

0 人收藏 0 人点赞
#data-collection

@swyx:在他们@latentspacepod节目中,我们讨论了@pimdewitte如何意外地打造了完美的世界模型数据收集业务……

X AI KOLs Timeline ↗ · 2026-06-25 缓存

该推文强调,Pim de Witte通过收集全球最大的可训练(视频,动作)对数据集,意外地构建了一个世界模型数据收集业务,并宣布以23亿美元估值完成3.2亿美元A轮融资。

0 人收藏 0 人点赞
#data-collection

Social Fetch - 社交媒体API

Product Hunt ↗ · 2026-06-25

Social Fetch 是一个用于从所有主要社交媒体平台抓取数据的API。

0 人收藏 0 人点赞
#data-collection

如何退出谷歌搜索新AI数据训练功能

Wired ↗ · 2026-06-24 缓存

谷歌正在推出新的搜索服务历史记录设置,该设置默认开启,会将用户上传的媒体内容保存用于AI训练。本文介绍如何退出该功能并指出隐私方面的担忧。

0 人收藏 0 人点赞
#data-collection

@NFTCPS: X推特上那些搬运博主的内容源终于知道从哪来的! 就这个工具MediaCrawler,一个工具通吃小红书、抖音、快手、B站、微博、贴吧、知乎,公开的内容、评论、点赞、转发都能扒下来。 最骚的是它不用搞JS逆向那套,靠浏览器登录态直接拿签名,…

X AI KOLs Timeline ↗ · 2026-06-23 缓存

MediaCrawler是一个多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、贴吧、知乎的公开内容抓取,利用浏览器登录态绕过JS逆向,降低技术门槛。

0 人收藏 0 人点赞
#data-collection

反对Meta收集员工培训数据用于机器学习模型的请愿

Hacker News Top ↗ · 2026-06-21 缓存

Meta员工正在请愿反对模型能力倡议(MCI),该倡议收集键盘敲击、鼠标移动和屏幕内容等计算机使用数据用于AI训练,引发了严重的隐私和监管担忧。

0 人收藏 0 人点赞
#data-collection

@WY_mask: MediaCrawler:开源小红书/抖音/微博/B站/快手爬虫工具 支持爬取视频、图片、评论、点赞、转发等信息 https://github.com/NanmiCoder/MediaCrawler…

X AI KOLs Timeline ↗ · 2026-06-21 缓存

MediaCrawler 是一个开源的多平台自媒体数据采集工具,支持小红书、抖音、微博、B站、快手等平台的公开信息抓取,无需JS逆向,基于Playwright浏览器自动化。

0 人收藏 0 人点赞
#data-collection

指标不可避免的弱点

MIT Technology Review ↗ · 2026-06-19 缓存

一篇关于自我量化陷阱的反思文章,认为虽然指标可以揭示有用的信息,但它们往往会掩盖或扭曲更深刻的自我认知。

0 人收藏 0 人点赞
#data-collection

在参议院投票后,特朗普政府放弃终止海洋监测计划

Ars Technica ↗ · 2026-06-18 缓存

在参议院的反对下,特朗普政府撤销了拆解海洋观测倡议的决定。该倡议是一个耗资3.5亿美元的海洋监测网络,用于气候追踪、天气预报和渔业管理。

0 人收藏 0 人点赞
#data-collection

收集机器人训练数据是又脏又累的活。一些AI实验室已开始付费让XDOF来做。

TechCrunch AI ↗ · 2026-06-17 缓存

XDOF,一家刚结束隐身模式的初创公司,已筹集7000万美元,用于构建机器人训练的数据管道和工具,以解决物理交互数据的瓶颈问题。该公司发布了一个大型机器人操作轨迹数据集ABC,以加速机器人AI的发展。

0 人收藏 0 人点赞
#data-collection

美丽而丑陋的形状

Reddit r/artificial ↗ · 2026-06-16

对X平台架构的分析揭示了Grok AI如何与X Premium、行为数据和定向广告整合,表明用户既是产品也是训练数据来源。

0 人收藏 0 人点赞
#data-collection

AI 把我吓得不轻。

Reddit r/artificial ↗ · 2026-06-15

一位用户描述了谷歌的AI概览如何分析Instagram个人资料并找到所有互动,引发了对永久在线足迹的隐私担忧。

0 人收藏 0 人点赞
#data-collection

@VaibhavSisinty: 金奈一位25岁的家庭主妇仅靠做日常家务每小时赚250卢比(3美元)。她把手机戴在头上……

X AI KOLs Timeline ↗ · 2026-06-12 缓存

金奈一位25岁的家庭主妇为AI公司拍摄日常家务视频,每小时赚250卢比,这些公司正在训练人形机器人。她是印度日益增长的零工经济的一部分,成千上万人通过记录日常任务来训练未来的机器人。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈