data-curation

Tag

Cards List
#data-curation

RL Environments Are All You Need (6 minute read)

TLDR AI · 6d ago Cached

The author argues that RL environments serve as the essential data for building AI agents, enabling systematic training, prompt optimization, and evaluation rather than manual iteration.

0 favorites 0 likes
#data-curation

Poplar: A Scalable Pipeline for Human-Centric Image Dataset Synthesis

Hugging Face Daily Papers · 2026-08-01 Cached

Introduces Poplar, a scalable Specify-Render-Inspect pipeline for synthesizing human-centric image datasets, and releases Poplar-9K, a curated dataset of 9,401 image-text pairs with auditable inspection records.

0 favorites 0 likes
#data-curation

DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

Hugging Face Daily Papers · 2026-07-27 Cached

DecoupleMix introduces a systematic framework for optimizing pretraining data mixtures for Vision-Language Models by decoupling inter-class and intra-class ratio search, using convex optimization to improve scalability and performance over heuristic baselines.

0 favorites 0 likes
#data-curation

From a Multilingual Streaming ASR Backbone to Kenyan-Language Systems: Data-Centric Adaptation of Nemotron 3.5 for Kikuyu, Dholuo, and Kalenjin

arXiv cs.CL · 2026-07-22 Cached

This paper presents an engineering study adapting NVIDIA Nemotron 3.5 ASR Streaming 0.6B to Kikuyu, Dholuo, and Kalenjin, achieving 42.97% and 33.98% WER on internal sets for Kikuyu and Dholuo, respectively, through data-centric techniques including corpus auditing, normalization, and streaming evaluation.

0 favorites 0 likes
#data-curation

BatteryLake: Agentic, Physics-Grounded Curation of Heterogeneous Battery Aging Data and Benchmarking

arXiv cs.AI · 2026-07-14 Cached

This paper introduces BatteryLake, a governed data lakehouse that uses LLM agents for evidence-grounded metadata extraction and schema mapping, with human-in-the-loop verification, to curate heterogeneous battery aging datasets and release an open benchmark.

0 favorites 0 likes
#data-curation

Physics-Informed Machine Learning Under Small-Data Constraints: Lessons from Abrasive Waterjet Milling

arXiv cs.LG · 2026-07-10 Cached

This paper presents methodological contributions for physics-informed machine learning under small-data constraints, using an abrasive waterjet milling dataset of 155 points. It shows that data curation choices, evaluation design, and physics integration form matter significantly, with Gaussian Process variants outperforming other models.

0 favorites 0 likes
#data-curation

Data for Agents

Hugging Face Blog · 2026-07-08 Cached

NVIDIA discusses the importance of open and synthetic data for building robust AI agents, highlighting their Nemotron open datasets for training, reasoning, and tool-use.

0 favorites 0 likes
#data-curation

CurateEvo: Data-Curation Evolving for Agentic Post-Training

arXiv cs.CL · 2026-07-08 Cached

CurateEvo is a failure-driven dynamic evolution framework for agentic post-training data curation. It iteratively rewrites curation strategies using failed trajectories, improving effectiveness and efficiency on benchmarks like ACEBench-Agent and BFCL-V4.

0 favorites 0 likes
#data-curation

MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

Hugging Face Daily Papers · 2026-07-08 Cached

MedPMC is an automated framework that transforms medical literature into high-fidelity multimodal data for foundation models, achieving significant improvements across multiple benchmarks and clinical settings.

0 favorites 0 likes
#data-curation

Post-Generation Curation of Synthetic Images via Homogeneous-Heterogeneous Splitting

arXiv cs.LG · 2026-07-07 Cached

This paper proposes a generator-agnostic post-generation curation method that selects informative subsets of synthetic images by splitting real classes into canonical homogeneous and non-redundant heterogeneous subsets, and scoring synthetic images via a fidelity-diversity criterion. It consistently outperforms existing data-selection baselines and matches real-data performance with up to 40% fewer synthetic samples.

0 favorites 0 likes
#data-curation

DataComp-VLM: Improved Open Datasets for Vision-Language Models

Hugging Face Daily Papers · 2026-06-26 Cached

This paper introduces DataComp-VLM (DCVLM), a comprehensive benchmark for evaluating data curation strategies for vision-language models. The authors find that data mixing, rather than filtering, significantly improves performance, and their resulting DCVLM-Baseline dataset achieves state-of-the-art results on 33 downstream tasks.

0 favorites 0 likes
#data-curation

@harold_matmul: dspy.GEPA used in pretraining data curation in the new Microsoft AI effort :-)

X AI KOLs Timeline · 2026-06-24 Cached

The article explains how GEPA (Genetic-Pareto Optimization) within DSPy is used for efficient prompt tuning, specifically applied to pretraining data curation at Microsoft AI, allowing researchers to replace manual prompt engineering with automated compute-driven optimization.

0 favorites 0 likes
#data-curation

OpenThoughts-Agent: Data Recipes for Agentic Models

Hugging Face Daily Papers · 2026-06-23 Cached

This paper introduces OpenThoughts-Agent, an open-source data curation pipeline for training agentic language models, achieving a 44.8% average accuracy across seven benchmarks and outperforming prior open datasets through systematic experiments.

0 favorites 0 likes
#data-curation

DRIFT: Refining Instruction Data via On-Policy Data Attribution

arXiv cs.LG · 2026-06-18 Cached

DRIFT proposes a method that uses on-policy influence functions to refine training data distribution for supervised fine-tuning of large language models, consistently improving performance ceilings over existing baselines.

0 favorites 0 likes
#data-curation

Characterizing Narrative Content in Web-scale LLM Pretraining Data

Hugging Face Daily Papers · 2026-06-17 Cached

A fine-grained study of narrative features in web-scale LLM pretraining data, introducing NarraBERT and NarraDolma to measure narrative patterns and their distribution across sources.

0 favorites 0 likes
#data-curation

Structured Testbench Generation for LLM-Driven HDL Design and Verification-Oriented Data Curation

arXiv cs.AI · 2026-06-12 Cached

This paper presents STG, a structured testbench generation framework for LLM-driven hardware design workflows that reduces token cost and improves verification reliability compared to existing prompt-based approaches.

0 favorites 0 likes
#data-curation

Can Generalist Agents Automate Data Curation?

arXiv cs.AI · 2026-06-04 Cached

Researchers introduce Curation-Bench, a benchmark to evaluate whether generalist coding agents can automate the iterative data curation loop in AI development. Results show agents can match strong baselines within ten iterations, but reliable data research requires scaffolded method adaptation rather than open-ended prompting alone.

0 favorites 0 likes
#data-curation

Can Generalist Agents Automate Data Curation?

Hugging Face Daily Papers · 2026-06-02 Cached

This paper explores whether generalist coding agents (Claude Code, Codex, etc.) can automate data curation loops, achieving published baselines within 10 iterations but revealing a gap in exploring new methods. A scaffold that forces agents to adapt prior research yields policies that beat baselines using 10x less data.

0 favorites 0 likes
#data-curation

Exploring Autonomous Agentic Data Engineering for Model Specialization

Hugging Face Daily Papers · 2026-05-28 Cached

This paper introduces Autonomous Agentic Data Engineering, a task where LLMs autonomously execute end-to-end data curation pipelines for model specialization, showing significant performance gains (e.g., GPT-5.2 improves a student model by 57.29%).

0 favorites 0 likes
#data-curation

LoMo: Local Modality Substitution for Deeper Vision-Language Fusion

Hugging Face Daily Papers · 2026-05-28 Cached

LoMo proposes a data curation method that reformulates single-modality prompts into interleaved multimodal sequences to improve cross-modal representation alignment in vision-language models, achieving consistent gains on multiple benchmarks.

0 favorites 0 likes
Next →
← Back to home

Submit Feedback