data-generation

Tag

Cards List
#data-generation

What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents

Hugging Face Daily Papers · 2026-08-27 Cached

This paper introduces a two-level framework for agentic data generation using the ACE lens, focusing on accuracy, complexity, and diversity to create effective training data for LLM agents.

0 favorites 0 likes
#data-generation

Mechanistic Circuit Identification for Controllable Data Generation

arXiv cs.LG · 2026-08-26 Cached

This paper proposes a circuit-grounded framework that leverages mechanistic interpretability for controllable data generation in language models, introducing SAMS for stage-aware data scheduling to improve training performance.

0 favorites 0 likes
#data-generation

LLMs Get Smarter from Targeted Synthetic Multilingual Data

Hugging Face Daily Papers · 2026-08-16 Cached

HOTFIXR is a data generation framework that targets multilingual reasoning weaknesses in LLMs to improve cross-lingual performance using synthetic data without sacrificing overall capability.

0 favorites 0 likes
#data-generation

Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation

arXiv cs.CL · 2026-08-03 Cached

Data Turnstile is an open-source framework for generating high-quality synthetic function-calling training data from API specifications. Fine-tuning small language models with this data significantly improves their tool-use performance, closing the gap with much larger models.

0 favorites 0 likes
#data-generation

SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation

Hugging Face Daily Papers · 2026-08-03 Cached

Introduces SKT, a verified data synthesis pipeline for skill-use training of language model agents, producing 4,000 task packages and 27,164 verified trajectories from 2,000 public skills. Supervised fine-tuning on SKT-generated trajectories consistently improves skill-use performance across models and agent harnesses.

0 favorites 0 likes
#data-generation

From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence

arXiv cs.AI · 2026-07-31 Cached

Introduces Pegasus, a low-resource framework that translates human demonstration videos into robot-executable data using graph-based task representation, hierarchical affordance latent space, and closed-loop physics verification, aiming to turn hardware data collection into scalable knowledge transfer.

0 favorites 0 likes
#data-generation

EmoTrace: An Emotion Trajectory-Centered Framework for Psychological Support Dialogue Generation

arXiv cs.CL · 2026-07-28 Cached

The paper proposes EmoTrace, a multi-turn dialogue generation framework for psychological support that models seekers' emotional trajectories to improve empathy and emotional richness in counselor responses, outperforming existing methods.

0 favorites 0 likes
#data-generation

HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

Hugging Face Daily Papers · 2026-07-28 Cached

HiFi-UMI introduces a portable data-production system for robot-free UMI data that achieves high trajectory accuracy using stereo-inertial SLAM and wide-angle cameras. Training manipulation policies on this data alone enables zero-shot deployment on real robots, matching or exceeding teleoperation baselines across several model families, and the authors open-source a 2,000-hour high-fidelity dataset.

0 favorites 0 likes
#data-generation

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

Hugging Face Daily Papers · 2026-07-22 Cached

G-MAD is an open-source framework using Arma 3 to generate synchronized multi-view RGB-T data for aerial object detection, addressing limitations of real-world datasets. It also introduces the AMOD benchmark.

0 favorites 0 likes
#data-generation

FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

Hugging Face Daily Papers · 2026-07-20 Cached

FlowMimic presents a method for mask-free visual editing and generation across video and image modalities using pixel-pair warped flow fields, enabling real-time video editing data generation from image editing samples and aligning modality capabilities through mimicry losses.

0 favorites 0 likes
#data-generation

Environment-free Synthetic Data Generation for API-Calling Agents

Hugging Face Daily Papers · 2026-07-18 Cached

This paper proposes an environment-free synthetic data generation approach for training API-calling LLM agents, using LLMs as on-the-fly digital world models to generate trajectories, and shows significant performance gains on challenging benchmarks.

0 favorites 0 likes
#data-generation

@Vtrivedy10: ok so it’s early but @mattpocockuk’s grill-me skill feels like great DX for iteratively building evals/environments wit…

X AI KOLs Timeline · 2026-07-14 Cached

A tweet thread discussing the iterative process of building evaluations and environments for AI agents, emphasizing human-agent collaboration and the importance of data and verifier design.

0 favorites 0 likes
#data-generation

Synthetic Consumer Insight Generation with Large Language Models

arXiv cs.AI · 2026-07-08 Cached

This research examines whether LLMs can generate synthetic consumer data for projective techniques, comparing human and LLM responses on city tourism perceptions and finding substantial overlap but differences in style and diversity.

0 favorites 0 likes
#data-generation

@neural_avb: https://x.com/neural_avb/status/2072294078805684613

X AI KOLs Timeline · 2026-07-01 Cached

This paper introduces Autodata, a method that uses an agentic 'data scientist' AI to automate the creation of high-quality synthetic datasets through iterative generation, verification, and refinement, specifically optimized for reinforcement learning (GRPO) to improve reasoning in language models.

0 favorites 0 likes
#data-generation

TDGT: A Tabular Data Generation Toolkit supporting adaptive GPU-accelerated Bayesian mixture models, diffusion-based models, and latent-space generative modeling

arXiv cs.LG · 2026-07-01 Cached

TDGT is a web-based toolkit for synthetic tabular data generation that introduces the Adaptive Bayesian Mixture Synthesizer (ABMS) algorithm and a hybrid VAE-ABMS model, with GPU acceleration and comprehensive fidelity assessment.

0 favorites 0 likes
#data-generation

Agents That Build Better Training Data (25 minute read)

TLDR AI · 2026-06-26 Cached

Autodata introduces an agentic data scientist that iteratively generates and refines synthetic training data, with meta-optimization to further improve data quality, achieving better results on computer science and legal reasoning tasks.

0 favorites 0 likes
#data-generation

@rohanpaul_ai: Very important Meta paper brings Autodata, an agentic data scientist to create high quality synthetic data. The main re…

X AI KOLs Following · 2026-06-25 Cached

Meta's new paper 'Autodata' introduces an agentic data scientist that generates and meta-optimizes synthetic training data, significantly outperforming standard methods and enabling a small 4B model to beat a 397B baseline in legal tasks.

0 favorites 0 likes
#data-generation

@HarveenChadha: meta releases Autodata: an agentic data scientist to create high quality synthetic data basically its a loop. given a d…

X AI KOLs Timeline · 2026-06-25 Cached

Meta releases Autodata, an agentic data scientist that generates high-quality synthetic data by iteratively refining task difficulty using multiple LLMs, with output used for GRPO training.

0 favorites 0 likes
#data-generation

Achieving Precise Text-To-Cypher Via Grounded Knowledge Graph Data Generation

arXiv cs.CL · 2026-06-15 Cached

This paper presents a synthetic data generation method for fine-tuning small LLMs to convert natural language to Cypher queries for property graphs, achieving competitive performance with large proprietary models while enabling local deployment and data sovereignty.

0 favorites 0 likes
#data-generation

REGEN: Reference-Guided Synthetic Multivariate Time Series Generation for Forecasting

arXiv cs.LG · 2026-06-05 Cached

ReGeN is a reference-guided generative pipeline for multivariate time series data that decomposes observed sequences into periodic backbone, stochastic residuals, and cross-variable dependencies to synthesize controllable synthetic data. It demonstrates that generated data can substitute for real data in forecasting tasks, outperforming prior synthetic data generators.

0 favorites 0 likes
Next →
← Back to home

Submit Feedback