data-efficiency

Tag

Cards List
#data-efficiency

ReliableTableQA:How Much Supervision Does Reliability Annotation Need?

arXiv cs.LG · 2026-07-24 Cached

Introduces ReliableTableQA, a framework for training LLMs to annotate statistical reliability of tabular QA results, showing that a small SFT set is sufficient and GRPO only helps when SFT is under-trained.

0 favorites 0 likes
#data-efficiency

Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation

Hugging Face Daily Papers · 2026-06-29 Cached

ILLUME-X is a unified multimodal model for free-form interleaved text-image generation, featuring improved data efficiency, stable training, and a comprehensive evaluation metric called ILScore. It outperforms previous models on tasks like style transfer, image decomposition, and storytelling.

0 favorites 0 likes
#data-efficiency

CLI-Universe: Towards Verifiable Task Synthesis Engine for Terminal Agents

Hugging Face Daily Papers · 2026-06-22 Cached

CLI-Universe is a synthesis engine that generates verifiable terminal-agent tasks via multi-dimensional capability taxonomy and evidence-guided research, producing a distilled dataset of 6,000 trajectories. Fine-tuning Qwen3-32B on this dataset achieves 33.4% on Terminal-Bench 2.0, setting a new state-of-the-art for open-source models at or below 32B parameters.

0 favorites 0 likes
#data-efficiency

Offline Preference-Based Trajectory Evaluation

arXiv cs.LG · 2026-06-17 Cached

This paper proposes offline preference-based trajectory evaluation for agentic systems, which compares trajectories via temporal preferences rather than binary success metrics. It shows that this approach reduces ties from roughly 75% to 35%, improving discriminative power and data efficiency across diverse benchmarks.

0 favorites 0 likes
#data-efficiency

APEX: Automated Prompt Engineering eXpert with Dynamic Data Selection

arXiv cs.CL · 2026-06-11 Cached

APEX introduces a dynamic data selection strategy for automatic prompt optimization, stratifying datasets into easy, hard, and mixed tiers to improve data efficiency, achieving significant performance gains over initial prompts on multiple benchmarks.

0 favorites 0 likes
#data-efficiency

Active Learning with Foundation Model Priors: Efficient Learning under Class Imbalance

arXiv cs.LG · 2026-06-09 Cached

This paper proposes a novel active learning framework that leverages foundation model priors to jointly address class imbalance and label noise, achieving over 50% annotation savings compared to baselines across image and text domains.

0 favorites 0 likes
#data-efficiency

Towards Unified and Data-Efficient Prognostics and Health Management with Tabular Foundation Models

arXiv cs.LG · 2026-06-05 Cached

This paper proposes a framework for applying tabular foundation models to industrial time series for prognostics and health management, demonstrating strong performance and data efficiency across multiple PHM tasks.

0 favorites 0 likes
#data-efficiency

Data-efficient flood depth prediction through domain-aware coreset selection and tabular foundation models

arXiv cs.LG · 2026-06-05 Cached

This paper proposes a domain-aware coreset construction pipeline that enables a tabular foundation model to predict flood depth with only 0.7% of the training data, achieving 98.5% of the supervised reference accuracy and allowing transfer across watersheds without retraining.

0 favorites 0 likes
#data-efficiency

[R] Measuring the Symmetry--Data Exchange Rate

Reddit r/MachineLearning · 2026-06-04 Cached

This paper empirically measures the symmetry–data exchange rate predicted by equivariance theory, finding that wrong-group symmetry constraints are actively harmful, augmentation with test-time orbit averaging matches equivariant architectures, and the theoretical |G|-fold sample complexity reduction is only weakly confirmed with wide confidence intervals. The study is explicitly exploratory and not pre-registered.

0 favorites 0 likes
#data-efficiency

Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation

Hugging Face Daily Papers · 2026-05-31 Cached

This paper proposes Decoupled Residual Denoising Diffusion Models (DRDD) for unified and data-efficient image-to-image translation, decoupling noise diffusion for domain harmonization from residual diffusion for semantic mapping.

0 favorites 0 likes
#data-efficiency

Less Data, Faster Training: repeating smaller datasets speeds up learning via sampling biases

arXiv cs.LG · 2026-05-21 Cached

This paper investigates the 'small-vs-large gap', where training on fewer samples with more repetitions can lead to faster learning and compute savings compared to using larger datasets, attributing the speedup to layer-wise growth enabled by sampling biases. The findings suggest that smaller datasets with repetition can be proactively leveraged as favorable inductive biases, particularly in reasoning tasks.

0 favorites 0 likes
#data-efficiency

Context Training with Active Information Seeking

Hugging Face Daily Papers · 2026-05-13 Cached

This paper introduces a context optimization method that uses active information seeking via Wikipedia search and browser tools, combined with a search-based training procedure, to achieve robust performance improvements across diverse domains without updating model weights.

0 favorites 0 likes
#data-efficiency

RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data

Hugging Face Daily Papers · 2026-05-13 Cached

RoboEvolve is a framework that co-evolves a VLM planner and VGM simulator for robotic manipulation, achieving data efficiency with only 500 unlabeled seed images and robust continual learning.

0 favorites 0 likes
#data-efficiency

Zero-shot World Models Are Developmentally Efficient Learners [R]

Reddit r/MachineLearning · 2026-04-18

Researchers introduce Zero-shot World Models (ZWM), an approach that achieves visual competence comparable to state-of-the-art models while trained on minimal data (single child's visual experience) without task-specific training. This work demonstrates a path toward more data-efficient AI systems that match human developmental learning efficiency.

0 favorites 0 likes
← Back to home

Submit Feedback