corpus-analysis

Tag

Cards List
#corpus-analysis

Corpus Characterization and Inverse Constitutional Fine-Tuning for Style-Aware Radiology Reports

arXiv cs.CL · yesterday Cached

The paper introduces a method using corpus characterization and inverse constitutional fine-tuning to improve the stylistic alignment of AI-generated radiology reports with authentic radiologist writing. This approach achieves significant gains in text alignment metrics, demonstrating effectiveness for style-aware report generation.

0 favorites 0 likes
#corpus-analysis

SynthSentry: Detecting Synthetic Data Contamination in Language Model Training Data

arXiv cs.CL · 2d ago Cached

SynthSentry introduces a corpus-level, model-agnostic method to detect synthetic data contamination in language model training data without access to generating models, using distributional divergence over lexical, n-gram, and perplexity statistics.

0 favorites 0 likes
#corpus-analysis

SGHA: Evidence-Grounded Research Problem Discovery with Local Language Models

arXiv cs.AI · 2026-08-19 Cached

SGHA is a fully automated system that uses a local 9B language model to discover research problems from scientific literature by structuring evidence and detecting structural gaps, offering transparency and privacy over proprietary models.

0 favorites 0 likes
#corpus-analysis

Novels generated by language models show compressed formal variation

arXiv cs.CL · 2026-08-14 Cached

This paper analyzes whether LLM-generated novels exhibit compressed formal variation compared to human-written novels, finding that AI outputs are more uniform in sentence structure, readability, and punctuation despite individual novels resembling human style.

0 favorites 0 likes
#corpus-analysis

What Do Biomedical NER and Entity Linking Benchmarks Measure? A Corpus-Centric Diagnostic Framework

arXiv cs.CL · 2026-05-21 Cached

This paper presents a corpus-centric diagnostic framework for analyzing biomedical NER and EL benchmarks, revealing substantial differences across nine corpora and arguing that standard statistics are insufficient for characterizing evaluation demands.

0 favorites 0 likes
← Back to home

Submit Feedback