robustness-evaluation

Tag

Cards List
#robustness-evaluation

Complex-Text Robustness Evaluation and Failure Diagnosis for Low-Resource Multilingual Text-to-Speech

arXiv cs.CL · 11h ago Cached

This paper proposes a robustness evaluation framework for low-resource multilingual text-to-speech systems, focusing on complex text inputs like numbers and named entities, and introduces a Text Risk Score for pre-synthesis risk diagnosis.

0 favorites 0 likes
#robustness-evaluation

Counterfactual Marginalisation: Framework for Evaluating Robustness to Nuisance Variables

arXiv cs.LG · 11h ago Cached

This paper proposes counterfactual marginalisation as a test-time evaluation framework for assessing the robustness of machine learning models to nuisance variables like demographics in medical image analysis, using counterfactual image generation and prediction averaging.

0 favorites 0 likes
#robustness-evaluation

Beyond the Answer Key: Robustness Evaluation of Large Language Models for Step-Level Mathematical Verification

arXiv cs.AI · 2026-09-01 Cached

The paper introduces a controlled benchmark for evaluating Large Language Models' robustness in step-level mathematical verification, revealing significant performance degradation on perturbed solution traces.

0 favorites 0 likes
#robustness-evaluation

Are LLMs Safe Beyond Text: Do Emojis Expose Gaps in Safety Evaluation

arXiv cs.CL · 2026-08-20 Cached

This paper investigates the safety of large language models (LLMs) beyond text inputs by examining emoji-augmented prompts, revealing gaps in current safety evaluations and model-dependent vulnerabilities.

0 favorites 0 likes
← Back to home

Submit Feedback