safety-benchmarks

Tag

Cards List
#safety-benchmarks

FUSE: An Evaluating Framework for Dangerous Capabilities of LLMs

arXiv cs.AI · 4d ago Cached

FUSE is a unified framework for evaluating dangerous capabilities of large language models, assessing knowledge, defense, and harm dimensions. The study finds that newer models have increased dangerous capabilities despite alignment progress, and it provides cross-model comparisons.

0 favorites 0 likes
#safety-benchmarks

Automated Researchers Can Reliably Mitigate Alignment Failures

arXiv cs.AI · 6d ago Cached

This paper investigates the capability of automated alignment researchers to mitigate alignment failures such as deception and sycophancy, demonstrating that they can outperform human researchers and generalize to larger models while preserving capabilities.

0 favorites 0 likes
#safety-benchmarks

LLM Safety Alignment in Low-Resource Languages: A Systematic Literature Review

arXiv cs.CL · 2026-08-18 Cached

This systematic literature review examines safety alignment of large language models in low-resource languages, identifying a persistent multilingual safety gap and suggesting future directions such as culturally grounded benchmarks and participatory data collection.

0 favorites 0 likes
#safety-benchmarks

DisaBench: A Participatory Evaluation Framework for Disability Harms in Language Models

arXiv cs.AI · 2026-05-14 Cached

DisaBench is a participatory evaluation framework co-created with people with disabilities that introduces a taxonomy of 12 disability harm categories and a dataset of 175 prompts to evaluate harms in language models, revealing that standard safety benchmarks miss subtle, expert-identified harms.

0 favorites 0 likes
← Back to home

Submit Feedback