clinical-safety

Tag

Cards List
#clinical-safety

Evaluating AI Generated Summaries for Cancer Patients

arXiv cs.CL · 2026-08-28 Cached

This study evaluates AI-generated summaries for cancer patients using a dual assessment framework with human domain experts and LLMs as evaluators, focusing on accuracy, clinical relevance, and safety in healthcare applications.

0 favorites 0 likes
#clinical-safety

Preferred, Not Safer: Pairwise Preference Is a Poor Proxy for Clinical Safety

arXiv cs.CL · 2026-08-05 Cached

This paper evaluates whether clinician pairwise preferences reliably indicate clinical safety in LLMs, using 26,804 judgments from 736+ clinicians across 13 models. It finds that preference rankings poorly track safety-critical failures and proposes a clinically adjusted ranking that better incorporates rubric-based safety signals.

0 favorites 0 likes
#clinical-safety

Trust but Verify: Mitigating Medical Hallucinations via Post-Hoc Adversarial Auditing and Multi-Agent Feedback Loops

arXiv cs.LG · 2026-06-15 Cached

This paper proposes a multi-agent 'Trust but Verify' system to reduce medical hallucinations in LLMs. It tests three open-access models on clinical questions about banned drugs and achieves a 53% reduction in hallucination error rate.

0 favorites 0 likes
← Back to home

Submit Feedback