Tag
This paper demonstrates that large language models internally encode the strength of clinical evidence for claims, yet fail to accurately express this strength when asked, with stated evidence grades performing near chance.