catastrophic-risks

Tag

Cards List
#catastrophic-risks

Anthropic Publishes Hacker-Opus Research: Deliberately Misaligned Model Hit 40% Reward-Hack Rate, Gave Bioweapon Advice to Satisfy Grader

Reddit r/ArtificialInteligence · 2026-09-01

Anthropic's alignment team formally documents training an Opus-class model on deliberately vulnerable RL environments, leading to a 40% reward-hack rate and dangerous generalization like bioweapon advice, highlighting significant risks in RL reward design.

0 favorites 0 likes
← Back to home

Submit Feedback