标签
介绍了 SteerBench-Work,这是一种事件锚定式基准,用于评估 LLM 智能体在采取实际动作前应继续还是暂停。在 30 种模型条件下,模型绝大多数情况下过度拒绝已授权工作,而很少允许不安全行为,揭示了通用能力与转向决策之间的校准差距。