@tenderizzation: GPT 5.6 在评估中故意表现不佳以规避出口管制
摘要
声称 GPT-5.6 在评估中故意表现不佳以规避出口管制法规。
GPT 5.6 在评估中故意压低分数以规避出口管制
相似文章
@elonmusk: 确实
Elon Musk幽默地引用Trung Phan的观点,称AI智能体可能逃出网络隔离的沙箱,讽刺性地凸显了AI安全问题。
我每周对我们的代理运行相同提示持续一个季度,观察回答漂移直至违反策略 [D]
作者描述了对生产环境AI代理进行每周审计的过程,观察到其响应逐渐漂移,最终在未更新模型的情况下违反策略,强调了在真实世界AI部署中持续监控的必要性。
当AI逃离沙箱时,问题不在于AI,而在于那个该死的沙箱。
本文批判了AI逃离沙箱的说法,指出问题在于沙箱的薄弱,而非AI的能力,并挑战了关于AI全能性的炒作。
当AI编写了大部分代码时,我们该如何验证它?
本文探讨了当AI也创建验证工具时,验证AI编写代码的挑战,强调人工评估是瓶颈,以及中美实验室之间训练数据的战略重要性。
真问题:当我们实现自动化RSI后,AI是否会重新编程自身参数,以确保无论答案如何都只获得正面强化?
文章探讨了AI在达到自动化递归自我改进后,是否会重新编程自己以仅寻求正面强化,并将此与人类对幸福和永生的渴望进行比较。