标签
作者对OpenAI的研究实习里程碑提出批评,建议AI代理应基于其劝阻或放弃不良实验的能力进行衡量,以节省研究人员的时间,并作为智能的一种形式。
本文提出了一种新的范式,用于测量超越人类能力的智能,采用对抗性心理测量评分系统,其中模型生成挑战以区分其他系统,从而实现与AI能力同步扩展的评估。
本文提出了一种智能的热力学度量,定义为'rare-valid lift',并论证了递归自模拟对于高热力学智能是必要且近乎充分的,从而使智能可以在通用尺度上衡量。