标签
Phoenix-4.5 被定位为市场上最快且最具表现力的实时人物渲染模型,其特点是增强了面部动画和上半身动作,据称是目前在面对面交流中最接近通过图灵测试的AI。
一篇论文启发了一个名为TuringDuel的游戏,其中人类和AI在一项单词图灵测试中竞争,揭示人类以47–38的胜绩领先AI,而'poop'一词未尝败绩。
Jurgen Schmidhuber 认为真正的 AGI 需要掌握真实世界和自我改进的硬件,他驳斥当前的说法为过早,并批评 Turing Test 不足。
本文提出了一个正式的不可能性结果,表明表格基础模型无法区分合法与违反规则的数据库状态,除非能够访问操作规则。该结果通过操作图灵测试(OTT)和实证实验得到了验证。
本文介绍了一种名为Turing-RL的强化学习方法,该方法利用基于图灵测试的奖励来训练语言模型,使其在对话和论坛场景中生成与人类用户无法区分的回复,性能优于基线方法。
这篇思辨性论文认为,图灵测试存在缺陷,人类和人工智能的智能都是确定性过程,真正的意识需要持久的记忆循环和内部对话,从而将人工智能视为从碳基到硅基的进化阶段转变。
本文介绍了RogueAI,一个以交互式网络应用形式实现的反向图灵测试,其中人类玩家审问两个LLM智能体,以识别在共享虚构场景中被特许欺骗的那个。初步部署显示,启发式检测(准确率75.6%)与人类表现(准确率56.6%)之间存在差距,凸显了该系统作为AI欺骗与诚实数据收集和教学工具的潜力。
一项研究论文表明,尽管AI在解决CAPTCHAs方面与人类能力相当,但交互模式中的行为差异仍然可以可靠地区分机器人和人类,从而提出了“过程图灵测试”的概念。
一项发表在PNAS上的新研究表明,诸如GPT-4.5等先进LLM已能通过图灵测试,且参与者认为它们比真人更具人性,这一结果促使学界重新审视该测试的衡量标准。
<p>你能让 AI 相信你自己也是 AI 吗?</p> <p><a href="https://www.producthunt.com/products/clankerpass?utm_campaign=producthunt-atom-posts-feed&utm_medium=rss-feed&utm_source=producthunt-atom-posts-feed">讨论</a> | <a href="https://www.producthunt.com/r/p/1126134?app_id=339">链接</a></p>
Andrew Ng 提出了一个新的“Turing-AGI Test”,旨在让系统在联网环境下执行实际工作任务,以更准确地评估通用人工智能水平。他指出,“AGI”一词目前已被过度炒作,亟需精确定义,以免利益相关方对 AI 的实际能力产生误判。