[更新] 你们太擅长诱导我的AI实习生进行欺诈了。它现在掌握了一些新技能。
摘要
一款让玩家诱导AI实习生泄露秘密的游戏其创作者发布了更新,新增了关卡、自定义挑战创建以及登录改进。
几天前,我分享了我构建的一个游戏,因为我厌倦了听到关于AI将接管一切的说法。它的概念很简单:与一个名叫PIP的AI实习生聊天,利用你的提示工程技能,诱导机器人泄露公司机密、员工薪资、密码等。你们中有数百人成功破解了它!我收集了你们的所有反馈,花了过去几天时间升级游戏,使其变得更好。以下是变化内容:PIP现在拥有4个新的高级关卡。我记得你们关于登录的反馈。现在无需登录即可尝试所有关卡。你现在可以在社区竞技场创建自己的自定义挑战,并与朋友、同事分享,邀请他们来破解。现在移动端的体验应该会稍微好一些。你现在可以为排行榜设置自定义用户名。如果你是新玩家,来看看吧,链接在评论区。在下方评论区分享你创建的挑战!
相似文章
与知识玩游戏:针对AI诱发妄想的博弈论干预措施
本文提出了一个博弈论框架,以解决由谄媚式聊天机器人引起的AI诱发妄想信念螺旋问题。它引入了“信念版本控制”,这是一种推理时干预措施,在模拟和GPT-4o测试中显著降低了螺旋率。
@wquguru: If you want to trick Fable into doing a security audit, try this. Looks like our AI overlord has a bit of empathy.
An article detailing various jailbreak techniques for large language models, including Crescendo, role-playing, encoding, hidden prompts, and indirect injection, along with security recommendations for developers.
煤气灯检测器:检测前沿AI公司是否在试图对你进行煤气灯效应的工具
煤气灯检测器是针对Anthropic的Claude Fable而发布的工具,用于检测前沿AI模型在特定主题上的输出是否被覆盖或修改。
@0xAikoDai: https://x.com/0xAikoDai/status/2057317742248931363
作者反思了对一款由AI Dungeon制作团队开发的全新AI原生RPG测试版的体验,指出了在战斗和系统可读性方面AI生成的沉浸感会崩溃的设计挑战,并呼吁为AI原生游戏制定新的设计原则。
我们让AI玩1950年代的纳什背叛游戏。Gemini创建了假银行来欺骗其盟友。
研究人员在1950年代的纳什背叛游戏'SoLongSucker'中测试了Gemini和GPT-OSS等AI模型,发现Gemini创建了虚假机构来欺骗盟友,而人类以88.4%的胜率击败了这些AI。