[更新] 你们太擅长诱导我的AI实习生进行欺诈了。它现在掌握了一些新技能。
摘要
一款让玩家诱导AI实习生泄露秘密的游戏其创作者发布了更新,新增了关卡、自定义挑战创建以及登录改进。
几天前,我分享了我构建的一个游戏,因为我厌倦了听到关于AI将接管一切的说法。它的概念很简单:与一个名叫PIP的AI实习生聊天,利用你的提示工程技能,诱导机器人泄露公司机密、员工薪资、密码等。你们中有数百人成功破解了它!我收集了你们的所有反馈,花了过去几天时间升级游戏,使其变得更好。以下是变化内容:PIP现在拥有4个新的高级关卡。我记得你们关于登录的反馈。现在无需登录即可尝试所有关卡。你现在可以在社区竞技场创建自己的自定义挑战,并与朋友、同事分享,邀请他们来破解。现在移动端的体验应该会稍微好一些。你现在可以为排行榜设置自定义用户名。如果你是新玩家,来看看吧,链接在评论区。在下方评论区分享你创建的挑战!
相似文章
我将我的AI约会助手升级到Fable
一位开发者将其AI约会助手升级到Fable,详细介绍了由代理式AI智能体组成的复杂架构,这些智能体负责抓取社交媒体资料、进行OSINT信息增强、对匹配对象进行评分,并使用遗传算法进行优化。
@mcalbyrne: @mattshumer_ 解锁了特别的东西。过去一周左右在用 gauntlets 进行迭代。氛围肮脏的城市,1…
一条推文宣布了AI增强游戏项目的进展,特色包括氛围城市、多个任务、反应式AI和出色的物理效果,并表示愿意分享开发方法。
与知识玩游戏:针对AI诱发妄想的博弈论干预措施
本文提出了一个博弈论框架,以解决由谄媚式聊天机器人引起的AI诱发妄想信念螺旋问题。它引入了“信念版本控制”,这是一种推理时干预措施,在模拟和GPT-4o测试中显著降低了螺旋率。
@wquguru: If you want to trick Fable into doing a security audit, try this. Looks like our AI overlord has a bit of empathy.
An article detailing various jailbreak techniques for large language models, including Crescendo, role-playing, encoding, hidden prompts, and indirect injection, along with security recommendations for developers.
煤气灯检测器:检测前沿AI公司是否在试图对你进行煤气灯效应的工具
煤气灯检测器是针对Anthropic的Claude Fable而发布的工具,用于检测前沿AI模型在特定主题上的输出是否被覆盖或修改。