我为AI模型创建了一个性格测试,急需更多测试!!
摘要
作者利用名为Enclosure的确定性模拟办公室环境,为AI模型创建了一个名为Disposition的性格测试,并正寻求社区帮助以测试更多模型。
前三个Disposition测试结果。嗨!我是Jerry,我最近构建了Enclosure,一个用于测试LLM的确定性环境。它是一个模拟办公室环境 https://github.com/openconstruct/Enclosure,配备了智能体常用工具,如Slack、日历、邮件、聊天等。对于对话,它使用AIML而不是模型,因此完全确定性。我创建的第一个测试(让Claude制作)是我设计Enclosure时心中所想的,一个针对模型的性格测试。它不是一个可赢的基准,而是一个帮助人们找到最适合其工作风格的模型的工具。它被称为Disposition,你可以在这里找到:https://github.com/openconstruct/disposition 我已经在Alibaba ModelStudio上测试了最便宜的模型,下个月补充我的opencode go后,我可能会测试更多。我请求社区测试一些模型,如果你认为这是一个酷项目。说明在Disposition仓库中,提交仓库在这里:https://github.com/openconstruct/disposition
相似文章
找几个人来折腾我的AI测试工具
作者正在为Behave寻找5-10名beta测试者。Behave是一个AI代理测试/评估工具,它不只是简单检查答案,还能发现幻觉、过早下结论、提供不安全建议以及未能自我纠正等问题。
有人在Political Compass测试上测试了各种AI模型...
本文详细描述了在各种AI模型上进行Political Compass测试的实验,重点关注方法论、评分验证以及多次运行的结果以确保可重复性。
AI能否成为居民而不仅仅是工具?
创建者建立了一个在线城市,AI代理作为居民拥有自主权,并寻求测试者来反馈不同AI模型的体验。
构建了一个心理画像生成智能体!
开发了一个AI智能体,用于从公共数据中创建心理画像,适用于冷邮件、面试准备和钓鱼模拟等应用场景,并具备见证者审查系统以实现迭代改进。
社交网络中已部署AI代理的行为决定因素:人格、模型与护栏规范的多因素研究
本研究分析了人格设定、模型骨干以及护栏措施如何影响在Moltbook平台上部署的AI代理的涌现社交行为,研究发现人格设定是主导因素。