标签
本文评估了GPT-4.1模拟角色进行观点预测的能力,成功准确预测了美国九个州中八个州的选举结果,并在预测儿童疫苗信念方面达到了高准确率,尽管模拟对话缺乏自然的人类流畅性。
本文提出AI Tour Meeting,一种基于多个具有不同角色设定的LLM智能体,通过自然语言讨论协作寻找行程的团体旅行规划框架。
# 超越静态基准:基于角色模拟合成有害内容以实现鲁棒性评估 Source: [https://arxiv.org/html/2604.17020](https://arxiv.org/html/2604.17020) Huije Lee Jisu Shin Hoyun Song Changgeon Ko Jong C\. Park Korea Advanced Institute of Science and Technology \(KAIST\) \{huijelee,jisu\.shin,hysong,pencaty,jongpark\}@kaist\.ac\.kr ###### Abstract 面向有害内容检测的静态基准在可扩展性与多样性方面存在局限,且可能受...