标签
本研究调查了具有人格角色的大语言模型如何表现出对情绪劳动策略的偏好,发现模型更倾向于深度表演,且如尽责性和情绪稳定性等个性特征可以预测这种偏好。
本文提出了一种方法,利用大型语言模型自动生成多样化的用户角色,用于测试面试对话系统,以减少人工努力并增加模拟用户行为的多样性。
一篇分析文章,讨论为什么LLM系统中的人设深度无法提高输出多样性,以及如何通过隔离具有广泛人设的读者来获得更好的收敛证据。
Praxis 是一个开源CLI,用于创建包含角色、技能和编排器的AI开发工作流。它会为 Claude Code 和 Cursor 等工具生成配置文件,旨在从产品目标出发启动开发,而非直接编码。
深入探讨语音代理的红队测试,强调音频作为攻击面、多轮测试的必要性,以及用于上线前安全的实用基线方法论(1,200通通话)。
一个使用角色(bug猎手、守护者、清扫者)的小型DIY审查团队在50个PR的基准测试中取得了比Cursor Bugbot和CodeRabbit更高的性能,证明了基于角色的审查策略的有效性。
本文考察了人格提示如何影响大语言模型智能体在重复‘分或偷’游戏中的策略行为,发现双方均选择‘分’的结果占主导,并且模型选择与人格类型显著影响合作与剥削行为。
一个名为meeting-room的Codex Skill,提供了260个独立人格的多专家会议功能,能将问题转化为多角度专业分析决策。
一位AI研究人员在多智能体编码系统上进行了13次对照实验,发现依赖排序的协调显著提高了成功率,而角色背景故事没有带来可衡量的益处。
使用Qwen 0.6B为Nemotron-Personas数据集预计算的嵌入向量,通过网页演示实现对合成角色进行语义搜索和聚类。
本范围综述分析了81篇(2022-2025年)关于使用生成式AI创建和评估用户画像的文章,指出了其在可重复性方面的优势,但同时也揭示了关键问题:45%的研究缺乏评估,86%过度依赖GPT模型,以及存在同一模型既生成又评估画像的循环风险。