标签
深入探讨语音代理的红队测试,强调音频作为攻击面、多轮测试的必要性,以及用于上线前安全的实用基线方法论(1,200通通话)。
一个使用角色(bug猎手、守护者、清扫者)的小型DIY审查团队在50个PR的基准测试中取得了比Cursor Bugbot和CodeRabbit更高的性能,证明了基于角色的审查策略的有效性。
本文考察了人格提示如何影响大语言模型智能体在重复‘分或偷’游戏中的策略行为,发现双方均选择‘分’的结果占主导,并且模型选择与人格类型显著影响合作与剥削行为。
一个名为meeting-room的Codex Skill,提供了260个独立人格的多专家会议功能,能将问题转化为多角度专业分析决策。
一位AI研究人员在多智能体编码系统上进行了13次对照实验,发现依赖排序的协调显著提高了成功率,而角色背景故事没有带来可衡量的益处。
使用Qwen 0.6B为Nemotron-Personas数据集预计算的嵌入向量,通过网页演示实现对合成角色进行语义搜索和聚类。
本范围综述分析了81篇(2022-2025年)关于使用生成式AI创建和评估用户画像的文章,指出了其在可重复性方面的优势,但同时也揭示了关键问题:45%的研究缺乏评估,86%过度依赖GPT模型,以及存在同一模型既生成又评估画像的循环风险。