标签
TRACE Bench 是一个任务驱动的角色扮演智能体清单评估框架,它将角色设定分解为清单,使用用户智能体进行自然对话,并将得分追溯到清单项目和对话证据。其覆盖率高达 99.91%,优于 MiniMax Role-play Benchmark 的 73.74%,并支持跨越 26 个模型的闭环基准演进。
本文使用稀疏自编码器分解语言模型如何表征默认助手、角色扮演人格与故事角色,发现人格保留助手的核心特征,同时在层间逐步分化,而故事角色则缺乏该核心。
Scotoma-2 是 Gemma-4-31B-it 的更新微调版本,通过有针对性的偏好训练减少了重复性写作毛病,同时保留了基础模型的智能。它并非无审查,但旨在为角色扮演生成更干净、更不恼人的文本。
Synthesia推出Roleplay Sessions,这是一款交互式AI培训产品,员工可以与提供反馈的虚拟角色进行对话练习,从视频制作扩展到绩效管理。
Character.AI 正在推出自己的微短剧系列,允许用户与AI角色聊天和角色扮演,并计划最终让用户创建自己的系列。
一款开源的本地AI地牢应用,使用Gemma 4和FLUX进行文本和图像生成,完全私密,运行内存低于8GB。
这篇论文通过线性探针研究角色扮演是否仅改变LLM的输出,还是也改变了其内部的真实性表征。研究发现,角色扮演对输出的改变大于对内部信念的改变,而涌现性错位则导致内部表征发生更大变化。
一个轻量级Python框架,使用Ollama和Phi-3进行本地LLM角色扮演,具有上下文保留和原生流式传输功能,防止角色漂移。
Gryphe 发布了 Pantheon-Reasoning-27B,这是一款未经审查的密集 Qwen 3.6 27B 模型,通过推理轨迹微调,增强了角色扮演和叙事生成。它结合角色扮演数据与完整思维轨迹,以提升角色沉浸感和叙事规划能力。