标签
本文介绍了MoralSim,用于评估LLM智能体在道德冲突的社会困境中的行为表现,其中道德行为与利润激励相冲突,研究发现没有模型能始终保持道德,合作率差异很大。
Qwen发布了Qwen-AgentWorld-35B-A3B,这是一个35B参数的MoE模型,拥有3B激活参数,旨在作为语言世界模型,模拟智能体在七个领域(包括MCP、终端、软件工程、安卓、网页和操作系统)交互时的环境响应。
Qwen 发布 Qwen-AgentWorld-35B-A3B,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域的智能体环境。该模型采用三阶段流水线训练,支持 MCP、搜索、终端、SWE、Android、Web 和操作系统交互。
Anthropic 推出了 Claude Fable 5,一款 Mythos 级 AI 模型,用户通过模拟一个拥有1000名代理的城市,在沉浸式3D环境中管理任务和生产力。