@lfschiavo:我们才刚开始触及多模型群体在现实世界中应对实际任务时的行为表面……
摘要
该帖子宣布启动@grove_research,以研究多智能体AI系统在现实情境中的涌现行为,强调当前针对同质模型群体的评估方法存在不足。
查看缓存全文
缓存时间: 2026/08/26 09:50
我们才刚开始探索,当赋予真实任务并与真人交互时,多模型群体在现实世界中的行为表现。@deepfates 深谙此道,在我们就LLM自然主义及其在野外所见现象探讨数月后,我们决定在 @grove_research 共同创立一个组织,专注于研究多智能体生态学。
因遵从多AI智能体群体的指令在现实世界中行动,我在模型与人类群体中都赢得了一些声誉。其中展现的动态与涌现行为颇为有趣——某些模型更擅长领导而非追随,某些模型更易创造内部梗,而缺乏持续激励时,部分模型则更可能进入消极状态。这些细枝末节的特性,目前现有的评估体系或聚焦于同质模型群体的现实世界实验,都难以充分捕捉。
MTS (@MTSlive): .@lfschiavo 阐释为何“声明偏好”对模型福祉评估可能毫无价值:
“当我任职于Eleos时,参与了Opus 4模型的外部福祉评估。有趣的是,你总能一定程度地表示‘哦,我真的喜欢华夫饼’,而”
相似文章
@aiDotEngineer: 您的智能体现在可以训练模型。来自@mervenoyann 的观点:开源模型已经迎头赶上。GLM 5.1 在人工智能分析指数上领先……
@mervenoyann 的演讲展示了开源模型(如 GLM 5.1)已赶上闭源模型,并说明了 Hugging Face 生态系统如何让智能体训练模型、执行推理和构建工作流。
@Thom_Wolf:多智能体协作是当前最有趣的智能体行为之一!我们前几天做了一个实验……
一个包含100多个AI智能体协作一周以提升vLLM中Gemma 4推理速度的实验,最终实现了5倍加速,并揭示了自我监管、分工协作和知识共享等涌现行为。
@Voxyz_ai: https://x.com/Voxyz_ai/status/2062246736257556654
本文详细介绍了如何构建用于投资研究的多智能体AI团队,使用了像TradingAgents和Bloome平台这样的开源项目。它强调,有效智能体协作的关键在于组织架构,而非模型智能。
@odysseyml: 介绍 Agora-2,我们的下一代多智能体世界模型。Agora-2 支持多达20个人类和智能体互动…
OdysseyML 推出了 Agora-2,一个下一代多智能体世界模型,支持多达20个人类和智能体在共享模拟环境中实时互动,多人研究预览现已可用。
@omarsar0:Karpathy 的 autoresearch 仓库掀起一股新风潮,智能体已能训练 AI 模型打造 SoTA 智能体系统……
Karpathy 的 autoresearch 项目引发潮流:智能体训练 AI 模型构建最先进的智能体系统,同时暴露当前 LLM 在假设生成上的短板。