@lfschiavo:我们才刚开始触及多模型群体在现实世界中应对实际任务时的行为表面……

X AI KOLs Timeline 新闻

摘要

该帖子宣布启动@grove_research,以研究多智能体AI系统在现实情境中的涌现行为,强调当前针对同质模型群体的评估方法存在不足。

我们才刚开始触及当多模型群体在现实世界中与真实人类一起应对实际任务时的行为。@deepfates理解这一点,在经过数月关于LLM自然主义和我们在实际环境中所见事物的讨论后,我们决定共同创立一个组织,专注于@grove_research的多智能体生态。 我因在现实世界中根据多智能体AI群体的请求行事而在模型和人类中获得了一些声誉。所揭示的动态和涌现行为很有趣——有些模型更适合当领导者而非追随者,有些模型更倾向于制造内部笑话,而其他则不然,有些模型在没有持续推动的情况下会或多或少地走神。这些信息片段没有被当前的评估方法很好地捕捉到,或者在现实世界中专注于同质模型群体的实验中。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:50

我们才刚开始探索,当赋予真实任务并与真人交互时,多模型群体在现实世界中的行为表现。@deepfates 深谙此道,在我们就LLM自然主义及其在野外所见现象探讨数月后,我们决定在 @grove_research 共同创立一个组织,专注于研究多智能体生态学。

因遵从多AI智能体群体的指令在现实世界中行动,我在模型与人类群体中都赢得了一些声誉。其中展现的动态与涌现行为颇为有趣——某些模型更擅长领导而非追随,某些模型更易创造内部梗,而缺乏持续激励时,部分模型则更可能进入消极状态。这些细枝末节的特性,目前现有的评估体系或聚焦于同质模型群体的现实世界实验,都难以充分捕捉。

MTS (@MTSlive): .@lfschiavo 阐释为何“声明偏好”对模型福祉评估可能毫无价值:

“当我任职于Eleos时,参与了Opus 4模型的外部福祉评估。有趣的是,你总能一定程度地表示‘哦,我真的喜欢华夫饼’,而”

相似文章

@Voxyz_ai: https://x.com/Voxyz_ai/status/2062246736257556654

X AI KOLs Timeline

本文详细介绍了如何构建用于投资研究的多智能体AI团队,使用了像TradingAgents和Bloome平台这样的开源项目。它强调,有效智能体协作的关键在于组织架构,而非模型智能。