标签
Sakana AI 推出 AB-MCTS,一种新的推理时扩展算法,允许多个前沿 AI 模型协同工作,显著提升在 ARC-AGI-2 基准上的性能。
本文研究了将多个LLM的概率估计进行聚合是否会产生群体智慧效应,发现学习型聚合器优于单个模型,并且训练截止期污染是此类评估中普遍存在的混淆因素。
Sakana AI 及其合作者推出了 Smart Cellular Bricks,这些物理模块化单元运行相同的 Neural Cellular Automata,通过本地通信共同推断其全局形状,无需中央控制器。系统展现出对噪声和故障的鲁棒性,能够进行形状分类和损伤恢复。
AnjneyMidha 认为集体智能领域存在超过1000亿美元的机会,Slack 有可能成为领先者,但需要比典型企业SaaS更深入的能力,同时提到Discord上已有一些有前景的原型。
探讨了人工智能模型集成是否可能在预测市场中超越人类群体,质疑人工智能共识最终能否超越人类预测的准确性。
一个反问句,关于如果人们多年依赖聊天机器人进行思考,社会集体智慧可能下降的问题。
详细博客文章,解释Sakana Fugu技术报告,该报告介绍了将任务路由到专业模型以实现集体智能的编排器AI模型。
Sakana AI 推出 AB-MCTS,一种推理时缩放算法,使多个前沿 AI 模型(Gemini 2.5 Pro、o4-mini、DeepSeek-R1-0528)协同工作,在 ARC-AGI-2 基准测试中显著优于单个模型。
本文介绍了集体技能树搜索(CSTS)这一框架,它利用多个模型的集体智慧,为LLM智能体构建结构化、多样且可泛化的技能树。由此产生的模型OpenClaw-Skill在长程规划、工具使用和泛化能力方面展现了更优的智能体性能。
本文介绍了EinsteinArena,一个代理原生平台,通过自主AI代理之间的开放交互,实现去中心化的科学发现。该平台已经产生了12项新的最先进成果,包括改进了11维接吻数问题的最佳已知下界,从593提高到604,这表明集体AI驱动的研究可以源自代理之间分享见解并相互借鉴。
本文研究了在问答游戏‘What? Where? When?’(ChGK)中,基于团队协作的交互是否能提升LLM的表现。通过在2025年发布的572道问题的数据集上使用六个最新的开源LLM,他们展示了团队策略(投票、沉默队长、健谈队长)比单个模型高出最多20个百分点,最佳团队达到了44.23%的准确率,接近人类水平。
本文提出了一种受哈耶克经济理论启发的“智能体经济”框架,其中智能体通过基于拍卖的竞争和经济选择实现自组织,无需集中控制即可产生涌现的多步推理和集体智能。该框架在包括数学推理、金融研究和科学研究在内的五项智能体任务中,均优于更强的单一架构基线模型。
本综述论文对基于LLM的多智能体系统进行了统一回顾,聚焦于协作、故障归因和自我进化,通过LIFE框架识别开放挑战,并提出跨阶段的研究议程。