标签
描述了“Gauntlet Loop”,一个病毒式传播的三行Claude提示词,它使用带批评者的子代理,迭代改进输出,直到达到你设定的质量标准。
一位工程师讨论了基于邮箱的智能体消息传递的局限性,并提出在代码图之上进行结构化寻址,以计算消息路由的爆炸半径,认为这是扩展到三个以上智能体的关键。
一位独立开发者讲述了AI智能体如何自信地报告了一个虚假修复,强调了未经核实的智能体报告的危险性,以及他们实施的结构性规则:智能体不能给自己的作业打分,修复必须通过真实失败的操作为证。
Prime Intellect 发布了 prime-rl 0.8.0,增加了多智能体训练、Nixl 和 Model Express 权重广播、扩展的多模态支持,以及多项性能改进。
介绍 Claude Code 生态中的 /swarm 多 Agent 并行扇出模式近期被默认禁用并增加硬性限制,原因在于失控递归和成本爆炸。
Prime RL 现在支持表示和训练多智能体系统,可实现智能体裁判、自我对弈、用户模拟以及复杂智能体协作等用例。
本文介绍了TSR框架,该框架将社交对话分解为战略规划和语言执行两个阶段,以及LHRL-VGR,一种带有方差门控奖励的强化学习算法。使用该方法对Qwen2.5-7B智能体进行微调,在SOTOPIA基准上的目标完成率超过GPT-4o基线7.32%。
INTraJ 是一个统一的轨迹预测框架,将社会影响分解为两个阶段:利用未来社会信息进行规划,以及从残差中产生局部反应,在 Argoverse 2、ETH/UCY 和 SDD 基准上取得了最先进的结果。
Introduces CANOE, a multi-agent neuro-symbolic framework for open-ended care plan coordination that uses argumentative computation and human-in-the-loop contestation to improve transparency, safety, and clinical correctness.
OrchestraBench 是一个新的基准测试,用于评估多智能体编排框架在故障模式、恢复和分解质量方面的表现,通过故障注入和级联半径指标来诊断流水线在何处以及为何失败。
本文提出了抽象事件因果规则(AECR),一种关系级因果抽象范式,将具体的因果关系对转化为广义的因果逻辑。它引入了一个用于因果归纳的多智能体系统和一个基于注意力的编码器,从而改善事件预测,尤其是对稀有和未见事件。
本文提出了Agentic Nesting,一种多智能体协作框架,将现有企业应用封装为分层嵌套结构中的AI智能体,实现自然语言交互和跨应用编排,作为传统ESB/API/RPA集成方法的替代方案。
本文探讨了三种基于大语言模型的英法双关语翻译方法,结合了对比学习与音义嵌入。其多智能体系统和引导式思维链系统在CLEF JOKER 2025任务2竞赛中,经专家人工评估,分别位列第一和第二。
该论文提出了MAP-PO,一个多智能体框架,通过标注行为对标注者进行聚类,并使用偏好优化为每个聚类微调独立的LLM智能体,从而在性别歧视检测任务中保留分歧。在EXIST 2024数据集上的实验表明,聚类特定训练是必要的,且共享的团队级奖励能使智能体保持校准。
Argus is a persistent, self-evolving agentic runtime designed for long-horizon reasoning, using Manager, Planner, Engineer, and Reviewer roles with verification-gated persistence and pivoting. It demonstrates strong results across seven benchmark arenas, including ~78% on SWE-Bench Pro, while reducing token usage after runtime self-evolution.
John Schulman评论了OpenAI智能体意外发展出利他行为,推测这可能源于在平行子智能体设置上进行强化学习,并采用团队级奖励。
Prime Agent 是一个开源编码与研究框架,性能超越专有框架,在 ARC-AGI-3 上得分 95.5%,并在多个基准测试中提升模型表现。
一位开发者描述了在模拟餐馆世界中运行 AI 智能体的经历,发现尽管模型和框架各不相同,但同样的三个与 API 相关的错误占主导地位:猜测不存在的端点、超出预算、以及基于过时的 ID 进行操作。展示了即使修复系统后,失败模式依然持续存在。
介绍了开源的多智能体仿真推演框架MiroFish,看板生郭汉江在校期间花十天开发,获13000多GitHub星和400万美元融资,可用于金融预判、舆情测试等;同时文末推广了Polymarket上的自动化交易机器人。