@rohanpaul_ai: 大多数AI代理仍然根据它们返回的答案来评判。来自@Apodex_AI的Apodex 1.1正在训练更难的事情:…
摘要
Apodex 1.1是一个AI系统,将焦点从简单答案转移到完成和验证整个工作,具备环境扩展和代理协调的能力。
查看缓存全文
缓存时间: 2026/09/04 04:13
大多数 AI 智能体的评判标准仍是其返回的答案。
来自 @Apodex_AI 的 Apodex 1.1 正在针对更高难度进行训练:模型能否接管全部工作,在数百个步骤中维持一个真实工作空间,在部分环节出错时恢复运行,并交付可被实际验证的产物。
Apodex 1.1 构建于一种不同的 AI 能力单元之上:完成可核查的工作,而非仅提供一个精炼的答案。
任务可以从原始文件、数据集、电子表格、论文、图像或代码开始。系统可以对它们进行检查、选择方法、运行代码、保持任务状态、从故障中恢复,并产出可被验证的结果。
其背后有两条扩展路径。环境扩展增加了模型学习的可执行文件、搜索和代码场景。智能体协调扩展则训练模型将长任务分配给多个智能体,将部分结果回传至共享状态,并在证据变化时调整计划。
AgentOS 使文件、工具状态、产物、依赖关系和协调状态在工作中保持持久化。子智能体可以在每个分支完成前返回有用的结果,这样主智能体就能在不丢弃仍有效的进度的情况下,重新定向未完成的工作。
官方发布的结果显示,Apodex 1.1 与 Agent Team 团队在专业工作、金融、科学、推理和搜索等多个领域均处于领先性能梯队。
🧵 1.
相似文章
Apodex 1.1: 扩展智能代理以应对复杂工作
Apodex 1.1通过扩展可执行环境并训练智能代理进行长期协调,改善了在复杂现实任务中的持续、可验证进展,以更小的350亿参数模型实现了领先性能。
@Apodex_AI: 认识 𝗔𝗽𝗼𝗱𝗲𝘅 𝟭.𝟬 — 一个用于深度研究的重型智能体团队,树立了最新技术水平(SOTA)!该团队搜索网络,阅读…
Apodex 1.0 是一个用于深度研究的重型AI智能体团队,通过搜索网络、推理证据并生成带有可验证证据链的报告,实现了最先进的性能(SOTA)。
@Apodex_AI: 深入阅读博客:https://apodex.com/blog/apodex-1.0 技术报告:http://apodex.com/pdf/20260608 GitHub:https://github.com…
ApodexAI 发布了 Apodex-1.0,这是一个深度研究模型,作为使用工具的 ReAct 代理运行。其重型模式 Apodex-1.0-H 采用异步代理团队,最多包含 150 个子代理,在深度研究基准测试(包括 BrowseComp、DeepSearchQA、HLE 和 FrontierScience)上取得了新的最先进结果,超越了 GPT-5.5-pro 和 Claude-Opus-4.8 等模型。
@heyshrutimishra: Apodex 1.0 发布,架构确实与众不同。它基于 Qwen3.5 进行后训练,成为一个自我进化的系统:…
Apodex 1.0 是一个基于 Qwen3.5 后训练的自我进化 AI 系统,在 BrowseComp、DeepSearchQA 和 HLE-text 上达到 SOTA。其 4B 迷你模型性能超越 30B 级别模型,并配有 AgentOS 运行时用于任务编排。开放权重可用。
AI代理做事越来越强了。接下来它们应该学会做什么?
一场关于AI代理从生成答案到完成多步骤任务演进的讨论,以及它们下一步应发展哪些能力以处理复杂的现实世界工作。