@rohanpaul_ai: 大多数AI代理仍然根据它们返回的答案来评判。来自@Apodex_AI的Apodex 1.1正在训练更难的事情:…

X AI KOLs Following 模型

摘要

Apodex 1.1是一个AI系统,将焦点从简单答案转移到完成和验证整个工作,具备环境扩展和代理协调的能力。

大多数AI代理仍然根据它们返回的答案来评判。 来自@Apodex_AI的Apodex 1.1正在训练更难的事情:模型能否接管整个工作,在数百个步骤中保持真实工作区存活,在部分失败时恢复,并交付真正可验证的产物。 Apodex 1.1围绕不同的AI能力单位构建:完成的、可检查的工作,而非精致的答案。 一个任务可以从原始文件、数据集、电子表格、论文、图像或代码开始。系统可以检查它们,选择方法,运行代码,保持任务状态,从故障中恢复,并产生可检查的输出。 底层是两条扩展路径。环境扩展扩展了模型学习的可执行文件、搜索和代码场景。代理协调扩展训练它将长任务分配给多个代理,将部分结果带回共享状态,并在证据变化时修改计划。 AgentOS在整个工作中保持文件、工具状态、产物、依赖关系和协调状态持久化。子代理可以在每个分支完成之前返回有用结果,因此主代理可以重定向未完成的工作,而不丢弃仍然有效的进度。 官方发布的结果将Apodex 1.1与Agent Team置于专业工作、金融、科学、推理和搜索领域的领先性能水平。 🧵 1.
查看原文
查看缓存全文

缓存时间: 2026/09/04 04:13

大多数 AI 智能体的评判标准仍是其返回的答案。

来自 @Apodex_AI 的 Apodex 1.1 正在针对更高难度进行训练:模型能否接管全部工作,在数百个步骤中维持一个真实工作空间,在部分环节出错时恢复运行,并交付可被实际验证的产物。

Apodex 1.1 构建于一种不同的 AI 能力单元之上:完成可核查的工作,而非仅提供一个精炼的答案。

任务可以从原始文件、数据集、电子表格、论文、图像或代码开始。系统可以对它们进行检查、选择方法、运行代码、保持任务状态、从故障中恢复,并产出可被验证的结果。

其背后有两条扩展路径。环境扩展增加了模型学习的可执行文件、搜索和代码场景。智能体协调扩展则训练模型将长任务分配给多个智能体,将部分结果回传至共享状态,并在证据变化时调整计划。

AgentOS 使文件、工具状态、产物、依赖关系和协调状态在工作中保持持久化。子智能体可以在每个分支完成前返回有用的结果,这样主智能体就能在不丢弃仍有效的进度的情况下,重新定向未完成的工作。

官方发布的结果显示,Apodex 1.1 与 Agent Team 团队在专业工作、金融、科学、推理和搜索等多个领域均处于领先性能梯队。

🧵 1.

相似文章

Apodex 1.1: 扩展智能代理以应对复杂工作

Hugging Face Daily Papers

Apodex 1.1通过扩展可执行环境并训练智能代理进行长期协调,改善了在复杂现实任务中的持续、可验证进展,以更小的350亿参数模型实现了领先性能。

@Apodex_AI: 深入阅读博客:https://apodex.com/blog/apodex-1.0 技术报告:http://apodex.com/pdf/20260608 GitHub:https://github.com…

X AI KOLs Following

ApodexAI 发布了 Apodex-1.0,这是一个深度研究模型,作为使用工具的 ReAct 代理运行。其重型模式 Apodex-1.0-H 采用异步代理团队,最多包含 150 个子代理,在深度研究基准测试(包括 BrowseComp、DeepSearchQA、HLE 和 FrontierScience)上取得了新的最先进结果,超越了 GPT-5.5-pro 和 Claude-Opus-4.8 等模型。