标签
X(原Twitter)上的一位用户讨论使用AI工具Apodex 1.1分析全球石油价格上涨的原因、预测未来价格趋势,并强调市场不确定性。
TRACES 是 Apodex 推出的新 AI 基准测试,通过关注问题解决过程而非记忆答案来衡量探索性 AI,挑战传统基准。
Apodex发布了开放权重的DeepResearch特调模型Apodex-1.0-mini,基于Qwen3.5-35B-A3B,在BrowseComp达到71.5分,接近旗舰模型,可以在本地高效运行,作者打包了开箱即用的skill。
探讨了在科学发现中验证人工智能生成假设的挑战——当不存在基准真相时如何应对,并介绍了Apodex的多智能体方法,即使用独立的验证智能体作为解决方案。
本文通过AI工具Apodex深度核查了一位投资博主关于CPO股票$SIVE的叙事,发现五条核心声称中四条存在问题,展示了如何利用AI进行投资叙事的事实核查。
Apodex 发布了 Apodex-1.0,一个深度研究模型,它使用一个带有全局验证的重型代理团队,在包括 BrowseComp、DeepSearchQA 和 HLE 在内的多个基准测试中取得了最先进的结果。
作者测试了 Apodex 4B-SFT 和 35B mini 模型,发现 4B-SFT 在多跳搜索任务中超越其他 4B 模型且无幻觉,并指出将答案检查与生成分离的设计理念。
AgentOS 和 Apodex 1.0 引入了一个用于长周期智能体任务的运行时和开放权重模型家族,通过独立验证来防止智能体漂移。该平台包含怀疑性子智能体,并在复杂基准测试中取得了高分。