内部人士对Astra能力的看法

Reddit r/singularity 模型

摘要

一位内部人士评估了GPT Astra的能力,强调其在长期任务、协调、应用学术文献和代码生成方面的优势,并指出在创意写作方面相比前代模型有所改进。

@Lentils80在X上的帖子"在过去的几天里,两个GPT Astra检查点“ultima-alpha”和“vega-alpha”正在进行测试。“ultima-alpha”似乎是面向公众的发布候选版本,而“vega-alpha”是专注于网络安全的变体,用于特定企业的安全工作。根据我的广泛测试,当OpenAI说Astra是为长期任务和协调而构建的,他们确实如此。即使不设置“/goal”,它也能运行非常长的时间,完全自主,并且在协调和引导其生成的子代理方面非常出色。对于研究社区来说,它非常擅长应用现有的学术文献。我尝试用它处理一些困难的图形优化问题,涉及大量复杂数学,它表现得很好。它编写的代码质量很高且可维护性好(对于LLM来说),我认为在所有模型中排名最好。但大多数普通人可能只会将其作为主代理运行,而使用更便宜的模型作为子代理。此外,创意写作似乎比5.6 Sol好得多(在我看来),仍然不是最好的,但明显不那么臃肿。”——在代码方面比Fable好,但在前端和3D方面最差(不确定他指的是5还是5.1)。
查看原文

相似文章

GPT-6 Astra

Product Hunt

OpenAI发布GPT-6 Astra,这是其最强大的AI模型,适用于高级推理、软件工程和智能体工作流,具备异步工具调用和中途引导功能,并制定了分阶段推出计划。