里约热内卢的“本土”LLM似乎是现有模型的合并

Hacker News Top 模型

摘要

Nex-AGI 发布并开源了 Nex-N2,这是一个具有统一框架的智能体模型,能够实现自适应和连贯的思考,在智能体和编程基准测试中取得了有竞争力的性能。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/15 00:56

nex-agi/Nex-N2 来源:https://github.com/nex-agi/Nex-N2 — 🤗 模型 | 💻 GitHub | 🧭 ModelScope | 🚀 Nex-AGI | 🔀 OpenRouter(6月9日起享受两周免费!) # Nex-N2 一个具备智能体思维的智能体模型。 今天,我们正式发布并开源我们的下一代模型 Nex-N2——这是一个为真实生产力场景打造的智能体模型。凭借一流的编码和智能体能力,Nex-N2能在真实环境中持续推动复杂的长期任务,提供稳定且端到端的结果。 过去一年,由Vibe Coding和Harness Engineering引领的范式转变,正在重新定义LLM智能体的边界。从对话到推理,再到能够执行长期任务并接收环境反馈的智能体,模型需要处理的任务越来越难,上下文越来越长,环境也越来越真实。下一代模型竞争的核心不再是 模型能否思考,而是能否可靠高效地将思考转化为可执行、可验证、可迭代的行动。 Nex-N2不将推理、工具使用和环境执行视为独立能力,而是通过一个 智能体思维(Agentic Thinking) 框架将它们统一起来,将需求理解、任务规划、代码实现、环境反馈、评估调试和持续迭代连接成一个完整的闭环。该框架包含两个部分: - 自适应思维(Adaptive Thinking):让模型自行决定何时思考以及思考的深度——快速执行简单操作,同时在关键决策上深入推理。 - 一致性思维(Coherent Thinking):在通用推理和多样化的智能体任务中,采用一致的推理范式,跨任务和模态保持一致性,实现稳定的能力迁移。 在真实的智能体工作流中——智能体编码、深度研究、工具调用和终端执行——Nex-N2达到了第一梯队的性能,并在多个权威基准上相比上一代Nex-N1有显著提升。在实际生产力场景中,例如OpenClaw一人公司工作流、端到端游戏开发、Web和多模态生成,它同样展现出卓越的易用性、鲁棒性和稳定性。 ## 开源 秉持开源承诺,我们从今天起开放 Nex-N2-ProNex-N2-mini 作为开源模型。 - Nex-N2-Pro: Hugging Face (https://huggingface.co/nex-agi/Nex-N2-Pro) | ModelScope (https://www.modelscope.cn/models/nex-agi/Nex-N2-Pro) - Nex-N2-mini: Hugging Face (https://huggingface.co/nex-agi/Nex-N2-mini) | ModelScope (https://www.modelscope.cn/models/nex-agi/Nex-N2-mini) - 早期体验: SiliconFlow (https://cloud.siliconflow.cn/me/models?target=nex-agi%2FNex-N2-Pro) 欢迎开发者和企业集成并试用Nex-N2,分享您的反馈。 ## 性能 我们从三个方向——智能体任务、编码任务和通用任务——在真实智能体工作流中评估Nex-N2,覆盖工具调用、基于搜索的决策、软件工程和终端执行等基准。Nex-N2-Pro表现出强劲性能,与GPT-5.5和Opus 4.7等顶级模型并驾齐驱:它在编码(如Terminal-Bench 2.1上75.3)和长期任务(GDPval上1585)上表现出色,在SWE-Atlas和DeepSWE等新基准上展现出尤为强大的泛化能力和竞争力。在通用能力和核心推理方面,它与领先前沿模型持平。 Nex-N2基准概览 Nex-N2提供两种变体,均基于Qwen3.5系列进行后训练:Nex-N2-Pro(基于Qwen3.5-397B-A17B)和Nex-N2-mini(基于Qwen3.5-35B-A3B-Base),覆盖不同的延迟与质量权衡。下表列出了它们在我们完整评估套件中的得分,以及领先的专有和开源模型的得分。 | 基准 | Nex-N2-mini | Nex-N2-Pro | GPT-5.5 | Opus 4.7 | Kimi-K2.6 | GLM-5.1 | MiniMax M3 | DeepSeek-V4-Pro | | — | — | — | — | — | — | — | — | — | | 智能体 | | | | | | | | | | BrowseComp | 74.1 | 83.7 | 84.4 | 79.8 | 83.2 | 79.3 | 83.5 | 83.4 | | GDPval | 1402 | 1585 | 1769 | 1753 | 1481 | 1535 | - | 1554 | | Toolathlon | 33.3 | 51.9 | 55.6 | 52.8 | 50.0 | 40.7 | - | 51.8 | | WildClawBench | 47.7 | 53.5 | 58.2 | 62.2 | - | 48.2 | - | 43.7 | | WideSearch | 62.0 | 75.6 | - | - | 80.8 | - | - | - | | TAU3 | 65.9 | 71.1 | - | - | - | 70.6 | - | - | | 编码与软件工程 | | | | | | | | | | SWE-Bench Pro | 50.2 | 58.8 | 58.6 | 64.3 | 58.6 | 58.4 | 59.0 | 55.4 | | Terminal-Bench 2.1 | 60.7 | 75.3 | 83.4 | 69.7 | - | 58.7 | 66.0 | 72.0 | | DeepSWE | 8.0 | 33.6 | 70 | 54 | 24 | 18 | - | 8 | | SWE-Bench Verified | 74.4 | 80.8 | 82.9 | 87.6 | 80.2 | - | 80.5 | 80.6 | | SWE Atlas QnA | 31.5 | 37.9 | 45.4 | 45.2 | - | - | 37.9 | - | | SWE Atlas RF | 30.0 | 32.9 | 44.8 | 48.6 | - | - | - | - | | SWE Atlas TW | 23.3 | 40.0 | 42.6 | 38.2 | - | - | 30.8 | - | | 通用与推理 | | | | | | | | | | GPQA Diamond | 82.6 | 90.7 | 93.6 | 94.2 | 90.5 | 86.2 | - | 90.1 | | IFEval | 89.1 | 94.0 | - | - | 94.5 | 94.5 | - | 91.9 | | Apex | 9.4 | 36.5 | - | - | 24.0 | 11.5 | - | 38.3 | ## 使用 ### 本地部署 > 注意: 为获得Nex系列模型的最佳性能,建议使用我们定制的sglang分支进行服务。 首先,安装我们定制的sglang分支: bash # 使用定制的 `sglang` 分支 git clone https://github.com/nex-agi/sglang.git cd sglang # 安装 Python 包 pip install --upgrade pip pip install -e "python" #### Nex-N2-Pro 启动服务器(示例:两台 8× H100 服务器,CUDA 13.0): bash # 多节点(2 个节点)。在每个节点上运行相同的命令,并设置: # <node_rank> = 0 在头节点,1 在其他节点 # <head_ip> = 头节点的 IP(其他节点可访问) python -m sglang.launch_server \ --model-path /path/to/your/model \ --tp 16 \ --nnodes 2 \ --node-rank <node_rank> \ --dist-init-addr <head_ip>:20000 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder \ --mamba-scheduler-strategy extra_buffer #### Nex-N2-mini 启动服务器(示例:一台 2× H100 服务器,CUDA 13.0): bash python -m sglang.launch_server \ --model-path /path/to/your/model \ --tp 2 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder \ --mamba-scheduler-strategy extra_buffer ### Docker 部署 我们还提供了一个预构建的 Docker 镜像,其中预装了定制的 sglang 分支:nexagi/sglang:v0.5.12。启动命令同上。 #### Nex-N2-Pro bash # 多节点(2 个节点)。在每个节点上运行相同的命令,并设置: # <node_rank> = 0 在头节点,1 在其他节点 # <head_ip> = 头节点的 IP(其他节点可访问) docker run --gpus all --shm-size 32g --network host \ -v /path/to/your/model:/model \ nexagi/sglang:v0.5.12 \ python3 -m sglang.launch_server \ --model-path /model \ --tp 16 \ --nnodes 2 \ --node-rank <node_rank> \ --dist-init-addr <head_ip>:20000 \ --host 0.0.0.0 --port 30000 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder \ --mamba-scheduler-strategy extra_buffer #### Nex-N2-mini 单节点,2× H100: bash docker run --gpus all --shm-size 32g --ipc=host \ -p 30000:30000 \ -v /path/to/your/model:/model \ nexagi/sglang:v0.5.12 \ python3 -m sglang.launch_server \ --model-path /model \ --tp 2 \ --host 0.0.0.0 --port 30000 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder \ --mamba-scheduler-strategy extra_buffer ### 推荐采样参数 为获得最佳生成质量,我们推荐以下采样参数: - temperature: 0.7 - top_p: 0.95 - top_k: 40 ### 函数调用 Nex系列模型支持强大的函数调用能力。要启用函数调用,在启动服务器时添加 --tool-call-parser qwen3_coder 标志: bash python -m sglang.launch_server --model-path /path/to/your/model --tool-call-parser qwen3_coder ### 推理解析器 Nex系列模型会输出显式的推理过程。添加 --reasoning-parser qwen3 标志,可将推理内容与最终响应分开解析。它可以与上面的函数调用解析器组合使用: bash python -m sglang.launch_server --model-path /path/to/your/model --tool-call-parser qwen3_coder --reasoning-parser qwen3

相似文章

nex-agi/Nex-N2-Pro

Hugging Face Models Trending

Nex-AGI 发布了 Nex-N2-Pro 与 Nex-N2-mini,这是一个开源的智能体模型,采用“智能体思维”框架,统一了推理、工具使用和环境执行。在智能体编程和长周期任务上展现出具有竞争力的性能。

prefeitura-rio/Rio-3.5-Open-397B

Hugging Face Models Trending

Rio 3.5 Open 397B 是一个开源的前沿AI模型,基于 Qwen 3.5 397B 进行后训练,采用 SwiReasoning 实现动态显式/隐式推理切换,在智能体编程、推理和多语言基准测试中取得了最先进的性能。