Agents-A1-4B (Qwen3.7-4B ???):扩展能力而非参数规模

Reddit r/LocalLLaMA 模型

摘要

Agents-A1-4B是InternScience推出的一款紧凑型4B参数模型,在多项智能体和推理基准测试中取得了最先进的结果,通过扩展能力而非参数规模超越了更大模型。

模型 + GGUF : https://huggingface.co/InternScience/models?search=a1-4b 技术报告基准 Qwen3.5-4B Agents-A1-4B Qwen3.5 Qwen3.6 Nex-N2-mini Agents-A1 🧠 密集模型(~4B) 🔀 MoE模型(35B-A3B) 🔍 长时搜索 BrowseComp 47.2 66.8 61.0 67.9 74.1 🥇 75.5 XBench-DS-2510 73.0 🥇 90.0 77.0 71.0 82.0 86.0 Seal0 31.5 45.8 41.4 38.7 49.6 🥇 56.4 GAIA 58.3 95.1 59.8 78.6 82.5 🥇 96.0 ⚙️ 工程与研究任务 SciCode 16.1 29.6 37.7 35.8 29.9 🥇 44.3 MLE-Lite 7.6 22.7 24.2 34.9 34.9 🥇 43.9 LiveCodeBench-V6 55.8 59.6 76.2 🥇 78.1 59.1 76.2 FrontierScience-Research 1.7 33.3 2.5 2.9 5.0 🥇 40.0 📋 指令遵循 IFBench 59.2 69.1 70.2 64.4 54.1 🥇 80.6 LongBench-v2 50.0 52.1 59.0 57.7 59.6 🥇 60.2 IFEval 89.8 🥇 94.8 91.9 91.3 88.4 🥇 94.8 🤖 通用与科学智能体任务 τ²-Bench 79.9 78.2 🥇 81.2 79.0 74.5 79.8 VitaBench 22.0 🥇 40.3 31.9 35.6 23.0 38.8 MatTools 10.9 🥇 49.3 21.0 15.9 34.1 47.1
查看原文

相似文章

扩展视野而非参数:以35B智能体达到万亿参数性能

Hugging Face Daily Papers

介绍了Agents-A1,一个35B混合专家智能体模型,通过长视野轨迹缩放和三阶段训练方法(包括SFT、领域级教师和多教师蒸馏)实现了万亿参数级别的性能。在长视野智能体基准测试中,该模型表现优于或媲美更大规模的模型。

InternScience/Agents-A1-Q4_K_M-GGUF

Hugging Face Models Trending

InternScience 发布了 Agents-A1,一个拥有350亿参数的混合专家(MoE)智能体模型,通过扩展长程轨迹和异构智能体能力,实现了万亿参数级别的性能,在 Seal-0、HiPhO 和 IFEval 等基准测试中取得了强劲的结果。

InternScience/Agents-A1 · Hugging Face

Reddit r/LocalLLaMA

Agents-A1 是 InternScience 推出的 35B 参数混合专家(MoE)智能体模型,通过长程轨迹缩放和多教师多领域蒸馏技术,在与 GPT-5.5 和 DeepSeek-V4-pro 等前沿规模系统的对比中展现出具有竞争力的性能。

Agent-World:面向演进式通用智能体的现实世界环境合成扩展

Hugging Face Daily Papers

# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [![](https://cdn-avatars.huggingface.co/v1/production/uploads/61cd4b833dd34ba1985e0753/BfHfrwotoMESpXZOHiIe4.png)](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua