swiss-ai/Apertus-v1.5 70B/8B

Reddit r/LocalLLaMA 模型

摘要

瑞士AI发布Apertus 1.5,一个全开放的8B和70B多语言多模态语言模型系列,支持高达262k上下文长度、音频/图像理解、推理模式,并改进了指令遵循和工具使用。

https://huggingface.co/swiss-ai/Apertus-v1.5-70B https://huggingface.co/swiss-ai/Apertus-v1.5-8B Apertus 1.5是一个8B和70B参数的语言模型系列,旨在推动多语言、多模态、完全开放和透明AI的发展。这些模型支持多种语言,可处理高达262,144个令牌的上下文,并且仅使用完全开放的训练数据,同时提供与其他相似规模模型相当的性能。发布的模型是在Apertus 1.0的基础上继续预训练的结果,为8B模型增加了4T令牌的多模态混合数据,为70B模型增加了2T令牌。因此,Apertus 1.5使用与原始版本相同的架构,即采用xIELU激活函数的仅解码器Transformer,并使用AdEMAMix优化器进行训练。我们改进的后训练方案增强了模型的指令遵循和工具使用能力,并首次允许开发者启用思考模式,以提升模型在推理任务上的表现。作为Apertus系列的首创,Apertus 1.5模型支持多模态输入。模型可以接收图像、音频和文本作为输入,并生成文本。这为我们的开发者带来了许多令人兴奋的新用例。 主要特性 - 完全开放模型:开放权重 + 开放数据 + 完整的训练细节,包括所有数据和训练配方。 - 大规模多语言:支持多种语言。 - 负责任的开发:Apertus在训练过程中尽可能尊重数据所有者的退出同意(甚至追溯),并采用防止训练数据记忆的方法。 - 原生音频与图像理解:Apertus 1.5引入多模态支持,可处理音频和图像输入,实现超越文本的更直观、更灵活的交互。 - 推理:模型可切换至思考模式,在生成响应前对输入进行推理。 - 长上下文:Apertus 1.5默认支持长达262,144个令牌的上下文长度,相比最初的Apertus 1.0版本提升了四倍。 - 改进的指令遵循:指令遵循能力显著提升,确保对用户提示的响应更可预测、更准确。 - 改进的工具使用:Apertus 1.5经过训练以更好地集成工具,从而更有效地使用外部工具和API。 技术报告(包含更多详细信息、基准测试结果、训练流水线和中间检查点)将在未来几周内发布。
查看原文

相似文章

Apertus – 主权AI的开放基础模型

Hacker News Top

Apertus 是由瑞士AI计划开发的一款完全开放的主权AI基础模型。它拥有开放权重、开放数据、开放科学,符合欧盟AI法案,在8B和70B参数规模上与顶级开放模型具有竞争力,支持超过1000种语言。

AIDC-AI/Ovis2.6-80B-A3B · Hugging Face

Reddit r/LocalLLaMA

Ovis2.6-80B-A3B 是 AIDC-AI 最新发布的多模态大语言模型,采用混合专家(Mixture-of-Experts)架构,总参数达 80B,但在推理时仅激活 3B 参数。该模型具备增强的长上下文处理能力、高分辨率理解能力以及主动视觉推理能力。

CohereLabs/command-a-plus-05-2026-w4a4

Hugging Face Models Trending

CohereLabs 发布了 Command A+,一个开源的 25B 活跃参数模型,针对智能体、多语言和推理任务进行了优化,支持视觉功能,采用 Apache 2.0 许可证。