标签
DeepSeek v4 Pro 0813在网络安全漏洞发现基准测试中超越了所有其他模型,在pass@3下实现了87.5%的CVE重新发现率,但精确度和运行一致性较低。
本文介绍了Macaron-V1,一个开放的持续学习智能体-模型家族,使用Mixture-of-LoRA在冻结的基础模型上组合专家适配器,并具有递归自我改进和模型-框架协同设计。
一个名为 kimi-k3-in-c 的新工具,在单个 CPU 上以低至 8.24 GB 的内存运行 2.78T 参数的 Kimi K3 开源模型,从磁盘流式加载专家,并以每 token 10-32 秒的确定性输出运行。
NVIDIA released Alpamayo 2 Super, an open reasoning model for autonomous vehicles, now available for commercial use under the OpenMDW-1.1 license, delivering frontier-scale reasoning for robotaxis and AV development.
Arcee AI、Loka、AWS 和 Prime Intellect 使用强化学习对开放模型进行后训练,以提升科学工具使用和生物推理能力,在药物工具和 Gene Ontology 基准测试上取得了显著进展。
Kimi K3是Moonshot AI推出的2.8T参数开放模型,基准测试表现强劲,但可能过度优化,且落后顶级闭源模型数月。它从Claude蒸馏而来,其发布可能先于IPO。
NVIDIA 发布了 Cosmos 3 Edge,一个40亿参数的开源世界模型,专为边缘设备设计,帮助机器人和视觉AI代理理解周围环境、实时推理并生成动作。它在同类模型中实现了领先的吞吐量和准确度。
Google宣布了为Pixel 10的TPU优化的Gemma 4 E2B,实现了设备端多模态AI能力,如离线聊天、图像识别和音频转录。
一个开放模型,通过控制信号预测机器人的动作,引发了一个问题:它到底是一个世界模型,还是一个视频生成器?
本文分析了开放语言模型的采用情况,发现以Qwen为首的中国模型目前在下载量上占据主导地位,到2026年3月已超越美国模型。Qwen的领先优势来自其多样化的模型尺寸,而DeepSeek在超大型模型领域领先,一些美国模型仍显示出强劲的增长势头。
介绍 Leanstral 1.5,一个119B参数(6B活跃)的开放模型,用于Lean 4的形式化证明工程,在miniF2F上达到100%,在PutnamBench和FATE基准测试上达到最先进分数,并发现了开源仓库中先前未知的漏洞。
GLM 5.2,一个开放AI模型,现已通过与Fireworks的合作在Cursor编码工具中可用。
NVIDIA 发布了 Nemotron-TwoTower-30B-A3B-Base-BF16,这是一种基于扩散的语言模型,采用逐块自回归扩散方法,通过对令牌块进行迭代去噪来生成文本,实现了自回归基线 2.42 倍的生成吞吐量,同时保留了基准测试质量 98.7% 的水平。
GLM-5.2 是一款新的开源AI模型,为开放模型树立了高标准,但仍在追赶专有前沿模型,并且缺乏一些功能,如视觉功能。
NVIDIA发布了Nemotron 3开放模型,提供了Nano、Super、Ultra三种尺寸,通过混合Mamba Transformer、潜在MoE和多token预测等架构创新优化硬件效率,并采用Open MDW 1.1开放许可协议。
NVIDIA 优化了 Google DeepMind 的 DiffusionGemma——一个能并行生成 256 个令牌文本块的开放模型,在本地 RTX GPU、DGX Spark 和 DGX Station 系统上实现了高达 4 倍的性能提升。
Google推出DiffusionGemma,这是一个实验性的26B MoE开源模型,通过文本扩散技术,在GPU上实现高达4倍的文本生成速度提升,针对速度要求高的交互式本地工作流。
Nex AGI 发布了 Nex-N2,这是一个开源智能体模型系列,用于编程、工具使用、深度研究和长时工作流,具备最先进的基准测试结果并采用 Apache 2.0 许可证。
NVIDIA 宣布推出 Alpamayo 2 Super,这是一款面向 L4 级自动驾驶出租车的 32B 开源推理模型,具备 360 度感知、元动作等功能,并提供包括 AlpaGym 仿真和 OmniDreams 场景生成在内的全套技术栈。
文章指出,腾讯的Hy3 Preview开放模型在评估中表现惊人,缩小了与顶级闭源模型的差距,但与西方AI实验室相比仍讨论不足。