标签
TechCrunch Disrupt 2026将设有由Nvidia高管Nader Khalil和Sydney Sykes主持的会议,辩论开放和封闭AI模型之间的权衡及其对初创公司决策的影响。
Cognition的SWE-2模型,基于Kimi K3进行后训练,在Terminal-Bench 2.1上获得92.8分,相较于前沿模型如Fable 5.1和GPT-6 Astra,提供具有竞争力的性能且成本更低。
对 Pokee AI 的 Pokee-Isaac 28B 的讽刺回应。该模型号称拥有 1000 万 token 上下文,是智能体模型,可运行在单张 RTX 4090 上,但不开放权重,仅通过 API 提供。
本文对用于同行评审的代理审核系统进行基准测试,评估了开源和专有系统在研究论文上的表现。最佳配置实现了83.0%的成对准确率,并捕获了71.6%的注入错误,但用户反馈强调了误报和吹毛求疵的问题。
根据OpenRouter数据,开源大型语言模型在token市场份额上已超越专有模型,在三个月内从偏向专有模型的60-40比例转变为偏向开源的60-40比例。
根据 Artificial Analysis 的 Intelligence Index,GLM-5.2 (max) 目前整体上排名第三,包含对智能性、开放性、成本和令牌使用量的详细分析。
Meta已放弃其开源权重Llama模型系列,转而支持由Alexandr Wang团队开发的完全专有模型Muse Spark,标志着Meta作为开源AI捍卫者角色的终结。
Epoch AI Research 分析了开源权重模型与专有模型之间的能力差距,发现自年初以来,开源权重模型一直比最先进水平落后约四个月。