标签
小米推出MiMo-V2.6,一款具备音频/语音功能的全模态AI模型,声称其性能与Claude Opus 5和GPT-5.6 Sol等领先模型不相上下。
Grok 4.7在法律工作和终端任务方面显示出显著改进,在Harvey Legal Agent Benchmark和Terminal-Bench 4.0等基准测试中超越竞争对手,同时保持代币价格不变。
Benzi是一个AI编程代理,通过读取更少源代码并使用确定性工具调用,在基准测试中超越竞争对手,在代码智能任务中实现高效率。
来自比哈尔邦的20岁独立开发者Abhinav Anand发布了Arcle V1,这是一个开源权重的5.84B参数统一全能AI模型,在包括MATH-500在内的多个基准测试中优于Apple的AFM 3B模型。
H3 Max 是一个AI模型,能在不到3秒内生成5秒的768p视频,带有原生立体声音频,比实时更快,并在Design Arena和Artificial Analysis的图转视频类别中排名第一。一个演示展示了其在Twitch上的连续视频流应用。
本文介绍了Meta^n,这是一种通过应用固定元操作来扩展推理深度的递归自我改进方法,在ARC-AGI-2等基准测试上超越了先前方法。
AutoSaddler是一个自动套件优化框架,通过使用失败信号迭代更新套件,提升LLM智能体在长期任务上的表现,在GAIA2和SWE-Bench等基准测试中实现了显著提升。
Ornith-1.5 发布了一系列参数从 9B 到 397B 的开源大语言模型,在可比模型中实现了最先进的性能,并提供多种部署友好的格式。
本文表明,通过最近邻重叠和ICA差异测量的嵌入空间结构保留,与多个任务上的基准性能强相关,为模型有效性提供了预测指标。
AntAngelMed 是由浙江省卫生健康信息中心、阿里健康(Ant Healthcare)以及安贞儿医疗 AI(Anzhen'er Medical AI)联合开发并开源的全新 1000 亿参数医疗大模型。该模型采用高效的 MoE(混合专家)架构以实现高性能推理,并在 HealthBench 和 MedAIBench 基准测试中取得了领先排名。
Perceptron公司发布了其旗舰视频分析模型Mk1,声称成本比竞争对手低80-90%,同时在空间和视频推理基准上表现出色。
Interfaze 推出了一种混合 AI 模型架构,结合 CNN/DNN 的专项优势与 Transformer 能力,在 OCR 和翻译等确定性任务上实现卓越精度,同时在规模化应用中保持成本效率。