标签
MiniMax发布了M3,一个开放权重模型,结合了前沿编码、1M上下文和原生多模态能力,性能与Opus相当,但成本仅为其一小部分。
AI教学工具首个Skill“立体几何解题”发布,支持文字解题、图片解题和随机出题,测试显示deepseek-v4-pro性价比高,甚至部分题目准确率超过GPT5.5。
Greg pr07 宣布了一种新的浏览器基础设施,采用自定义Firecracker虚拟机、Chromium分支和裸金属,成本降低高达6倍,亚秒级冷启动,支持10,000个并发浏览器。
本文提出了一种基于轻量级多模态LLM的框架,用于电力传输设备的成本效益缺陷分级,利用上下文学习和思维链生成训练数据,并对Qwen3-VL-8B进行微调,实现了最先进的性能。
DeepSeek宣布其V4-Pro API永久降价75%,每百万缓存输入令牌仅0.003625美元,输出0.87美元,比OpenAI的GPT-5.5便宜约34倍。该模型拥有1.6万亿参数但仅需490亿活跃参数,支持100万令牌上下文,在编码和推理基准测试中表现领先。
Composer 2.5 在 CursorBench 上达到 63.2%,每个任务仅需 $0.55,几乎以 20 倍低的成本匹配顶级模型。
谷歌的 Gemini 3.5 Flash 模型在 Zapier 的 Automation Bench 上排名第一,以显著更低的成本超越了其他前沿模型。
使用开源模型构建了比 CodeRabbit 更便宜的替代方案,以六分之一的成本实现了相似或更好的 PR 审查准确性,并具备自动修复和基于提示的 bug 修复等功能。
作者演示了,通过使用开源模型和Codex编排进行高性价比微调,小型垂直语言模型(6B-15B)能够在细分基准上超越顶级大语言模型,仅用价值300美元的数据集就取得了成果。
谷歌发布 Veo 3.1 Lite,这是一款高性价比的视频生成模型,现已可通过 Gemini API 调用。相较于 Veo 3.1 Fast,其调用成本降低 50%,且生成速度保持不变。该模型支持文生视频与图生视频,并提供灵活的分辨率与画面比例选项。
Anthropic 宣布推出 Claude Opus 5,这是一款强大且经济高效的 AI 模型,其智能水平接近 Claude Fable 5,但价格仅为后者的一半,在编程和知识工作基准测试中取得了最先进的结果。