标签
Desert Ant Labs,一家欧洲人工智能实验室,推出一套用于音频、视觉和文本的小型专用设备端模型,通过在设备本地运行,提供快速推理和隐私保护。
VDN-Minimax-H3 是一款开源混合注意力模型,能够在几乎无损的质量下加速视频生成,具有快速推理和即插即用适配器的特性,由 MiniMax H3 提供支持。
Viggle-Animate 是一款 AI 模型,仅使用单张重绘帧即可替换视频中的角色,无需复杂的中间表示,即可实现高效准确的动作迁移。
Fast Inference 是一项 LLM API 服务,为开发者提供快速且经济实惠的访问顶级开源和闭源模型的服务,并集成了编码代理和工具如 Claude Code 和 Codex。
IBM发布两款新的紧凑型AI模型Granite Speech 5.0 Turbo CTC,用于极快且准确的英语语音转录,在NVIDIA H200 GPU上实现超过12,600 RTFx。
用户赞扬 Ling 3.0 Tiny AI 模型在低端 PC 上快速高效,并将其与 Qwen 3.5 9b 和 Gemma 12 等模型进行了有利的比较。
Molei Tao 介绍了 FLARE,这是一种扩散语言模型,其性能接近 GPT5,且推理速度显著更快。
Liquid AI发布了两个新的编码器模型,LFM2.5-Encoder-230M和LFM2.5-Encoder-350M。这些模型快速、易于训练且多语言能力强。速度基准测试显示,与ModernBERT-base相比,CPU性能提升了3.7倍以上。
投资者Matt Shumer的一条疯传帖子通过有效展示快速推理的价值,极大地推动了Groq的业务,而Groq创始人Jonathan Ross多年以来一直难以传达这一点。
Google DeepMind 发布了 Nano Banana 2 Lite(也称为 Gemini 3.1 Flash Lite Image),定位为最快、最便宜的 Gemini 图像模型,专为速度和规模优化。
Mimo 2.5 使用双 RTX Pro 6000 GPU 展示了在大上下文窗口下的快速性能。
Google推出DiffusionGemma,这是一个实验性的26B MoE开源模型,通过文本扩散技术,在GPU上实现高达4倍的文本生成速度提升,针对速度要求高的交互式本地工作流。
Mosaic是一个概率天气模型,其预报技巧与最先进的模型相当,同时在单个H100上能在12秒内生成24个成员的10天全球预报。
Santiago (@svpino) 强调 MiniMax-M2.7,一个 230B 参数的开源权重模型,能与 Opus 4.6 和 GPT-5.4 等顶级专有模型相抗衡,在 SambaNova 上以低成本实现 440+ tokens/s 的推理速度。
百度发布了ERNIE-Image-Turbo,一个蒸馏文本到图像生成模型,可在8步推理中实现快速生成,同时保持强大的文本渲染、指令遵循和结构化图像生成能力。
OpenAI 推出 GPT Image 2.5 系列图像生成模型,包括高质量旗舰版 Sunburst 和极速版 Flare,现已在 API、ChatGPT 和 Codex 平台上线。
P-Image 是 Pruna 的文本到图像生成模型,可在不到一秒内生成最先进的图像,兼具速度、经济性和高质量。
Pruna的p-image-edit是一款运行在Replicate平台上的高端AI模型,能够在一秒内快速完成业界领先的图像编辑,兼具速度、经济性和高视觉质量,精准遵循提示词并具备强大的文字渲染能力。