标签
DeepSeek 推出 V4-Pro 和 V4-Flash,支持灵活的推理强度、原生 OpenAI Responses API,以及针对 Codex 优化的智能体工作流,可通过 API 和应用/网页使用。
FAAAH 是一个无依赖、兼容 OpenAI 的代理,它将 API 请求转换为文本文件,并使用像 Claude Code 这样的 AI 编程代理作为后端,从而可以复用现有订阅,而无需为云 LLM API 付费。
Google Cloud API Gateway 现已在公开预览版中提供模型路由,提供一个无服务器入口层,可接受兼容 OpenAI 的请求,并动态路由到 Gemini、Claude 或 OpenAI 模型。
Google Cloud API Gateway 宣布模型路由公开预览,让开发者通过使用 OpenAPI 规范的单一端点访问 Gemini、Claude 和 OSS 模型。
Celeris-1 是一种采用基于扩散的推理架构的新型语言模型,实现了接近 GPT-5 水平的智能,响应速度快 15 倍,吞吐量高。
Hetzner 推出了一项实验性的 LLM 推理 API 服务,提供与 OpenAI 兼容的端点,并搭载 Qwen3.6-35B-A3B-FP8 模型。该服务在实验期间免费,无 SLA,旨在收集用户反馈。
Ramp 正在开源其内部 LLM 路由器,该路由器能根据每个请求自动选择最佳模型,以优化成本和性能。
CLIProxyAPI 是一个为 CLI 提供兼容 OpenAI/Gemini/Claude/Codex/Grok API 接口的代理服务器,现已支持 OpenAI Codex 和 Claude Code 的 OAuth 访问,方便开发者使用本地或多账户进行 CLI 访问。
Mesh LLM 是一个分布式AI计算平台,它聚集多台机器上的闲置GPU来运行大型语言模型,并暴露单一的OpenAI兼容API。该平台利用iroh的点对点网络,实现无需中央服务器的私有、去中心化推理。
GitHub 上又一款开源工具 Shimmy,仅 5MB 单文件,用 Rust 编写,提供快速稳定的本地推理和完整的 OpenAI 兼容 API,直指 Ollama 的痛点,启动不到 100ms,内存占用约 50MB。
opencode-cc 是一个高性能 Go API 代理,将 Anthropic/OpenAI 兼容的协议桥接到 OpenCode Zen 协议,使 Claude Code、Codex CLI 等工具能够透明使用包括 GLM、Kimi、DeepSeek、Qwen 在内的国产大模型,支持自动协议路由、工具调用、Web 控制面板等功能。
一位没有编程背景的钢琴老师,在5个月内自学编程,推出了testyourllm.com——一个自主AI红队测试工具,能够攻击任何兼容OpenAI的LLM端点。在实时测试中,攻击型AI“Tron”首次尝试就攻破了Llama 3.3 70B。
Hugging Face Jobs 现在允许你使用 vLLM 通过一条命令快速启动一个私有的、兼容 OpenAI 的 LLM 端点,无需配置服务器或 Kubernetes。
FreeLLMAPI 是一个开源工具,将 16 家 LLM 提供商的免费额度聚合为一个 OpenAI 兼容端点,自动路由和用量跟踪,每月总计约 17 亿 Token。
我们为AI智能体构建了一个统一API网关,通过单个兼容OpenAI的端点支持Claude、GPT、Codex、Gemini等多种模型。它简化了构建AI智能体和SaaS产品的开发者的集成、计费和部署流程。
ZenMux API 宣布免费提供 GLM 5.2、Kimi K2.7 Code、Step 3.7 Flash 等多个模型,无需信用卡或等待名单,支持 OpenCode、Cursor 等 OpenAI 兼容客户端。
FreeModel.dev提供一个免费API代理,每周赠送66美元的GPT-5.5和Claude Opus额度,并设有推荐奖励。
fm-proxy 是一个即插即用的代理,让任何接受 OpenAI API URL 的应用都能运行 macOS 27 的本地和 Private Cloud Compute Foundation 模型,无需额外服务器或密钥。
开发者将Gemma 4 E4B在Google LiteRT引擎上的表现与Q4 GGUF量化版本进行对比,发现由于多令牌预测(MTP),文本生成速度提升约2.4倍,但图像描述仅提升1.1倍。文章提供了一个面向OpenAI兼容端点的Python封装,但存在确定输出、单会话引擎等限制。
Shimmy is a lightweight single-binary local inference server that provides a drop-in OpenAI-compatible API for running GGUF models, supporting hot-swapping models and requiring no Python dependencies.