标签
Jev,一个结构化文本分类模型,展示了在40秒内仅以0.09美元代币处理37个品牌的724条实时广告的能力,通过并行处理和与Gemini的集成,实现了每条记录216毫秒的中位数延迟。
OpenAI 在 GitHub Copilot 中扩展其 GPT-6 模型系列,推出两个新模型:用于平衡代理编码的 GPT-6 Sol 和用于经济高效任务的 GPT-6 Luna。
介绍 Claude Opus 5.5,这是 Claude 5.5 家族中的第一个模型,其性能达到 Claude Fable 5.1 的水平,但运行成本降低 40%,且速率限制提高。
Jev 是一个能够通过单次 API 调用同时运行九款经典游戏的系统,每小时费用为1.80美元,展示了在实时游戏中的高效 AI 性能。
Jev 是一个新的AI模型,专注于快速决策,提供比前沿大语言模型快20-200倍、便宜40-400倍的性能,由 Diogo Almeida 发布。
ChatGPT的共同发明者宣布发布名为Jev的新AI模型,采用RLCD训练,声称其速度快20-200倍,成本低40-400倍(输出代币免费),并针对可组合智能进行了优化,作为通往AGI的路径。
Occamy-1.0是一个成本效益高的开源AI模型,专为协作代理设计,在复杂多步骤任务中表现出色,并与更大型的前沿系统具有竞争力,同时保持广泛的代理能力。
从头训练了一个小型Transformer模型,仅花费0.67美元就在ARC-AGI-1基准测试上实现了44%的准确率,在速度、准确性和成本效益方面均优于先前方法。
文章讨论了 GLM-5.3-Flash 模型的基准测试对比,重点介绍了其前沿智能和成本效率,该内容来自发布博客文章。
Mixedbread 推出 Toast 1,这是一款专用搜索代理,其质量可与前沿模型媲美,同时成本最高降低 10 倍,速度最高提升 12 倍。它自动化了代理式搜索循环,并在 OfficeQA Pro V2 和法律知识任务等基准测试中取得了最先进的结果。
Raindrop推出由rd-signal-2驱动的Signals 2.0,这是一个从生产轨迹构建任务特定二元分类器的新模型管道。它声称在成本降低1600倍的情况下,实现了接近GPT-5.6 Sol xhigh的准确率,同时还推出了Signal Builder,用于构建自定义分类器,且零数据保留。
据报道,Hark Handoff 在多个基准测试中优于 GPT-5.5 和 Opus 4.8,成本降低 90%,它使用 SFT 和基于 GRPO 的异步强化学习,基础模型未公开。作者对计算机使用代理的延迟表示怀疑,但对演示持乐观态度。
Hark 发布了 AI 模型 Handoff,据报道其在 OM2W 基准测试中取得创纪录分数,以远低于其他顶尖模型的运行成本实现了更优性能。
browser-use 宣布推出由 GPT-5.6 Luna 驱动的新代理,它能阅读 Hacker News 热门帖子并生成完整报告,仅需 3 美分,凸显了 AI 驱动网页浏览的低成本。
阿里巴巴发布 Qwen3.8-Max,一个 2.4T 参数的 MoE 前沿模型,开放权重将于下周推出,声称自主运行16天,成本显著低于 GPT-5.6 Sol 和 Claude Fable 5。
RAG-HAR+ 是RAG-HAR的一种检索优先、成本优化的扩展,用于从可穿戴传感器进行人体活动识别。它利用检索设计器代理和多数投票机制,在降低LLM使用量的同时保持准确率,并展示了边缘部署的可行性。
这本手册教开发者如何构建一个生产级RAG系统,使用Cloudflare Workers、Vectorize和Workers AI,专注于成本效益和可靠性。
Google推出Gemini 3.5 Flash Cyber,这是一款用于漏洞检测的高性价比AI安全模型,同时推出Gemini 3.6 Flash和3.5 Flash-Lite,将其定位为Anthropic的Mythos的更便宜替代品。
本文提出了一种基于GPT-5模型变体的生成式AI辅助摘要框架,以解决自动作文评分中输入长度限制的问题,并在ASAP 2.0数据集上展示了模型能力、摘要保真度和计算成本之间的权衡。
Cognition 发布了 SWE-1.7,一个功能强大的 AI 模型,专为智能体软件工程设计,以更低的成本实现了前沿级别的性能。该模型在强化学习训练、多集群基础设施、数据整理以及针对长任务的自我压缩方面进行了改进。