标签
GPT-6 Sol 和 GPT-6 Luna 今日面向 ChatGPT Work 和 Codex 用户推出,涵盖 Plus、Pro、Business、Enterprise 和 Edu 等级。
这条推文对比了AI模型性能的持久性,暗示OpenAI模型在发布初期表现优异,之后会退化,而Anthropic的Claude则能保持稳定。
一条推文质疑 AI 模型中从 Opus 5 到 Opus 5.5 的版本跳跃,询问这是否是正常的序列实践。
据称,开源MiMo v2.6模型建立了新的帕累托前沿,在基准测试中成本比Grok 4.7低57倍,比DeepSeek v4.1 Flash便宜27%。
据报道,名为GPT-6 Sol、Luna和Astra Minor的新AI模型出现在Microsoft的Azure模型配置中,这暗示了即将发布或集成的可能性。
JevBench v1.3.0 是一个用于Jev类决策模型的可复现基准测试,基于智能性、校准度、速度和成本对52个系统进行评估和排名。
文章质疑阿里巴巴是否放弃了其35B A3B MoE模型,指出在Qwen 3.8发布之际,没有新的小规模MoE模型公告。
一位用户发现了一个代理,提供每天最多20小时免费访问 GLM 5.3 Flash 和 DeepSeek 4.1 Flash AI 模型,对 GitHub 注册和连续使用有额外奖励,无需支付信息。
作者创建了一个猫咪生存游戏来测试AI模型Jev和Laya的性能,发现Jev更准确但较慢,而Laya很快但不准确,并计划为这类模型开发一个排行榜。
Qwen4 系列 AI 模型,包括 Qwen4-Max、Qwen4-Flash&Qwen4-Plus 和 Qwen4-27B,即将推出,参数规模前所未有的达到5T至10T级别,在 Yunqi Conference 上进行了预览。
一个综合性的网站,汇集了免费使用的AI资源,包括主流模型、图像生成工具、编程辅助工具和本地部署选项,旨在帮助用户节省寻找AI工具的时间。
Anthropic 报告了影响 Claude 模型(包括 Mythos 5.1、Fable 5.1 和 Opus 5)的错误率上升,这些问题在影响了 Claude API 和 Claude Code 等服务后已得到解决。
Elon Musk 发推文回应用户 Auggie,后者报道称 Grok 4.7 在音乐错误检测测试中获得 100% 的分数,与 GPT-6 Astra 的表现相当。
Jev 和 SemIf 等 AI 模型正在优化软件中的 if-then 决策过程,从而大幅降低成本并提高准确性,这突显了专业化其他编程原语的潜力。
发布最新AI模型的全面基准测试,包括Grok 4.7、GPT 6、Astra Fable 4.1和DeepSeek V4.1 Flash,以提供公正的比较。
《The Information》的报道指出,AI模型正在协助OpenAI进行AI训练,如果属实,可能预示着AI开发的重大进展。
一位用户使用Zhipu GLM 5.3 Flash和curl_cffi绕过Cloudflare封锁,以在JoMu RSS阅读器中启用YouTube视频摘要。