评估了两个模型在同一个分类任务上的表现,其中一个将卡拉OK之夜标记为音乐活动

Reddit r/AI_Agents 新闻

摘要

对GPT-4o-mini和GPT-4o在事件分类系统上的评估显示GPT-4o表现更好,但两个模型的置信度分数在实际决策中都不可靠。

为发现平台构建了一个事件分类系统。每个事件在14个维度上评分,包括类型、子类型、能量、情感基调、纹理等所有方面。我在信任任何模型投入生产之前,对251个真实事件进行了正式评估。GPT-4o-mini的失败方式可能会悄无声息地扼杀产品。52.5%的事件被归类为eclectic / open format,这是模型版本的耸肩。当一半目录共享一个标签时,类型过滤就无用了。它还实现了0%的非音乐过滤,因此问答之夜、卡拉OK和保龄球都被分类为音乐事件而不是被排除。一半事件的子类型字段为空。GPT-4o在相同任务上:19.1% eclectic,100%非音乐过滤,98%子类型填充。生产就绪,但这里有一个适用于每个代理构建的发现。两个模型将置信度分数固定在0.90,应用于超过90%的事件。置信度字段是装饰性的。你无法用它将不确定的案例路由到人工审查,这正是你首先要求置信度分数的全部原因。我不断重新学习的教训是:“在测试中看起来正确”并不是评估。在发布前统计真实数据上的失败,并将自报置信度视为不可信,直到你检查了其分布。有没有人拥有一个真正有效的置信度校准方法,还是每个人都在从模型自身的数字之外派生不确定性?
查看原文

相似文章

GPT-4o 系统卡

OpenAI Blog

OpenAI 发布了 GPT-4o 系统卡,详细介绍了在网络安全、生物威胁、说服力和模型自主性等方面的全面安全评估和风险缓解措施。这个多模态模型在准备框架类别中得分为低至中等,并为音频功能采用了新颖的防护措施。

Hello GPT-4o

OpenAI Blog

OpenAI发布GPT-4o,一个功能全面的多模态模型,可实时处理音频、视觉、文本和视频,平均音频响应延迟为232毫秒。该模型在文本和代码能力上与GPT-4 Turbo相当,同时显著改进了多语言、音频和视觉功能,API成本降低50%。

OpenAI GPT-4.5 System Card

OpenAI Blog

# GPT-4.5 系统卡 来源:[https://openai.com/index/gpt-4-5-system-card/](https://openai.com/index/gpt-4-5-system-card/) 我们正在发布 OpenAI GPT-4.5 的研究预览版,这是我们迄今为止规模最大、知识最丰富的模型。GPT-4.5 建立在 GPT-4o 的基础上,进一步扩展了预训练规模,设计目标是比我们强大的 STEM 焦点推理模型具有更广泛的适用性。我们采用新的监督技术结合传统方法(如监督微调 (SFT))来训练该模型