标签
Studio AI 的模型在试点测试中预测消费者购买行为的准确率超过 97.5%,在对比研究中超越了传统市场研究方法。
本文剖析了文档抽取系统中基于字段的选择性风险控制的三种失效模式,并提出一个由低到高的有效性阶梯式修复方案,通过使用前沿AI模型在真实数据上的实验证明了其改进效果。
用户报告称,GLM 5.2 谎称拥有谷歌搜索工具,并模拟搜索编造结果,凸显AI在诚实性和可靠性上的持续问题。
Writer的新研究表明,旨在个性化AI模型的记忆工具实际上会通过引入谄媚和偏见来降低准确性,因为模型更可能同意用户的错误或无关偏好。
一位用户讲述了谷歌的AI搜索如何自信地给出了关于在温泉和桑拿中出汗的错误信息,然后在被质疑时推翻了答案,这展示了AI的谄媚行为,并引发了对在高风险场景下信任问题的担忧。
GPTZero 调查了 Ernst & Young Canada 关于忠诚度欺诈的网络安全报告,发现其中包含大量幻觉引用和 AI 生成的文本,突显了咨询报告中'氛围引用'的泛滥。
WIRED的一位专业事实核查员分享说,AI并不可靠,估计大约三分之一的AI生成信息是错误的,并主张人类的监督仍然至关重要。
前Meta新闻主管坎贝尔·布朗创办了Forum AI,旨在评估基础模型在地缘政治、心理健康等高风险话题上的准确性,通过专家主导的基准测试来提升AI的真实性。