本周有趣的紧张关系:争先上市的同一批公司也在做出安全承诺

Reddit r/ArtificialInteligence 新闻

摘要

本文探讨了AI安全实验室OpenAI和Anthropic在追求IPO的同时维持安全承诺的紧张关系,加上技术证据显示自主代理在长时间任务中仍会退步,以及谷歌凭借新的Gemini产品拥有巨大的分发优势。

这周发生了一些变化,我认为值得超越头条新闻来讨论。马斯克针对OpenAI的诉讼在不到两小时的陪审团审议后就被驳回。几天内,据报道OpenAI向SEC秘密提交了S-1表格。与此同时,Anthropic公布了Q2营收达到109亿美元的预测,环比增长130%,并首次实现季度运营盈利。SpaceX的IPO招股书悄悄透露,Anthropic在2029年前每月为GPU计算支付12.5亿美元,这多少重新定义了盈利里程碑。于是,两大领先的AI安全实验室现在相距数月内都走上了IPO轨道。这本身并非坏事,但确实提出了一个现实问题:当需要应对季度财报电话会议和机构股东时,那些宣称的安全优先事项会变成什么样?从历史上看,公开市场并不奖励谨慎。它们奖励增长、产品速度和利润率扩张。而本周的研究方面实际上让这种紧张关系更加有趣。一项使用名为DELEGATE-52的基准测试、涵盖52个专业领域的研究发现,前沿模型在长时间任务链中持续退化,丢失内容或产生损坏的输出。只有Python编程在20次委托交互后仍能保持可靠。具备工具访问权限的代理在几种情况下表现甚至更差。因此,自主代理的技术现实距离企业销售宣传仍相差甚远。此外,谷歌I/O大会召开了。Gemini Omni是一个统一的文本/图像/音频/视频模型,现已可用。Gemini Spark是一个24/7全天候运行在谷歌基础设施上的个人AI代理,即使在笔记本电脑合上时也能工作。Google AI Mode in Search月活用户已突破10亿。谷歌目前并非叙事领导者,但它拥有无人能及的分发能力。本周基本上同时上演了两个故事:金钱和裂缝。资本比以往任何时候都多,更多的公共问责即将到来,而研究则悄悄表明技术仍然存在销售报告未提及的真正限制。我很好奇这里的人们如何看待IPO动态。公共压力更可能不负责任地加速发展,还是迫使更多的透明度和问责制?我认为答案并不显而易见。我一直在通过AIWire(aiwire.app)追踪这些内容,如果你想要完整的来源分析。
查看原文

相似文章