AI Overviews 让谷歌陷入困境,GPT-Live 将推理置于后台,如何判断你的模型是否具有操纵性
摘要
AI 自动化正将从业者从专业化角色转向更广泛的全栈或全周期岗位,这可能会增加对软件开发、市场营销和招聘等领域高级技能的需求。
The Batch News & Insights: 随着 AI 越来越自动化编程,它使开发人员能够腾出时间从事传统上留给高级工程师的高层软件开发任务,比如决定技术架构和参与产品需求范围的界定。
查看缓存全文
缓存时间: 2026/07/20 09:23
# AI 概览让谷歌陷入麻烦,GPT-Live 将推理置于后台,如何判断你的模型是否在操纵用户
亲爱的朋友们,
随着人工智能越来越多地自动化编码,开发者得以将时间花在传统上由高级工程师承担的高级软件开发任务上,比如决定技术架构和参与产品需求范围界定。对此类工作的需求正在增长,因为它是对编码的经济补充,而编码正变得越来越便宜。这就是为什么我确信,对广泛的人工智能工程技能的需求将会上升。我在其他受人工智能影响的领域也看到了类似的模式开始出现,并且我持谨慎乐观的态度——与“工作末日”的预测相反——我相信人工智能通常会增加对拥有合适技能的人的需求。
以市场营销为例。人工智能有助于起草和编辑营销文案、收集市场数据以及执行非常基础的数据分析。(根据我的经验,即使是前沿模型的分析也常常是错误的。所以,可以使用人工智能帮助你完成数据科学任务,但不要盲目相信它自信满满的结论!)这使得营销人员能够将更多时间花在更高层次的任务上。我看到,与专注于社交媒体营销或文案编辑等狭窄的营销角色不同,天然精通人工智能的营销人员正在崛起,他们帮助从头到尾协调更广泛的营销活动,从构思到多线程执行再到分析经验教训。
正如人工智能正在将许多专业开发者(如前端、后端、移动端等)转变为全栈开发者一样,我看到了早期迹象表明,它正在将更多营销人员转变为全栈营销人员。
或者以招聘为例。一些公司设有不同的角色:寻访员(负责在线寻找候选人)、协调员(负责日程安排)和招聘人员(负责管理招聘流程)。但寻访越来越自动化,协调也部分自动化了。结果,我看到更多精通人工智能的招聘人员自己独立完成整个周期,完成上述所有任务。
随着人工智能进入更多领域,我预计会有更多人在自己的学科内扮演“全栈”或“全周期”角色,这意味着他们将扮演更广泛的角色,整合传统上分离的角色。这能让个人做更多事情,我相信最终会导致对技能的需求增加,以及更高的薪酬。
专业人员在笔记本电脑上协作,桌子旁分布着市场营销和工程团队等多种角色。更广泛的模式是:在许多工作角色中,随着资历的提升,你会更擅长管理集成复杂性——将前端、后端和数据工程等许多不同的工作流编织成一个更大的整体。随着人工智能自动化工作的某些部分(通常是更可验证的部分),它为个人扮演更广泛的角色创造了更多空间。
这种模式并不适用于所有工作角色。在某些角色中,资历提升意味着专业化程度加深。这大致对应于个人在“个人贡献者”职业轨道上发展,而不是管理/技术领导轨道。例如,一位机器学习工程师对某个技术细分领域获得极其深入的理解;一位金融专家从通才金融分析师成长为某个重要领域(如审计跨境交易)的专家;或者一位医生在仅仅一种疾病上建立起深厚的专业知识。在许多(但不是全部)这样的领域中,我预计对人工技能的需求将会增长,但人工智能对任何专业的影响将取决于人工智能崎岖不平的边界在该维度上进展的速度。我会在未来的信中分享更多。
在此期间,我想邀请你思考:回顾2022年,你的团队成员会完成哪些任务?那些很可能是你现在所做工作的补充。因此,如果你能利用人工智能自己完成更多这样的任务——这可能需要学习新技能——这可能是一条利用人工智能变得更有效率的途径。
继续构建!
Andrew
## 来自 DEEPLEARNING.AI 的消息 (http://deeplearning.ai/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX)
新短期课程:使用 Cerebras 实现快速 LLM 推理在 Cerebras 的 Wafer-Scale Engine 上构建实时响应的 LLM 应用程序,从实时个性化到多工具工作流,一次快速响应即可完成。免费注册 (https://www.deeplearning.ai/courses/fast-llm-inference-with-cerebras?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX)
## 新闻
图示:模型中的实时音频处理,带有异步检查和基于回合的消息检查。## 一个模型说话,另一个模型思考
ChatGPT 的语音模式现在可以同时听和说,将针对对话模型的更难问题传递给后台的推理模型。
**最新消息:**7 月 8 日,OpenAI 发布了 (https://openai.com/index/introducing-gpt-live/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX) 一对语音模型——GPT-Live-1 和 GPT-Live-1 mini——它们为重建的 ChatGPT Voice 提供支持。这两个模型同时处理传入和传出的音频,而不是等待一轮结束。电信工程师称之为全双工:传输和接收同时进行,就像电话通话一样,而不是像对讲机那样交替进行。当某个回答需要更深入的思考时,语音模型会将问题交给 GPT-5.5,并在该模型工作时继续说话。该系统取代了高级语音模式 (AVM),后者是一个通过离散回合进行监听、推理和说话的单一模型。
- **输入/输出:** 两个模型都是语音输入、语音输出,进行连续处理,因此输入和输出重叠。在 ChatGPT 中,对话伴随着屏幕上由应用渲染的视觉卡片(天气、股票、体育、地图)。该应用接受图像和文件上传。不支持实时视频和屏幕共享。OpenAI 表示正在努力添加这两项功能,它们在旧版 Standard 和 AVM 中仍然可用。
- **功能:** 实时翻译;九个重新制作的语音,都是预定义的,并配有安全措施,阻止模仿真人的声音;用户可选择 (https://help.openai.com/en/articles/20001274-chatgpt-voice?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX) GPT-Live-1 的推理努力程度(Instant、Medium、High)——Instant 在后台运行 GPT-5.5 Instant,而 Medium 和 High 以相应的努力程度运行 GPT-5.5 Thinking。GPT-Live-1 mini 仅调用 GPT-5.5 Instant。
- **性能:** 在 OpenAI 的测试中,GPT-Live-1 在高推理级别下在 GPQA 上得分为 84.2% (https://epoch.ai/benchmarks/gpqa-diamond?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX),而前代 AVM 为 45.3%;人类评分者在 75.7% 的情况下更喜欢 GPT-Live-1 而不是 AVM,在 69.2% 的情况下更喜欢 GPT-Live-1 mini。
- **可用性:** 现已面向全球在 iOS、Android 和 ChatGPT.com 上可用。GPT-Live-1 是 Go、Plus 和 Pro 计划用户的默认选项,无需额外付费;GPT-Live-1 mini 是免费计划的默认选项。尚未发布开发者 API;目前,OpenAI 的开发者语音选项仍然是 GPT-Realtime-2 (https://www.deeplearning.ai/the-batch/openai-challenges-speech-to-speech-leaders?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX),该 API 于 5 月出现在 Realtime API 中。
- **未公开的信息:** 参数数量、架构细节、训练数据、知识截止日期、延迟测量、基于用量的定价。
**工作原理:** OpenAI 发布了一份 GPT-Live 系统卡 (https://deploymentsafety.openai.com/gpt-live?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX),描述了一个由多个模型组成的系统,它们作为一个整体协同工作。这些语音模型与前代产品有两个不同之处:它们连续处理音频而不是逐轮处理,并且将更深入的工作交给一个单独的模型。
- 每个 GPT-Live 模型在处理传入音频的同时生成自己的输出,每秒多次决定其下一个动作。这些动作包括说话、倾听、等待、打断、进行反馈 (https://www.researchgate.net/publication/328415682_Listening_to_Real-World_English_Part_3_Backchanneling?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX)(发出“嗯”、“是的”等表示倾听的信号),或触发一个工具。
- 当某个问题需要网络搜索、更深入的推理或使用工具进行多步骤工作(在多个轮次中查找信息并据此采取行动)时,语音模型将任务交给 GPT-5.5,在该模型运行时继续说话,并将结果编织回来。这两个模型共享对话上下文,但被分别编排和服务。OpenAI 表示,当新的推理模型推出时,它将把 GPT-Live 指向这些模型。
- 安全检查与对话同时运行。系统会检查正在进行的输入和输出,并可以引导或中断回复、播放口头的安全消息、以文本或语音形式在屏幕上显示支持资源,或者在较高风险的情况下结束对话。
**性能:** 在 OpenAI 的评估中,最大的改进出现在路由到 GPT-5.5 的任务上,委托系统按设计工作。OpenAI 发布的每一项比较都将 GPT-Live 与自己的前代产品 AVM 进行比较,而不是与竞争对手的语音模型进行比较,其最强有力的说法依赖于内部基准。
- 在 GPQA(涵盖生物学、化学和物理学的研究生水平科学知识)上,GPT-Live-1 在高推理级别下得分为 84.2%,而 AVM 为 45.3%。
- 差距在 BrowseComp 上更为明显 (https://openai.com/index/browsecomp/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX)(针对难找事实的智能体网络搜索):GPT-Live-1 在高推理级别下正确回答了 75.2% 的问题,而 AVM 仅为 0.7%。
- 人类评分者在 75.7% 的情况下更喜欢 GPT-Live-1 的对话质量而不是 AVM,在 69.2% 的情况下更喜欢 GPT-Live-1 mini,这是在匹配的 5 到 10 分钟对话中进行的排名,涵盖了总体偏好、轮流说话、打断和对话流畅性。
- 两个 GPT-Live 模型在标记不允许的内容方面都优于 AVM,在不法行为(GPT-Live-1 为 97%,AVM 为 74%)和自伤(96% 对 89%)方面有显著提升。在对抗性提示方面的提升更为明显:GPT-Live-1 标记了 84% 与心理健康相关的查询,而 AVM 为 57%;对于自伤相关查询,GPT-Live-1 标记了 98%,而 AVM 为 72%。
**新闻背后:** GPT-Live 设计的两个部分(全双工处理和推理模型编排)都有先例。阿里巴巴的 Qwen2.5-Omni Thinker-Talker (https://www.deeplearning.ai/the-batch/qwen2-5-omni-7b-raises-the-bar-for-small-multimodal-models?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX) 架构将一个文本生成的“思考器”和一个语音的“说话者”训练成一个系统。Thinking Machines Lab 在 TML-Interaction-Small (https://www.deeplearning.ai/the-batch/built-in-conversational-interactivity?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX) 中将一个前台交互模型与一个后台推理器配对。Kyutai 的 Moshi (https://kyutai.org/blog/2024-07-03-meet-moshi/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX),被其作者称为“首个实时全双工语音大语言模型”,于 2024 年推出;Nvidia 于 1 月发布了基于 Moshi 的开源权重模型 PersonaPlex (https://research.nvidia.com/labs/adlr/personaplex/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX);而 Google 的 Gemini Live 目前提供 (https://gemini.google/overview/gemini-live/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX) 连续对话以及摄像头和屏幕共享。OpenAI 可以声称它将这一组合提供给大规模受众;该公司表示,每周有超过 1.5 亿人使用 ChatGPT 的语音和听写功能。
**为什么重要:** OpenAI 在语音系统上的投资可能预示着更广泛的雄心。根据 *Bloomberg* 的报道,该公司计划在今年年底前推出一款便携式、无屏幕的智能音箱 (https://www.bloomberg.com/news/articles/2026-07-14/openai-s-first-device-will-be-moveable-screenless-speaker-built-as-ai-companion?accessToken=eyJhbGciOiJIUzI1NiIsInR5cCI6IkpXVCJ9.eyJzb3VyY2UiOiJTdWJzY3JpYmVyR2lmdGVkQXJ0aWNsZSIsImlhdCI6MTc4NDEzMTUzOCwiZXhwIjoxNzg0NzM2MzM4LCJhcnRpY2xlSWQiOiJUSTYwSllUOU5KTFMwMCIsImJjb25uZWN0SWQiOiJFNDUxRjJDRDc0MTg0MDI2QTYxMTZFMkQ3MjU0RDkzNyJ9.veSm2iNRiwnMjtFQ5d1KE9yc-yPE7gd7LpZB9TdI7L4&utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-9ZESiGFnscLUwIW_gCW7ttx4uGiDRVtC_fVxShqWJ9BmAIpRKiMjr9dHrnCgJ6cIYnWweX),完全依赖 GPT-Live 语音交互,设备将于 2027 年初上市。据报道,该设备将随着时间的推移学习更多关于用户的信息,从而实现高度个性化的交互,并利用比目前市场上的智能音箱更强大的人工智能模型。OpenAI 的战略取决于它能否成功地将语音打造为日常生产力的首要界面。
**我们的想法:** 任何发布过语音系统的人都花了多年时间从外部进行回合检测:调整静音阈值、填充定时器、猜测停顿是否意味着说话者已经说完或只是在思考。全双工并不会使这种猜测变得更好;它使这种猜测变得多余,因为模型会时刻决定是否说话、等待,或只是发出一个“嗯”。不过,这里不那么引人注目的设计选择从长远来看可能更重要。由于对话层与推理层解耦,GPT-Live 继承了每一个前沿模型的改进,并且它永远不必在快速响应和深入思考之间做出选择。全双工让语音变得愉悦地交谈;委托则让它值得交谈。
---
一个线条锐利的德国鹰徽被叠加在色彩缤纷的谷歌标志上,象征着法律案件。## 谷歌因 AI 生成的搜索结果被认定负有责任
一家德国法院裁定,谷歌可以为其 AI 概览(显示在搜索结果顶部)生成的不当言论承担法律责任。
**最新消息:** 慕尼黑地区法院 (https://www.dw.com/en/german-court-holds-google-liable-for-fake-ai-answers/a-77527661?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc) 裁定,谷歌可能对 AI 概览生成的虚假 AI 答案负责。该案件涉及一篇关于房地产投资的文章,其中提到了原告。当用户搜索原告姓名时,AI 概览生成了一段虚假的陈述。法院认为,谷歌作为信息社会服务提供商,有义务检查 AI 概览是否包含非法内容,并可能因未能做到这一点而承担损害赔偿责任。谷歌表示将上诉。
相似文章
了解人工智能经济(7分钟阅读)
谷歌启动ATLAS大型研究,分析1500万次AI交互,以了解人们在工作和日常生活中使用AI的方式,揭示出广泛但浅显的采用,并强调协作使用而非自动化。
AI求职面试催生了一个全新行业
本文探讨了为AI职位提供的付费辅导和面试准备服务这一日益增长的行业,其背后是OpenAI、Anthropic和Google DeepMind等公司的高需求和激烈竞争。
关于AI就业的争论变得更加混乱
Ramp和Revelio Labs的一份报告发现,大力投资AI的公司人员增长更快,包括初级岗位,这反驳了AI导致失业的担忧,尽管数据偏向于技术前沿公司。
面对Anthropic压力,Google加码推进智能体AI
来源:[Google Creates Strike Team to Improve Coding Models — The Information](https://www.theinformation.com/articles/google-creates-strike-team-improve-coding-models)
AI抢走了我的工作!接下来怎么办?- Ajey Gore
Ajey Gore探讨了AI如何通过自动化类似翻译的任务同时增强判断工作来重塑技术角色,并逐角色分析了哪些部分发生了变化,哪些得到了增长。