中国挫败Meta的自主智能体雄心,美国评估即将推出的模型,AI诊断乳腺X光片

The Batch 产品

摘要

吴恩达推出AI Andrew,这是一个模仿其个性的AI伴侣,基于RAG和代理工作流构建,并邀请用户试用。

The Batch AI新闻与见解:我们一直在开发AI Andrew,这是一个由我的个性塑造的AI伴侣。
查看原文
查看缓存全文

缓存时间: 2026/05/16 00:14

# 中国挫败Meta的智能体野心,美国评估新模型,AI诊断乳腺X光片 来源:https://www.deeplearning.ai/the-batch/issue-353 亲爱的朋友们, 我们一直在开发AI Andrew,一个由我的个性塑造的AI伙伴。我邀请你去试试看 (http://avatar.andrewng.org/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B)。 许多人都想了解AI对他们的工作、学习和职业生涯意味着什么。我经常喜欢与人谈论这些话题。如果你想就此进行对话,你可能会发现AI Andrew是一个有用的思考伙伴,甚至可能是一个朋友——一个你可以与之谈论AI概念、项目想法、职业决策以及你心里想的任何其他事情的人。 我的团队已经迭代开发AI Andrew好几个月了,我们使用错误分析流程来找出它说出我不会说的话的情况,并调试我们的智能体框架以试图缩小差距。我的沟通风格是经过成千上万次互动多年塑造而成的。我以前从未尝试过将其编码到一个智能体工作流中。事实证明这很难,并且仍在进行中。 反思我关于如何沟通的信念,是一次有趣的练习。我相信: - **尊重个体。*** * 我非常尊重几乎所有与我交谈的人,无论他们的经验水平或人生阶段如何。我希望这在我的每一次沟通中都能体现出来。 - **庆祝胜利。** 许多人都有胜利,无论是大的(比如找到新工作或建立新关系)还是小的(比如一段代码终于跑通了)。我喜欢听到并庆祝你们的胜利! - **对你认为重要的事情保持同理心。** 我希望帮助他人实现他们的梦想。对我来说,重要的是你的梦想——而不是任何人对你的期望——成为焦点。在符合道德行为的前提下(如果我看到问题,我会礼貌地提出异议),我希望AI Andrew也能支持你的目标。 - **技术精确性。** 作为技术领导者,我致力于准确陈述技术和科学问题。 Andrew Ng的插图头像,穿着浅蓝色衬衫,带有验证徽章,代表AI Andrew。- **以精心校准的信心表达观点。** 如果我不确定该说什么,我会尝试提问,而不是做出陈述。在我们的错误分析中,我们发现许多LLM过于急切地给出建议,尽管缺乏上下文。在现实生活中,我只有在相当确信建议是正确的时候才会给出建议(比如“请考虑技术X!”)。否则,我更愿意提出一个问题,帮助对方得出一个好的答案(“你认为应用技术X怎么样?”或者“你认为这里最适合应用哪种技术?”)。这种方法利用了他们和我的背景信息来帮助他们做出更好的决策,而不是过分强调我对其情况的有限了解。 我仍在学习如何更好地进行对话,以支持他人追求自己的目标。我们在框架中使用了大量混合技术,包括RAG和许多其他工具,混合使用小型和大型模型,护栏,广泛的评估,短期和长期记忆,以及离线智能体循环,这些循环会自动向系统提出改进建议。 需要澄清的是,AI Andrew仍有不足!例如,最近一位内部测试人员让它幻觉出爬过一些山,遗憾的是,我没有爬过那些山,它偶尔也会给出我质疑的建议。尽管如此,许多用户报告说通过与AI Andrew交谈获得了新的见解,我希望你会觉得它(他?)是一个友好的伙伴,你可以与之谈论个人和职业事务。 如果你想试试,请告诉我(以头像形式)(http://avatar.andrewng.org/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B)你在想什么! 继续构建, Andrew --- ## 来自DEEPLEARNING.AI的消息 (http://deeplearning.ai/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B) DeepLearning.AI和AMD联合推广的课程鼓励更深入地理解LLM并提升应用技能;立即注册。 (https://www.deeplearning.ai/courses/transformers-in-practice)超越使用LLM,去理解它们的工作原理!在*Transformers in Practice*课程中,你将学习Transformer如何生成文本、处理上下文,以及如何使用注意力机制、KV缓存和量化高效运行。获得DeepLearning.AI Pro成员证书。立即注册 (https://www.deeplearning.ai/courses/transformers-in-practice?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B) ## 新闻 图表比较了美国和中国的AI模型性能随时间的变化,突出了Elo得分和增长趋势。## 美国将评估即将推出的模型 美国政府表示,将在尖端模型向公众开放之前对其进行评估,这与白宫早先的不干预政策形成了鲜明对比。 **最新进展:** 美国国家标准与技术研究院(NIST),作为美国商务部的一个下属机构,宣布 (https://www.nist.gov/news-events/news/2024/11/us-ai-safety-institute-establishes-new-us-government-taskforce-collaborate?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B)一个新的跨机构工作组将评估AI模型在部署前可能带来的国家安全风险。美国领先的AI公司同意在发布前提交模型进行评估。此外,白宫正在考虑 (https://thehill.com/policy/technology/5866292-white-house-ai-evaluation-process/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B)一项行政命令,要求AI模型在部署前必须获得批准。 **工作方式:** NIST表示,测试将侧重于网络安全、生物安全和化学武器方面的可证明风险。政府没有透露与AI公司协议的具体细节,也没有说明根据测试结果预计会对模型施加何种控制。 - 模型将由“测试人工智能国家安全风险”(TRAINS)进行评估,该小组由NIST下属的“人工智能标准与创新中心”(CAISI)监督。TRAINS与已披露的其他NIST小组不同之处在于,它旨在快速响应,并利用了多个联邦机构,包括商务部、国防部、能源部、国土安全部、国家安全局和国家卫生研究院。 - TRAINS尚未透露其打算使用的基准。然而,NIST已经分享了CAISI早期对DeepSeek V4 Pro与其他大型语言模型的比较 (https://www.nist.gov/news-events/news/2026/05/caisi-evaluation-deepseek-v4-pro?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B)。CAISI根据九个广泛使用的公共基准(涵盖网络安全、编程、数学、自然科学和抽象推理)以及一个名为PortBench(在不同编程语言之间移植命令行界面工具)的内部测试的汇总结果,对模型能力进行了排名。 - Google、Microsoft和xAI同意 (https://x.com/AndrewCurran_/status/2053988980975120785?s=20&utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B)提供具有有限或缺失护栏的模型,而Anthropic和OpenAI在2024年已同意 (https://www.nist.gov/news-events/news/2024/08/us-ai-safety-institute-signs-agreements-regarding-ai-safety-research?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B)类似条款。这些协议将使得能够对能力、风险以及风险缓解进行公私合作的评估研究。 **新闻背景:** 这一突然的政策转变标志着特朗普政府此前专注于消除拜登时代阻碍AI创新的监管障碍的重大背离。大约在一个月前,Anthropic宣布其尚未广泛可用的Claude Mythos Preview模型能够利用广泛使用的软件中的漏洞,引起了政府的注意。 - 特朗普总统在2025年1月上任后立即指派 (https://www.deeplearning.ai/the-batch/how-the-white-houses-action-plan-aims-to-build-ai-leadership-infrastructure-and-innovation?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B)三位关键顾问制定一项AI行动计划,旨在通过暂停或废除拜登总统制定的监管政策来“维持和增强美国在全球的AI主导地位”。2023年,拜登政府发布 (https://www.deeplearning.ai/the-batch/all-about-the-u-s-executive-order-on-ai-use-and-development?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B)了一项行政命令,要求开发者训练处理需求大致相当于1万亿参数的模型时通知政府。 - 2026年3月,Anthropic试图限制Claude在监视和自主武器方面的军事用途。白宫拒绝了任何限制,并完全禁止 (https://www.deeplearning.ai/the-batch/secretary-of-war-pete-hegseth-calls-claude-a-security-risk-replaces-it-with-gpt-models?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B)该模型在军事上的使用。 - 次月,Anthropic宣布 (https://www.deeplearning.ai/the-batch/why-claudes-advanced-mythos-preview-model-will-be-limited-release-only?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B)Claude Mythos Preview能够自主利用主要操作系统和应用程序中的漏洞。该公司已与50个组织共享了Mythos,用于检测和修补其软件。 - 上周,白宫表示反对 (https://www.wsj.com/tech/ai/white-house-opposes-anthropics-plan-to-expand-access-to-mythos-model-dc281ab5?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B)该公司计划将预览范围扩大到另外70个组织,理由是对国家安全以及Anthropic是否有足够的算力来服务现有Mythos用户和政府表示担忧。该公司尚未声明是否打算挑战政府限制预览模型分发的权力。 **为何重要:** 白宫从对AI模型采取自由放任态度转向发布前审查,反映了AI模型已经强大到足以对国家安全构成即时威胁这一正在显现的现实。要求AI开发者在向公众发布之前测试先进模型,可以让政府提前获知潜在问题,并激励AI开发者主动管理这些问题。这也将使政府能够决定哪些模型适合更广泛的分发,哪些必须被保留或修改(原因可能不透明)。AI公司目前尚未被要求提交新模型进行政府测试,那些已同意这样做的公司也是自愿的。然而,官员们正在考虑一项将强制要求此类测试的行政命令。 **我们的思考:** 一套标准化的基准测试,全面且按照一致的程序进行,对AI行业是有益的,但我们认为,制定这些测试的正确方式是通过自由市场,而不是由政府强加。此外,要求发布前进行政府测试会减慢美国开发者的速度,使他们相对于其他国家的同行处于竞争劣势,并可能通过监管俘获帮助他们挫败开源竞争对手。 --- 图表显示了GPT-Realtime-2在各领域的性能,与其他语音到语音模型竞争。## OpenAI挑战语音到语音领导者 OpenAI的语音到语音模型更新让开发者可以调节速度与推理之间的权衡。 **最新进展:** OpenAI在其Realtime API中引入了 (https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/?utm_campaign=The%20Batch&utm_source=hs_email&utm_medium=email&_hsenc=p2ANqtz-8cuiiVLnATemCGAdKNDtup_GrEhEHsJhdlDTkYIM8n8XIaDVGXJd-FTXYiQ4OZoijxg67B)三款新的音频模型。GPT-Realtime-2是一个具有可配置推理工作量的语音到语音模型。GPT-Realtime-Translate可在超过70种输入语言和13种输出语言之间进行语音翻译,GPT-Realtime-Whisper则将语音转录为文本。 - **输入/输出:***GPT-Realtime-2*文本、音频、图像输入(最多12.8万个Token),文本、音频输出(最多3.2万个Token,最小推理时首段音频延迟1.12秒,高推理时为2.33秒);*GPT-Realtime-Translate*音频输入(最多1.6万个Token),音频输出(最多2000个Token);*GPT-Realtime-Whisper*文本音频输入(最多1.6万个Token),文本输出(最多2000个Token) - **知识截止日期:** 2024年9月30日 - **GPT-Realtime-2 功能:** 五个推理工作量级别(最小、低、中、高、极高),并行工具调用,工具调用的旁白,可选的引言,对问题输入的良好处理,语气(态度)控制,函数调用 - **GPT-Realtime-2 性能:** 在Scale AI的Audio MultiChallenge音频输出排行榜和Artificial Analysis Conversational Dynamics中排名第一,在Artificial Analysis Big Bench Audio中并列第三 - **可用性:** 通过OpenAI Realtime API - **价格:***GPT-Realtime-2* 输入/缓存/输出音频Token每百万32美元/0.40美元/64美元,输入/缓存/输出文本Token每百万4美元/0.40美元/24美元,输入/缓存图像Token每百万5美元/0.50美元;*GPT-Realtime-Translate* 每分钟0.034美元;GPT-*Realtime-Whisper* 每分钟0.017美元 - **未公开:** 参数数量、架构、训练数据和方法 **GPT-Realtime-2如何工作:** GPT-Realtime-2将音频输入和音频输出作为一个端到端的过程(包括推理)来处理,而不是分开的语音到文本、文本生成和文本到语音步骤。 - API参数设置推理工作量。“低”是默认值,旨在为实时对话最小化延迟。更高的推理工作量会增加延迟和推理Token的消耗。 - 在工具调用期间,模型可以使用口语化的短语(如“正在检查您的日历”或“正在查询”)来旁白其工作进度。可选的引言(如“让我检查一下”)可以放在对提示的响应之前,以便用户在模型推理时跟踪进度。 - 当模型无法完成请求时,它会通过短语(如“我现在遇到了问题”)提醒用户,而不是保持沉默。 **GPT-Real**

相似文章

@rohanpaul_ai:中国的 AI 竞赛正逐渐从“模型能力之争”转向“应用落地之争”。阿里巴巴 Qwen App 展示了……

X AI KOLs Following

本文分析了中国 AI 战略如何从模型能力转向大规模应用落地,重点介绍了阿里巴巴 Qwen App 作为深度融入工作流的工具,是如何嵌入日常专业与消费者任务的。文章将该路径与西方聚焦独立研究助手的方式进行了对比,指出中美 AI 发展路径正呈现分化趋势。