@MSFTResearch:大规模评估智能体行为,倡导以仓库替代文档,并邀请全球研究者共同应对价值对齐挑战…

X AI KOLs Following 新闻

摘要

微软研究院最新通讯重点介绍了AgentPex(一个用于自动评估智能体行为的开源系统);关于排序系统方差缩减的新理论工作;呼吁从文档转向仓库以促进人机协作;以及一项关于AI价值对齐的全球挑战。

大规模评估智能体行为,倡导以仓库替代文档,并邀请全球研究者共同应对价值对齐。深入研究最新一期Research Focus。https://t.co/avaAdeIODF https://t.co/Uh6EoIr8sH
查看原文
查看缓存全文

缓存时间: 2026/06/01 15:29

大规模评估智能体行为,论证仓库优于文档,并邀请全球研究人员共同应对价值对齐问题。深入了解最新研究聚焦。https://t.co/avaAdeIODF https://t.co/Uh6EoIr8sH


Microsoft Build,以及智能体评估、作为媒介的仓库和AI价值对齐挑战

来源:https://www.linkedin.com/pulse/microsoft-build-plus-agentic-evaluation-repositories-gam7e Microsoft Research (https://www.linkedin.com/showcase/microsoftresearch/)

Microsoft Research

我们推动科学与技术发展,造福人类。

发布于 2026年6月1日

本期内容:

  • AgentPex:一个开源系统,能够自动检测基于结果的基准测试所遗漏的智能体轨迹中的程序性失败。
  • 加性控制变量:新研究证明,在排序和推荐系统中,最优加性基线在渐近意义上优于标准方差缩减工具。
  • 仓库是知识工作的新单元:一篇新文章认为,组织应转向将仓库而非文档作为人机协作的主要媒介。
  • 全球AI价值挑战:面向哲学、伦理学、法律和社会科学领域研究人员的公开征集,旨在应对AI中的价值对齐问题。
  • Microsoft Build:6月2日至3日在旧金山和线上举办的为期两天的AI动手实践会议。

新研究

AgentPex是一个基于AI的自动化智能体系统评估系统,其核心洞察在于:智能体提示和系统指令隐含地定义了可检查的行为规则。这些规则充当部分规范,AgentPex可以提取并利用它们来评估智能体是否遵循了其被指示执行的过程。

AI智能体正越来越多地嵌入真实的软件系统中,通过多轮对话、工具调用和中间决策来执行多步骤工作流。这些执行历史记录被称为智能体轨迹,使得人工验证变得困难。仅基于结果的基准测试可能会遗漏关键的程序性失败,例如错误的工作流路由、不安全的工具使用或违反提示指定规则的行为。

AgentPex通过从提示和系统指令中自动推导行为规范,然后检查每个轨迹是否符合这些规范来解决这个问题。在对来自τ2-bench数据集的424个轨迹(涵盖电信、零售和航空客户服务场景)进行的评估中,AgentPex揭示了基于结果的指标未能检测到的违规行为。它还提供细粒度的领域级诊断,帮助开发人员大规模理解模型行为、比较系统并识别弱点。

源代码已以开源形式发布 (https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fgithub%2Ecom%2Fmicrosoft%2Fagentpex&urlhash=xlNL&trk=article-ssr-frontend-pulse_little-text-block)。

新研究

本文研究了排序和推荐系统中离线策略评估的方差缩减问题,并证明β-IPS(一种具有最优加性基线的估计器)在渐近意义上优于自归一化逆倾向评分(SNIPS)——一种标准的方差缩减工具。

通过对方差差距进行解析分解,作者证明了SNIPS在渐近意义上等价于使用一个特定但通常并非最优的加性基线。这些结果从理论上证明了在排序和推荐系统中从自归一化转向最优基线修正的合理性。

通过明确证明β-IPS在均方误差上渐近优于SNIPS,这项工作填补了近期研究中的一个空白。近期研究曾指出加性控制变量可能提供更优性能,但缺乏用于评估的理论保证。

文章

本文认为,组织应转向将仓库而非传统文档作为与AI智能体在复杂任务上进行协作的主要媒介。仓库以当前文档所不具备的方式支持人机协作。

幻灯片演示、报告和电子表格是线性的、单文件的、面向快照的。相比之下,AI智能体更适合处理多样化且结构复杂的内容、变更跟踪和可分解性,而源代码仓库原生就提供这些特性。因此,仓库正在成为人类与智能体交互的主要媒介:人类声明意图,智能体将其细化为工件,双方迭代直至产生高质量结果。在这种场景下,文档并未消失,而是成为更大结构的一个方面。仓库是真相的来源,其中的文档则是面向人类的展现形式。这种模式可以超越软件,推广到任何涉及意图、细化和验证的生产力流程。

研究挑战

AI能否在现实世界的复杂性中推理人类价值?微软的全球AI价值挑战赛邀请哲学、伦理学、法律和社会科学领域的研究人员共同应对AI中最基本但悬而未决的问题之一。该挑战赛呼吁提出困难且真实的价值困境,以考验当前大语言模型的推理和判断能力——超越抽象的思维实验,致力于开发关于价值推理、伦理判断和社会对齐的严格基准。挑战赛面向全球参与者开放,包括研究生、博士生、博士后研究员、教职员工和学术研究人员。特别欢迎具有不同文化、学科和社会视角的个人,因为理解人类价值观需要超越单一世界观。加入挑战,帮助定义价值对齐AI的未来。

活动

Microsoft Build汇聚了开发者和技术爱好者,共同了解微软最新的创新和开发工具。您将与构建和扩展AI的团队一起,深入探讨真实代码、真实系统和真实工作流。为期两天,动手实践,没有空话。学习尖端的多模型训练和智能体评估,掌握编排智能体工作流,并与微软产品和工程专家一起进行动手实践。了解工程领导者如何设计、训练和交付可扩展的AI系统,并准备好立即应用这些技能。

立即浏览目录并准备您的日程——无论是线下参与还是线上参与。

研究聚焦 (https://www.linkedin.com/newsletters/research-focus-7335362495383040001)

研究聚焦

140,524 位关注者

更多来自 Microsoft Research 的文章

  • 2026年5月18日 ### 云效率、开发者生产力和 LINGUA 非洲提案征集 本期内容:HarvestContainers:一种在不违反延迟SLA的情况下回收高达75%闲置CPU容量的系统… (https://www.linkedin.com/pulse/cloud-efficiency-developer-productivity-lingua-africa-vpyxf?trk=article-ssr-frontend-pulse)
  • 2026年5月4日 ### 人机协作、企业隐私与高效注意力机制 本期内容:引导人机协作:一项涉及388名员工的实地研究发现,AI使用的组织方式… (https://www.linkedin.com/pulse/human-ai-collaboration-enterprise-privacy-efficient-d2gte?trk=article-ssr-frontend-pulse)
  • 2026年4月20日 ### 微软在 ICLR 2026:深度学习、大语言模型推理、生成模型 微软很自豪拥有超过100篇被接收论文,并成为第14届国际…的赞助商 (https://www.linkedin.com/pulse/microsoft-iclr-2026-deep-learning-llm-reasoning-generative-h74se?trk=article-ssr-frontend-pulse)
  • 2026年4月6日 ### 语境中的情感、机器人灵巧性、更智能的AI智能体,以及 CHI 2026 本期内容:超越标签的推理:一个诊断框架测试大语言模型如何在低资源情况下解释情感… (https://www.linkedin.com/pulse/sentiment-context-robot-dexterity-smarter-ai-agents-eprye?trk=article-ssr-frontend-pulse)
  • 2026年3月23日 ### 数据中心中的 MicroLED、大规模多模态 AI、智能体记忆与交互式规划 本期内容:MicroLED 数据中心网络:面向下一代…的低功耗、低成本光通信 (https://www.linkedin.com/pulse/microled-datacenters-multimodal-ai-scale-agent-memory-avyic?trk=article-ssr-frontend-pulse)
  • 2026年3月9日 ### Phi-4 多模态推理、可扩展的 LLM 系统、电影级视频生成与 AI 健康 本期内容:Phi-4-reasoning-vision-15B:一个用于视觉-语言任务的紧凑型多模态推理模型,现已… (https://www.linkedin.com/pulse/phi-4-multimodal-reasoning-scalable-llm-systems-cinematic-ximke?trk=article-ssr-frontend-pulse)
  • 2026年2月23日 ### 玻璃存储突破、稳健推理、可扩展安全测试、多语言AI,以及评估模型的思考方式 本期内容:Project Silica:用于长期数据保存的玻璃存储技术进展;RLTR:训练大语言模型… (https://www.linkedin.com/pulse/glass-storage-breakthroughs-robust-reasoning-scalable-idaoe?trk=article-ssr-frontend-pulse)
  • 2026年2月9日 ### 面向低资源语言的新基准和模型、医学和大脑基础模型、太空AI与创新套件 本期内容:Paza:面向低资源语言的、基于实际社区使用的新ASR基准和模型;Vibe Kit… (https://www.linkedin.com/pulse/new-benchmarks-models-low-resource-languages-medical-ivafe?trk=article-ssr-frontend-pulse)
  • 2026年1月26日 ### 面向物理世界的AI、扩展向量搜索与记忆驱动的视频生成 本期内容:Rho-alpha:通过语言驱动的机器人控制推进面向物理世界的AI;SPIRE:… (https://www.linkedin.com/pulse/ai-physical-world-scaling-vector-search-memory-driven-sdzze?trk=article-ssr-frontend-pulse)
  • 2026年1月12日 ### 2026年AI展望:多模态推理、机器人技术、GPU优化与可解释的LLM思考 本期内容:AI展望:来自Microsoft Research关于自主性、推理和具身智能的现场笔记… (https://www.linkedin.com/pulse/whats-next-ai-2026-multimodal-reasoning-robotics-gpu-s448e?trk=article-ssr-frontend-pulse)

探索内容分类

相似文章