@MSFTResearch: 小型语言模型借助SocialRL学会谈判,PazaBench V2将语音AI评估扩展到非洲语言…
摘要
微软研究院重点介绍了关于使用SocialRL进行小型语言模型谈判、PazaBench V2用于非洲语言语音评估、EvoLib帮助智能体从经验中学习、改进的A/B测试方法以及AI驱动的精准肿瘤学的新研究。
查看缓存全文
缓存时间: 2026/08/03 23:54
面向AI智能体的社会推理、AI对癌症作为动态系统的建模,以及扩展至非洲的语音AI评估
Source: https://www.linkedin.com/pulse/social-reasoning-ai-agents-modeling-cancer-dynamic-system-2ft3e/?trackingId=5ej4Kd0vRMWdFctGGafVWg%3D%3D Microsoft Research (https://www.linkedin.com/showcase/microsoftresearch/)
Microsoft Research
我们推动科学与技术发展,以造福人类。
发布于2026年8月3日
本期内容:SocialRL帮助小型语言模型培养用于谈判和代理的战略社会推理技能;新研究通过处理相关指标和减少错误发现来提高A/B测试的可靠性;EvoLib使AI智能体能够将过去的经验转化为随时间推移而不断演进的知识,从而提升性能;PazaBench V2扩展了语音识别系统在非洲语言和国家中的评估;Project Ex Vivo探索AI如何通过将癌症建模为动态系统来推进精准肿瘤学。
新研究
https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fwww%2Emicrosoft%2Ecom%2Fen-us%2Fresearch%2Farticles%2Ffrom-passive-delegates-to-strategic-negotiators-reinforcing-social-reasoning-in-small-language-models%2F&urlhash=67L0&trk=article-ssr-frontend-pulse_publishing-image-block
我们越来越频繁地让AI智能体代表我们行事:安排会议、比较报价、敲定交易条款,或在市场中讨价还价。我们希望它们代表我们的利益,去面对利益可能冲突或错位的对手。然而,那些让助手在对话中讨人喜欢的特质——如随和、透明、急于寻找共同点——在谈判桌上却会成为短板。一个总是说“好的”的智能体或许是一个好的对话伙伴,但在为委托方争取利益方面却是个糟糕的代表。SocialRL帮助智能体构建社会推理技能,从而更好地代表我们进行谈判。初步测试表明,它可以帮助小型语言模型达到甚至超越前沿模型的性能。
新研究
https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fwww%2Emicrosoft%2Ecom%2Fen-us%2Fresearch%2Farticles%2Ftreatment-effect-assessment-at-scale-accounting-for-correlated-metrics-and-metric-relevance-in-modern-experimentation%2F&urlhash=PAeR&trk=article-ssr-frontend-pulse_publishing-image-block
这项研究旨在通过确定实验产生的是真正的产品影响还是单纯的统计噪声,帮助企业从A/B测试中做出更好的产品决策。研究人员分析了数千个实验,发现一种广泛使用的技术——Fisher方法——在指标高度相关时可能会大幅高估处理效应。研究团队用基于Benjamini-Hochberg的方法取代了它,该方法能更强地控制错误发现率,同时在大规模部署中仍然切实可行。研究结果还凸显了现代AI驱动实验系统面临的一个重要挑战:生成更多指标很容易,但确保这些指标具有相关性,对于得出可信结论至关重要。
新研究
https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fwww%2Emicrosoft%2Ecom%2Fen-us%2Fresearch%2Fblog%2Fevolib-turning-experience-into-evolving-knowledge%2F&urlhash=VIWN&trk=article-ssr-frontend-pulse_publishing-image-block
存储和检索过去经验的能力是AI智能体性能的重要驱动因素。但这并不等同于真正在学习。而且,智能体通常会记住大量过去的对话、思考过程和动作,以至于很难梳理所有这些数据并提炼出可用于完成新任务的内容。相比之下,人们通常会记住最重要的东西:有效的方法、要避免的错误,以及在多种情境下都适用的技能。
近期论文《Test-Time Learning with an Evolving Library》 (https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fwww%2Emicrosoft%2Ecom%2Fen-us%2Fresearch%2Fpublication%2Ftest-time-learning-with-an-evolving-library%2F&urlhash=1mNQ&trk=article-ssr-frontend-pulse_little-text-block) 探讨了AI系统如何能更像人类那样学习。EvoLib从过去的经验档案中提取可复用的知识,并随着新经验的到来不断对其进行优化。这可以在不更新底层模型的情况下,随着时间的推移提升智能体的性能。
新发布
https://www.linkedin.com/posts/today-we-announce-the-second-release-of-share-7485415808999817216-KIiV/?trk=article-ssr-frontend-pulse_publishing-image-block
可靠的基准测试对于推进包容性AI至关重要。微软刚刚发布了PazaBench的重大更新,这是一个用于评估跨非洲语言自动语音识别(ASR)模型的基准。通过扩大语言、地理和社区数据集覆盖范围,PazaBench V2为研究人员和从业者开发面向历史上服务不足语言的语音技术提供了更强的基础。它是评估跨非洲语言和情境的语音转文本模型最全面的资源之一。
此次更新具体包括:
- 额外覆盖22种非洲语言,总数达到61种,并将PazaBench (https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fhuggingface%2Eco%2Fspaces%2Fmicrosoft%2Fpaza-bench&urlhash=eq-n&trk=article-ssr-frontend-pulse_little-text-block) 扩展到38个非洲国家的社区
- 新增一个ASR模型
- 数据集覆盖范围扩展到11个
- 测试样本数量增加近一倍,以支持稳健的评估
研究更新
https://www.linkedin.com/redir/redirect?url=https%3A%2F%2Fnews%2Emicrosoft%2Ecom%2Fmicrosoft-signal%2Fmagazine%2Fissue%2Fissue-05%2F%23project-ex-vivo&urlhash=nsX8&trk=article-ssr-frontend-pulse_publishing-image-block
几十年来,精准癌症医学往往侧重于识别驱动肿瘤的突变和其他分子变化,然后为患者匹配靶向药物。虽然这种方法改变了许多患者的治疗结果,但它只捕捉到了癌症难以治疗的部分原因。
Project Ex Vivo利用AI来更好地理解癌细胞状态,并将癌症视为一个动态系统。在本次采访中,联合负责人Ava Amini将该项目描述为从二元信号向更连续测量形式的转变。
Research Focus (https://www.linkedin.com/newsletters/research-focus-7335362495383040001)
Research Focus
146,687 位关注者
微软研究院的更多文章
- 2026年7月20日 ### 22个新增天气变量、灾后建筑快速损毁评估,以及从人类纠正中学习的机器人。本期内容:Aurora 1.5扩展了用于天气和地球系统预报的开放基础模型,新增22个… (https://www.linkedin.com/pulse/22-new-weather-variables-rapid-postdisaster-building-lkhue?trk=article-ssr-frontend-pulse)
- 2026年7月7日 ### ICML 2026亮点 微软在ICML 2026 微软正在赞助国际机器学习大会(ICML),这是一个顶尖的… (https://www.linkedin.com/pulse/highlights-from-icml-2026-microsoftresearch-alcoe?trk=article-ssr-frontend-pulse)
- 2026年6月15日 ### 硬件加速分析、AI驱动的癌症研究,以及知识工作的未来 本期内容:CoddSpeed:一个硬件加速框架,可在GPU、FPGA上实现高达30倍的分析加速… (https://www.linkedin.com/pulse/hardware-accelerated-analytics-ai-powered-cancer-research-nznve?trk=article-ssr-frontend-pulse)
- 2026年6月1日 ### Microsoft Build,以及代理评估、作为媒介的代码库、AI价值对齐挑战 本期内容:AgentPex:一个开源系统,可自动检测代理跟踪中的程序性失败… (https://www.linkedin.com/pulse/microsoft-build-plus-agentic-evaluation-repositories-gam7e?trk=article-ssr-frontend-pulse)
- 2026年5月18日 ### 云效率、开发者生产力,以及LINGUA Africa提案征集 本期内容:HarvestContainers:一个无需违反延迟要求即可回收高达75%空闲云CPU容量的系统… (https://www.linkedin.com/pulse/cloud-efficiency-developer-productivity-lingua-africa-vpyxf?trk=article-ssr-frontend-pulse)
- 2026年5月4日 ### 人机协作、企业隐私与高效注意力 本期内容:Scaffolding Human-AI Collaboration:一项涉及388名员工的实地研究发现,AI使用的组织方式… (https://www.linkedin.com/pulse/human-ai-collaboration-enterprise-privacy-efficient-d2gte?trk=article-ssr-frontend-pulse)
- 2026年4月20日 ### 微软亮相ICLR 2026:深度学习、LLM推理、生成模型 微软很自豪拥有超过100篇被接收的论文,并成为第14届国际… (https://www.linkedin.com/pulse/microsoft-iclr-2026-deep-learning-llm-reasoning-generative-h74se?trk=article-ssr-frontend-pulse)
- 2026年4月6日 ### 情境中的情感、机器人灵巧性、更智能的AI智能体,以及CHI 2026 本期内容:超越标签的推理:一个新的诊断框架测试LLMs如何在低资源… (https://www.linkedin.com/pulse/sentiment-context-robot-dexterity-smarter-ai-agents-eprye?trk=article-ssr-frontend-pulse)
- 2026年3月23日 ### 数据中心中的MicroLED、大规模多模态AI、智能体记忆与交互式规划 本期内容:MicroLED数据中心网络:面向下一代…的低功耗、低成本光通信 (https://www.linkedin.com/pulse/microled-datacenters-multimodal-ai-scale-agent-memory-avyic?trk=article-ssr-frontend-pulse)
- 2026年3月9日 ### Phi-4多模态推理、可扩展LLM系统、电影级视频生成,以及AI健康应用 本期内容:Phi-4-reasoning-vision-15B:一个用于视觉-语言任务的紧凑型多模态推理模型,现已… (https://www.linkedin.com/pulse/phi-4-multimodal-reasoning-scalable-llm-systems-cinematic-ximke?trk=article-ssr-frontend-pulse)
浏览内容分类
相似文章
@MSFTResearch:我们显著扩展了覆盖范围,支持:● 22 种新增语言,现已覆盖 38 个非洲国家…
微软研究院宣布扩大了其 ASR 模型的覆盖范围,新增了 22 种语言,覆盖 38 个非洲国家,并提供了新的数据集和测试样本。
@MSFTResearch: 今天,我们宣布PazaBench的第二个版本发布,这是我们用于评估跨非洲语言自动语音识别(ASR)模型的基准测试。
微软研究院宣布PazaBench的第二个版本发布,这是一个用于评估跨非洲语言自动语音识别模型的基准测试。
@MSFTResearch:最好的AI不只是扩展规模,它还会适应所服务的语言、文化、人群和社区。探索三个…
微软研究院重点介绍了三本手册,用于以包容性为原则设计、部署和评估AI系统,强调对语言、文化和社区的适应。
@MSFTResearch:会“跑题”的大模型,零样本就能上岗的机器人,为不均衡数据而生的扩散模型,这就是……
微软研究院精选 ICLR 论文:大模型在对话中失去连贯性、零样本机器人学习、面向不均衡数据的扩散模型。
@MSFTResearch:Paza:为低资源和多语言语言构建稳健语音技术的指南,从数据收集…
微软研究院推出了Paza语音手册,这是一份交互式指南,用于为低资源和多语言语言构建稳健的语音技术,涵盖数据收集、模型训练、部署和评估。配套视频介绍了该手册,并演示了如何应用经过验证的实践。