@lateinteraction: dspy.GEPA 用于新微软 AI 努力的预训练数据整理 :-)
摘要
来自 dspy 的 GEPA 优化的 LLM 判断器用于微软 MAI-Thinking-1 模型预训练流程中的数据过滤。
dspy.GEPA 用于新微软 AI 努力的预训练数据整理 :-)
查看缓存全文
缓存时间: 2026/06/03 23:55
dspy.GEPA 被用于微软最新AI项目中的预训练数据筛选 :-)
Lakshya A Agrawal (@LakshyAAAgrawal): 很高兴看到 GEPA 优化的大语言模型裁判被用于 MAI-Thinking-1 模型预训练流程中的数据过滤!
相似文章
@harold_matmul: dspy.GEPA 用于新微软AI工作中的预训练数据筛选 :-)
本文解释了DSPy中的GEPA(基因-帕累托优化)如何用于高效的提示调优,特别是在微软AI的预训练数据筛选中应用,使研究人员能够用自动化的计算驱动优化取代手动提示工程。
@harold_matmul: 这是我的主意 :) 使用GEPA创建LLM程序是一种非常自然的工作流。迭代速度非常快,……
用户感谢GEPA工具,强调其为LLM程序提供了自然的工作流、快速的迭代速度,以及利用数据-derived priors偏置优化的能力。
微软的全新MAI模型
微软宣布推出两款全新大语言模型(LLMs):MAI-Thinking-1(350亿参数推理模型)和MAI-Code-1-Flash(50亿参数代码模型)。两款模型均基于企业级、无污染的干净数据训练,且未使用第三方蒸馏技术。据称,在盲评中,MAI-Thinking-1的受欢迎程度超过了Sonnet 4.6。
@_akhaliq: SpenseGPT 实用的一次性剪枝方法,支持大语言模型推理中的稀疏和密集 GEMM
SpenseGPT 提出了一种实用的一次性剪枝方法,用于大语言模型,可在推理过程中同时支持稀疏和密集的 GEMM,提升效率。
探索用于模型特化的自主代理数据工程
本文形式化了自主代理数据工程,其中LLMs作为自主数据工程师,为特定领域策划和优化训练数据,使用GPT-5.2使学生模型性能提升了57.29%。