MAI(微软人工智能)在编程方面远远落后
摘要
文章批评微软人工智能的编码模型表现逊于Kimi K3和Deepseek V4等竞争对手,暗示尽管资源雄厚,MAI仍远远落后。
Kimi K3基本上与美国前沿实验室持平,Deepseek V4以约5%的成本达到前沿智能的约90%,然而MAI团队(全球资源最充足的AI团队之一)却拒绝将MAI-Thinking-1或MAI-Code-Flash提交给Artificial Analysis进行基准测试,这充分说明他们落后了多少。我理解MAI最初专注于降低MS Teams转录/Copilot图像生成的COGS(他们的音频和图像模型处于前沿且极具性价比,可在Artificial Analysis上查看),但考虑到其资源,在编程和通用智能方面如此落后实在令人遗憾。不知道萨提亚在想什么。MSFT股票可能将停滞不前,直到他们能推出一个基准测试表现良好的模型。
相似文章
微软试图以新模型重返AI编码领域(1分钟阅读)
微软计划在下周的Build大会上发布新的AI编码模型,旨在恢复与Anthropic的Claude Code和OpenAI的Codex等竞争对手的竞争力。
MAI-Thinking-1
微软AI推出MAI-Thinking-1,这是一个350亿活跃参数的推理模型,从头训练,无需蒸馏,在软件工程和数学基准测试中表现强劲,同时强调干净数据和自给自足。
@mustafasuleyman: 非常兴奋地宣布今天推出七款全新的世界级MAI模型。它们代表了我们认为是AI设计的新时代……
微软宣布推出七款新的MAI模型,包括一个强大的推理模型(MAI-Thinking-1)和编程模型(MAI-Code-1-Flash),以及用于企业定制化的Frontier Tuning。
微软的全新MAI模型
微软宣布推出两款全新大语言模型(LLMs):MAI-Thinking-1(350亿参数推理模型)和MAI-Code-1-Flash(50亿参数代码模型)。两款模型均基于企业级、无污染的干净数据训练,且未使用第三方蒸馏技术。据称,在盲评中,MAI-Thinking-1的受欢迎程度超过了Sonnet 4.6。
AI编码代理是否遇到了瓶颈,还是我们衡量它们的方式出了问题?
本文探讨了AI编码代理的炒作与现实之间的差距,认为它们对于加速工作流程的某些部分有效,但在架构、调试和审查方面仍需人工监督,并质疑当前基准测试是否衡量了正确的东西。