Minimax M3 似乎没有政治审查

Reddit r/LocalLLaMA 模型

摘要

Minimax M3 模型似乎没有政治审查,在偏见基准测试中在中国的大语言模型中显得格外突出。

我目前正在做一个关于中国/CCP的人工智能偏见基准测试,这个结果显得格外突出。所有其他 Minimax 模型都像典型的中国大语言模型一样受到审查。
查看原文

相似文章

为LLM构建了一个政治基准。KIMI K2无法回答关于台湾的问题(显然)。GPT-5.3在提供选择退出选项时100%拒绝回答问题。[P]

Reddit r/MachineLearning

研究人员构建了一个开源的政治坐标基准,包含14个政策领域的98个结构化问题,用于评估前沿LLM(GPT-5.3、Claude Opus 4.6、KIMI K2)。关键发现:拒绝模式与选择退出选项显著改变了模型定位。GPT-5.3在提供选择退出选项时100%拒绝回答问题,而KIMI K2虽然在其它方面表现进步立场,但在台湾/新疆问题上表现出特定主题的审查。

LLM权重中的政治审查机制(109分钟阅读)

TLDR AI

这项关于Qwen 3.5的机制可解释性研究揭示了负责政治审查的特定电路,展示了如何通过引导内部方向来识别、分析甚至关闭该电路。研究结果表明,模型的事实知识保持完整,审查行为只是叠加在其之上。

定义和评估 LLM 中的政治偏见

OpenAI Blog

OpenAI 推出了一个全面的框架来定义和评估 LLM 中的政治偏见,引入了跨越 5 个偏见轴线、包含 100 个主题的 500 条提示评估。结果显示 GPT-5 模型相比之前的版本实现了 30% 的偏见减少,少于 0.01% 的生产环境中的 ChatGPT 回复存在政治偏见。

Minimax M3 与 M2.7 对比

Reddit r/LocalLLaMA

讨论比较新款 Minimax M3 模型与其前代 M2.7,寻求发布两周后的用户反馈。

使用五款中文编码大模型一个月后,M3真的会登顶吗?

Reddit r/ArtificialInteligence

一位用户分享了一个月内在TypeScript/Next.js代码库上对五款中文编码大模型(Kimi K2.6、GLM-5.1、MiMo V2.5 Pro、MiniMax 2.7、DeepSeek V4 Pro)的比较,从前端、后端、代码审查、全能型和推理等类别进行评分。他们指出MiniMax 2.7以约7%的成本实现了Opus 4.6约90%的质量,并推测即将推出的MiniMax 3.0是否会弥补规划和测试覆盖方面的不足,从而登上榜首。