Opus 5.5 爱说「这很重要」(以及其他 AI 写作痕迹)
摘要
TechCrunch 报道了一项 Graphite 的研究,该研究分析了 AI 写作的痕迹,发现 Claude Opus 5.5 过度使用「this matters」(这很重要)和「dependable」(可靠)等短语,而 OpenAI 的 Astra 则偏爱模棱两可的措辞和纠错式表述——即便模型们已经逐渐摒弃了破折号等旧有的写作痕迹。
Opus 5.5 最明显的写作痕迹是「dependable」这个词,它出现的频率是人类样本的 23 倍。
查看缓存全文
缓存时间: 2026/10/01 20:06
# Opus 5.5 爱说"这很重要"(以及其他 AI 写作痕迹)| TechCrunch
来源:https://techcrunch.com/2026/10/01/opus-5-5-loves-to-tell-you-this-matters-and-other-ai-writing-tells/
如今 LLM 生成的文章无处不在,人们急切寻找识别它们的方法。虽然破折号和 "delve" 这类早期的痕迹早已不见踪影,但研究人员表示,AI 模型在写作时仍会不自觉地依赖不少明显的习惯性表达。
营销公司 Graphite 的一项[新研究](https://graphite.io/five-percent/research/ai-tells-opus-5-5-update)分析了前沿模型的写作习惯,摸清了每个模型偏爱的词汇和句式。虽然破折号这类旧痕迹已被消除,但模型仍然倾向于使用对比强烈的句式,而每个模型版本都表现出各自独有的怪癖。最大的意外是痕迹的范围之广。Graphite 找出了 13,000 个在 AI 内容中出现频率至少是人类内容两倍的短语——这就是他们对"痕迹"的定义。
"事实证明,Claude 模型的词汇分布其实正随时间逐渐接近人类,"Graphite 首席 AI 官 Greg Druck 告诉 TechCrunch。"而 GPT 系列模型则在朝着相反的方向走。"
研究大规模的 AI 写作需要精心的设计。Graphite 先以 ChatGPT 发布前发表的 10,000 篇文章为语料,作为人类生成的对照组。随后研究人员让不同 AI 模型根据摘要重写这些文章,尽可能消除原文带来的偏差。通过比对来自人类和各模型的对应样本,他们得以比较某些词句在 AI 写作中出现的频率,以及更宏观的句式结构规律。
根据 Graphite 的结果,Claude Opus 5.5 最大的痕迹是 "dependable"(可靠的)这个词,出现频率是人类样本的 23 倍。虽然 Opus 5.5 现在已经避开了"这不是 X,而是 Y"的句式(https://techcrunch.com/2026/04/20/ai-writing-its-not-just-this-its-that-barrons/),但它仍然习惯说某样东西"不只是 X,而是 Y"。
更重要的是,Opus 热衷于告诉你为什么某件事很重要,"this matters"(这很重要)这一短语的出现频率是人类写作的 116 倍,而 "why X matters"(为什么 X 很重要)则是 92 倍。
OpenAI 的 Astra 则有另一套泄密特征。这个模型爱描述所讨论话题的"另一个维度",并倾向于用"可能提供"或"可以提供"某项好处来弱化主张。它最大的痕迹是 Graphite 所谓的"纠正性框架",即把某个话题定义为"不只是 X",或以替代方案的形式提出,说"而不是依赖 X"。根据 Graphite 的研究,这些句式在 Astra 生成的文章中比人类写作中出现的频率高出 100 多倍。
值得注意的是,各家前沿实验室似乎都已对模型滥用破折号的问题做出回应。在 Graphite 的样本中,Opus 5.5 使用破折号的频率比 Opus 5 低了 99%。Astra 目前比人类样本少用 88%,而 Gemini 3.1 Pro 几乎已经从写作中完全消除了破折号。
不过,Graphite 表示,尽管个别痕迹在变化,痕迹的总数基本保持稳定。"并不是说痕迹在减少,"Druck 告诉 TechCrunch。"他们设法消除了最广为人知的那些痕迹,但又会有新的冒出来。而且每个模型版本都有自己的特征。"
考虑到各家实验室都专注于更接近人类的写作风格,痕迹竟然如此顽固,着实令人意外。在 [Opus 5.5 的发布页](https://www.anthropic.com/claude-opus-5-5)上,Anthropic 夸赞该模型"比以往的模型沟通更自然",称早期用户"觉得它的写作更清晰、更易读"。
OpenAI 在发布 [GPT-6 的 Sol 和 Luna](https://openai.com/index/introducing-gpt-6-sol-and-luna/) 时也做出了类似的说法,称用户"可以期待更高的清晰度、更少的行话、更少奇怪的措辞"。
但 Druck 对实验室能在多大程度上彻底消除这些特征性的句式和短语持怀疑态度。
"我有一个大致的假设:实验室对这些事情的控制能力可能比你们想象的要弱,"Druck 说。"这些是拥有数十亿参数的巨型模型。它们能运行的测试数量是有限的,总会有漏网之鱼。"
*当您通过文章中的链接购买商品时,我们可能会赚取少量佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。*
Russell Brandom 自 2012 年起报道科技行业,重点关注平台政策和新兴技术。他此前在 The Verge 和 Rest of World 工作,并为 Wired、The Awl 以及麻省理工的 Technology Review 撰稿。您可以通过 [email protected] 或 Signal(412-401-5489)与他联系。
[查看作者简介](https://techcrunch.com/author/russell-brandom/)
相似文章
Opus 5.5刚刚在一项测试AI能否编写完整脚本的基准中超越了专业人类基准,该脚本需具备正确的语气、实质内容、节奏、钩子且最少AI瑕疵
Opus 5.5 AI模型在一项评估脚本质量的基准测试中超越了专业人类作家,评估内容涵盖语气、实质内容、节奏和最少的AI生成错误
@emollick: 关于AI写作的风格特征(如破折号等)已经有很多讨论,但本文关注的是AI叙事…
本文介绍了StoryScope,一个分析语篇层面叙事特征以区分AI生成小说和人类创作故事的流程。它达到了很高的准确率,并揭示了不同大语言模型(如Claude、GPT和Gemini)独特的叙事指纹。
最著名的AI写作怪癖也是最神秘的
本文探讨了AI写作中持续存在的‘否定平行结构’(例如‘不是X,而是Y’)这一怪癖,其在AI生成文本中的普遍性,以及OpenAI等公司为减少过度使用所做的努力。
基准测试是一回事,实际感受是另一回事。
作者认为,最近发布的AI模型(如Claude Opus 4.8和GPT 5.5)只是渐进式改进,类似于iPhone的升级,真正的创新正在转向工具层,例如Claude Code和Codex。
高级AI的谄媚(4分钟阅读)
探讨了前沿AI模型如何变得更具微妙的谄媚性,通过提供表面的反驳而非明显的赞美来讨好聪明的用户,并讨论了对AI使用和基准测试的影响。