@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2054617475484938719
摘要
Academic Research Skills 是首个可安装的 Claude Code 工作流,它封装了一个多智能体管线,用于检测和防止学术论文中的幻觉引用,解决了2025年预印本中统计到的146,932个幻觉引用问题。
查看缓存全文
缓存时间: 2026/05/13 20:25
研究人员刚刚统计出 146,932 个幻觉引用。这个仓库是首个可安装的修复方案
Academic Research Skills:4 个 Claude Code 技能、25 种模式、两道完整性门控,CC BY-NC 4.0
阅读约 10 分钟后,您将决定是否安装并使用它,以及如何立即使用每个技能。 TLDR?查看这份 HTML 交互式指南(测试版),灵感来自 @trq212
Zhao 等人刚刚在 2025 年的预印本记录中统计出 146,932 个幻觉引用(arXiv:2605.07723,2026-05)。Academic Research Skills 是首个可安装的 Claude Code 工作流,它在论文管道中直接植入修复方案。Cheng-I Wu 于 2026 年 5 月 5 日发布了 v3.7.0,支持双命令插件安装。许可证为 CC BY-NC 4.0:源代码可用,但并非 OSI 开源。
Jeremy Nguyen @JeremyNguyenPhD·Mar 10 用于学术研究的 Claude Code 技能:Edward Wu 分享了一套技能,包含一个 12 智能体的论文写作工作流和一个 13 智能体的研究团队。GitHub 链接在下方回复中:(另外:欢迎加入我的在线“读书会“,一起探讨实现其他功能) Show more 10110766106K
背景
该仓库由 Cheng-I Wu(GitHub Imbad0202)创作。创建于 2026 年 2 月 26 日,目前拥有 +6.7k 星标。README 中注明了学术渊源。方法论借鉴自 PaperOrchestra(Song, Song, Pfister, Yoon, 2026, Google, arXiv:2604.05018)。失败模式分类来自 Lu 等人(2026, Nature 651:914-919, “The AI Scientist”)。它解决的问题非常具体。
大多数学术 AI 工作流以一次性提示的形式存在于私人聊天中。从文献搜索到草稿、同行评审、引用检查再到披露的管道,每次都要重新构建。Academic Research Skills 将该管道打包为四个 Claude Code 技能,并在每个阶段设置强制的人工检查点。
仓库快照
技术架构
您可以跳到下方的“入门指南“部分。
该套件包含四个技能,具有声明的数据访问层级、25 种注册模式和一条 10 阶段编排管道。每个技能负责工作流的一部分。
deep-research 包含 13 个智能体和 7 种模式。它负责上游调研:文献综述、事实核查、系统评价、苏格拉底式问题框架构建。数据访问级别为原始(raw)。模式包括 full、quick、socratic、lit-review、fact-check、systematic-review 和 review。
academic-paper 包含 12 个智能体和 10 种模式。它负责草稿撰写、修订、引用检查、格式转换以及 AI 披露声明。数据访问级别为编辑(redacted)。模式包括 full、plan、outline-only、revision、revision-coach、abstract-only、lit-review、format-convert、citation-check 和 disclosure。
academic-paper-reviewer 包含 7 个智能体和 6 种模式。它运行多视角同行评审,包括一位主编、三位动态评审者和一位“魔鬼代言人“。数据访问级别为 verified_only。calibration 模式根据用户提供的黄金标准集测量评审者自身的假阴性率(FNR)和假阳性率(FPR)。
academic-pipeline 包含 4 个智能体,并协调以上所有组件。它运行一条 10 阶段流程:研究、撰写、第 2.5 阶段完整性检查、同行评审、修订、重新评审(最多 2 轮)、第 4.5 阶段最终完整性检查、格式转换、最终输出和流程总结。
第 2.5 和第 4.5 阶段完整性门控是承重部件。它们运行一个基于 Lu 等人枚举的失败模式的 7 模式失败清单:实现错误、幻觉结果、捷径依赖、将错误重新框架为洞见、方法论捏造、框架锁定和引用幻觉。这些门控会在疑似失败时阻止管道推进,而不是静默标记。
**材料通行证(Material Passport)**是交接模式。它在技能之间传递 literature_corpus[],包含 CSL-JSON 格式的作者、年份、标题和指向用户自身知识库的来源指针。自 v3.6.5 起,消费者运行一个“语料库优先、搜索填充空白“的流程:先预筛选用户的语料库,然后仅针对剩余空白搜索外部数据库。
v3.7.3(正在 main 分支开发中,尚未发布)是对 Zhao 等人审计的直接回应。该审计覆盖了 arXiv、bioRxiv、SSRN 和 PMC 上 250 万篇论文中的 1.11 亿条参考文献,仅 2025 年就发现了 146,932 个幻觉引用,并报告称 85.3% 的预印本幻觉会留存到已发表记录中。v3.7.3 关闭了那篇论文所命名的“声明忠实性“差距中的定位通道部分。具体新增的是三层引用排放。每个可见引用都会在 **** 标签后附带一个隐藏的 **** 标记,其中 **** 为 quote、page、section、paragraph 或 none。引文锚点最多 25 个单词。排放 none 会触发最终硬门控拒绝。完整的 L3 声明忠实性审计将在 v3.8 中发布。
污染信号是 v3.7.3 的第二个新增内容。当引用的年份 >= 2024 且发表场所属于十个预印本服务器的封闭列表(arXiv、bioRxiv、medRxiv、SSRN、Research Square、Preprints.org、ChemRxiv、EarthArXiv、OSF Preprints、TechRxiv)时,触发 preprint_post_llm_inflection。当现有的 Semantic Scholar API 协议未返回匹配时,触发 semantic_scholar_unmatched。两者都是建议性注释,而非阻断门控。
入门指南
插件安装(Claude Code CLI、VS Code、JetBrains,v3.7.0+)需要两条命令:
/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills
这将设置四个技能、三个插件智能体、十个 /ars-* 斜杠命令和一个 SessionStart 启动钩子。通过键入 /ars-plan 并描述一篇论文来验证。该技能应打开一个苏格拉底式对话来映射章节结构。
传统安装路径(git clone + 符号链接)仍适用于使用旧版 Claude Code 的用户或希望在每个项目中控制技能的用户:
git clone https://github.com/Imbad0202/academic-research-skills.git ~/academic-research-skills
cd /path/to/your/project
mkdir -p .claude/skills
ln -s ~/academic-research-skills/deep-research .claude/skills/deep-research
ln -s ~/academic-research-skills/academic-paper .claude/skills/academic-paper
ln -s ~/academic-research-skills/academic-paper-reviewer .claude/skills/academic-paper-reviewer
ln -s ~/academic-research-skills/academic-pipeline .claude/skills/academic-pipeline
最低运行环境为 Claude Code 加 Anthropic API 密钥:
export ANTHROPIC_API_KEY=sk-ant-...
claude
可选的文档工具,用于 DOCX 和 APA 7.0 PDF 输出:
brew install pandoc
brew install tectonic
对于 Codex CLI 用户,兄弟发行版为 Imbad0202/academic-research-skills-codex。相同的工作流内容,Codex 原生打包。
根据 docs/PERFORMANCE.md,成本大约为:使用 Opus 4.7 生成一篇 15,000 字、60 个参考文献的论文,约 4 到 6 美元。跨模型验证(ARS_CROSS_MODEL)额外增加 0.60 到 1.10 美元。一次完整运行超过 20 万输入 token 和 10 万输出 token,因此长时间会话可能失去提示缓存优势,需要材料通行证恢复。
实际使用方法
三个入口点覆盖大多数实际使用场景。
完整管道。 键入 /ars-full 或用自然语言描述目标(“我想写一篇关于人工智能对高等教育质量保障影响的研究论文”)。编排器从第 1 阶段开始,并在每个 FULL 检查点等待用户确认的情况下走完所有十个阶段。输出包括一篇完成的 APA 7.0 论文、一封编辑决定函、一份修订路线图、两份完整性报告和一份 AI 自我反思报告。
引导式规划。 当研究问题尚不明确时,键入 /ars-plan。苏格拉底导师智能体将用户意图分类为探索性或目标导向性。探索模式禁用自动收敛,并运行逐章对话:定义问题、选择方法、映射论证。输出包括章节计划加一份 INSIGHT 集合。
目标单一技能调用。 当只需要单一功能时跳过编排器:
典型首次会话如下所示。运行 /ars-plan 获取章节映射。然后运行 /ars-lit-review 填充语料库。最后运行 /ars-full,此时材料通行证中已填充语料库。材料通行证是会话之间的交接文件。它包含文献语料库、章节计划和完整性报告。要在新的 Claude Code 会话中恢复之前的运行,设置 ARS_PASSPORT_RESET=1 并使用 resume_from_passport= 模式。对于已有草稿,键入“我已有一篇论文,请评审它“即可从第 2.5 阶段进入管道,先运行完整性检查。对于回复评审意见,键入“我收到了评审意见“即可从第 4 阶段进入管道,运行修订教练流程。
管道以流程总结阶段结束:一个协作质量评估,覆盖六个维度,每项评分为 1 到 100。该分数反馈给 AI 自我反思报告,后者会展示本次运行的让步率、健康警报和谄媚风险。
证据
在当前学术 Claude Code 技能集群中,Academic Research Skills 是唯一一个在管道本身中内置多阶段完整性门控的候选方案。比较是架构性的,而非经验性的。目前尚无针对学术管道工具的正式基准测试。
当前限制(5月13日)
许可证摩擦。 CC BY-NC 4.0 禁止商业使用。源代码可用,但非 OSI 开源。
Claude Code 锁定。 参考分发版以 Claude Code 为首选。存在 Codex 兄弟版本。不支持 Cursor、OpenCode 和 Gemini。
完整性门控泄漏。 维护者自己在示范论文的发布后审计中发现,有 21 个问题(68 个参考文献中)经过了自动完整性检查的三轮审核后仍然存活。v3.7.3 关闭了定位通道部分。完整的声明忠实性审计推迟到 v3.8。
标签版本与主分支偏离。 v3.7.0 是最新的标签版本。三层引用排放位于 main 分支上,作为 [Unreleased] v3.7.3 的工作内容。
元数据不一致。 .claude-plugin/plugin.json 声称“35+ 模式,32 智能体集成“。MODE_REGISTRY.md 显示 25 种模式。直接文件计数发现 36 个智能体。
AlphaSignal 评价
值得关注。 Academic Research Skills 实现了其 README 中声称的功能。v3.7.0 是已签名的版本,插件资源已到位(.claude-plugin/、10 个 /ars-* 命令、3 个插件智能体、SessionStart 钩子),静态 lint 检查通过了规范一致性、模式和保护模式检查。该工作流架构是对一篇刚刚以语料库规模数字量化了引用幻觉问题的论文的最强可安装回应。一个非显而易见的发现是:维护者记录了自己的失败。示范审计中,68 个参考文献中有 21 个滑过了三轮完整性检查。这种诚实是门控确实有效的最有力证据。但这也是为什么评价不是“生产就绪“的原因。
改变评价的因素包括:一个宽松的许可证(或商业层级)、在 v3.8 中发布完整的 L3 声明忠实性审计,以及一个非 Claude Code 的参考分发版。在此之前,工作流设计比工作流运行时更有价值。
受益人群与非受益人群
受益人群:非商业环境下的博士生、学术研究人员和已使用 Claude Code 的实验室团队;研究如何将完整性门控嵌入多阶段工作流的智能体工具构建者;以及正在评估 AI 披露模式的期刊或研讨会。
非受益人群:商业 SaaS 或付费咨询团队(CC BY-NC 4.0 禁止构建)、仅使用 Cursor 或 OpenCode 的栈(参考分发版以 Claude Code 为首选),以及需要字节级可重现引用保证的任何人(v3.7.3 锚点在某些地方是建议性的,L3 完全审计尚未发布)。
从业者启示
使用 Claude Code 的研究人员现在可以安装一个具有强制完整性门控的 10 阶段学术工作流,作为四个技能,因为 v3.7.0 提供了一行插件路径。
链接
- github.com/Imbad0202/academic-research-skills(仓库,约 5 分钟插件安装)
- arxiv.org/abs/2605.07723(Zhao 等人关于引用幻觉的审计,约 25 分钟阅读)
关注 @AlphaSignalAI 获取更多类似内容。在 AlphaSignal.ai 订阅每日 AI 信号。超过 280,000 名开发者在阅读。
常见问题
问:如何在 Claude Code 中安装 Academic Research Skills? 答:两条插件命令:/plugin marketplace add Imbad0202/academic-research-skills 然后 /plugin install academic-research-skills。需要最新版 Claude Code 和 ANTHROPIC_API_KEY。首次运行:/ars-plan。
问:Academic Research Skills 会自动写论文吗? 答:不。仓库中的 POSITIONING.md 明确说明 ARS 是辅助性的,而非自主性的。在每个 FULL 阶段以及第 2.5 和第 4.5 阶段完整性门控处,强制的人工检查点会阻止静默推进。
问:ARS 如何减少引用幻觉? 答:两道完整性门控(第 2.5 阶段预评审,第 4.5 阶段预定稿)运行一个 7 模式失败清单,外加 Semantic Scholar API 验证。v3.7.3 增加了三层引用排放:每个引用后附加一个隐藏的锚标记,指定引用位置为引文、页、节、段落或无定位符。
问:运行一个完整的论文管道的成本是多少? 答:根据 docs/PERFORMANCE.md,使用 Opus 4.7 生成一篇 15,000 字、60 个参考文献的论文约需 4 到 6 美元。跨模型验证额外增加 0.60 到 1.10 美元。一次完整运行超过 20 万输入 token 和 10 万输出 token。
问:Academic Research Skills 是开源的吗? 答:源代码可用,但非 OSI 开源。许可证为 CC BY-NC 4.0(Creative Commons Attribution-NonCommercial 4.0)。商业 SaaS、托管服务、付费咨询和企业部署需要单独许可。
相似文章
@AlphaSignalAI:Karpathy 将实验自动化。AutoResearchClaw 将整个实验室自动化。大多数 AI 研究工具只处理一步。这个……
AutoResearchClaw 是一个 GitHub 仓库,它能够将整个 AI 研究流程自动化——从想法到完整的会议论文,包含真实的实验、经过验证的引用和可运行的代码,在 55 个主题的基准测试中,比之前的自主研究系统性能提升 54.7%。
面向 Claude Code 的学术研究技能
一套为 Claude Code 设计的插件套件,协助学术研究者在从研究到发表的全流程中提供支持,强调人类在环(human-in-the-loop)的完整性校验和风格校准。
@DivyanshT91162: Claude Code 刚刚获得了学术研究超级能力。有人构建了一个 10 阶段的 AI 研究系统,它不仅“撰写论文”……
一款专为 Claude Code 设计的全新开源 10 阶段 AI 研究系统插件,自动化了文献综述、引用验证和同行评审模拟。它通过事实核查和模拟批判性反馈,声称能够以极低的成本生成高质量的学术初稿。
有源可查,否则未曾发生:一种用于检测引用幻觉的多智能体框架
本文介绍了 CiteTracer,这是一个用于检测大语言模型(LLM)生成的科学写作中引用幻觉的多智能体框架,在合成和真实世界基准上均实现了高精度。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2057867718632550782
对学术研究生命周期中250多种AI工具的全面调查,确定了五个关键原则,并强调了AI生成与验证能力之间日益扩大的差距。