arXiv上可访问数学的扩展:HTML转换与MathML 4
摘要
arXiv报告了其正在进行的HTML Papers项目,重点介绍了改进的转换保真度、达到75%无错误率的语料库级HTML转换、用于可访问语音的初步MathML 4 Intent注释,以及为降低成本而进行的LaTeXML的Rust移植。
arXiv:2605.16562v1 公告类型:新
摘要:我们报告了arXiv的HTML Papers产品的持续开发情况,该产品自2023年首次发布以来,已适用于每个新的TeX/LaTeX提交。
2025年和2026年初的主要亮点包括:
(i) 社区驱动的HTML保真度和服务健康改进,约6000份用户报告中有一半已解决;
(ii) 语料库级转换工作,目标是实现90%无错误HTML(目前为75%);
(iii) 用于无障碍语音输出的初步MathML 4 Intent注释;
(iv) 正在进行中的LaTeXML Rust移植,可降低计算成本并在提交时实现更快的预览。
arXiv HTML Papers项目仍处于实验阶段,但随着我们更好地理解arXiv读者的需求以及新标准和编程语言与AI进步带来的技术机遇,该产品正在逐步成熟。
查看缓存全文
缓存时间: 2026/05/19 06:34
# HTML 转换与 MathML 4:来源:https://arxiv.org/html/2605.16562 11institutetext:arXiv, Cornell Tech, New York NY, USA 11email:\{deyan,bcaruso,jake,jeff\}@arxiv\.org22institutetext:National Institute of Standards and Technology, Gaithersburg MD, USA 22email:bruce\.miller@nist\.gov## 在 arXiv 上规模化可访问数学:HTML 转换与 MathML 4 Bruce R\. Millerhttps://orcid.org/0000-0002-2300-0367\{\}^\{\\,\\mbox\{\\scriptsize\\lx@orcidlink\{0000\-0002\-2300\-0367\}\{\\orcidlogo\}\}\}Brian Carusohttps://orcid.org/0000-0002-7489-0144\{\}^\{\\,\\mbox\{\\scriptsize\\lx@orcidlink\{0000\-0002\-7489\-0144\}\{\\orcidlogo\}\}\}Jacob Weiskoffhttps://orcid.org/0000-0002-8778-0032\{\}^\{\\,\\mbox\{\\scriptsize\\lx@orcidlink\{0000\-0002\-8778\-0032\}\{\\orcidlogo\}\}\}Jeff Sank ###### 摘要 我们报告 arXiv HTML 论文服务(自 2023 年首次发布以来,适用于每个新的 TeX/LaTeX 提交)的持续开发进展。2025 年至 2026 年初的主要亮点包括: - \(i\) 社区驱动的 HTML 保真度与服务健康改进,约 6,000 份用户报告中已解决约一半; - \(ii\) 语料规模的转换工作,目标实现 90% 的无错误 HTML(目前为 75%); - \(iii\) 初始的 MathML 4 Intent 注释,用于可访问的语音输出; - \(iv\) 正在进行的 LaTeXML Rust 移植,降低了计算成本并加快了提交时的预览速度。arXiv HTML 论文项目仍处于实验阶段,但随着我们更好地理解 arXiv 读者的需求以及新标准、编程语言与人工智能进步带来的技术机遇,该项目正逐步成熟。 ## 1 背景 arXiv 是全球最大的预印本服务器,涵盖数学、计算机科学、物理学及相关 STEM 领域。迄今已发表超过 300 万篇文章,且增长仍在加速:2026 年月度提交量首次达到 3 万篇\[4 (https://arxiv.org/html/2605.16562#bib.bib1)\]。其主要分发的 PDF 格式保留了视觉保真度,但在重排、交互和辅助技术方面提供的结构信息有限。LaTeX 团队正在开展的工作旨在改善 PDF 的可访问性\[9 (https://arxiv.org/html/2605.16562#bib.bib13)\]。带有高质量 MathML 的 HTML 是一种不同的表示方式:它将叙事和数学结构暴露给 Web 平台\[13 (https://arxiv.org/html/2605.16562#bib.bib4)\],使同一文档资产能同时支持浏览器中的响应式渲染、通过屏幕阅读器进行的可访问读出、上下文导航,以及面向搜索、链接和下游分析的机器可读性。arXiv 规模的管道必须面对 STEM 文档的全面多样性:异构的符号体系、多样的叙事陈述、视觉块(图形、表格、图表)、丰富的元数据和附录,以及每个学科中习惯性的 TeX 用法。我们的转换过程提供一种契约:一旦 LaTeX 文档被系统成功处理,作者撰写的内容将完整保留到最终 HTML 中,每个结构性和语义性的 LaTeX 构造都会变成 Web 平台可操作的 HTML 标记。成功有程度之分:简单的章节划分较为容易,响应式设计和主题化相对省力,数学表达式的可访问读出较为困难,而诸如对交换图的丰富、可访问导航等下游功能则更加困难。达到 90% 的 arXiv 提交能成功转换为 HTML 的门槛,将是一个强烈信号,表明通过 HTML 大规模实现 LaTeX 编写文档的可访问性是可行的,并且 arXiv 自身能够长期提供此类官方服务。然而,要保证给定文档的高质量可访问结果,只有当“作者对可访问性有基本理解,并在编写时考虑可访问性”时才有可能\[10 (https://arxiv.org/html/2605.16562#bib.bib7),5 (https://arxiv.org/html/2605.16562#bib.bib6)\]。 ## 2 MathML Intent 与可访问性 我们的 HTML 输出带有 MathML,而不是公式图像。这一选择将数学结构暴露给 Web 平台(可导航表达式、语音输出、响应式重排),并让我们能够在浏览器支持和辅助工具成熟的过程中逐步丰富同样的标记。这一方向在 2023 年成为可能:Igalia 的工作将 MathML Core\[12 (https://arxiv.org/html/2605.16562#bib.bib11)\]引入 Chromium\[7 (https://arxiv.org/html/2605.16562#bib.bib2)\],并完成了跨浏览器支持——原生数学渲染首次在各大浏览器中变得可行。LaTeXML 和 ar5iv 最初已表明,基准的 HTML+MathML 转换在 arXiv 规模上是可行的\[8 (https://arxiv.org/html/2605.16562#bib.bib9),1 (https://arxiv.org/html/2605.16562#bib.bib10)\];当前的挑战是在此基础上构建高质量读出,覆盖 arXiv 页面中全部文档和表达式。arXiv 承载着前沿 STEM 研究,其中的符号体系通常是专门化的、局部过载的,或是首次引入的。在此环境中,默认辅助技术的读出可能不可靠或让听众感到困惑,而对于最新颖最困难的符号体系,补救工作能推进到何种程度仍然是一个开放的研究问题。解决此问题的相关标准是 MathML 4 Intent\[11 (https://arxiv.org/html/2605.16562#bib.bib12)\]。新的`intent`属性携带一种紧凑的表达式语法,并标准化了三个保留值词汇:*核心概念*、*开放概念*和*核心属性*。它还定义了下划线语法用于*字面量*:字符串应原样由辅助技术发音。Core 词汇面向中等和高等教育教学内容,为 STEM 文本中最常见的问题提供标准解决方案。对新颖符号体系的完全补救并非我们当前的重点。我们当前的基线是语法优先。我们用`:literal` intent 属性注释公式,这在系统层面易于分配,并为语音输出提供了可预测的目标。与`:literal`一起,我们输出结构良好、可导航的 MathML Core,通过 LaTeXML 的数学语法从作者的 TeX 构建。我们期望 LaTeXML 对数学表达式的丰富内部表示作为基础,利用 Intent 的 Open 概念构建 MathML 树。我们的 MathML 输出还将每个公式的原始 TeX 源代码作为附加注释携带在元素内部。这使得依赖 TeX 语法的非标准服务能够直接在同一 HTML 页面上操作,无需进一步修改。但我们提醒,在 Web 原生编写中常见的良好行为 TeX 方言只是 arXiv 数学中使用的 TeX 的一个小子集。针对完整 arXiv 语料库的消费者应优先使用 MathML Core 树,其受限的元素和属性词汇表以及标准树结构能提供可预测的下游应用和行为。 ## 3 arXiv 部署与新的 HTML 页面框架 arXiv 的 HTML 论文服务于 2023 年上线\[6 (https://arxiv.org/html/2605.16562#bib.bib8)\],在每个*新*提交上展示一个实验性的 HTML 版本——只要 LaTeXML 能产生输出。历史 arXiv 语料库尚未纳入实时管道,目前仅以 HTML 形式在 ar5iv Labs 站点\[1 (https://arxiv.org/html/2605.16562#bib.bib10)\]提供;将历史文章引入主 HTML 论文渠道是未来的目标。实时管道以大约每季度一次的节奏更新。每次更新整合来自上游 NIST LaTeXML\[8 (https://arxiv.org/html/2605.16562#bib.bib9)\]的内核改进、社区贡献的增强以及 arXiv 自身的鲁棒性补丁。每个 LaTeXML 修复首先作为拉取请求贡献到 NIST 维护的仓库上游;然后要么在 NIST 合并,要么在预览窗口期间应用于 arXiv 的“高速度”LaTeXML 分支。我们的共同目标是让 arXiv 使用的每次升级都能落地上游,从而使两个代码库保持紧密一致。与转换管道并行,我们迭代了包装每篇转换文章页面框架,并于 2026 年 3 月部署了新版本。重构清晰分离了页面标记、主题和页面内服务,使得各部分可以独立演进。这使我们能够响应读者常见的请求,例如减少干扰的阅读体验选项(如最小化周围 UI)以及在窄设备上更好地处理超大构造。 ## 4 影响信号:用户报告与语料统计 我们使用两种互补信号来区分不同故障模式的优先级。第一种是 GitHub 上的公共 `arxiv/html_feedback` 问题追踪器,读者和作者在此报告单篇文章的转换问题\[2 (https://arxiv.org/html/2605.16562#bib.bib5)\]。这些报告直接反映了*最严重*的错误:促使读者创建问题的渲染缺陷。从 2025 年初到 2026 年 4 月,我们已解决了约 6,000 份报告中大约一半。第二种是通过在整个历史 ar5iv 语料库\[1 (https://arxiv.org/html/2605.16562#bib.bib10)\]上运行 LaTeXML 管道收集的大规模缺失包统计,该语料库覆盖约 90% 的 arXiv 文章(有 TeX/LaTeX 源码,其余 10% 仅有 PDF)。这提供了哪些 LaTeX 包和宏最常导致转换失败的汇总视图,并识别出*最频繁*的错误。仅针对频率优化可能会让问题严重的文章处于破损状态,而仅针对报告摩擦优化可能遗漏细微但普遍的错误;同时追踪两者能保持我们工作的可扩展性并对读者可见。 ## 5 语料覆盖率与 LaTeXML v0\.9 我们可以报告 arXiv HTML 输出的两个不同覆盖率指标。目前约 97% 的提交能生成一些 HTML;这个数字是一个可用性上限而非质量声明,且包括渲染部分或效果不佳的文档。更有意义的指标是那些没有 LaTeXML 错误且通常基本可读的文章比例。该比例已下滑至约 75%。这种下滑追踪了文献本身的一个移动目标:会议、期刊和作者采用新的宏包,依赖项持续迁移到较新的 LaTeX 3 定义。该周期内 LaTeXML 最大的结构性变化是改进了原始 LaTeX 3 解释的内核。现在 arXiv 完全运行该内核:没有 LaTeXML 绑定的包被直接加载而非跳过,仅当它们的语义不可恢复时才回退到更简单的 HTML 方言(在可访问性、主题化和响应式布局方面相应权衡)。与内核工作同时,对 arXiv 预印本中最常见的矢量图形和数学渲染路径进行了持续改进,从而扩大了对 TikZ 和 xy 图的覆盖率。即将发布的 LaTeXML v0\.9 还带来前导处理的重构:标题、作者、所属机构及相关元数据现在通过更统一的模型流动,许多类绑定已更新以匹配。结合上述内核和图形处理工作,这直接惠及 arXiv——其论文通常带有复杂的作者元数据。NIST 的 Perl LaTeXML 仍然是生产参考。我们的目标是将 arXiv 预览渠道中的成功进展引入参考仓库,以配合计划于 2026 年夏季发布的 LaTeXML v0\.9。 ## 6 LaTeXML 的 Rust 重实现 我们报告正在进行中的 LaTeXML Rust 重实现,该项目始于 NIST 并继续在 arXiv 进行。其推动力来自三个方面:降低 arXiv 规模的云端转换成本;通过更快的转换改善提交者预览体验;以及可持续性——arXiv 自身正在迁移离开 Perl,后者不再是新项目的主流选择,且贡献者社区持续萎缩。工作始于 2016 年,2020 年至 2024 年间重新集中精力,产生了约 50,000 行手写 Rust 代码,涵盖 TeX 引擎模拟、标记化、消化和 XML 模型。这足以通过核心 LaTeXML 测试套件中的约 25%。翻译工作一直基本休眠,直到 2026 年 2 月和 4 月 Claude Opus 4\.6 和 4\.7 的出现,其代理编码循环使得持续进展变得可行。在大约三周的 AI 辅助开发中,我们取得了我们估计原本需要超过两人年等效手写工作的进展。代理贡献现已接近额外 100,000 行 Rust 代码,并且管道通过了所有核心测试。在与 Perl 实现的输出一致性方面,我们在评估切片的前几百篇 arXiv 文章上达到了同等水平。“同等”是在工程意义上使用的:Rust 管道在相同输入上成功运行,保留了必要的文档结构,并产生了足够相似的 HTML/MathML 以满足下游可访问性和渲染需求。在匹配输入上的早期基准测试显示,Rust 管道运行速度比 Perl 参考快 10–30 倍,支持了推动翻译的成本和预览延迟目标。代码目前是私有仓库;遵循上游 LaTeXML 的许可立场,计划在翻译一致性得到充分确认后,以宽松的公共领域许可发布。这保持了连续性:LaTeXML 的广大用户基础应继续使用生产就绪的 Perl 原版,直到我们确信切换是可行的。我们现在将翻译工作视为关于代理 AI 何时能加速成熟科学软件现代化的案例研究。到目前为止,我们确定了导致代理翻译成功初始阶段所需的七个护栏: 1. 1\. 一个边界明确的翻译任务(从功能完整的 Perl 设计到 Rust); 2. 2\. 在使用任何 AI 之前进行大量手写引导; 3. 3\. 一个可执行的测试套件,包含 332 个覆盖 LaTeXML 管道的案例; 4. 4\. 来自 `rustc`、`clippy` 和用于结构输出验证的 RelaxNG schema 的即时反馈; 5. 5\. 访问权威文档(LaTeXML 手册、Knuth 的 *TeXbook* 以及 TeX 源代码本身); 6. 6\. 访问上游 LaTeXML git 历史,作为 PR 粒度的上下文指南; 7. 7\. 模型在 TeX、Perl、Rust、Unicode、XML 和 HTML 上的跨语言专业知识。 还有一个后盾:由一位资深维护者进行大约每小时一次的审查,捕获那七个护栏未能捕捉的残留故障模式。我们列出此列表并非作为对任何特定模型代的断言,而是作为现代化成熟科学软件的一份配方:依赖测试套件和编译器反馈,致力于范围明确的翻译,用手写代码提供初始指导,并保持一位资深维护者在循环中。 ## 7 展望 长期目标是使天生可访问的数学交流成为默认而非例外。arXiv 是实现这一转变的自然环境:一个开放、活跃、持续增长的语料库,其中的改进能同时传播到数学文献的很大一部分。arXiv 也正处于一个机构转型时期。2026 年 4 月,arXiv 宣布将离开其在康奈尔理工学院的长期驻地,成为一个独立的非营利组织\[3 (https://arxiv.org/html/2605.16562#bib.bib3)\]。新结构旨在赋予 arXiv 以社区现在期望的规模,带来新的稳定性和专注。我们欢迎来自 ICMS 社区的反馈:关于更好的 HTML 论文和可访问数学的合作想法,以及总体上的任何意见。相似文章
@heynavtoor: Rongxin Ouyang 解决了每个非英语世界的研究人员一直在默默忍受的那个问题…
PDFMathTranslate 是一个开源工具,用于翻译科学PDF文件,同时保留数学公式、图表、表格和布局,已被EMNLP 2025接收,并在MIT许可下免费提供。
@askalphaxiv:GPT 5.6 Sol 可以将 arXiv 论文一次转换为交互式 Marimo 笔记本!非常适合通过动手操作来理解的论文…
GPT 5.6 Sol 可以将 arXiv 论文一次转换为交互式 Marimo 笔记本,有助于通过动手操作理解可解释性、推理工程等领域的论文。
PDFMathTranslate: 保留版式的科学文档翻译工具
本文介绍PDFMathTranslate,一款基于大语言模型和精准版式检测技术的开源科学文档翻译工具,可在翻译过程中保留原文档的版式。
@atomic_chat_hq: Mistral OCR 4 将手写的微积分考试卷转化为干净的LaTeX!我们给它一张手写考试页面的照片。这…
Mistral OCR 4 将手写的微积分考试卷转换为干净的LaTeX,准确读取公式并处理图表,但不会重新绘制它们。该模型提供带有边界框和置信度分数的结构化输出,支持170种语言。
面向 LLM 的 Markdown 浏览器
作者介绍了 TextWeb,这是一个开源工具,它将网页渲染为 Markdown 格式供 LLM 处理,而非使用昂贵的大视觉模型,该工具支持命令行界面 (CLI) 和 MCP 服务器。