标签
The paper introduces Stoicheia, a 405M-parameter character-level masked diffusion encoder for Ancient Greek that unifies textual restoration, parsing, and metrical scansion in a single model, outperforming prior systems like Ithaca on benchmark tasks.
LlamaIndex 认为,文档 OCR 并未被前沿模型商品化,基准数据显示专业解析器仍然更准确且成本更低。
这篇文章解释了像 PCRE 这样的现代正则表达式引擎能够解析远超正则语言的内容,驳斥了“HTML 无法用正则表达式解析”这一常见说法。
本文探讨了解析 C 语言 `sizeof` 运算符所面临的挑战,该运算符可以接受表达式或带括号的类型,而复合字面量和后缀运算符又带来了额外的复杂性。文章讨论了解析策略,并指出 C2y 新引入的 `_Countof` 运算符也面临类似问题。
一篇博客文章,介绍 bx::Scanner,一组小型零拷贝、无分配的扫描原语,简化了编写解析器的过程,而无需完整的解析器生成器或复杂的 PEG 库。
ast-grep 用 Rust 重写了 Tree-sitter 的 C 核心,实现了高达 30% 的解析速度提升和 22% 的端到端性能提升,但内存使用略有增加。
这篇博文探讨了C23中涉及`auto`作为类型推断说明符或存储类说明符的解析歧义,展示了当`x`是typedef时,GCC和Clang在解析如`auto x = 67;`这样的声明上的分歧,以及属性如何使情况复杂化。
一篇介绍如何在个人网站上消费和使用Microformats 2数据的文章,涵盖解析器选择、获取注意事项和数据存储策略。
这篇博文开启了一个系列,介绍如何在Python中构建APL解释器,涵盖对包含数字、函数和运算符的基本APL表达式进行分词和解析。
本文研究了利用大型语言模型(LLM)重写碎片化对话话语以改进冻结的篇章解析器,发现零样本澄清不可靠,且通过重写进行错误修复存在实际上限,表明可重写性预测是一项缺失的关键能力。
一篇探讨在TypeScript中应用“解析,而非验证”原则的博客文章,展示了如何使用品牌类型(branded types)在解析后保留类型信息,尽管TypeScript的结构类型系统使得这种做法不如在Elm或Haskell等语言中那样自然。
作者分享了一个具体例子,使用Claude AI调试hyperscript中的解析回归问题,展示了AI辅助开发的优势与不足,并提醒不要过度依赖。
该论文介绍了 simdjson,这是第一个能够在单核上使用 SIMD 指令每秒处理数 GB 数据的验证性 JSON 解析器,相比 RapidJSON 等现有解析器实现了显著的加速。
本技术指南介绍了如何使用 Python 和 Apache Spark 实现自定义查询语言(EHQL),重点在于使用 Lark 定义语法和解析。
百度发布Unlimited-OCR,这是一个基于Deepseek-OCR构建的开源模型,用于一次性长程文档解析,支持单张图片、多页文档和PDF。
一份全面的指南,介绍HTTP服务器的工作原理,涵盖网络协议、分块编码、状态机、解析器编写和并发基础知识,并附有亲手构建的说明。
C++26的#embed和静态反射,结合simdjson库,允许在编译时解析JSON,将配置文件转化为编译时常量,无运行时开销。