parsing

标签

Cards List
#parsing

解析表达式语法与正则表达式对比:在Lisp中构建导出HTML(通过SXML)的Org解析器

Lobsters Hottest ↗ · 2026-09-24 缓存

该博文介绍了构建OrgWebAlchemy的过程,这是一个采用解析表达式语法(Parsing Expression Grammars)的Guile Scheme库,用于解析Org mode文档并通过SXML转换为HTML,同时对比了在此任务中PEGs与正则表达式的优劣。

0 人收藏 0 人点赞
#parsing

Tilia—Haskell 的新格式化工具

Lobsters Hottest ↗ · 2026-09-17 缓存

Tilia 是 Haskell 的一个新格式化工具,它解决了诸如注释处理、运算符固定性推断和 CPP 支持等挑战。

0 人收藏 0 人点赞
#parsing

如何让不支持的工具调用响应在LLM基准测试中变得“完全稳定”

Reddit r/artificial ↗ · 2026-09-03

LLM基准测试的评分流程可能由于预处理而错误地将不支持的工具调用响应视为稳定的空输出,这凸显了在评估中区分解析失败和真实输出的重要性。

0 人收藏 0 人点赞
#parsing

优化Markdown解析器的内存使用

Lobsters Hottest ↗ · 2026-08-23 缓存

这篇博客文章详细介绍了优化C++ Markdown解析器内存使用的技术,通过arena分配和指针压缩,将AST节点大小从232字节显著减少到16字节,同时保持解析速度。

0 人收藏 0 人点赞
#parsing

关于编译器构建的观点

Lobsters Hottest ↗ · 2026-08-19 缓存

本文分享了关于现代编译器构建的个人观点,主张使用如OhmJS进行解析和Prolog进行类型检查的工具,重点强调简洁性和迭代开发。

0 人收藏 0 人点赞
#parsing

我们正在将 dotenvy 分叉为 dotenv-ng

Hacker News Top ↗ · 2026-08-17 缓存

SecretSpec 发布了 dotenv-ng,这是 dotenvy 的一个现代 Rust 分叉版,旨在修复诸如 bcrypt 片段等秘密的解析问题,并处理 .env 文件处理中的维护缺口。

0 人收藏 0 人点赞
#parsing

Stoicheia: Character-Level Masked Diffusion for Ancient Greek Textual Restoration, Parsing, and Metrical Scansion

arXiv cs.CL ↗ · 2026-08-10 缓存

The paper introduces Stoicheia, a 405M-parameter character-level masked diffusion encoder for Ancient Greek that unifies textual restoration, parsing, and metrical scansion in a single model, outperforming prior systems like Ithaca on benchmark tasks.

0 人收藏 0 人点赞
#parsing

@llama_index: “OCR 现在只是一个功能。前沿模型将吞噬它。”我们不断听到这种说法。数据却表明并非如此。在三个……

X AI KOLs Following ↗ · 2026-08-05 缓存

LlamaIndex 认为,文档 OCR 并未被前沿模型商品化,基准数据显示专业解析器仍然更准确且成本更低。

0 人收藏 0 人点赞
#parsing

正则表达式的真正威力(2012)

Hacker News Top ↗ · 2026-08-03 缓存

这篇文章解释了像 PCRE 这样的现代正则表达式引擎能够解析远超正则语言的内容,驳斥了“HTML 无法用正则表达式解析”这一常见说法。

0 人收藏 0 人点赞
#parsing

sizeof 在 C 中解析出乎意料地困难

Lobsters Hottest ↗ · 2026-08-02 缓存

本文探讨了解析 C 语言 `sizeof` 运算符所面临的挑战,该运算符可以接受表达式或带括号的类型,而复合字面量和后缀运算符又带来了额外的复杂性。文章讨论了解析策略,并指出 C2y 新引入的 `_Countof` 运算符也面临类似问题。

0 人收藏 0 人点赞
#parsing

解析器不一定要复杂

Hacker News Top ↗ · 2026-07-29 缓存

一篇博客文章,介绍 bx::Scanner,一组小型零拷贝、无分配的扫描原语,简化了编写解析器的过程,而无需完整的解析器生成器或复杂的 PEG 库。

0 人收藏 0 人点赞
#parsing

快速简易的解析器组合子

Lobsters Hottest ↗ · 2026-07-27 缓存

关于在 Scheme (Gambit) 中构建解析器组合子的教程,解释了如何使用函数式编程技术编写快速且可读的解析器。

0 人收藏 0 人点赞
#parsing

AST-grep 如何使用 Rust 重写 Tree-sitter 并使其速度提升 30%

Hacker News Top ↗ · 2026-07-26 缓存

ast-grep 用 Rust 重写了 Tree-sitter 的 C 核心,实现了高达 30% 的解析速度提升和 22% 的端到端性能提升,但内存使用略有增加。

0 人收藏 0 人点赞
#parsing

解析C语言中类型推断声明之险

Lobsters Hottest ↗ · 2026-07-25 缓存

这篇博文探讨了C23中涉及`auto`作为类型推断说明符或存储类说明符的解析歧义,展示了当`x`是typedef时,GCC和Clang在解析如`auto x = 67;`这样的声明上的分歧,以及属性如何使情况复杂化。

0 人收藏 0 人点赞
#parsing

Microformats – 数据丰富网页的构建模块

Lobsters Hottest ↗ · 2026-07-25 缓存

一篇介绍如何在个人网站上消费和使用Microformats 2数据的文章,涵盖解析器选择、获取注意事项和数据存储策略。

0 人收藏 0 人点赞
#parsing

让我们为APL构建一个简单的解释器

Lobsters Hottest ↗ · 2026-07-10 缓存

这篇博文开启了一个系列,介绍如何在Python中构建APL解释器,涵盖对包含数字、函数和运算符的基本APL表达式进行分词和解析。

0 人收藏 0 人点赞
#parsing

解析的七十年:理论与实践的影响

Lobsters Hottest ↗ · 2026-07-06

七十年解析理论及其在计算机科学中的实际应用概述。

0 人收藏 0 人点赞
#parsing

超越监督式澄清:利用LLM重写输入以辅助对话篇章解析

arXiv cs.CL ↗ · 2026-07-03 缓存

本文研究了利用大型语言模型(LLM)重写碎片化对话话语以改进冻结的篇章解析器,发现零样本澄清不可靠,且通过重写进行错误修复存在实际上限,表明可重写性预测是一项缺失的关键能力。

0 人收藏 0 人点赞
#parsing

解析,而非验证——在并不鼓励你这样做的语言中

Hacker News Top ↗ · 2026-06-30 缓存

一篇探讨在TypeScript中应用“解析,而非验证”原则的博客文章,展示了如何使用品牌类型(branded types)在解析后保留类型信息,尽管TypeScript的结构类型系统使得这种做法不如在Elm或Haskell等语言中那样自然。

0 人收藏 0 人点赞
#parsing

与AI共事:一个具体例子

Hacker News Top ↗ · 2026-06-29 缓存

作者分享了一个具体例子,使用Claude AI调试hyperscript中的解析回归问题,展示了AI辅助开发的优势与不足,并提醒不要过度依赖。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈