parsing

标签

Cards List
#parsing

Stoicheia: Character-Level Masked Diffusion for Ancient Greek Textual Restoration, Parsing, and Metrical Scansion

arXiv cs.CL · 6天前 缓存

The paper introduces Stoicheia, a 405M-parameter character-level masked diffusion encoder for Ancient Greek that unifies textual restoration, parsing, and metrical scansion in a single model, outperforming prior systems like Ithaca on benchmark tasks.

0 人收藏 0 人点赞
#parsing

@llama_index: “OCR 现在只是一个功能。前沿模型将吞噬它。”我们不断听到这种说法。数据却表明并非如此。在三个……

X AI KOLs Following · 2026-08-05 缓存

LlamaIndex 认为,文档 OCR 并未被前沿模型商品化,基准数据显示专业解析器仍然更准确且成本更低。

0 人收藏 0 人点赞
#parsing

正则表达式的真正威力(2012)

Hacker News Top · 2026-08-03 缓存

这篇文章解释了像 PCRE 这样的现代正则表达式引擎能够解析远超正则语言的内容,驳斥了“HTML 无法用正则表达式解析”这一常见说法。

0 人收藏 0 人点赞
#parsing

sizeof 在 C 中解析出乎意料地困难

Lobsters Hottest · 2026-08-02 缓存

本文探讨了解析 C 语言 `sizeof` 运算符所面临的挑战,该运算符可以接受表达式或带括号的类型,而复合字面量和后缀运算符又带来了额外的复杂性。文章讨论了解析策略,并指出 C2y 新引入的 `_Countof` 运算符也面临类似问题。

0 人收藏 0 人点赞
#parsing

解析器不一定要复杂

Hacker News Top · 2026-07-29 缓存

一篇博客文章,介绍 bx::Scanner,一组小型零拷贝、无分配的扫描原语,简化了编写解析器的过程,而无需完整的解析器生成器或复杂的 PEG 库。

0 人收藏 0 人点赞
#parsing

快速简易的解析器组合子

Lobsters Hottest · 2026-07-27 缓存

关于在 Scheme (Gambit) 中构建解析器组合子的教程,解释了如何使用函数式编程技术编写快速且可读的解析器。

0 人收藏 0 人点赞
#parsing

AST-grep 如何使用 Rust 重写 Tree-sitter 并使其速度提升 30%

Hacker News Top · 2026-07-26 缓存

ast-grep 用 Rust 重写了 Tree-sitter 的 C 核心,实现了高达 30% 的解析速度提升和 22% 的端到端性能提升,但内存使用略有增加。

0 人收藏 0 人点赞
#parsing

解析C语言中类型推断声明之险

Lobsters Hottest · 2026-07-25 缓存

这篇博文探讨了C23中涉及`auto`作为类型推断说明符或存储类说明符的解析歧义,展示了当`x`是typedef时,GCC和Clang在解析如`auto x = 67;`这样的声明上的分歧,以及属性如何使情况复杂化。

0 人收藏 0 人点赞
#parsing

Microformats – 数据丰富网页的构建模块

Lobsters Hottest · 2026-07-25 缓存

一篇介绍如何在个人网站上消费和使用Microformats 2数据的文章,涵盖解析器选择、获取注意事项和数据存储策略。

0 人收藏 0 人点赞
#parsing

让我们为APL构建一个简单的解释器

Lobsters Hottest · 2026-07-10 缓存

这篇博文开启了一个系列,介绍如何在Python中构建APL解释器,涵盖对包含数字、函数和运算符的基本APL表达式进行分词和解析。

0 人收藏 0 人点赞
#parsing

解析的七十年:理论与实践的影响

Lobsters Hottest · 2026-07-06

七十年解析理论及其在计算机科学中的实际应用概述。

0 人收藏 0 人点赞
#parsing

超越监督式澄清:利用LLM重写输入以辅助对话篇章解析

arXiv cs.CL · 2026-07-03 缓存

本文研究了利用大型语言模型(LLM)重写碎片化对话话语以改进冻结的篇章解析器,发现零样本澄清不可靠,且通过重写进行错误修复存在实际上限,表明可重写性预测是一项缺失的关键能力。

0 人收藏 0 人点赞
#parsing

解析,而非验证——在并不鼓励你这样做的语言中

Hacker News Top · 2026-06-30 缓存

一篇探讨在TypeScript中应用“解析,而非验证”原则的博客文章,展示了如何使用品牌类型(branded types)在解析后保留类型信息,尽管TypeScript的结构类型系统使得这种做法不如在Elm或Haskell等语言中那样自然。

0 人收藏 0 人点赞
#parsing

与AI共事:一个具体例子

Hacker News Top · 2026-06-29 缓存

作者分享了一个具体例子,使用Claude AI调试hyperscript中的解析回归问题,展示了AI辅助开发的优势与不足,并提醒不要过度依赖。

0 人收藏 0 人点赞
#parsing

一种类型化的代数解析方法

Lobsters Hottest · 2026-06-28 缓存

一篇介绍类型化代数解析方法的论文,很可能来自剑桥大学。

0 人收藏 0 人点赞
#parsing

@shubh6200: 要了解如何处理海量文件,请阅读 @geofflangdale 和 @lemir 的《Parsing Gigabytes of JSON per Second》…

X AI KOLs Timeline · 2026-06-24 缓存

该论文介绍了 simdjson,这是第一个能够在单核上使用 SIMD 指令每秒处理数 GB 数据的验证性 JSON 解析器,相比 RapidJSON 等现有解析器实现了显著的加速。

0 人收藏 0 人点赞
#parsing

使用 Python 和 Apache Spark 实现自定义查询语言

Lobsters Hottest · 2026-06-23 缓存

本技术指南介绍了如何使用 Python 和 Apache Spark 实现自定义查询语言(EHQL),重点在于使用 Lark 定义语法和解析。

0 人收藏 0 人点赞
#parsing

Unlimited OCR: 一次性长程解析

Hacker News Top · 2026-06-23 缓存

百度发布Unlimited-OCR,这是一个基于Deepseek-OCR构建的开源模型,用于一次性长程文档解析,支持单张图片、多页文档和PDF。

0 人收藏 0 人点赞
#parsing

@avrldotdev: 最佳指南,适合任何人深入了解HTTP服务器工作原理并亲手构建一个。本文将帮助你学习:0. 网络…

X AI KOLs Timeline · 2026-06-22 缓存

一份全面的指南,介绍HTTP服务器的工作原理,涵盖网络协议、分块编码、状态机、解析器编写和并发基础知识,并附有亲手构建的说明。

0 人收藏 0 人点赞
#parsing

使用C++26静态反射在编译时解析JSON

Lobsters Hottest · 2026-06-15 缓存

C++26的#embed和静态反射,结合simdjson库,允许在编译时解析JSON,将配置文件转化为编译时常量,无运行时开销。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈