Picolibrary:一家小型出版机构
摘要
本文介绍了如何利用人工智能工具进行光学字符识别及合同起草,从而重新出版书籍,同时重点阐述了在格式处理及特殊文本元素处理方面所面临的挑战。
暂无内容
查看缓存全文
缓存时间: 2026/09/08 12:38
# Picolibrary:一家极小的出版机构
来源:https://novalis.org/blog/2026-08-31-picolibrary-a-very-small-press.html
我决定重新出版一本书。在联邦信息空间里,有个人——我记不清是谁了——说《Mmaa教授的讲座》(https://picolibrary.com/mmaa)是他们最喜欢的书。于是我联系了版权所有者,询问是否可以将其重新出版。抱歉,我知道自己本应专注于游戏开发(https://highmountainabbey.com/),但这个夏天实在太忙,实在抽不出空。另外,我几年前就曾询问过这些版权问题,直到现在才得到回复。为了迷惑大家,我一直说这是我买的第一本书。
最终与我沟通的代理人对一个从未出版过书籍的人联系过来感到有些惊讶。我只能说,既然我能做出游戏,肯定也能把书出版出来。而且由于我曾经从事软件自由相关的法律工作,对版权法也相当熟悉。(实际上,我对版权法的了解甚至超过了亚马逊,他们最初因为认为这本书属于公共领域而拒绝出版,但在我解释之后才改变主意。)其实只要动手去做就行。(https://milan.cvitkovic.net/things_youre_allowed_to_do/)
以下是关于整个出版流程的一些记录。首先是从合同开始。虽然我自信能够自己起草合同,但没必要这么做,因为作家协会已经提供了非常出色的标准合同模板(https://authorsguild.org/resource/model-trade-book-contract/)。这个合同对作家来说当然非常实用(这也在意料之中),而且还能用简洁的英文解释每项条款的含义。但由于这是重印本,版权情况有所不同(而且我也对合同中的某些条款有不同意见),所以我没有直接使用该模板。Claude根据作家协会的合同为我制定了新合同,我也确认这正是我想要的版本。我还得提醒Claude注意朗读问题(https://nfb.org/images/nfb/publications/bm/bm09/bm0906/bm090603.htm);显然,我希望这本书也能让盲人及其他阅读障碍者阅读!Claude对初稿的内部审核还发现了大约九处缺失的条款。让Claude来检查工作成果,几乎总能找到需要修改的地方。
接下来是文本准备阶段。过去,Dover出版社会为想要重印的公共领域作品制作照片复刻版。虽然效果不算完美,但在20世纪的技术条件下已经足够使用。现在我们身处21世纪,可以直接扫描书籍并进行OCR识别。不过OCR识别经常会出错,尤其是当书中包含非英文文本时。过去人们需要手动修正这些错误,而现在则有大型语言模型可以帮我们完成这项工作。不过我得提醒大家,这种方式并不完美,尤其是在格式处理方面。《Mmaa教授的讲座》中包含插图、表格、下标、小写字母、斜体等内容,这些都需要手动检查。不过文本本身我没有发现任何错误。你可能会认为查找扫描错误很简单——只要搜索非单词字符即可。但实际上这本书里充满了独一无二的词汇,比如“Brillat‑Beetonin”、“kcourage”、“Homomahomet”、“abbovvve”、“Maetermith”等等。哦,还有未翻译的法语内容。大型语言模型处理这些内容简直易如反掌。档案管理员们几年前就已经知道大型语言模型的这一强大能力了(https://arxiv.org/abs/2411.03340)。
起初我打算使用互联网档案馆的扫描版本,可惜他们的扫描版本是1975年版的,而版权所有者希望我使用1953年版的文本。这两个版本之间存在很大差异——1975年版的篇幅实际上长了近20%,而且到处都是新增内容。比如下面这段:
> “如果再加上极其虔诚的Archussher提出的论点,他基于从左到右阅读纤维素集合体的方式——也就是所谓的《创世记》第五章——得出的结论是,根据‘homo’本身的说法,它的出现时间是在公元前4004年10月28日上午九点;那么即便我们同意把某些科学家所称的‘notyethomo’以及另一些科学家所称的‘nomorehomo’都称为‘homo’,我们也能看出关于这种哺乳动物年龄的各种估计之间存在多大差异。”
除了新增内容外,1975年版还有一些细微的措辞改动——比如“everyone”被替换成了MLP(https://en.wiktionary.org/wiki/everypony)对应的表达“every termite”。此外,1975年版还使用了美式拼写,而且没有伯特兰·罗素的序言。
于是我决定直接给每一页拍照,然后让Claude进行OCR识别。虽然繁琐,但还是可行的。为了测试一下,我进入Claude的网页界面,让它处理第一页内容,结果它以版权法为由拒绝了。伙计,你难道不记得自己是怎么被训练的吗?它反而建议我使用专业的书籍扫描服务。既然你自己拒绝做,为什么还要给我指导如何“侵犯版权”呢?(老实说,当我告诉它我有相关版权时,它根本不相信。)
我找到了一个名为1DollarScan的机构。他们说如果我想获得原版书籍,就需要给他们发邮件,于是我就这么做了,结果他们报出的价格……根本不是一美元。实际上,差不多是每页一美元左右。所以最后我选择了Bound Book Scanning(https://boundbookscanning.com/)。他们的价格要合理得多(仍然不是一美元),而且工作质量也很高。
Claude Code似乎并不太在意版权问题。在加入伯特兰·罗素的序言之前,它还会礼貌地询问我是否有相关版权(我没有,于是我就去获取了版权)。除此之外,它很乐意帮忙处理扫描后的文本。虽然这和直接进行OCR识别的工作性质有所不同——它是基于已有的扫描结果进行处理,而非完全独立完成OCR识别——但实际上Claude Code最终还是完成了大量的OCR工作。
将文本交给大型语言模型处理确实有点可怕——它们以产生幻觉而闻名。(我知道有些人认为幻觉问题已经得到了解决,其实并没有。我曾经让Claude帮我找一些平角短裤,结果它竟然错误地声称以色列没有内衣产业。)不过对于OCR识别来说,即使是对一些已经绝版的文本,比如这本小说,Claude也能完成相当不错的识别工作。
电子书出版还需要做一些特定的决策。很多人会在手机上阅读书籍,这意味着诗歌内容往往需要额外的换行处理。举个例子:《Mmaa教授的讲座》中有一段诗歌的扫描版本,文本如下(行号已标出):“The Peace and Torment are in my gustatory organ, (行号)And my gustatory organ crawls all along my fore-(行号)and my mid-(行号)and my hind-gut(行号)And my guts live in my flesh,”;其中fore-、mid-和hind-都通过对齐在破折号处来表示它们都指的是肠道的不同部位。但在我的Pixel 9手机上,使用Kindle的默认设置和竖屏模式时,“And my gustatory organ crawls all along my”会占据整行,导致fore-的内容被换到下一行。我们最终决定将“my”也换到下一行,同时保持破折号的对齐。虽然没有完美的解决方案,但我觉得这样最能体现Themerson的写作意图。Claude经过几次尝试,最终在不同屏幕尺寸下都让文本显示得恰到好处。当然,如果使用更大的屏幕或打印版本,就不需要换行了。
这不仅是一个美学上的挑战,还有技术上的难题。书中有一处内容是“the Detective imitates the sound of the old Enemy of termites – the Dove\.”。这些角色的形象其实并没有具体的名称,只是由直线、弧线以及重音符号构成。我差点就把这些弧线表示为U+2323笑脸符号,直线则用破折号和竖线来表示。但由于使用组合重音符号无法正确显示,Claude建议使用ruby字符(https://en.wikipedia.org/wiki/Ruby_character),我之前听说过这个概念(我曾经学过日语),但从未想过会用到它。这确实是个好主意,只是Kindle会将ruby字符显示在笑脸符号的上方过远,而且它也不支持用于调整位置的CSS样式(这是我在Claude帮我制作了一个可以交互式调整重音符号大小/高度的工具之后才发现的)。所以其实这并不是个好主意。后来我又试着使用Themerson原始符号的图片,但这些图片是黑白的,在深色模式下看起来很糟糕(而且Kindle也不支持用于深色模式的自定义图片CSS)。最终我们决定将Themerson的符号手绘成字体并嵌入到书中。哎呀。
总之,经过一番繁琐的格式调整后,《Mmaa教授的讲座》1953年版的原始文本终于准备就绪了!
哦,我还需要一个网站(https://picolibrary.com/),这就需要一个域名,进而也需要一个机构名称。我通常都是以自己的名字开展项目,这样大家就能知道会得到什么——一些奇怪的东西。但出版机构通常会有正式的机构名称,而且把别人的书署上自己的名字也感觉有点奇怪。我选择“Picolibrary”这个名字,就是为了强调这只是一个小型的副业项目。我知道有时候小项目也会发展壮大。本内特·瑟夫曾经说过:“我们只是打算偶尔出版几本书”,结果却创立了Random House。我不指望自己也会遇到这种情况。不过我手头还有不少多余的ISBN编号(在美国,如果你想要两个ISBN,最好直接买十个),所以一切皆有可能。
我让Claude帮忙搭建网站,结果它生成了一些极其滑稽的、完全是编造出来的关于这家出版机构及其使命的文字。它甚至还真的用了“genuinely”这个词,似乎是怕有读者真的怀疑这些内容是不是胡编的。我删掉了那些内容,用自己的风格来撰写网站内容。(需要说明的是:这本来就是我的计划;我从不使用人工智能生成的文本,因为我觉得读起来很糟糕。)
现在,如果你想阅读我读过最奇怪的书之一(而我已经读过《叶之屋》了),那你就可以去阅读《Mmaa教授的讲座》(https://picolibrary.com/mmaa/)。这本书讲述的是白蚁的生活体验,而且伯特兰·罗素还推荐过它!
相似文章
出版业正在发生什么?
本文讨论了一个 Commonwealth Foundation 短篇小说奖得主可能由 AI 共同撰写的争议,重点介绍了使用 Gemini 等 AI 工具评估写作的情况,以及这对文学出版信任度的潜在影响。
Pinery Prose
Pinery Prose 是一款书籍合著 AI,它会把每次编辑记录为必须经你批准的差异(diff)。
Bibby AI:面向学术研究、写作与出版的编辑器原生智能平台
Bibby AI 是一个编辑器原生平台,它将从文献发现到投稿的学术写作流程整合在一起,利用操作文档语法表示的智能体来执行引文插入、结构编辑和格式调整。
Publia
Publia 是一个平台,用于发布人工智能生成的内容,让用户轻松部署 AI 生成的内容或应用程序。
PixelRead AI OCR
PixelRead AI OCR 是一款 Mac 工具,使用 AI 来捕获、翻译和理解文本。