text-processing

标签

Cards List
#text-processing

Desert Ant Labs

Product Hunt · 5天前 缓存

Desert Ant Labs 提供适用于语音、文本和视觉的小型专业AI模型,这些模型可在设备上离线运行,并配备SDK以便轻松集成,且无使用费用。

0 人收藏 0 人点赞
#text-processing

使用 M4 减少重复

Lobsters Hottest · 2026-08-31 缓存

本文解释了如何使用 m4 宏处理器,通过创建自定义宏来减少 OpenBSD 的 httpd 配置中的重复代码。

0 人收藏 0 人点赞
#text-processing

@GoogleDeepMind: 这是最新消息:在嘈杂环境中,对复杂电话号码、邮政编码和订单 ID 的理解能力更强了

X AI KOLs · 2026-08-26 缓存

Google DeepMind 宣布对其 AI 模型进行改进,增强了在嘈杂环境中理解复杂电话号码、邮政编码和订单 ID 的能力,同时加入了去除填充词和识别自定义词汇等功能

0 人收藏 0 人点赞
#text-processing

grapheme-kit: 字素级度量与多语言NLP文本处理

arXiv cs.CL · 2026-07-27 缓存

介绍grapheme-kit,一个开源Python库,该库扩展了词汇距离和评估度量,使其操作于字素簇而非Unicode码点,并改进了对泰米尔语和僧伽罗语的处理。

0 人收藏 0 人点赞
#text-processing

@0xCheshire: 研究了一下到底该怎么去 AI 味,找到了 7 个不同的 GitHub 项目: 中文改稿、英文改稿、技术写作和完整写作流程,都有对应选择。 1. qu-ai-wei(299 star) 中文去 AI 味 Skill,会一起处理套话、抽象表达…

X AI KOLs Timeline · 2026-07-26 缓存

介绍7个GitHub项目,用于去除AI写作痕迹,涵盖中文和英文文本,包括qu-ai-wei、Humanizer等工具,帮助用户写出更像人写的文章。

0 人收藏 0 人点赞
#text-processing

使用sed为书籍制作索引 (1997)

Hacker News Top · 2026-07-23 缓存

一篇1997年的教程,解释了如何使用sed和sort从原始术语-页码列表中为书籍创建格式化索引。

0 人收藏 0 人点赞
#text-processing

Gigatoken: 一个新的开源分词器,比Tiktoken快约100倍,比Huggingface快500-1000倍

Reddit r/LocalLLaMA · 2026-07-21 缓存

Gigatoken 是一个开源分词器,通过SIMD和缓存优化,相对于HuggingFace分词器实现了高达1000倍的加速,相对于Tiktoken实现了100倍加速。它支持作为现有分词器API的直接替代。

0 人收藏 0 人点赞
#text-processing

Show HN: Mojibake – 一个用C语言编写的底层Unicode库

Hacker News Top · 2026-07-16 缓存

Mojibake是一个为C11/C++17设计的自包含Unicode 17库,提供归一化、大小写转换和字符数据库功能,零依赖。

0 人收藏 0 人点赞
#text-processing

ColibotAI

Product Hunt · 2026-06-09

ColibotAI 是一款设备端AI工具,可在无需联网的情况下翻译、总结和解释任何文本。

0 人收藏 0 人点赞
#text-processing

@HowToAI_: 这个仓库将201GB文本压缩至6GB,且不损失任何精度。→ 比向量数据库小97% → 本地运行 →…

X AI KOLs Timeline · 2026-05-15 缓存

这个仓库将201GB文本压缩至6GB,且无精度损失,比向量数据库小97%。它可本地运行,并为Claude提供即插即用的MCP,完全开源且私密。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈