data-preprocessing

标签

Cards List
#data-preprocessing

@ZyphraAI:Zyphra Research 发布 PUFFER,一种用于大规模语言模型数据集的新型增量模糊去重系统。PUFFER 运行……

X AI KOLs Timeline ↗ · 2026-09-01 缓存

Zyphra Research 发布 PUFFER,这是一种针对大规模语言模型数据集的增量模糊去重系统,完全在 CPU 上运行,比现有方法快 11-35 倍,已根据 Apache 2.0 协议开源。

0 人收藏 0 人点赞
#data-preprocessing

@RealYDT: https://x.com/RealYDT/status/2065641164016120201

X AI KOLs Timeline ↗ · 2026-06-13 缓存

微软推出MarkItDown工具,旨在将各种文档格式(如PDF、Word、Excel)转换为Markdown,以方便大模型和RAG系统处理企业数据。

0 人收藏 0 人点赞
#data-preprocessing

使用语法与语义上下文评估汇总(SSAS)的情感预测一致性分析

arXiv cs.CL ↗ · 2026-04-20 缓存

本论文提出了SSAS(语法与语义上下文评估汇总)框架,旨在通过分层分类和迭代汇总来减少噪声和方差,提高基于大语言模型的情感预测的一致性。在三个行业标准数据集上的实证评估显示,数据质量和企业决策可靠性可提升30%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈