标签
房间混响和环境中的低频噪音对语音转文字准确性的影响远大于模型大小的选择;前端音频预处理(如自适应谱减法)可以恢复被掩蔽的音素,并比升级模型后端更有效地降低词错误率。
本文提出一个诊断框架,用于在基于LLM的公共话语立场分析中分离预处理流程不稳定性和测量方法不稳定性,发现跨方法的不一致性比流程效应更大且更具系统性,并且聚合指标可能会掩盖这些不稳定性。
本文研究了NLP中基于预处理的刻板印象缓解方法,发现虽然它们减少了针对特定群体的刻板印象,但可能无意中增加其他人口群体(包括不相关类别)的刻板印象或反刻板印象。作者跨模型系列和预处理策略展示了这些副作用,并讨论了对评估和缓解实践的影响。
本文介绍FourierQK,一种对Transformer注意力中的学习查询和键投影应用基于FFT的频域预处理的方法,在字符级语言建模上实现了显著的验证损失降低。该方法保留了完整的注意力分数结构,并展示了相对于标准点积注意力的可复现收益。
介绍进化特征工程(EFE),一种利用基于LLM的进化来自动发现结构化数据预处理变换的框架,在保持可解释性的同时提高时间序列预测和表格预测的准确性。
本文表明,精心的预处理——尤其是上下文长度选择、归一化和正则化——可以使简单的线性模型(如 Ridge 回归)在时间序列预测基准测试中与大型 Transformer、MLP 和 CNN 模型相竞争或更优。
本文系统研究了Twitter数据情感分析预处理技术的最佳顺序,发现分词影响最大,拼写纠正影响最小,最佳顺序为:分词、清洗、词干提取、停用词去除。
作者分享了在 Hermes 下运行多个持久 AI 代理配置导致 API 成本高昂的经历,通过实施每个配置的分层模型策略、预处理输入以及使用 API 网关进行成本可视化,将每日成本从 14-18 美元降低到 7-10 美元。
本文提出三元后缀分词(TST)方案,一种确定性分词方案,将数字划分为三位组,并附加显式的数量级标记,以改进大语言模型的数值推理能力。该方法通过在标记级别提供透明的数量级关系,解决了标准分词器中数字分割不一致的问题,并提供两种可扩展词汇量的实现变体。