natural-language-processing

标签

Cards List
#natural-language-processing

Prompts in the Wild: A Large Analyzed Collection of Transactional Prompts in Code

arXiv cs.CL · 昨天 缓存

This paper presents a large collection of 57.5K transactional prompts extracted from GitHub, introducing an ontology to analyze their linguistic structure and usage patterns across languages, tasks, and modalities.

0 人收藏 0 人点赞
#natural-language-processing

内涵照应

arXiv cs.CL · 昨天 缓存

本文研究内涵照应,认为基于描述的前提比现有的基于价值的解释更能说明代词的许可条件,并在一种名为 Plural Intensional Presuppositional predicate calculus (PIP) 的新逻辑中形式化了这一提议。

0 人收藏 0 人点赞
#natural-language-processing

类别结构保持胜过多样性:不平衡文本分类的文本增强方法综合基准

arXiv cs.CL · 昨天 缓存

本文在7个不平衡分类数据集上对11种文本增强方法进行了基准测试,包括经典扰动、嵌入空间检索和基于LLM的方法。研究发现,基于检索的过采样(EmbSMOTE)优于基于LLM的增强方法,并且保持类别条件结构比表面多样性更为重要。

0 人收藏 0 人点赞
#natural-language-processing

Reddit上在线性暴力叙事中的污名与支持

arXiv cs.CL · 2天前 缓存

这篇学术论文介绍了SCOPEdataset,将在线性暴力幸存者叙事中的污名信号与Reddit评论中的支持类型联系起来,发现内在化污名最为普遍,且社区回应在不同污名类型间保持稳定。

0 人收藏 0 人点赞
#natural-language-processing

ELMER:探索与精炼的进化语言模型

arXiv cs.LG · 3天前 缓存

介绍了ELMER,一种进化语言模型,它搜索自然语言策略描述并将其编译成可执行程序,使用经直接偏好优化微调的Qwen3-8B来控制变异强度并提高搜索效率。

0 人收藏 0 人点赞
#natural-language-processing

检测机器学习工程岗位简历中的软技能

arXiv cs.LG · 3天前 缓存

本文分析了机器学习工程师、数据科学家和软件工程师简历中软技能的表达方式,使用基于LLM的流程区分显式关键词与叙述性描述,并针对候选人侧数据检验需求侧假设。

0 人收藏 0 人点赞
#natural-language-processing

AI将5000年前的楔形文字泥板翻译成英文。

Reddit r/ArtificialInteligence · 3天前

人工智能已被用于将古老的5000年前的楔形文字泥板翻译成英文,展示了语言模型解码历史文本的新应用。

0 人收藏 0 人点赞
#natural-language-processing

立法证词中的自我介绍检测

arXiv cs.CL · 4天前 缓存

本文介绍了一个用于检测立法委员会证词中自我介绍的机器学习流程,使用词袋和BERT概率等特征。XGBoost取得了最佳F1分数0.9747,并通过BERT增强特征进一步改进。

0 人收藏 0 人点赞
#natural-language-processing

SurakshaEval:面向多语言大语言模型的印度语言安全基准

arXiv cs.CL · 4天前 缓存

介绍了 SurakshaEval,一个涵盖十种印度语言和英语的大语言模型安全基准,包含跨越七种危害类型的人工编写提示词。对多语言大语言模型进行基准测试,并发现了过度拒绝、在印度语言语境中遗漏隐含偏见等问题。

0 人收藏 0 人点赞
#natural-language-processing

NL2SHACL-Bench: A Benchmark Suite for Natural Language to SHACL Translation

arXiv cs.AI · 4天前 缓存

Introduces NL2SHACL-Bench, a benchmark suite for translating natural language requirements into SHACL shapes, evaluating four state-of-the-art LLMs and showing they struggle with semantic equivalence for complex patterns.

0 人收藏 0 人点赞
#natural-language-processing

使用生物标本记录对非地名录地名进行地理参照

arXiv cs.CL · 5天前 缓存

本文介绍了对生物标本记录中发现的历史和方言地名(这些地名不在当前地名录中)进行地理参照的方法,比较了确定性方法、概率方法和基于LLM的方法。概率推理实现了最高精度,而LLMs提供了有竞争力但精度稍低的估计。

0 人收藏 0 人点赞
#natural-language-processing

ConstructCIE:从建筑事故叙述中提取因果信息的数据集

arXiv cs.CL · 5天前 缓存

本文介绍了ConstructCIE,这是一个用于从OSHA建筑事故叙述中提取因果信息的人工标注数据集,并评估了监督序列标注器和指令微调的大语言模型在端到端层次化提取中的表现。

0 人收藏 0 人点赞
#natural-language-processing

自动化条目评估:利用LLM生成的评语预测条目的接受与拒绝

arXiv cs.AI · 5天前 缓存

本文介绍了一种自动化条目评估(AIE)模型,该模型利用微调的DeBERTa分类器,基于原始条目文本和Qwen3生成的评语来预测标准化测试中条目的接受/拒绝状态,取得了中等准确率,并凸显了公平性相关拒绝所带来的挑战。

0 人收藏 0 人点赞
#natural-language-processing

基于LLM生成的合成数据训练的模型的临床沟通处理:结构化综述与新型应用案例研究

arXiv cs.CL · 2026-08-07 缓存

本文综述了使用LLM生成的合成数据进行临床沟通处理的研究,并展示了13个案例研究,涵盖EMS报告、护士交接等场景,表明合成数据能够助推临床NLP系统的构建。

0 人收藏 0 人点赞
#natural-language-processing

分解蕴含用于事实性检查与幻觉检测

arXiv cs.CL · 2026-08-07 缓存

本文提出HallDetect,一种轻量级、无需参考的幻觉检测框架,它将生成内容分解为原子声明,并通过紧凑的蕴含模型进行验证。在多个基准测试中,它优于资源相当的基础模型,并提供了从声明到文本片段的审计轨迹。

0 人收藏 0 人点赞
#natural-language-processing

Sparse Mutual Information Graph Averaging for Improving Random Indexing Embeddings

arXiv cs.CL · 2026-08-07 缓存

This paper studies using sparse PPMI graph averaging to refine Random Indexing embeddings, showing it improves accuracy on a fairytales analogy benchmark but trails neural baselines on text8 and SimLex-999.

0 人收藏 0 人点赞
#natural-language-processing

抽象事件因果规则:归纳与应用

arXiv cs.AI · 2026-08-07 缓存

本文提出了抽象事件因果规则(AECR),一种关系级因果抽象范式,将具体的因果关系对转化为广义的因果逻辑。它引入了一个用于因果归纳的多智能体系统和一个基于注意力的编码器,从而改善事件预测,尤其是对稀有和未见事件。

0 人收藏 0 人点赞
#natural-language-processing

Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models

arXiv cs.CL · 2026-08-05 缓存

This paper proposes speculative correction, a training-free draft-then-refine decoding strategy for diffusion language models, showing quality-latency improvements using LLaDA2.1 models.

0 人收藏 0 人点赞
#natural-language-processing

Surrogate Substitution Preserves PHI Detectability: A Multi-Detector Equivalence Study

arXiv cs.AI · 2026-08-05 缓存

This paper evaluates whether structure-preserving de-identification via surrogate substitution maintains PHI detectability across multiple detectors, using equivalence testing on 57k paired spans across 7 languages and 11 detectors.

0 人收藏 0 人点赞
#natural-language-processing

Observatorio Lázaro:西班牙新闻界英语借词使用的自填充数据库

arXiv cs.CL · 2026-08-04 缓存

本文介绍了 Observatorio Lázaro,这是一个持续更新的数据库和公共网络/API 资源,利用神经序列标注模型监测西班牙数字新闻中的英语借词使用情况,记录了 2020 年至 2026 年间超过两百万条借词。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈