标签
This paper presents a large collection of 57.5K transactional prompts extracted from GitHub, introducing an ontology to analyze their linguistic structure and usage patterns across languages, tasks, and modalities.
本文研究内涵照应,认为基于描述的前提比现有的基于价值的解释更能说明代词的许可条件,并在一种名为 Plural Intensional Presuppositional predicate calculus (PIP) 的新逻辑中形式化了这一提议。
本文在7个不平衡分类数据集上对11种文本增强方法进行了基准测试,包括经典扰动、嵌入空间检索和基于LLM的方法。研究发现,基于检索的过采样(EmbSMOTE)优于基于LLM的增强方法,并且保持类别条件结构比表面多样性更为重要。
这篇学术论文介绍了SCOPEdataset,将在线性暴力幸存者叙事中的污名信号与Reddit评论中的支持类型联系起来,发现内在化污名最为普遍,且社区回应在不同污名类型间保持稳定。
介绍了ELMER,一种进化语言模型,它搜索自然语言策略描述并将其编译成可执行程序,使用经直接偏好优化微调的Qwen3-8B来控制变异强度并提高搜索效率。
本文分析了机器学习工程师、数据科学家和软件工程师简历中软技能的表达方式,使用基于LLM的流程区分显式关键词与叙述性描述,并针对候选人侧数据检验需求侧假设。
人工智能已被用于将古老的5000年前的楔形文字泥板翻译成英文,展示了语言模型解码历史文本的新应用。
本文介绍了一个用于检测立法委员会证词中自我介绍的机器学习流程,使用词袋和BERT概率等特征。XGBoost取得了最佳F1分数0.9747,并通过BERT增强特征进一步改进。
介绍了 SurakshaEval,一个涵盖十种印度语言和英语的大语言模型安全基准,包含跨越七种危害类型的人工编写提示词。对多语言大语言模型进行基准测试,并发现了过度拒绝、在印度语言语境中遗漏隐含偏见等问题。
Introduces NL2SHACL-Bench, a benchmark suite for translating natural language requirements into SHACL shapes, evaluating four state-of-the-art LLMs and showing they struggle with semantic equivalence for complex patterns.
本文介绍了对生物标本记录中发现的历史和方言地名(这些地名不在当前地名录中)进行地理参照的方法,比较了确定性方法、概率方法和基于LLM的方法。概率推理实现了最高精度,而LLMs提供了有竞争力但精度稍低的估计。
本文介绍了ConstructCIE,这是一个用于从OSHA建筑事故叙述中提取因果信息的人工标注数据集,并评估了监督序列标注器和指令微调的大语言模型在端到端层次化提取中的表现。
本文介绍了一种自动化条目评估(AIE)模型,该模型利用微调的DeBERTa分类器,基于原始条目文本和Qwen3生成的评语来预测标准化测试中条目的接受/拒绝状态,取得了中等准确率,并凸显了公平性相关拒绝所带来的挑战。
本文综述了使用LLM生成的合成数据进行临床沟通处理的研究,并展示了13个案例研究,涵盖EMS报告、护士交接等场景,表明合成数据能够助推临床NLP系统的构建。
本文提出HallDetect,一种轻量级、无需参考的幻觉检测框架,它将生成内容分解为原子声明,并通过紧凑的蕴含模型进行验证。在多个基准测试中,它优于资源相当的基础模型,并提供了从声明到文本片段的审计轨迹。
This paper studies using sparse PPMI graph averaging to refine Random Indexing embeddings, showing it improves accuracy on a fairytales analogy benchmark but trails neural baselines on text8 and SimLex-999.
本文提出了抽象事件因果规则(AECR),一种关系级因果抽象范式,将具体的因果关系对转化为广义的因果逻辑。它引入了一个用于因果归纳的多智能体系统和一个基于注意力的编码器,从而改善事件预测,尤其是对稀有和未见事件。
This paper proposes speculative correction, a training-free draft-then-refine decoding strategy for diffusion language models, showing quality-latency improvements using LLaDA2.1 models.
This paper evaluates whether structure-preserving de-identification via surrogate substitution maintains PHI detectability across multiple detectors, using equivalence testing on 57k paired spans across 7 languages and 11 detectors.
本文介绍了 Observatorio Lázaro,这是一个持续更新的数据库和公共网络/API 资源,利用神经序列标注模型监测西班牙数字新闻中的英语借词使用情况,记录了 2020 年至 2026 年间超过两百万条借词。