nlp

标签

Cards List
#nlp

Loanword or Switch? The Annotation Boundary, Not the Model, Drives Kazakh-Russian Code-Switching Identification

arXiv cs.CL · 5天前 缓存

This paper argues that the loanword-vs-switch annotation boundary, rather than the choice of model, drives Kazakh-Russian code-switching identification. The authors present a document-level gold LID dataset with an explicit annotation rule and show that naive heuristics and off-the-shelf LID tools fail to distinguish integrated borrowings from genuine code-switches.

0 人收藏 0 人点赞
#nlp

DE-NER:通过大型语言模型的对话引导实现零样本命名实体识别

arXiv cs.CL · 5天前 缓存

介绍DE-NER,一种用于零样本命名实体识别的对话引导框架,通过提问者和角色扮演LLM之间的自我对弈来明确实体边界,相比基线平均提高了3.75%的F1值。

0 人收藏 0 人点赞
#nlp

构建用于检测俄语社交媒体文本中自杀前兆和反自杀信号的大规模数据集的方法学

arXiv cs.CL · 5天前 缓存

本文提出了一种从社交媒体文本构建大规模俄语数据集的方法,用于检测自杀前兆和反自杀信号,包括标注指南和基线分类实验。

0 人收藏 0 人点赞
#nlp

从文本描述预测初创企业退出——一个计算语言学框架

arXiv cs.CL · 5天前 缓存

本研究应用计算语言学和监督式机器学习,仅凭文本描述即可预测早期初创企业的退出情况,发现创始人叙述携带预测信号,并引入了一个可量化的夸张得分(Hyping Score)。

0 人收藏 0 人点赞
#nlp

DataSpace:异构工作空间上可验证分析的数据代理基准

Hugging Face Daily Papers · 5天前 缓存

介绍了DataSpace,一个用于在异构工作空间上评估数据代理可验证表格分析能力的基准测试,包含410个跨语言任务和7,439个工件。当前前沿模型仅达到66.34%的准确率,表明仍有提升空间。

0 人收藏 0 人点赞
#nlp

ChronoLens:跨时间、跨语言和语言层面的语言变化测量

Hugging Face Daily Papers · 5天前 缓存

ChronoLens是一个框架,利用多语言语言模型和crosscoders测量五个议会传统(1803–2026年)中4498万篇文档跨语言层面的历史语言变化,表明变化幅度和方向在不同语言和不同时间会有所不同。

0 人收藏 0 人点赞
#nlp

Categorization with NLP

Lobsters Hottest · 5天前 缓存

A developer deep dive into an NLP-based grocery categorization tool, covering input lexing, stemming, and a unigram database approach to classify products into categories.

0 人收藏 0 人点赞
#nlp

@DanKornas:将来自网站、社交平台、电子邮件和信息源的非结构化新闻转化为可发布的智能报告是困…

X AI KOLs Timeline · 5天前 缓存

Taranis AI 是一个开源 OSINT 工具,利用人工智能和自然语言处理来收集、丰富和整理来自多个来源的非结构化新闻,以生成可发布的情报报告。

0 人收藏 0 人点赞
#nlp

突厥语族语言机器翻译的跨语言迁移

arXiv cs.CL · 6天前 缓存

本文利用mT5和成对迁移矩阵,研究了五种突厥语族语言之间的机器翻译跨语言迁移,发现迁移在紧密相关的语言对之间最强,并且在文字不匹配的设置中,拉丁化有所帮助。

0 人收藏 0 人点赞
#nlp

使用警方事故叙述对前沿大语言模型进行基准测试:对照官方事故数据库编码

arXiv cs.LG · 6天前 缓存

本文对六种前沿大语言模型(LLM)进行基准测试,评估其根据警方事故叙述为事故属性编码的效果,并与官方致命事故数据库进行对照。研究发现,虽然 GPT-5.5 High 在 LLM 中表现领先,但简单基线方法的性能可与 LLM 媲美甚至更优,且属性间的差异大于模型间的差异。

0 人收藏 0 人点赞
#nlp

跨移民路线体验性互文性检测:超越法语叙事的表面相似性

arXiv cs.CL · 6天前 缓存

本文介绍了体验性互文性检测,使用包括零样本LLM评分在内的无标注方法,以识别来自不同路线的法语移民叙事中共享的体验回声。

0 人收藏 0 人点赞
#nlp

M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models

arXiv cs.CL · 6天前 缓存

M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.

0 人收藏 0 人点赞
#nlp

From Inline Notes to Collected Commentaries: Toward Context-Preserving Organization of Exegetical Knowledge in Classical Chinese Texts

arXiv cs.CL · 6天前 缓存

This paper presents a computational framework for automatically compiling collected commentaries on classical Chinese texts, preserving contextual dependencies of inline notes via prompt chaining and cross-source clustering.

0 人收藏 0 人点赞
#nlp

TELLER: Dual-Path Iterative Preference Optimization for Table Entity Linking

arXiv cs.CL · 6天前 缓存

Presents TELLER, a dual-path iterative preference optimization approach for table entity linking, with direct-answer and reasoning paths that improve accuracy on TableInstruct and MammoTab V2 benchmarks.

0 人收藏 0 人点赞
#nlp

LLM的财务推理是否可信?基于长周期报表的真实世界测试

arXiv cs.CL · 6天前 缓存

介绍了FinIndices,一个大规模基准测试,用于评估LLM在未裁剪财务报表上的数据处理保真度,揭示了财务推理中的知识瓶颈和结构瓶颈。

0 人收藏 0 人点赞
#nlp

使用GMM和LLM通过定向数据增强进行不平衡数据聚类

arXiv cs.CL · 6天前 缓存

本文提出了一种新颖的无监督数据增强方法,结合高斯混合模型和大语言模型,通过为代表性不足的聚类生成合成文档,改善不平衡文本数据集上的聚类效果。

0 人收藏 0 人点赞
#nlp

分层 Copula-Gumbel-Top-\texorpdfstring{$K$}{K} 路由:固定逐词元路由律下冻结混合专家模型的双侧依赖控制

arXiv cs.LG · 6天前 缓存

本文介绍了分层 Copula-Gumbel-Top-K(H-CGA)路由,一种在冻结混合专家模型中控制词元路由选择之间联合依赖关系的方法,同时保持每个词元的路由律完全固定。它提供了一致性与负载分散之间的理论权衡,并通过一个小规模试点验证了该机制。

0 人收藏 0 人点赞
#nlp

搜索、检查、获取:利用布尔检索赋能深度研究智能体

Hugging Face Daily Papers · 6天前 缓存

本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。

0 人收藏 0 人点赞
#nlp

@antoniolupetti: 《理解Transformer与注意力机制》是一篇非常有趣的论文,它从应用数学的角度介绍了Transformer架构…

X AI KOLs Timeline · 6天前 缓存

一条推文重点介绍了一篇由Michel Fabrice Serret撰写的arXiv论文,该论文从应用数学的角度介绍了Transformer和注意力机制,涵盖了向量化、多头注意力以及降低注意力成本的方法,如KV缓存和Latent Attention。

0 人收藏 0 人点赞
#nlp

@stanfordnlp: Throwback Thursday – 但现在你应该看2024年的CS224N视频(https://youtube.com/playlist?list=PL…)

X AI KOLs Following · 2026-07-31 缓存

Stanford NLP Group 推荐了2024年的CS224N视频播放列表,提醒观众观看最新的基于深度学习的自然语言处理讲座。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈