transformer-models

标签

Cards List
#transformer-models

用于多轮短信钓鱼检测的扩展合成对话数据集

arXiv cs.CL · 2026-06-08 缓存

本文介绍了COVA-X,一个用于短信钓鱼检测的扩展合成多轮对话数据集,并表明Longformer现在优于XGBoost,从而证实了Transformer模型受益于更大的训练语料库。

0 人收藏 0 人点赞
#transformer-models

# 微调长存:针对特定任务的Transformer在Reddit虚假信息回复分类中优于零样本LLM

arXiv cs.CL · 2026-06-04 缓存

# 悉尼科技大学研究人员对比微调 Transformer 与零样本 LLM 在 Reddit 虚假信息回应分类任务中的表现 悉尼科技大学的研究人员对微调 Transformer 模型(DistilBERT、RoBERTa)与零样本 LLM(Llama 系列、Claude、Gemini)在 Reddit 虚假信息回应分类任务中的性能进行了比较,发现微调后的 RoBERTa 达到了 0.62 的宏观 F1 分数,而最佳零样本模型仅为 0.50。研究表明,针对特定任务的微调优于更大规模的通用模型,在检测信念传播方面尤为突出,同时前沿模型中的安全对齐机制可能会对模型性能产生负面影响。

0 人收藏 0 人点赞
#transformer-models

为什么金融机构正汇聚于交易基础模型以构建自身智能

NVIDIA Blog · 2026-06-02 缓存

金融机构正从孤立的AI模型转向基于Transformer架构的统一交易基础模型,如NVIDIA的报告和Revolut的PRAGMA模型所示,该模型改善了欺诈检测、信用评分和推荐,同时减少了特征工程工作量。

0 人收藏 0 人点赞
#transformer-models

一罩定乾坤:编辑后隐藏事实的发现与探究

arXiv cs.LG · 2026-05-29 缓存

本文研究了知识编辑方法ROME和MEMIT的内部机制,揭示了这些编辑依赖于一个共同的权重功能子空间,且是抑制而非覆盖知识,从而解释了编辑为何无法传播到相关事实。

0 人收藏 0 人点赞
#transformer-models

法律判决预测中的时间概念漂移:基于乌克兰法院判决三个时期的神经基线

arXiv cs.CL · 2026-05-26 缓存

本文通过在地缘政治动荡定义的三个时期的乌克兰法院判决上微调Transformer模型,研究法律判决预测中的时间概念漂移。发现显示严重的前向退化、反向迁移的不对称性,以及按时间顺序的持续学习有效缓解遗忘,而领域预训练降低退化幅度。

0 人收藏 0 人点赞
#transformer-models

语言模型需要睡眠

Hugging Face Daily Papers · 2026-05-25 缓存

本文提出了一种针对Transformer模型的类睡眠巩固机制,该机制利用快速权重和递归传递来改进长上下文处理,同时保持推理速度。

0 人收藏 0 人点赞
#transformer-models

Counter Turing Test 的发现:AI生成文本检测

arXiv cs.CL · 2026-05-21 缓存

本文介绍了 Counter Turing Test 共享任务在AI生成文本检测方面的发现,顶级系统在二分类任务中达到了完美表现,但在模型归因方面性能显著较低,突显了区分不同大语言模型输出的难度。

0 人收藏 0 人点赞
#transformer-models

德语政治文本的意识形态预测

arXiv cs.CL · 2026-05-15 缓存

该论文提出了一种基于Transformer的模型,用于在连续的左-右光谱上预测德语政治文本的政治意识形态。研究比较了13个模型,发现DeBERTa-large和Gemma2-2B在不同任务上表现最佳。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈