replication-study

标签

Cards List
#replication-study

经典语义抽取式摘要能否在印地语中进行评估?一项复现研究

arXiv cs.CL ↗ · 2026-09-25 缓存

本文复现了一种针对印地语的分布式语义抽取式摘要方法,并在标准语料库上进行评估,发现句子位置是唯一有效的特征,且当前的印地语基准测试未能激励高级内容选择。

0 人收藏 0 人点赞
#replication-study

在基础开放权重模型中重现情感表征的几何结构

arXiv cs.CL ↗ · 2026-09-22 缓存

本研究使用Google的Gemma-2-27b模型,重现了AI模型中情感表征在几何上镜像人类情感心理学的发现,并扩展分析以定位关键层并评估词元级别效应。

0 人收藏 0 人点赞
#replication-study

关于拖延症一项有影响力研究中的欺诈证据

Hacker News Top ↗ · 2026-08-31 缓存

一项复制研究未能重现一篇2022年关于拖延症与截止日期的论文发现,引发对原始有影响力研究数据欺诈的指控。

0 人收藏 0 人点赞
#replication-study

GPT-5.4:一个变音符号将输出率从47%提升至94%(可复制?)

Reddit r/ArtificialInteligence ↗ · 2026-08-24

一项关于GPT-5.4的研究表明,在系统提示中添加一个变音符号可以显著提高精确输出产物的比率,从47%提升至94%,并提供了论文以供复现。

0 人收藏 0 人点赞
#replication-study

FLOPs 与实际运行:AI效率评估中复现的重要性

arXiv cs.AI ↗ · 2026-08-18 缓存

本文复现了一项关于使用FLOPs评估AI效率的研究,验证了原始FLOPs在新硬件上不适合作为执行时间的度量,并强调了研究中完整复现包的必要性。

0 人收藏 0 人点赞
#replication-study

为AI智能体提供自然语言工具的显著效果:一项跨14个模型验证NLT性能的重复研究

arXiv cs.CL ↗ · 2026-07-07 缓存

这项重复研究独立验证了自然语言工具(NLT)框架在14个模型和8,560次试验中的有效性,结果显示,与结构化工具调用相比,NLT将工具调用准确率提高了14.9个百分点,并将关键错误减少了93%,其中较小模型和推理模型的收益最为显著。

0 人收藏 0 人点赞
#replication-study

模型在哪里找到快乐?开源LLM中的情感向量

arXiv cs.CL ↗ · 2026-06-26 缓存

本文复现了开源权重大语言模型Apertus-8B和Gemma-4-E4B中'情感向量'的发现,表明价态几何结构在不同模型间可恢复,但层间出现时机存在差异。研究还发现唤醒编码对用于提取的故事语料库敏感。

0 人收藏 0 人点赞
#replication-study

我们能信任AI推断的用户状态吗?一个用于验证LLM在操作环境中用户状态分类可靠性的心理测量学框架

arXiv cs.AI ↗ · 2026-05-18 缓存

本文实证检验了基于LLM的用户状态分类的心理测量学可靠性,发现213项指标中仅有31项满足可靠性标准,对实时自适应系统中的信任提出了质疑。

0 人收藏 0 人点赞
#replication-study

大型语言模型中的毒性测量与缓解:一项全面的复制研究

arXiv cs.CL ↗ · 2026-05-15 缓存

这项复制研究评估了DExperts在缓解LLM毒性方面的效果,发现其对显式毒性几乎完美安全,但对隐式仇恨言论效果降低,并且存在显著的延迟权衡。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈