标签
该论文审计了24项跨越1950年至2026年的通用人工智能预测,发现79%的预测甚至无法证伪,且七十五年来预测质量并未提升。
一个新的综合排名将三个公开的TTS排行榜合并为一个统一的排名,涵盖110个模型和46个提供商,每周更新并采用固定方法。
本文介绍了一种自动化方法,从76,000篇能源系统研究中提取定量技术经济数据,整理出320万个结构化数据点。由此产生的FAIR数据库能够分析文献趋势,并为能源模型提供输入数据。
一篇论文分析了在严格的大小和时间限制下训练语言模型的参数高尔夫开放挑战,发现单个技术很少能将BPB提高超过1%,但总体上实现了13.6%的降低。
一项对夸大AI生产力主张的批判性分析,引用了严谨的研究表明,与供应商经常声称的5-10倍相比,实际收益只有15-40%,并警告不要盲目接受这种炒作。
本系统综述对139项研究进行了分析,提出了一个统一的框架和元分析,用于通过多模态和多视图信息融合进行文档分类,发现融合提高了准确性(平均提升+5.28个百分点),但也揭示了可重复性挑战。
一篇 2026 年的博客文章重新审视了提示语气和上下文深度如何改变大模型回答,发现带有玩家风格的丰富提示比光秃秃的问题更能获得有数据支撑的深入答案。
Anthropic的经济研究团队回顾了56项美国的随机研究和欧洲关于工人再培训计划的实验,发现平均效果不大,并认为如果AI大规模取代工人,现有计划很可能无法满足需求。