human-comparison

标签

Cards List
#human-comparison

关于幻觉率

Reddit r/artificial ↗ · 2026-09-22

本文讨论了前沿的LLM模型如何在降低幻觉率方面取得进展,并认为人类也经常产生幻觉,建议我们应该更多地信任先进的AI模型,同时保持批判性思维。

0 人收藏 0 人点赞
#human-comparison

@petergyang: AI变得越聪明,我组出没有拼写或语法错误的连贯句子的能力就越差…

X AI KOLs Timeline ↗ · 2026-09-19

一条推文幽默地指出,随着AI变得更聪明,作者写出没有拼写或语法错误的句子的能力在下降。

0 人收藏 0 人点赞
#human-comparison

我们针对475个创意写作提示,对24个大语言模型与人类作家进行了基准对比

Reddit r/LocalLLaMA ↗ · 2026-09-18

本次基准发布比较了24个大语言模型与人类作家在475个创意写作提示上的表现,使用自定义奖励模型显示前沿模型优于业余作家,但不及专业作家。

0 人收藏 0 人点赞
#human-comparison

我们是否终于可以说当今的顶级AI模型比普通人更聪明?如果不是,还缺少什么?

Reddit r/artificial ↗ · 2026-09-13

本文探讨当前顶级人工智能模型是否比普通人更聪明,强调首先需要定义智能。

0 人收藏 0 人点赞
#human-comparison

@rohanpaul_ai: 人类通常需要先掌握基础再学习高级技能;我们需要在了解更难的事物之前先知道基础知识…

X AI KOLs Following ↗ · 2026-09-12 缓存

一篇论文对8个LLM与超过18,000名人类学习者进行了比较,发现LLM的高准确率可能掩盖了基础知识的不连贯性,并推荐使用连贯的问题集进行评估。

0 人收藏 0 人点赞
#human-comparison

“不太可能”有多不可能?评估大型语言模型对言语概率的感知

arXiv cs.CL ↗ · 2026-08-28 缓存

本文对大型语言模型如何解释言语概率表达式进行了系统性的跨模型评估,发现它们能够忠实追踪人类基准,但存在偏差,尤其是在负面表达方面,这对人类与AI之间的不确定性交流有影响。

0 人收藏 0 人点赞
#human-comparison

前沿AI可能在广泛的认知工作中已超越大多数个体的准确性。这怎能不是AGI?我们是否总在不断抬高标准?

Reddit r/ArtificialInteligence ↗ · 2026-08-24

讨论了前沿AI模型如GPT-5.6 Sol的先进能力,质疑它们是否构成AGI,并反思AI在复杂认知任务中正成为一种商品。

0 人收藏 0 人点赞
#human-comparison

使用自然语言处理比较人类与大语言模型中的语义导航

arXiv cs.CL ↗ · 2026-07-15 缓存

本文使用言语流畅性数据比较人类与大语言模型之间的语义搜索动态,发现人类表现出更加多变和探索性的搜索模式,而当前模型无法重现这些模式。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈