标签
本文讨论了前沿的LLM模型如何在降低幻觉率方面取得进展,并认为人类也经常产生幻觉,建议我们应该更多地信任先进的AI模型,同时保持批判性思维。
一条推文幽默地指出,随着AI变得更聪明,作者写出没有拼写或语法错误的句子的能力在下降。
本次基准发布比较了24个大语言模型与人类作家在475个创意写作提示上的表现,使用自定义奖励模型显示前沿模型优于业余作家,但不及专业作家。
本文探讨当前顶级人工智能模型是否比普通人更聪明,强调首先需要定义智能。
一篇论文对8个LLM与超过18,000名人类学习者进行了比较,发现LLM的高准确率可能掩盖了基础知识的不连贯性,并推荐使用连贯的问题集进行评估。
本文对大型语言模型如何解释言语概率表达式进行了系统性的跨模型评估,发现它们能够忠实追踪人类基准,但存在偏差,尤其是在负面表达方面,这对人类与AI之间的不确定性交流有影响。
讨论了前沿AI模型如GPT-5.6 Sol的先进能力,质疑它们是否构成AGI,并反思AI在复杂认知任务中正成为一种商品。
本文使用言语流畅性数据比较人类与大语言模型之间的语义搜索动态,发现人类表现出更加多变和探索性的搜索模式,而当前模型无法重现这些模式。