标签
该推文讨论了Chamath的观点:继信息免费之后,专业判断力正在成为免费的基础设施,软件正在吞噬专业能力。
本文介绍了UPBench,这是一个基准测试,用于评估大型语言模型在城市规划知识方面的表现,涵盖四个知识支柱和五个认知层次。研究发现,模型在高阶分析任务上表现优于事实回忆,并识别出如监管幻觉和实践智慧缺失等认知局限。