标签
该推文指出,能够处理气味的多模态大语言模型尚未存在,凸显了当前人工智能技术的局限性。
讨论语音代理在转录为文本时如何丢失语调、犹豫和说话人身份等副语言信号,并质疑这些特征是否以及如何在下游被捕获和使用。
Gary Marcus 重点介绍了著名数学家陶哲轩关于人工智能与数学的讲座,指出其中提到的“证明消化不良”等风险,并认为AI可能只擅长某些数学任务,而非理论构建。
一位用户开玩笑说,ChatGPT 5.6 无法正确相加总和为100的数字,而是得到81,凸显了AI在基础算术上的局限性。
文章讨论了为何LLM无法从用户交互中学习,且缺乏确定性的真值层,提出动态知识图谱可以减少幻觉并在医学等高风险领域提升性能。
本文认为,当前的人工智能计算机使用代理通常通过直接访问API或编写脚本绕过实际用户界面,导致基准测试结果虚高,实际表现不可靠。文章指出,忽视界面是一种有缺陷的方法,无法泛化到杂乱的GUI环境中。
Electric Capital的Avichal Garg指出了人工智能无法复制的三大竞争优势,其中第三项并非技能。
作者分享了两年内使用AI构建平台的经验,指出了六种反复出现的故障模式(补丁式、假设式、漂移式、幻觉式、缺乏常识式、最小阻力式),并认为即使模型不断改进,这些故障模式依然存在,且变得更加难以察觉。
文章对比了OpenAI GPT-5.6 Soul和Anthropic Claude Fable 5在物理3D打印零件复制和自主杂志制作中的表现,Soul在速度和设计精度上略胜一筹,但两者在复杂现实任务中均需大量人工干预,暴露了当前AI在现实制造任务中的局限性。
一位开发者借助AI构建了一个完整的3D开放世界赛车游戏,详细说明了AI表现出色的地方(样板代码、孤立系统)以及失败的地方(空间推理、系统集成、游戏手感)。该游戏已上线并有真实的日常玩家。
一篇分析,质疑自2025年2月惊艳发布以来,Deep Research AI产品的进展为何停滞不前,指出尽管有渐进式改进,但已知弱点(如幻觉和不可靠的源验证)依然存在。
一篇观点文章,认为真正自主的自动驾驶汽车尚未实现,批评特斯拉的过度承诺,并强调当前AI系统(如大语言模型)的局限性。
本文探讨了AI模型在长对话中维持上下文的局限性,重点指出了近期偏差以及上下文窗口大小与实际理解之间的区别。文章还建议了一些实用的变通方法,如重复说明约束条件和使用持续更新的上下文文档。
一项新研究在28项真实世界研究中测试了LLM,发现它们仅在53%的情况下与人类多数一致,与随机猜测无异,挑战了用LLM取代人类反馈的趋势。
一份指南,识别了盲目依赖大语言模型时的七个常见陷阱,如幻觉、谄媚和提示注入,并提供了如何避免每个陷阱的实用建议。
Gergely Orosz反思了AI未能加速进展的领域,例如跨地区推出金融服务和支持旧硬件,并指出软件从来都不是主要瓶颈。
文章批判AI公司用AI取代中层管理人员的商业模式,指出许可费可能追平员工薪酬,且人类天生需要人际互动,因此大规模替代不现实。
Yann LeCun指出,尽管AI取得了进展,我们仍然缺乏L5级自动驾驶汽车,以及能够像人类青少年或10岁儿童那样表现的家用机器人。