标签
这篇文章批判性地审视了一部Netflix的AI纪录片,突出了其浅薄的分析、对Sam Altman的偏见描绘,以及忽略了与AI相关的更深层社会和环境问题。
TypeSafe AI推出了其Jev模型,声称没有幻觉且概率经过校准,但文章质疑校准缺乏公开证据,同时指出开发者快速采用。
一次怀疑性的深入研究发现Humanity's Last Exam基准测试中存在许多错误,官方的o3-mini评分器错误地标记正确答案为错误。
本文批判了专为AI编码时代设计的编程语言Bend 2,指出其陷入了'氛围编程'的陷阱,并将其与SPARK等形式化验证方法进行了不利的比较。
作者批评了 AI 模型 Astra 在代码架构决策上的不足和对删除不必要的代码的抵制,认为它应该接受更好的训练以适应长期的软件工程实践。
这篇帖子批评有效利他主义是傲慢行为,并引用推文指控有效利他主义者将AI安全作为政治意识形态来阻碍技术进步。
本文批评了科技行业中对'AI agent'一词的过度使用,主张使用诸如'shard'之类的术语来指代更简单、有界限的组件,以避免对自主性产生误导性认知。
作者对OpenAI的研究实习里程碑提出批评,建议AI代理应基于其劝阻或放弃不良实验的能力进行衡量,以节省研究人员的时间,并作为智能的一种形式。
作者尝试使用MaleCNS v1.0果蝇连接组来玩《Pong》,但未能学会。审计失败揭示了电路连接的关键问题,并突显了像Doom、Minecraft和Beat Saber模组这类流行AI项目的缺陷。
Alex Gibney 的近四小时纪录片《Musk》在威尼斯首映,批评了 Elon Musk,但突出了他在火箭、汽车和基础设施方面的技术成就。
本文批评了Artificial Analysis Intelligence Index作为一个毫无意义的基准,质疑其在比较像Qwen 27B这样的LLM与更大模型如GPT-5.2和Opus 4.6时的有效性。
作者认为,当前的人工智能智能体基准测试忽略了诸如错误处理、人工干预和长期可靠性等实际问题,强调了操作因素对现实世界可信度的重要性。
一位用户发推文分享了他向AI模型Opus 5请教佛学的经历,并评论了'seamslop'这个概念,它可能指的是AI生成内容的质量。
一条推文批评AI和风险投资人士错误地将倡导AI护栏的人标记为“减速者”,并暗示其他人实际上是进步的减速者。
RA-CAD 提出了一种用于文本到CAD生成的状态感知智能体,采用生成-执行-批判-重写循环,并通过组相对策略优化进行反馈驱动的智能体优化。它在CADFusion和Text2CAD基准上实现了最先进的执行有效性和几何质量。