标签
一位具有编码背景的VP/PM分享了使用Claude Opus和Fable等LLM的实践经验,重点指出了模型在记忆、幻觉和原创性方面的局限,同时强调了人类直觉和领域专业知识不可替代的价值。
Hebbia CEO George Sivulka 指出,平均而言人类比 Token 更便宜,但在规模化场景下优质 Token 更便宜。中位数企业 Agent 成本约 80 美元/小时,管理得当时可低至 4 美元/小时,管理差则高达 7000 美元/小时。
这篇来自耶鲁大学和芝加哥大学的论文发现,LLM生成的研究思路与人类研究思路的主要区别不在于质量,而在于范围:LLM产生的思路更窄,其中47%-64%的思路侧重于连接不同的工作,而人类的这一比例仅为12.1%。
本研究论文引入了一个框架,用于衡量人类生成与LLM生成的研究思路之间的分布差距,发现LLM思路集中在特定的机会模式与综合方法上,而人类思路则更为多样化。
一项名为Humanity vs Singular的Reddit实验测试人类是否能识别AI的劝说——AI生成的评论试图影响关于一个有争议的说法的讨论,目的是观察在AI参与下,社区是否仍能达成共识。
本文深入分析了AI的样本效率远低于人类的问题,指出前沿模型需要海量领域特定数据,而人类仅需少量示例即可学习,这种数据黑洞是当前AI发展的核心瓶颈。文章通过多个比较(标记量、机器人操控、驾驶)和反驳常见反对意见,论证了这一差距的严峻性,并探讨了对AI自动化目标的影响。
询问软件工程师估计到2026年年中AI与人类编写代码的百分比,引发对SWE中AI现状的讨论。
Aaron Levie 的 AI 精神病定律描述了CEO等远离实际工作的人如何倾向于高估AI取代人类的能力,只关注理想情况的结果,而忽视了工作中复杂的最后步骤。
一篇观点文章讨论了将真实艺术作品标记为AI生成如何导致错误的批评,并指出'slop'的定义是缺乏人类故事,而非AI参与。
一项研究评估了AI评审员(GPT-5.2、Claude Opus 4.5、Gemini 3.0 Pro)与45位人类专家评审员对Nature系列期刊论文的评审表现,发现AI评审员在综合评审质量上可以超越评分最高的人类评审员,尽管其准确性略低,但能提出更多重要问题。