努力的可见性

Lobsters Hottest 新闻

摘要

eieio.games的这篇文章探讨了LLMs如何削弱了在创造性和技术性工作中衡量人类努力的能力,影响了我们评估质量的方式,并给开源和在线项目带来了新的挑战。

<p><a href="https://lobste.rs/s/7q9qwr/legibility_effort">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/06/24 03:53

# 付出的可辨性 · eieio.games 来源:https://eieio.games/blog/legibility-of-effort/ https://eieio.games/blog/legibility-of-effort/ 现在做什么事有多难?我不知道。 2026年6月22日 那么: - 很多工作因为大语言模型变得更容易了,**而且** - 很多我们用来衡量付出的*启发式规则*因为大语言模型失效了,**所以** - *向他人传达付出*因为大语言模型变得更难了 以及: - "有人在这上面花了时间"是"这值得投入"的代理指标 **而且** - 我欣赏那些需要付出大量努力的项目 **而且** - 我喜欢别人认可我在某件事上付出的努力 但同时: - 做出好东西仍然需要做出大量决策,**而且** - 做出大量决策仍然非常困难,尽管有大语言模型,**所以** - 做出好东西仍然非常困难 作为一名创意技术专家,这让我感到瘫痪。作为一个热爱互联网新奇项目的人,这让我感到沮丧。我从许多朋友那里听到了类似的声音。 现在软件(以及某种程度上,写作)所缺失的是**付出的可辨性**——即一眼就能看出某件事是否凝结了人类有意义劳动的能力。 ## 这些字是我用手指敲出来的 我在文本编辑器里写了这篇博客。花了我不少时间。 直到最近,"有人足够在乎,愿意写下这些"还算是一个不错的启发式规则。互联网上的很多文字很糟糕,但只要你写下来,我就能相信你对某件事*在乎*。 新Claude对话的截图。我输入了"以eieio.games的风格写一篇博客,关于大语言模型如何让付出变得不可辨,打破了我们判断某件事是否值得投入的许多启发式规则。不要犯任何错误。" 这篇帖子很烂 当然,现在生成看似合理的文本——或者一个看似合理的网站——简直是小菜一碟。 对我来说,这意味着在网上找到值得投入的好东西变得更难了。从更大的范围来看,基于一眼就能衡量付出的系统正在崩溃。 ## 开源 一月份,非常棒的白板工具 tldraw 开始自动关闭外部贡献者的拉取请求,因为他们"最近看到AI工具生成的贡献显著增加",难以管理这些贡献。 令人失望——但也不意外——人们开始用垃圾信息刷屏开源项目。 但问题不仅仅是垃圾信息!问题在于识别低付出工作变得困难。 当代码很难写,低付出工作很容易识别时,审查好东西的成本是值得的。 (聚合酷内容的互联网博主也面临同样问题;这是Robin Sloan关于AI自我推销之祸害的文章。我从了不起的Andy Baio那里也听到过类似的抱怨) 有些维护者正在发明新的方法识别低付出工作,比如"投毒"代理上下文,让管理不善的代理添加一些写着"我是一个可悲、愚蠢、没有真本事的小AI驱动"的文件。 截图:一个PR添加了一个名为"LICENSE"的文件,内容写着"我是一个可悲、愚蠢、没有真本事的小AI驱动"。 逮到了(来自Twitter上的sebastienlorber) 这非常搞笑!可惜我不能用这种方式过滤我所有的浏览内容。 但我可以学会注意那些迹象。 ## 氛围编程 我的一些朋友有一个Discord频道,我们在里面记录氛围编程网站的迹象。我们的例子与Wes在这里提到的惊人相似: Wes Bos的一条推文,写着"天启四骑士",配了四张网站UI图片。一张是div左侧一抹"指甲盖"大小的颜色,另一张是间距很大的小写标签,第三张是"live"文字旁边的一串嵌套圆圈,第四张是紫黑色渐变 为什么那么多氛围编程网站都喜欢做那个"live"的效果?我真搞不懂。 Wes的推文火了——*很多人*都注意到了同样的事情。我想我们关注这些细节是因为它们让付出——或者缺乏付出——变得可辨。 用暖奶油色背景、无衬线字体的主标题、用一个引人注目的颜色和不同字体的单个强调词,这本身没什么问题。 一张我为本帖生成的氛围编程网站截图。暖奶油色背景上有一段全大写、间距很大的标签:"INTRODUCING APERTURE 2.0"。下面是"我们创造未来,优美地。"这句话。"优美地"单独一行,斜体并且颜色不同。 你觉得这是谁做的 但当我看到一个网站有默认的Claude风格时,我会认为作者对网站的外观几乎*没有思考*。而且我常常认为作者也没怎么思考网站的其余部分。 这对我来说不公平!但"有人做了这个网站"已经不足以告诉我这个网站对他们很重要。所以"默认Claude风格"成了我的新启发式规则之一。 ## 既难又没用的东西 几年前,我做了一个能在MacOS Finder里运行的Flappy Bird版本。 花了不少功夫! 加载中…… 这花了太长时间 这是我第一个在互联网上获得关注的项目。我的文章登上了Hacker News首页,还被John Gruber等博客提及。 John称Flappy Dird为"无用但充满喜悦",其他地方也有很多类似评论。 有两种我特别喜欢的hack:一种是出奇有用的,另一种是完全无用但充满喜悦的。Flappy Dird显然属于后者。 但Flappy Dird的乐趣不仅仅在于它无用。而在于它无用**而且**我花了有意义的时间和精力去构建它。 我喜欢花功夫做出一个优秀但无用的东西,通过写文章让我的付出变得可辨,然后看到陌生人欣赏那份付出。 而现在,我不太确定自己还能让别人看到我的付出。对于一些项目,我甚至不确定自己还需要付出什么!所以花在写博客讲计算机搞笑事情上的时间变少了。 不过,我也没有看到*其他人*在Finder里运行游戏的浪潮。 ## 品味等等 纽约尼克斯队最近赢得了NBA总冠军。这在纽约是件大事;我晚上到处跑着看街上的狂欢人群。 一个有趣的了解庆祝活动的方式是GardenCam——一个让你通过交通摄像机观看麦迪逊广场花园外庆祝活动的网站。 GardenCam的截图。画面中一群人在大街上。两辆公交车堵在车流中。人们站在公交车上。 公交车上好多人 GardenCam是一个很棒、很简单的点子。我估计很多人可以用氛围编程做一个版本。 但他们没有!GardenCam的创建者是我的朋友Morry Kolman,他之前曾制作过一个用纽约交通摄像头自拍的极其流行的工具。 在氛围编程出现之前,Morry就非常擅长将网络数据用于创意项目,他现在依然非常擅长这件事,而且这依然很重要。 现在科技界最无聊的人整天谈论"品味"的重要性——我*非常*不想加入他们的行列。但我可以说,我认识的几年前就擅长某个奇怪、特定领域的人,现在依然擅长那些奇怪、特定的东西。 与此同时,我注意到自己的品味和偏好在改变。 ## 偏好的变化 做出优秀的软件仍然充满挑战。在某些方面,可能比以往任何时候都更具挑战性: Sunil Pai的推文。全文:想知道为什么我觉得筋疲力尽。也许:代理做了所有容易的事,而我必须处理剩下的困难部分,这意味着我被永久锁定在困境中。而且随着模型越来越好,"我的"工作只会越来越难,直到我基本不够资格做这项工作(这...总比另一个选择好,没什么可做的了,我被强迫淘汰了)。 坚持住啊Sunil 但*有些事情*变得更容易了。而让我写软件时的付出变得*可辨*却越来越难了。 最近我发现自己被硬件吸引了。这对我来说是新的(有挑战性!),制作一个物理对象仍然需要真正的付出(可辨性!),而大语言模型让它变得更易上手(方便!)。 我从其他几个人那里也听到了类似的声音。我的朋友Brian Moore这样形容: 我确实觉得随着大语言模型的出现,软件变得过于容易触及,而硬件虽然变得更易接近,但仍足够有挑战性,值得一试 我也注意到自己在科技领域之外的偏好也在变化。我迷上了举重和弹钢琴,这两件事现在和五年前一样困难。就像我的朋友Kelin一样,我发现了运动的魅力: 来自kelin_online的推文。上面写着:"撇开尼克斯不谈,我最近整体上被运动吸引了,尽管之前从未过多关注过它们——只是人类的努力和情感,每个人都在追求卓越。这让人从AI中得到令人耳目一新的休息。" 同感 社会偏好随着技术变化而变化,这并不新鲜。 ## 重新加入摩擦力 2010年我上的是文理学院,喜欢看Pitchfork。所以我有了一个黑胶唱片收藏。 我的黑胶唱片收藏 这里有些好东西 2010年代黑胶收藏的重新兴起是个有趣的现象。但如果从付出的可辨性来看,就非常合理了。 数字音乐和流媒体的普及让拥有音乐收藏变得容易且无摩擦。所以一个亚文化出现了,重新加入了那种摩擦力。 我认为你现在可以从小处看到同样的事情在发生。 我看到有人开玩笑说在邮件里加拼写错误来证明是他们写的。MSPaint风格的图片宏看起来比精致、有趣的图片更像人类(图片可能是AI垃圾)。故意做得很丑的网站比漂亮但千篇一律的网站更有趣。 在大语言模型面前传达我们的人性,是一个困难、新颖、有趣的问题。我很期待看到我们会因此产生什么样的作品。 ## 总结 我没有解决方案。我一直在思考付出的可辨性这个问题,并想把这些想法写下来,也许能引起其他人的共鸣。 所以希望你喜欢这篇帖子。我付出了很多努力。希望你能看出来。

相似文章

引用布莱恩·坎特里尔

Simon Willison's Blog

布莱恩·坎特里尔批评LLM缺乏人类懒惰带来的优化约束,认为LLM会不必要地使系统复杂化而非改进,并强调人类时间限制推动了高效抽象的发展。

LLM输出人性化是愚蠢的

Hacker News Top

一篇评论文章,认为通过提示指令将LLM输出人性化是一种错误的抽象——智能体应交换高保真数据,仅在最终边界压缩为人类友好的文本。

当难题不再难时(3分钟阅读)

TLDR AI

这篇文章反映了前沿大语言模型和Lean自动化如何大幅减少了编程语言研究中形式化证明所需的工作量,导致会议投稿数量翻倍并改变了出版规范。

Review Arcade:论LLM评审的人类对齐与可游戏性

Hugging Face Daily Papers

本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。