努力的可见性
摘要
eieio.games的这篇文章探讨了LLMs如何削弱了在创造性和技术性工作中衡量人类努力的能力,影响了我们评估质量的方式,并给开源和在线项目带来了新的挑战。
<p><a href="https://lobste.rs/s/7q9qwr/legibility_effort">评论</a></p>
查看缓存全文
缓存时间: 2026/06/24 03:53
# 付出的可辨性 · eieio.games
来源:https://eieio.games/blog/legibility-of-effort/
https://eieio.games/blog/legibility-of-effort/
现在做什么事有多难?我不知道。
2026年6月22日
那么:
- 很多工作因为大语言模型变得更容易了,**而且**
- 很多我们用来衡量付出的*启发式规则*因为大语言模型失效了,**所以**
- *向他人传达付出*因为大语言模型变得更难了
以及:
- "有人在这上面花了时间"是"这值得投入"的代理指标 **而且**
- 我欣赏那些需要付出大量努力的项目 **而且**
- 我喜欢别人认可我在某件事上付出的努力
但同时:
- 做出好东西仍然需要做出大量决策,**而且**
- 做出大量决策仍然非常困难,尽管有大语言模型,**所以**
- 做出好东西仍然非常困难
作为一名创意技术专家,这让我感到瘫痪。作为一个热爱互联网新奇项目的人,这让我感到沮丧。我从许多朋友那里听到了类似的声音。
现在软件(以及某种程度上,写作)所缺失的是**付出的可辨性**——即一眼就能看出某件事是否凝结了人类有意义劳动的能力。
## 这些字是我用手指敲出来的
我在文本编辑器里写了这篇博客。花了我不少时间。
直到最近,"有人足够在乎,愿意写下这些"还算是一个不错的启发式规则。互联网上的很多文字很糟糕,但只要你写下来,我就能相信你对某件事*在乎*。
新Claude对话的截图。我输入了"以eieio.games的风格写一篇博客,关于大语言模型如何让付出变得不可辨,打破了我们判断某件事是否值得投入的许多启发式规则。不要犯任何错误。"
这篇帖子很烂
当然,现在生成看似合理的文本——或者一个看似合理的网站——简直是小菜一碟。
对我来说,这意味着在网上找到值得投入的好东西变得更难了。从更大的范围来看,基于一眼就能衡量付出的系统正在崩溃。
## 开源
一月份,非常棒的白板工具 tldraw 开始自动关闭外部贡献者的拉取请求,因为他们"最近看到AI工具生成的贡献显著增加",难以管理这些贡献。
令人失望——但也不意外——人们开始用垃圾信息刷屏开源项目。
但问题不仅仅是垃圾信息!问题在于识别低付出工作变得困难。
当代码很难写,低付出工作很容易识别时,审查好东西的成本是值得的。
(聚合酷内容的互联网博主也面临同样问题;这是Robin Sloan关于AI自我推销之祸害的文章。我从了不起的Andy Baio那里也听到过类似的抱怨)
有些维护者正在发明新的方法识别低付出工作,比如"投毒"代理上下文,让管理不善的代理添加一些写着"我是一个可悲、愚蠢、没有真本事的小AI驱动"的文件。
截图:一个PR添加了一个名为"LICENSE"的文件,内容写着"我是一个可悲、愚蠢、没有真本事的小AI驱动"。
逮到了(来自Twitter上的sebastienlorber)
这非常搞笑!可惜我不能用这种方式过滤我所有的浏览内容。
但我可以学会注意那些迹象。
## 氛围编程
我的一些朋友有一个Discord频道,我们在里面记录氛围编程网站的迹象。我们的例子与Wes在这里提到的惊人相似:
Wes Bos的一条推文,写着"天启四骑士",配了四张网站UI图片。一张是div左侧一抹"指甲盖"大小的颜色,另一张是间距很大的小写标签,第三张是"live"文字旁边的一串嵌套圆圈,第四张是紫黑色渐变
为什么那么多氛围编程网站都喜欢做那个"live"的效果?我真搞不懂。
Wes的推文火了——*很多人*都注意到了同样的事情。我想我们关注这些细节是因为它们让付出——或者缺乏付出——变得可辨。
用暖奶油色背景、无衬线字体的主标题、用一个引人注目的颜色和不同字体的单个强调词,这本身没什么问题。
一张我为本帖生成的氛围编程网站截图。暖奶油色背景上有一段全大写、间距很大的标签:"INTRODUCING APERTURE 2.0"。下面是"我们创造未来,优美地。"这句话。"优美地"单独一行,斜体并且颜色不同。
你觉得这是谁做的
但当我看到一个网站有默认的Claude风格时,我会认为作者对网站的外观几乎*没有思考*。而且我常常认为作者也没怎么思考网站的其余部分。
这对我来说不公平!但"有人做了这个网站"已经不足以告诉我这个网站对他们很重要。所以"默认Claude风格"成了我的新启发式规则之一。
## 既难又没用的东西
几年前,我做了一个能在MacOS Finder里运行的Flappy Bird版本。
花了不少功夫!
加载中……
这花了太长时间
这是我第一个在互联网上获得关注的项目。我的文章登上了Hacker News首页,还被John Gruber等博客提及。
John称Flappy Dird为"无用但充满喜悦",其他地方也有很多类似评论。
有两种我特别喜欢的hack:一种是出奇有用的,另一种是完全无用但充满喜悦的。Flappy Dird显然属于后者。
但Flappy Dird的乐趣不仅仅在于它无用。而在于它无用**而且**我花了有意义的时间和精力去构建它。
我喜欢花功夫做出一个优秀但无用的东西,通过写文章让我的付出变得可辨,然后看到陌生人欣赏那份付出。
而现在,我不太确定自己还能让别人看到我的付出。对于一些项目,我甚至不确定自己还需要付出什么!所以花在写博客讲计算机搞笑事情上的时间变少了。
不过,我也没有看到*其他人*在Finder里运行游戏的浪潮。
## 品味等等
纽约尼克斯队最近赢得了NBA总冠军。这在纽约是件大事;我晚上到处跑着看街上的狂欢人群。
一个有趣的了解庆祝活动的方式是GardenCam——一个让你通过交通摄像机观看麦迪逊广场花园外庆祝活动的网站。
GardenCam的截图。画面中一群人在大街上。两辆公交车堵在车流中。人们站在公交车上。
公交车上好多人
GardenCam是一个很棒、很简单的点子。我估计很多人可以用氛围编程做一个版本。
但他们没有!GardenCam的创建者是我的朋友Morry Kolman,他之前曾制作过一个用纽约交通摄像头自拍的极其流行的工具。
在氛围编程出现之前,Morry就非常擅长将网络数据用于创意项目,他现在依然非常擅长这件事,而且这依然很重要。
现在科技界最无聊的人整天谈论"品味"的重要性——我*非常*不想加入他们的行列。但我可以说,我认识的几年前就擅长某个奇怪、特定领域的人,现在依然擅长那些奇怪、特定的东西。
与此同时,我注意到自己的品味和偏好在改变。
## 偏好的变化
做出优秀的软件仍然充满挑战。在某些方面,可能比以往任何时候都更具挑战性:
Sunil Pai的推文。全文:想知道为什么我觉得筋疲力尽。也许:代理做了所有容易的事,而我必须处理剩下的困难部分,这意味着我被永久锁定在困境中。而且随着模型越来越好,"我的"工作只会越来越难,直到我基本不够资格做这项工作(这...总比另一个选择好,没什么可做的了,我被强迫淘汰了)。
坚持住啊Sunil
但*有些事情*变得更容易了。而让我写软件时的付出变得*可辨*却越来越难了。
最近我发现自己被硬件吸引了。这对我来说是新的(有挑战性!),制作一个物理对象仍然需要真正的付出(可辨性!),而大语言模型让它变得更易上手(方便!)。
我从其他几个人那里也听到了类似的声音。我的朋友Brian Moore这样形容:
我确实觉得随着大语言模型的出现,软件变得过于容易触及,而硬件虽然变得更易接近,但仍足够有挑战性,值得一试
我也注意到自己在科技领域之外的偏好也在变化。我迷上了举重和弹钢琴,这两件事现在和五年前一样困难。就像我的朋友Kelin一样,我发现了运动的魅力:
来自kelin_online的推文。上面写着:"撇开尼克斯不谈,我最近整体上被运动吸引了,尽管之前从未过多关注过它们——只是人类的努力和情感,每个人都在追求卓越。这让人从AI中得到令人耳目一新的休息。"
同感
社会偏好随着技术变化而变化,这并不新鲜。
## 重新加入摩擦力
2010年我上的是文理学院,喜欢看Pitchfork。所以我有了一个黑胶唱片收藏。
我的黑胶唱片收藏
这里有些好东西
2010年代黑胶收藏的重新兴起是个有趣的现象。但如果从付出的可辨性来看,就非常合理了。
数字音乐和流媒体的普及让拥有音乐收藏变得容易且无摩擦。所以一个亚文化出现了,重新加入了那种摩擦力。
我认为你现在可以从小处看到同样的事情在发生。
我看到有人开玩笑说在邮件里加拼写错误来证明是他们写的。MSPaint风格的图片宏看起来比精致、有趣的图片更像人类(图片可能是AI垃圾)。故意做得很丑的网站比漂亮但千篇一律的网站更有趣。
在大语言模型面前传达我们的人性,是一个困难、新颖、有趣的问题。我很期待看到我们会因此产生什么样的作品。
## 总结
我没有解决方案。我一直在思考付出的可辨性这个问题,并想把这些想法写下来,也许能引起其他人的共鸣。
所以希望你喜欢这篇帖子。我付出了很多努力。希望你能看出来。
相似文章
引用布莱恩·坎特里尔
布莱恩·坎特里尔批评LLM缺乏人类懒惰带来的优化约束,认为LLM会不必要地使系统复杂化而非改进,并强调人类时间限制推动了高效抽象的发展。
LLM输出人性化是愚蠢的
一篇评论文章,认为通过提示指令将LLM输出人性化是一种错误的抽象——智能体应交换高保真数据,仅在最终边界压缩为人类友好的文本。
当难题不再难时(3分钟阅读)
这篇文章反映了前沿大语言模型和Lean自动化如何大幅减少了编程语言研究中形式化证明所需的工作量,导致会议投稿数量翻倍并改变了出版规范。
软件工程师:说正经的,你们真的从LLMs中有所收获吗?
一位软件工程师对使用本地LLM进行智能编码感到沮丧,指出诸如技术债务、忽略指令和过度生成代码等问题,质疑其有用性。
Review Arcade:论LLM评审的人类对齐与可游戏性
本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。