标签
一条来自 @reach_vb 的推文,向 @simonw 询问评估 AI 模型或 harness 的方法,提到了已饱和的 'pelican on a bike svg' 基准。
关于当前AI编程代理输出验证实践的一点反思,指出开发者通常只是粗略查看差异就合并,而没有全面审计代理的会话活动,引发了对AI时代代码审查文化的担忧。