标签
一位经验丰富的开发者反思了AI代理演示与实际性能之间的差距,强调了诸如文档不完善、权限期望过于简单,以及认为概率性软件在生产中会变得确定性的误解等问题。
作者管理一个小型开发团队,分享了使用AI编码工具的现实混合结果:它们加快了样板代码和入门流程,但在复杂问题上会产生自信的错误答案,并增加了代码审查工作量,产生的净增益微乎其微,远低于常被引用的10倍改进。
当多个AI模型以相同价格运行一周时,实际的token使用量揭示了与排行榜排名不同的偏好差异,表明编码和通用聊天各有不同的顶级模型,且长上下文使用集中在两个受信任的模型上。