标签
ReactBench是一个新的评估基准,用于测试编码代理在实际React工作中的表现,它超越了简单的测试通过,通过开源React Doctor验证器强制执行React的性能、可访问性和质量。早期结果显示,顶级模型解决的任务不到一半,其中新引入的问题中最常见的是bug。
一条推文质疑:尽管声称用AI构建应用比以往任何时候都更容易,但为何AI驱动的应用质量并未显著提升。
用户称赞Grok 4.5的速度和质量,上传个人网站PRD后3分钟生成,效果不错。
QUALITY.md 是一种开放的文件格式和命令行工具,用于定义和评估项目质量,帮助团队和代理在质量标准上保持一致。
一篇探讨「品味」概念的随笔,将其定义为做出高质量定性判断的能力,并论证当生产被AI商品化后,品味将变得更有价值。
Impeccable AI 现已成为 GitHub Copilot 的内置技能,为所有创作者提供设计和质量的内置层。
A collection of agent skills by Google engineer Addy Osmani for web quality audits, performance optimization, SEO, accessibility, and Core Web Vitals, installable via npx add-skill.
本文介绍了LIMMT,这是一项以数据为中心的研究,表明使用高质量、极小的运动数据子集(不到AMASS的3%)进行训练,在基于物理的人形动作追踪方面优于使用完整数据集,并通过物理可行性、多样性和复杂性来定义运动数据质量。
一篇反思性的博文,引用罗伯特·波西格的《禅与摩托车维修艺术》,探讨随着生成式AI工具泛滥,科技行业中的质量危机与虚无主义,呼吁重新关注工艺与价值观。
George Hotz认为,采用AI代理进行软件开发是一个代价高昂的错误,因为它们生成的是越来越难以检测的劣质代码(slop),而不是可靠的代码。他警告说,大型组织将比个人更受这一趋势的伤害。