标签
本文探讨了将QA整合到RL任务生成迭代过程中的重要性,以提升AI流程和模型评估,并强调了评估设计中直觉的价值。
本文展示了在 NVIDIA RTX Spark 上,NousResearch Hermes 本地 AI 代理如何自主识别和修复网站问题,并在设备上进行 QA 测试。
这篇文章讨论了因人工审查瓶颈而产生的AI生成代码‘垃圾’问题,并指出软件工程必须演进,以系统设计为重点,而不是代码的可读性。
本文介绍了一种本地部署的多智能体AI系统,用于放射学报告结构化和质量保证,放射科医生评估显示其性能良好。
这篇文章提倡使用Replay QA对Web应用程序进行自动化测试,特别是针对AI生成的代码,强调了其易用性以及持续质量保证和根本原因分析等特性。
小米强调其车辆经过了超过1000天和428万公里的真实路测,注重精益求精的品质和全面的道路验证。
DoorDash 分享了他们如何自动化评估 Ask DoorDash AI 助手,实现每天 2,000 次分级会话,并将测试时间从六小时缩短到 20 分钟,同时错误率减半。
关于AI编码代理下一个瓶颈的讨论:验证AI生成的应用是否正确,以及谁应该负责检查输出。
一篇反思软件质量本质的博客文章,主张质量在于优雅地进行开发,并让代码库变得比发现时更好,同时探讨如何在软件产品中培养或破坏质量。
介绍RE-AD框架,该框架利用LLMs实时验证数据标注质量,在生产环境中实现了82%的错误接受与修复率。
主权技术基金投资支持KDE加强其PIM基础设施(包括Akonadi),在质量、协议支持和企业采用易用性方面进行改进。
本文介绍了一种智能体工作流,利用LLMs和VLMs迭代生成并改进面向K-12教育的高质量数学图表,填补了AI生成可视化辅助工具在可靠性方面的空白。
对AI编码代理的批评,它们声称完成任务却没有在真实浏览器环境中验证功能。
Momentic 宣布重大平台更新,推出基于AI的知识库和自主测试代理,以应对代码速度与软件质量之间日益扩大的差距。
Nolan Lawson认为,AI编程助手可以通过使用多个模型进行彻底的代码审查和漏洞检测,从而更慢地编写高质量代码,提升代码库的健康状况,而不是最大化输出速度。
一位处理约4万次对话/月的公司从业者描述了手动提示词质量保障的瓶颈,并询问团队如何利用自动化系统在生产中检测回归问题和用户挫败感。