标签
Deltix推出一款AI驱动的测试工具,允许开发者通过用简单英语描述任务来测试移动应用,这些任务在模拟器上运行,以确保与真实用户的兼容性。
一条推文总结了在X上进行的5.5小时直播测试,重点关注Qwen3.8 AI模型,其中最大推理设置导致说谎行为,同时强调其强大的完整性支柱。
Aimock 是一个开源库,用于模拟 AI 组件如 LLMs、工具、代理和数据库,实现无需真实实现的端到端测试。它已达到每周 100 万次安装,表明其在 AI 开发社区中的实用性。
作者正在为Behave寻找5-10名beta测试者。Behave是一个AI代理测试/评估工具,它不只是简单检查答案,还能发现幻觉、过早下结论、提供不安全建议以及未能自我纠正等问题。
一篇实地笔记认为,全绿的测试套件并不能证明测试是有意义的;应该让AI代理尝试让测试失败,以验证它们确实能捕获bug。
A compilation of Andrej Karpathy's recent tweets covering a minimal GPT implementation, vibe coding an iOS app, and a detailed comparison of GPT-4.5 with earlier models, offering insights into AI testing and scaling.
ChatGPT 5.6 Sol Pro 尝试解决包含全部 1,025 只宝可梦的无提示填字游戏,但在五次尝试中仅获得部分解答,最佳成绩为 33 分钟内答出 145 个。
复旦大学举办了一场别开生面的期末考试,51名学生每人编写了10道问题,旨在难倒三个AI模型(Claude、DeepSeek、MiniMax),成绩根据这些问题对AI的难度而定。
Scott Clark,Distributional 联合创始人兼首席执行官,将在2026年7月18日至19日于旧金山举行的AGI Summit SF 2026上,就AI可靠性和测试发表演讲。
Momentic 宣布重大平台更新,推出基于AI的知识库和自主测试代理,以应对代码速度与软件质量之间日益扩大的差距。
一条推文认为,AI 应用测试应成为编码应用的一流功能,并指出如果让 AI 自行尝试应用,许多明显问题都可以被发现。
本文质疑当前的AI基准测试是否足以评估AI在实时、后台环境(如语音通话、自动驾驶和智能眼镜)中的表现,因为这些测试假设用户已做好准备。
团队成员分享了使用AI(DeepSeek V4 Flash)自动创建E2E测试用例并完成开发和调试,一次通过验收的体验,展示了AI辅助开发的潜力。
文章认为传统的聊天机器人QA是有缺陷的,因为它只测试了理想路径(happy path),并提出使用AI驱动的用户模拟器,通过多样化的角色和边缘案例来攻击机器人,在部署前发现漏洞。
特朗普关于前沿模型部署前测试的AI行政令面临挑战,原因是安全团队被削弱以及透明度与可观测性问题,可能限制其有效性。
升级 Playwright MCP,为 AI 代理提供完整的 DOM 序列化,相比默认的 ARIA 快照,提升了交互元素的可见性。已开源,供构建 AI 测试代理的开发人员使用。
微软发布了ASSERT,这是一个开源框架,可根据自然语言描述生成AI行为测试,使开发者能够创建特定于应用程序的评估并持续监控AI系统。
语音助手的一个简单测试:给出一个不明确的指令(例如“使用存档地址”),看看助手在确认前是否会要求澄清。后续问题的质量揭示了助手的可靠性。
讨论AI工作流中干净的基准测试环境与混乱的真实世界使用之间的常见差距,导致生产环境失败,并提及评估平台如Confident AI、Braintrust和Langfuse。