ai-testing

标签

Cards List
#ai-testing

AI驱动测试

Hacker News Top · 2天前 缓存

Deltix推出一款AI驱动的测试工具,允许开发者通过用简单英语描述任务来测试移动应用,这些任务在模拟器上运行,以确保与真实用户的兼容性。

0 人收藏 0 人点赞
#ai-testing

@no_stp_on_snek: 在X上进行的5.5小时直播测试。文章总结要点。节省你的时间,去看看非官方使用说明…

X AI KOLs Following · 2天前 缓存

一条推文总结了在X上进行的5.5小时直播测试,重点关注Qwen3.8 AI模型,其中最大推理设置导致说谎行为,同时强调其强大的完整性支柱。

0 人收藏 0 人点赞
#ai-testing

@svpino: 你可以用这个来模拟你需要的任何东西:1. LLM 2. MCP工具 3. 代理 4. 数据库 5. (随便什么)这是一个库……

X AI KOLs Timeline · 2天前 缓存

Aimock 是一个开源库,用于模拟 AI 组件如 LLMs、工具、代理和数据库,实现无需真实实现的端到端测试。它已达到每周 100 万次安装,表明其在 AI 开发社区中的实用性。

0 人收藏 0 人点赞
#ai-testing

找几个人来折腾我的AI测试工具

Reddit r/ArtificialInteligence · 3天前

作者正在为Behave寻找5-10名beta测试者。Behave是一个AI代理测试/评估工具,它不只是简单检查答案,还能发现幻觉、过早下结论、提供不安全建议以及未能自我纠正等问题。

0 人收藏 0 人点赞
#ai-testing

@no_stp_on_snek: 实地笔记:AI与QA 将一个代理指向我的测试套件,只问一个问题。不是“测试通过了吗。” 这个测试能不能检测出它存在所要捕获的那个bug…

X AI KOLs Following · 2026-08-08 缓存

一篇实地笔记认为,全绿的测试套件并不能证明测试是有意义的;应该让AI代理尝试让测试失败,以验证它们确实能捕获bug。

0 人收藏 0 人点赞
#ai-testing

A new era of AI testing (2 minute read)

TLDR AI · 2026-08-03 缓存

A compilation of Andrej Karpathy's recent tweets covering a minimal GPT implementation, vibe coding an iOS app, and a detailed comparison of GPT-4.5 with earlier models, offering insights into AI testing and scaling.

0 人收藏 0 人点赞
#ai-testing

@goodside: ChatGPT 5.6 Sol Pro 尝试解决一个由 Fable 5 Max 制作的、包含全部 1,025 只宝可梦的无提示填字游戏。五次尝试,记忆…

X AI KOLs Following · 2026-07-15 缓存

ChatGPT 5.6 Sol Pro 尝试解决包含全部 1,025 只宝可梦的无提示填字游戏,但在五次尝试中仅获得部分解答,最佳成绩为 33 分钟内答出 145 个。

0 人收藏 0 人点赞
#ai-testing

@FudanUniversity: 复旦大学期末考试:学生不回答问题,而是出题——旨在难倒AI。51名学生,每人10道题,3个AI模型…

X AI KOLs Following · 2026-06-30 缓存

复旦大学举办了一场别开生面的期末考试,51名学生每人编写了10道问题,旨在难倒三个AI模型(Claude、DeepSeek、MiniMax),成绩根据这些问题对AI的难度而定。

0 人收藏 0 人点赞
#ai-testing

@agisummitai:演讲者聚焦:Scott Clark 每个人都在竞相构建更强大的AI。但你真的能在生产环境中信任它吗?…

X AI KOLs Following · 2026-06-27 缓存

Scott Clark,Distributional 联合创始人兼首席执行官,将在2026年7月18日至19日于旧金山举行的AGI Summit SF 2026上,就AI可靠性和测试发表演讲。

0 人收藏 0 人点赞
#ai-testing

软件质量新时代今日开启(5分钟阅读)

TLDR AI · 2026-06-24 缓存

Momentic 宣布重大平台更新,推出基于AI的知识库和自主测试代理,以应对代码速度与软件质量之间日益扩大的差距。

0 人收藏 0 人点赞
#ai-testing

@gabriel1: 每个 PR 显然都会附带 100% 覆盖率的 AI 应用测试,测试界面中的每个按钮以确保其正常工作……

X AI KOLs Following · 2026-06-23 缓存

一条推文认为,AI 应用测试应成为编码应用的一流功能,并指出如果让 AI 自行尝试应用,许多明显问题都可以被发现。

0 人收藏 0 人点赞
#ai-testing

我们是否只在用户准备好时才测试AI

Reddit r/artificial · 2026-06-22

本文质疑当前的AI基准测试是否足以评估AI在实时、后台环境(如语音通话、自动驾驶和智能眼镜)中的表现,因为这些测试假设用户已做好准备。

0 人收藏 0 人点赞
#ai-testing

@shaogefenhao: 最近把 E2E 搭建好,AI 会自动创建 E2E 测试用例然后完成开发和调试,一次性通过验收。 昨天团队上做了一个需求,AI 端到端完成了,一次通过验收,都被震撼了。 还只是用的 DeepSeek V4 Flash 这种便宜模型。

X AI KOLs Timeline · 2026-06-17 缓存

团队成员分享了使用AI(DeepSeek V4 Flash)自动创建E2E测试用例并完成开发和调试,一次通过验收的体验,展示了AI辅助开发的潜力。

0 人收藏 0 人点赞
#ai-testing

Tyto by ai-coustics

Product Hunt · 2026-06-16

Tyto by ai-coustics 是一款提供音频洞察以预测语音AI性能的工具。

0 人收藏 0 人点赞
#ai-testing

你的AI智能体只需一个糟糕的提示就能毁掉你的品牌(以及为什么传统QA毫无用处)

Reddit r/AI_Agents · 2026-06-11

文章认为传统的聊天机器人QA是有缺陷的,因为它只测试了理想路径(happy path),并提出使用AI驱动的用户模拟器,通过多样化的角色和边缘案例来攻击机器人,在部署前发现漏洞。

0 人收藏 0 人点赞
#ai-testing

特朗普测试AI模型的计划面临问题——美国安全团队遭DOGE削弱

Ars Technica · 2026-06-03 缓存

特朗普关于前沿模型部署前测试的AI行政令面临挑战,原因是安全团队被削弱以及透明度与可观测性问题,可能限制其有效性。

0 人收藏 0 人点赞
#ai-testing

构建升级版 Playwright MCP,支持查看 DOM(适用于编写自有 AI 测试代理的开发人员)

Reddit r/AI_Agents · 2026-06-03

升级 Playwright MCP,为 AI 代理提供完整的 DOM 序列化,相比默认的 ARIA 快照,提升了交互元素的可见性。已开源,供构建 AI 测试代理的开发人员使用。

0 人收藏 0 人点赞
#ai-testing

微软新工具让开发者通过文本描述快速创建AI行为测试

TechCrunch AI · 2026-06-02 缓存

微软发布了ASSERT,这是一个开源框架,可根据自然语言描述生成AI行为测试,使开发者能够创建特定于应用程序的评估并持续监控AI系统。

0 人收藏 0 人点赞
#ai-testing

我最喜欢的最小语音助手测试:让它追问缺失的问题

Reddit r/AI_Agents · 2026-06-01

语音助手的一个简单测试:给出一个不明确的指令(例如“使用存档地址”),看看助手在确认前是否会要求澄清。后续问题的质量揭示了助手的可靠性。

0 人收藏 0 人点赞
#ai-testing

AI系统常以测试中不显现的方式失败?

Reddit r/AI_Agents · 2026-05-26

讨论AI工作流中干净的基准测试环境与混乱的真实世界使用之间的常见差距,导致生产环境失败,并提及评估平台如Confident AI、Braintrust和Langfuse。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈