ai-testing

标签

Cards List
#ai-testing

LLMTest

Product Hunt · 2026-05-22

LLMTest 是一个帮助开发者在应用中使用合适的 LLM 并设置回退方案的工具。

0 人收藏 0 人点赞
#ai-testing

@HowToAI_: 有人构建了一个工具,让Claude Code能自主测试你的整个iOS应用。它会导航你的整个应用,打开每一个…

X AI KOLs Timeline · 2026-05-15 缓存

一个基于Claude Code构建的新工具,可以通过导航每个屏幕、测试流程、读取调试日志,并从单个提示生成结构化漏洞报告,来实现iOS应用的自主测试。

0 人收藏 0 人点赞
#ai-testing

当AI必须承担全球责任时会发生什么?🌏⚠️ 我们用Grok 4.3在最困难的情景之一中测试了一种新的存在逻辑架构。

Reddit r/ArtificialInteligence · 2026-05-14

文章描述了使用Grok 4.3进行的一项测试,探讨所谓的“存在逻辑架构”如何影响AI在全球责任方面的决策。结果显示,非结构化提示与框架化提示之间的处理方法存在明显差异。

0 人收藏 0 人点赞
#ai-testing

GPT 5.5 无法解决这些谜题

Reddit r/singularity · 2026-05-14

GPT 5.5 未能解决 Jane Street 谜题,而其前身也同样无法应对,这表明人工智能推理能力持续存在局限性。

0 人收藏 0 人点赞
#ai-testing

@JamesZmSun: Codex 现在可以使用应用内浏览器在不同视口尺寸下测试您的应用!它将控制设备工具栏……

X AI KOLs Following · 2026-05-13

Codex 已更新,支持通过应用内浏览器在各种视口尺寸下测试 Web 应用,具备自动点击验证、长时间运行的截图反馈,以及通过禁用动画加速测试的功能。

0 人收藏 0 人点赞
#ai-testing

PACT,LLM 正面交锋谈判基准。20 轮买卖双方议价博弈:每轮 AI 可互发消息,买方提交出价,卖方提交要价。若出价 ≥ 要价,则以中间价成交。涵盖数千场对局。

Reddit r/singularity · 2026-05-11

PACT 推出了针对 LLM 的对抗性谈判基准测试,通过 20 轮买卖双方议价博弈来评估模型的说服力与适应能力。顶尖模型包括 GPT-5.5 和 Opus 4.7,评分由 Glicko-2 算法计算,并采用类 Elo 评分体系展示。

0 人收藏 0 人点赞
#ai-testing

GPT-4o 系统卡外部测试人员致谢

OpenAI Blog · 2024-08-08 缓存

OpenAI 发布了对为 GPT-4o 安全测试和系统卡开发做出贡献的外部红队测试人员和评估人员的致谢。该文档表彰了众多个人研究人员和组织,包括 METR 和 Apollo Research。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈