prompt-testing

标签

Cards List
#prompt-testing

@AISuperDomain: OpenAI专坑国内用户!发现好多Codex用户将推理级别开到Ultra的时候,其实给分配的模型是降智的gpt-5.5-mini。 但大部分用户根本没有注意到,只是无脑的跑loop。但检测方式也很简单,用下面的prompt就可以测试是否是…

X AI KOLs Timeline · 2026-08-10 缓存

帖子称OpenAI Codex在Ultra推理级别下给国内用户分配降智的gpt-5.5-mini模型,并提供检测prompt,呼吁用户扣1或扣2以统计针对国内用户的降智率。

0 人收藏 0 人点赞
#prompt-testing

smevals - 一个用于评估模型、提示词和测试框架的小型评估套件

Simon Willison's Blog · 2026-07-31 缓存

Simon Willison 介绍了 smevals,这是 Prime Radiant 开发的一个小型评估套件,用于评估模型、提示词和测试框架,提供运行评估、评分结果以及提供静态 HTML 报告的指令。

0 人收藏 0 人点赞
#prompt-testing

@ArizePhoenix: 你可以直接使用PXI在Phoenix上运行实验!这里有一个测试系统提示与schema感知提示的实验…

X AI KOLs Following · 2026-07-27 缓存

Arize Phoenix演示了如何使用PXI运行一个实验,该实验使用程序化代码评估器比较系统提示与schema感知提示,从而避免了使用LLM评审员的需求。

0 人收藏 0 人点赞
#prompt-testing

我们构建了一个用于智能体提示词的自动化QA/评估引擎。来帮我们测试一下吧!

Reddit r/AI_Agents · 2026-07-10

构建了一个名为Baseline的自动化QA/评估引擎,将提示词视为软件进行回归测试,允许非编程人员定义评分标准并自动优化提示词。目前处于有限公测阶段,提供30天免费试用。

0 人收藏 0 人点赞
#prompt-testing

AI智能体的自然语言测试(使用模拟隔离)

Reddit r/AI_Agents · 2026-06-28

本文介绍了一种针对AI智能体的新型自然语言测试系统,该系统利用模拟隔离自动生成多轮模拟并评估智能体行为,帮助开发者捕捉提示词变更引起的回归问题。

0 人收藏 0 人点赞
#prompt-testing

有人做出了我梦想中的AI工具

Reddit r/artificial · 2026-06-02

一篇帖子介绍了AIfiesta.ai,这个工具能够同时显示多个AI模型(ChatGPT、Gemini、Claude)对同一提示的回复,每个回复分别展示在自己的列中。

0 人收藏 0 人点赞
#prompt-testing

@punk2898: 还得是 Grok,一次生成,第二次漏了 提示词: “一位开朗的年轻中国女性,长直棕色头发,自然妆容,穿着柔和米色细肩带吊带背心,在明亮的健身房工作室中于蓝色垫子上保持平板支撑姿势,背景有镜子和器械,柔和自然光线,编辑摄影风格,照片级真实,…

X AI KOLs Timeline · 2026-05-17 缓存

用户测试Grok的图片生成功能,发现第一次成功生成完整图像,第二次则遗漏了部分提示词内容,生成不完整。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈