标签
帖子称OpenAI Codex在Ultra推理级别下给国内用户分配降智的gpt-5.5-mini模型,并提供检测prompt,呼吁用户扣1或扣2以统计针对国内用户的降智率。
Simon Willison 介绍了 smevals,这是 Prime Radiant 开发的一个小型评估套件,用于评估模型、提示词和测试框架,提供运行评估、评分结果以及提供静态 HTML 报告的指令。
Arize Phoenix演示了如何使用PXI运行一个实验,该实验使用程序化代码评估器比较系统提示与schema感知提示,从而避免了使用LLM评审员的需求。
构建了一个名为Baseline的自动化QA/评估引擎,将提示词视为软件进行回归测试,允许非编程人员定义评分标准并自动优化提示词。目前处于有限公测阶段,提供30天免费试用。
本文介绍了一种针对AI智能体的新型自然语言测试系统,该系统利用模拟隔离自动生成多轮模拟并评估智能体行为,帮助开发者捕捉提示词变更引起的回归问题。
一篇帖子介绍了AIfiesta.ai,这个工具能够同时显示多个AI模型(ChatGPT、Gemini、Claude)对同一提示的回复,每个回复分别展示在自己的列中。
用户测试Grok的图片生成功能,发现第一次成功生成完整图像,第二次则遗漏了部分提示词内容,生成不完整。