braintrust

标签

Cards List
#braintrust

你们如何在产品发布后检测新的提示注入模式?

Reddit r/AI_Agents · 2天前

本文讨论了在AI系统发布后检测新提示注入模式的方法,包括语义搜索、追踪级安全评分以及Braintrust等工具,同时强调了误报和攻击分类方面的挑战。

0 人收藏 0 人点赞
#braintrust

一次提示注入测试抓住了我们差一点就发布的问题

Reddit r/AI_Agents · 2026-08-09

一个团队描述了他们的提示注入评估套件如何在发布前发现文档助手的回归问题,并强调了在系统指令与检索数据之间保持严格层级的重要性。

0 人收藏 0 人点赞
#braintrust

在发布前制造一个黄金标准评估数据集

Reddit r/AI_Agents · 2026-07-23

一位开发者分享了为没有用户的AI产品创建黄金标准评估数据集的挑战,考虑了合成数据生成和对抗性测试,以避免发布后的重构。

0 人收藏 0 人点赞
#braintrust

RAG 幻觉烦得要命

Reddit r/AI_Agents · 2026-07-02

团队发现 80% 的 RAG 幻觉是由检索不佳导致的,而非生成模型的问题,强调需要分别评估检索与生成环节,才能有效调试错误答案。

0 人收藏 0 人点赞
#braintrust

我们如何在规模上实现持续追踪智能(8分钟阅读)

TLDR AI · 2026-06-05 缓存

Braintrust的Topics功能利用LLM摘要,使得生产环境中的代理追踪在大规模聚类和分类中变得可控,该方法受Anthropic的Clio方法启发。

0 人收藏 0 人点赞
#braintrust

Braintrust 如何通过 Codex 将客户需求转化为代码

OpenAI Blog · 2026-05-29 缓存

Braintrust 使用 OpenAI 的 Codex 与 GPT-5.5,在几分钟内将客户功能请求转化为预览分支,实现实时迭代和更快的反馈循环。

0 人收藏 0 人点赞
#braintrust

Codex 为 Braintrust 解锁了什么

YouTube AI Channels · 2026-04-21 缓存

Braintrust CEO Ankur Goyal 演示 OpenAI Codex 如何让团队在原来只能做一个原型的时间里生成 100 个功能原型,把 Slack 里的需求 10 分钟内变成可给客户测试的预览。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈