标签
本文介绍了Odds-Ratio Thompson Sampling(OR-TS),这是一种批量多臂老虎机方法,通过基于对比的更新处理波动的基准水平,在模拟和真实实验中均显示出相比绝对速率记忆法更低的遗憾值。
介绍树耦合A/B测试(TCAB),一种精确的反馈共享设计,通过更少的奖励查询比较多个自适应策略,同时保留每个策略的轨迹分布。
微软研究院重点介绍了关于使用SocialRL进行小型语言模型谈判、PazaBench V2用于非洲语言语音评估、EvoLib帮助智能体从经验中学习、改进的A/B测试方法以及AI驱动的精准肿瘤学的新研究。
一位软件工程师讨论了功能开关在何种情况下有意义,例如用于A/B测试和复杂部署,并提醒团队在能够控制部署时不要过度使用它们。
Corbin Braun 构建了一个进化式 A/B 缩略图测试工具,该工具每次只突变一个维度,使用 ABBA 模式轮换缩略图以避免偏差,并在多轮迭代中学习获胜突变。
Amboras 是一个原生 AI 电商平台,可自动优化商店,包括 A/B 测试和布局更改,旨在显著提升转化率。
Spotify Engineering讨论了将LLM评估用作A/B实验前的漏斗,提高了命中率,并在评估与实验之间建立了反馈循环。
作者介绍了 Syrin,这是一款用于 AI 代理的运行时 A/B 测试工具,允许团队针对提示词、模型和代理拓扑结构对实时流量进行受控实验。他们正在寻找 5-10 个工程团队在生产环境中测试该工具并提供反馈。