标签
关于使用 Pydantic AI 和 Pydantic Evals 确保 LLM 结构化输出的详细指南,涵盖结构验证、内容正确性和开放式判断。
讨论AI智能体可靠性中的一个盲点:缓存在获取时是真实的事实,但在使用时已经过时,导致一致但不正确的行为。提出将一致性(与源匹配)与时效性(源目前仍然真实)分开,并询问社区如何处理这个问题。
本文探讨了为何独立的人工智能评估初创公司很少能成功,原因包括人才流向技术栈中更有利可图的部分、客户群体狭窄,以及优化压力削弱了评估的效用。
对AI智能体时代大型Rails代码库的批评,提出转向基于技能的开发方式,使用智能体、Markdown技能和TypeScript实现确定性I/O。
Spotify Engineering讨论了将LLM评估用作A/B实验前的漏斗,提高了命中率,并在评估与实验之间建立了反馈循环。