llm-evals

标签

Cards List
#llm-evals

Pydantic AI 结构化输出与评估 · coles.codes

Reddit r/LocalLLaMA · 2026-07-14 缓存

关于使用 Pydantic AI 和 Pydantic Evals 确保 LLM 结构化输出的详细指南,涵盖结构验证、内容正确性和开放式判断。

0 人收藏 0 人点赞
#llm-evals

无评估可捕捉的智能体失败模式:使用缓存的过时事实

Reddit r/AI_Agents · 2026-07-01

讨论AI智能体可靠性中的一个盲点:缓存在获取时是真实的事实,但在使用时已经过时,导致一致但不正确的行为。提出将一致性(与源匹配)与时效性(源目前仍然真实)分开,并询问社区如何处理这个问题。

0 人收藏 0 人点赞
#llm-evals

为什么评估初创公司会失败(2025)

Hacker News Top · 2026-06-22 缓存

本文探讨了为何独立的人工智能评估初创公司很少能成功,原因包括人才流向技术栈中更有利可图的部分、客户群体狭窄,以及优化压力削弱了评估的效用。

1 人收藏 1 人点赞
#llm-evals

@alphabatcher:54万行Rails代码是进入智能体时代的残酷方式 Garry's List 发布时包含:> 26.2万行应用代码 > …

X AI KOLs Following · 2026-06-01 缓存

对AI智能体时代大型Rails代码库的批评,提出转向基于技能的开发方式,使用智能体、Markdown技能和TypeScript实现确定性I/O。

0 人收藏 0 人点赞
#llm-evals

利用LLM评估进行更好的实验——是漏斗,而非分叉(阅读时间约6分钟)

TLDR AI · 2026-05-21 缓存

Spotify Engineering讨论了将LLM评估用作A/B实验前的漏斗,提高了命中率,并在评估与实验之间建立了反馈循环。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈