@langfuse: 评估 评估 评估 在 Langfuse 中设置评估器从未如此简单…
摘要
Langfuse 推出了更轻松的评估器设置方式,包括模板、真实生产数据测试和交互式变量映射,以及全新的用户体验和一个演示视频。
评估 评估 评估
在 Langfuse 中设置评估器从未如此简单
从模板开始,选择真实生产数据来测试您的评估器,并使用交互式变量映射将正确的数据点引入评估上下文。
观看 @wochinge 的演示并查看新的用户体验
查看缓存全文
缓存时间: 2026/08/25 18:13
评测评测评测
在Langfuse中设置评测器从未如此简单 从模板库中选择快速上手,使用真实生产数据测试您的评测器,并通过交互式变量映射将准确的数据点注入评估上下文。
观看@wochinge的操作演示,体验全新用户界面
相似文章
迈向自动化Eval Engineering(5分钟阅读)
LangChain发布了Eval Engineering Skill,通过映射智能体仓库和生产跟踪数据自动生成可执行的Harbor评估,并采用迭代式用户访谈流程以优化评估。
@lotte_verheyden: 这太棒了!团队努力工作,确保 Langfuse 性能出色,即使你扩展到数百万乃至上千万条 trace
Langfuse v4 发布,采用重新架构的数据模型以提升性能,并新增全文搜索、监控器和 AI 助手等功能。
@LangChain: Tuned Evaluators 自动为生产追踪添加质量反馈。它们配备调优模型、提示及更多…
LangChain 推出了 LangSmith Tuned Evaluators,这是一款工具,可自动为 AI 代理的生产追踪添加质量反馈,使用调优模型和托管基础设施来评分如 Perceived Error 等行为。
@Vtrivedy10: 我最喜欢的问题,昨天在AIE演讲中讨论了代码智能体的评估+改进循环基础设施和用户体验!有点偏见,但……
演讲者讨论了评估和改进代码智能体的重要性,强调了LangSmith与Harbor的集成,以提供在隔离环境中运行、追踪和改进智能体评估的统一栈。
langfuse/langfuse
Langfuse 将其 LLM 工程平台开源,为生产级 AI 应用提供自托管的链路追踪、分析与评估工具。