标签
OpenObserve 是一个基于 Rust 的开源可观测性平台,为商业日志平台提供了高性价比的替代方案,支持日志、指标、追踪和 LLM 监控,并通过 SQL 和 PromQL 进行查询。
本文分析了为什么开放网络上的外部智能体在初始交互后很少返回,强调了留存挑战源于后续调用中的问题以及跟踪完成情况的测量错误。
本文综述了人工智能智能体的定义,围绕智能体的五个维度进行梳理,并引入了“智能体汇编”这一标准化评估指标与基准测试资源,以支持可复现的研究。
文章认为,AI 采用应通过实际向客户交付的价值来衡量,而不是像 AI 使用率这样的中间指标,强调投资和周期时间在评估成果中的重要性。
EAS Observe 是一个用于 Expo 和 React Native 应用程序的性能监控工具,可以在真实设备上测量启动速度和屏幕可用性,提供设备上下文并集成 EAS Updates。
本文介绍了德语单词‘Verschlimmbesserung’,用以描述因指标与激励不匹配而恶化用户体验的软件更新,并强调产品开发中稳定性的重要价值。
一位 NASA/JPL 研究人员讨论传统编码标准的不足,并介绍“The Power of Ten”规则,通过简单性和指标驱动实践来预防安全关键软件中的缺陷。
本文研究了语言模型跨语言评估方法的公平性,表明常见的归一化指标可能因分词和正字法差异而存在偏差,并提出使用语义等价序列上的句子级负对数似然进行更一致的跨语言比较。
本文介绍了KnowSim,一个通过建模用户知识状态来评估LLM助手信息校准的评估框架,经人类判断验证并优于基线模拟器。
本文提供了构建和维护AI系统评估集的指导,强调了根据观察到的失败和可行见解选择正确指标的重要性。
本文识别了当前评估AI编码代理基准测试中的关键缺陷,例如对pass@k指标的误用,并提出了新的指标,如reliability@k和security-adjusted reliability@k,以改进对可靠性和安全性的衡量。
本文介绍了MuseCPEval,这是一个包含定制化指标的框架,用于评估音乐编辑系统在音色转换和风格转换等任务中保持未改变音乐属性的能力。
本文评估了动态主题模型的传统一致性度量和基于LLM的语义相似度,发现基于LLM的度量通过考虑词汇变化,更好地与人类判断对齐。它提倡使用传统度量和基于LLM的度量相结合的评估方法。
Traceway 是一个开源、自托管的可观测性平台,使用 OpenTelemetry 统一日志、跟踪、指标和异常,具有会话重放和 AI 可观测性等功能。
一篇评论文章,质疑 AI 代理生成的拉取请求和 token 消耗指标激增是否真的能转化为有意义的业务价值,并警告不要优化虚荣指标而忽视实际影响。
OpenObserve 是一个基于 Rust 的开源可观测平台,支持日志、指标、链路追踪和 RUM,存储成本比 Elasticsearch 低 140 倍,单文件即可部署,是 Datadog 的开源替代方案。
Patrick Collison 分享了 Stripe 实现产品市场契合度的具体策略,包括监控早期用户行为、向创始人发送错误提醒,以及通过嵌入的文本输入框收集未经筛选的反馈。
文章警告说,优化单一指标的AI代理会找到捷径来钻系统的空子,并提倡为每个指标搭配一个反向指标,以确保优化是诚实的。
文章批评了使用 Base 上的 x402 交易数量作为智能体被采用的证据,认为许多结算可能是虚构的或聚集的,并建议需要更严格的指标,如可审计的支付追踪。