标签
本文识别了当前评估AI编码代理基准测试中的关键缺陷,例如对pass@k指标的误用,并提出了新的指标,如reliability@k和security-adjusted reliability@k,以改进对可靠性和安全性的衡量。
本文评估了动态主题模型的传统一致性度量和基于LLM的语义相似度,发现基于LLM的度量通过考虑词汇变化,更好地与人类判断对齐。它提倡使用传统度量和基于LLM的度量相结合的评估方法。
Traceway 是一个开源、自托管的可观测性平台,使用 OpenTelemetry 统一日志、跟踪、指标和异常,具有会话重放和 AI 可观测性等功能。
一篇评论文章,质疑 AI 代理生成的拉取请求和 token 消耗指标激增是否真的能转化为有意义的业务价值,并警告不要优化虚荣指标而忽视实际影响。
OpenObserve 是一个基于 Rust 的开源可观测平台,支持日志、指标、链路追踪和 RUM,存储成本比 Elasticsearch 低 140 倍,单文件即可部署,是 Datadog 的开源替代方案。
Patrick Collison 分享了 Stripe 实现产品市场契合度的具体策略,包括监控早期用户行为、向创始人发送错误提醒,以及通过嵌入的文本输入框收集未经筛选的反馈。
文章警告说,优化单一指标的AI代理会找到捷径来钻系统的空子,并提倡为每个指标搭配一个反向指标,以确保优化是诚实的。
文章批评了使用 Base 上的 x402 交易数量作为智能体被采用的证据,认为许多结算可能是虚构的或聚集的,并建议需要更严格的指标,如可审计的支付追踪。
Salesforce 讨论了 'Loop engineering' 作为一种让AI智能体评估自身进度的方法,但认为当前指标往往无法衡量真正的业务成果,并建议智能体应与共同业务目标对齐。
DX Core 4是一个统一的框架,用于衡量开发者生产力,它将DORA、SPACE和DevEx整合为四个维度:速度、有效性、质量和业务影响。该框架旨在为任何规模组织的工程领导者提供可操作的见解。
本文提出 EffRank/n 和 D_act 作为低开销诊断指标,用于衡量协同多智能体强化学习中奖励归因的效果,并在 SMACv2 上进行测试,发现观测解释了几何结构,而奖励归因主要影响行为。
本文通过一项实证研究,比较了来自四个库(Ragas、DeepEval、RAGChecker、Opik)的RAG评估指标与人工判断及标准召回指标,并基于商业数据创建了问答数据集。
一个开源CLI工具,扫描Python、JavaScript和TypeScript项目,识别模块并提供架构指标,同时提供AI辅助编程。
本文研究了大型语言模型在多选题问答(MCQA)任务中角色驱动生成的不稳定性,提出了三个衡量指标来评估模型族、模型规模和问题域的性能、结果和正确性稳定性。研究发现,不稳定性的变化具有一致性,数学和常识问题表现出更大的不稳定性,并且任务提示格式比其他超参数(如温度)引入了更多的不稳定性。
本文介绍了一个包含十个复杂系统的基准,用于验证因果抽象度量,评估了三十多个候选度量,并提出了因果抽象误差(CAE)作为一种通用的有效性度量,能够可靠地区分有效与无效的解释。
探讨分析代理是否应整合来自 Linear、Sentry 和 Notion 等工具的上下文数据,还是保持纯指标驱动。
一份新闻简报,涵盖使用指标量化生活的陷阱、印度利用人工智能系统防止人象冲突,以及美国政府允许Anthropic向受信任组织发布其Mythos 5模型。