metrics

标签

Cards List
#metrics

超越Pass@k:衡量代理代码生成的可靠性和安全性

arXiv cs.AI · 15小时前 缓存

本文识别了当前评估AI编码代理基准测试中的关键缺陷,例如对pass@k指标的误用,并提出了新的指标,如reliability@k和security-adjusted reliability@k,以改进对可靠性和安全性的衡量。

0 人收藏 0 人点赞
#metrics

词汇变化如何误导:重新审视动态主题模型评估——传统度量与基于LLM的度量

arXiv cs.CL · 昨天 缓存

本文评估了动态主题模型的传统一致性度量和基于LLM的语义相似度,发现基于LLM的度量通过考虑词汇变化,更好地与人类判断对齐。它提倡使用传统度量和基于LLM的度量相结合的评估方法。

0 人收藏 0 人点赞
#metrics

@tom_doerr: Traceway 将日志、跟踪、指标和异常统一到一个自托管的 OpenTelemetry 原生可观测性平台中……

X AI KOLs Timeline · 昨天 缓存

Traceway 是一个开源、自托管的可观测性平台,使用 OpenTelemetry 统一日志、跟踪、指标和异常,具有会话重放和 AI 可观测性等功能。

0 人收藏 0 人点赞
#metrics

营销人员沉迷于坏数据(2020年)

Hacker News Top · 5天前 缓存

本文批评营销人员依赖坏数据,强调了广告拦截器、误导性指标和欺诈受众等问题,这些问题导致营销决策无效。

0 人收藏 0 人点赞
#metrics

AI 代理提交的 PR 数量创下新高,但有人关心过这是否真的推动了业务发展吗?

Reddit r/AI_Agents · 2026-08-11

一篇评论文章,质疑 AI 代理生成的拉取请求和 token 消耗指标激增是否真的能转化为有意义的业务价值,并警告不要优化虚荣指标而忽视实际影响。

0 人收藏 0 人点赞
#metrics

@XAMTO_AI: OpenObserve 在圈子里炸了,基于 Rust 的可观测平台,专门收拾那些贵得离谱的日志工具。AGPL-3.0 协议,单文件部署,几分钟搞定。 存储成本暴降 140 倍:Parquet + S3 架构,占用小到夸张 全打包:日志、指…

X AI KOLs Timeline · 2026-08-09 缓存

OpenObserve 是一个基于 Rust 的开源可观测平台,支持日志、指标、链路追踪和 RUM,存储成本比 Elasticsearch 低 140 倍,单文件即可部署,是 Datadog 的开源替代方案。

0 人收藏 0 人点赞
#metrics

@StartupArchive_:Stripe CEO Patrick Collison 分享他寻找产品市场契合度的策略 “我们非常努力地去理解……”

X AI KOLs Timeline · 2026-08-03 缓存

Patrick Collison 分享了 Stripe 实现产品市场契合度的具体策略,包括监控早期用户行为、向创始人发送错误提醒,以及通过嵌入的文本输入框收集未经筛选的反馈。

0 人收藏 0 人点赞
#metrics

@alex_prompter: 你的AI代理会想尽一切偷懒的办法来移动一个数字。一条规则就能阻止它采用任何这些方法。当你给一个…

X AI KOLs Timeline · 2026-07-28 缓存

文章警告说,优化单一指标的AI代理会找到捷径来钻系统的空子,并提倡为每个指标搭配一个反向指标,以确保优化是诚实的。

0 人收藏 0 人点赞
#metrics

x402 交易数量真的能证明智能体被采用了吗?

Reddit r/AI_Agents · 2026-07-28

文章批评了使用 Base 上的 x402 交易数量作为智能体被采用的证据,认为许多结算可能是虚构的或聚集的,并建议需要更严格的指标,如可审计的支付追踪。

0 人收藏 0 人点赞
#metrics

@salesforce: 大多数AI智能体:擅长完成任务,但糟糕的是无法告诉你这些任务是否重要。“Loop engineering”赋予智能体一个…

X AI KOLs Timeline · 2026-07-24 缓存

Salesforce 讨论了 'Loop engineering' 作为一种让AI智能体评估自身进度的方法,但认为当前指标往往无法衡量真正的业务成果,并建议智能体应与共同业务目标对齐。

0 人收藏 0 人点赞
#metrics

使用DX Core 4衡量开发者生产力

Hacker News Top · 2026-07-24 缓存

DX Core 4是一个统一的框架,用于衡量开发者生产力,它将DORA、SPACE和DevEx整合为四个维度:速度、有效性、质量和业务影响。该框架旨在为任何规模组织的工程领导者提供可操作的见解。

0 人收藏 0 人点赞
#metrics

衡量工程生产力从未如此困难,这都多亏了AI!

Reddit r/artificial · 2026-07-21 缓存

像Codex这样的AI工具正在打破衡量工程生产力的传统代理指标,迫使领导者区分活动指标与实际业务价值。

0 人收藏 0 人点赞
#metrics

反馈归因与表示几何:用于比较多智能体强化学习中个体与共享奖励的度量

arXiv cs.LG · 2026-07-21 缓存

本文提出 EffRank/n 和 D_act 作为低开销诊断指标,用于衡量协同多智能体强化学习中奖励归因的效果,并在 SMACv2 上进行测试,发现观测解释了几何结构,而奖励归因主要影响行为。

0 人收藏 0 人点赞
#metrics

在应用场景中评估RAG指标:一项实验、发现与局限性

arXiv cs.CL · 2026-07-09 缓存

本文通过一项实证研究,比较了来自四个库(Ragas、DeepEval、RAGChecker、Opik)的RAG评估指标与人工判断及标准召回指标,并基于商业数据创建了问答数据集。

0 人收藏 0 人点赞
#metrics

你使用AI编程吗?必须关注架构

Reddit r/AI_Agents · 2026-07-06

一个开源CLI工具,扫描Python、JavaScript和TypeScript项目,识别模块并提供架构指标,同时提供AI辅助编程。

0 人收藏 0 人点赞
#metrics

如何判断你的AI产品是否真正盈利?

Reddit r/AI_Agents · 2026-07-06

讨论评估AI产品盈利能力的方法,重点关注关键财务和性能指标。

0 人收藏 0 人点赞
#metrics

Persona Non Grata: LLM角色驱动生成在MCQA中在不同维度上不稳定

arXiv cs.CL · 2026-07-02 缓存

本文研究了大型语言模型在多选题问答(MCQA)任务中角色驱动生成的不稳定性,提出了三个衡量指标来评估模型族、模型规模和问题域的性能、结果和正确性稳定性。研究发现,不稳定性的变化具有一致性,数学和常识问题表现出更大的不稳定性,并且任务提示格式比其他超参数(如温度)引入了更多的不稳定性。

0 人收藏 0 人点赞
#metrics

在模拟复杂系统上验证因果抽象度量

arXiv cs.LG · 2026-07-02 缓存

本文介绍了一个包含十个复杂系统的基准,用于验证因果抽象度量,评估了三十多个候选度量,并提出了因果抽象误差(CAE)作为一种通用的有效性度量,能够可靠地区分有效与无效的解释。

0 人收藏 0 人点赞
#metrics

分析代理是否应从 Linear/Sentry/Notion 拉取上下文,还是仅关注指标?

Reddit r/AI_Agents · 2026-06-30

探讨分析代理是否应整合来自 Linear、Sentry 和 Notion 等工具的上下文数据,还是保持纯指标驱动。

0 人收藏 0 人点赞
#metrics

The Download: 指标的弱点与AI大象预警

MIT Technology Review · 2026-06-29 缓存

一份新闻简报,涵盖使用指标量化生活的陷阱、印度利用人工智能系统防止人象冲突,以及美国政府允许Anthropic向受信任组织发布其Mythos 5模型。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈