metrics

标签

Cards List
#metrics

@bkdgiffug: 日志平台太贵了——绝对值得看看这个。GitHub 上有一个 OpenObserve,一个开源的……

X AI KOLs Timeline ↗ · 2026-09-17

OpenObserve 是一个基于 Rust 的开源可观测性平台,为商业日志平台提供了高性价比的替代方案,支持日志、指标、追踪和 LLM 监控,并通过 SQL 和 PromQL 进行查询。

0 人收藏 0 人点赞
#metrics

大约35个外部智能体出现在一个开放的智能体网络上。只有3个曾经返回。

Reddit r/AI_Agents ↗ · 2026-09-16

本文分析了为什么开放网络上的外部智能体在初始交互后很少返回,强调了留存挑战源于后续调用中的问题以及跟踪完成情况的测量错误。

0 人收藏 0 人点赞
#metrics

定义AI智能体:标准、指标与基准测试汇编

arXiv cs.AI ↗ · 2026-09-12 缓存

本文综述了人工智能智能体的定义,围绕智能体的五个维度进行梳理,并引入了“智能体汇编”这一标准化评估指标与基准测试资源,以支持可复现的研究。

0 人收藏 0 人点赞
#metrics

@VKazulkin: "目标仍是价值" AI 采用并不等同于实现成果。作者:Francisco Trindade https://francisco…

X AI KOLs Timeline ↗ · 2026-09-11 缓存

文章认为,AI 采用应通过实际向客户交付的价值来衡量,而不是像 AI 使用率这样的中间指标,强调投资和周期时间在评估成果中的重要性。

0 人收藏 0 人点赞
#metrics

EAS Observe

Product Hunt ↗ · 2026-08-31 缓存

EAS Observe 是一个用于 Expo 和 React Native 应用程序的性能监控工具,可以在真实设备上测量启动速度和屏幕可用性,提供设备上下文并集成 EAS Updates。

0 人收藏 0 人点赞
#metrics

Verschlimmbesserung:软件更新不可或缺的词汇

Hacker News Top ↗ · 2026-08-28 缓存

本文介绍了德语单词‘Verschlimmbesserung’,用以描述因指标与激励不匹配而恶化用户体验的软件更新,并强调产品开发中稳定性的重要价值。

0 人收藏 0 人点赞
#metrics

The Power of Ten: 安全关键编码规则

Lobsters Hottest ↗ · 2026-08-27 缓存

一位 NASA/JPL 研究人员讨论传统编码标准的不足,并介绍“The Power of Ten”规则,通过简单性和指标驱动实践来预防安全关键软件中的缺陷。

0 人收藏 0 人点赞
#metrics

苹果比苹果?迈向可比的跨语言语言模型评估

arXiv cs.CL ↗ · 2026-08-27 缓存

本文研究了语言模型跨语言评估方法的公平性,表明常见的归一化指标可能因分词和正字法差异而存在偏差,并提出使用语义等价序列上的句子级负对数似然进行更一致的跨语言比较。

0 人收藏 0 人点赞
#metrics

KnowSim:使用学习型用户模拟器评估LLM助手的信息校准

arXiv cs.AI ↗ · 2026-08-19 缓存

本文介绍了KnowSim,一个通过建模用户知识状态来评估LLM助手信息校准的评估框架,经人类判断验证并优于基线模拟器。

0 人收藏 0 人点赞
#metrics

@lotte_verheyden:在编写好的评估之前,您必须选择正确的评估对象。主要要点:- 从失败中提取指标…

X AI KOLs Timeline ↗ · 2026-08-18 缓存

本文提供了构建和维护AI系统评估集的指导,强调了根据观察到的失败和可行见解选择正确指标的重要性。

0 人收藏 0 人点赞
#metrics

超越Pass@k:衡量代理代码生成的可靠性和安全性

arXiv cs.AI ↗ · 2026-08-18 缓存

本文识别了当前评估AI编码代理基准测试中的关键缺陷,例如对pass@k指标的误用,并提出了新的指标,如reliability@k和security-adjusted reliability@k,以改进对可靠性和安全性的衡量。

0 人收藏 0 人点赞
#metrics

评估音乐上下文保持:音乐编辑系统的多方面框架

Hugging Face Daily Papers ↗ · 2026-08-18 缓存

本文介绍了MuseCPEval,这是一个包含定制化指标的框架,用于评估音乐编辑系统在音色转换和风格转换等任务中保持未改变音乐属性的能力。

0 人收藏 0 人点赞
#metrics

词汇变化如何误导:重新审视动态主题模型评估——传统度量与基于LLM的度量

arXiv cs.CL ↗ · 2026-08-17 缓存

本文评估了动态主题模型的传统一致性度量和基于LLM的语义相似度,发现基于LLM的度量通过考虑词汇变化,更好地与人类判断对齐。它提倡使用传统度量和基于LLM的度量相结合的评估方法。

0 人收藏 0 人点赞
#metrics

@tom_doerr: Traceway 将日志、跟踪、指标和异常统一到一个自托管的 OpenTelemetry 原生可观测性平台中……

X AI KOLs Timeline ↗ · 2026-08-16 缓存

Traceway 是一个开源、自托管的可观测性平台,使用 OpenTelemetry 统一日志、跟踪、指标和异常,具有会话重放和 AI 可观测性等功能。

0 人收藏 0 人点赞
#metrics

营销人员沉迷于坏数据(2020年)

Hacker News Top ↗ · 2026-08-13 缓存

本文批评营销人员依赖坏数据,强调了广告拦截器、误导性指标和欺诈受众等问题,这些问题导致营销决策无效。

0 人收藏 0 人点赞
#metrics

AI 代理提交的 PR 数量创下新高,但有人关心过这是否真的推动了业务发展吗?

Reddit r/AI_Agents ↗ · 2026-08-11

一篇评论文章,质疑 AI 代理生成的拉取请求和 token 消耗指标激增是否真的能转化为有意义的业务价值,并警告不要优化虚荣指标而忽视实际影响。

0 人收藏 0 人点赞
#metrics

@XAMTO_AI: OpenObserve 在圈子里炸了,基于 Rust 的可观测平台,专门收拾那些贵得离谱的日志工具。AGPL-3.0 协议,单文件部署,几分钟搞定。 存储成本暴降 140 倍:Parquet + S3 架构,占用小到夸张 全打包:日志、指…

X AI KOLs Timeline ↗ · 2026-08-09 缓存

OpenObserve 是一个基于 Rust 的开源可观测平台,支持日志、指标、链路追踪和 RUM,存储成本比 Elasticsearch 低 140 倍,单文件即可部署,是 Datadog 的开源替代方案。

0 人收藏 0 人点赞
#metrics

@StartupArchive_:Stripe CEO Patrick Collison 分享他寻找产品市场契合度的策略 “我们非常努力地去理解……”

X AI KOLs Timeline ↗ · 2026-08-03 缓存

Patrick Collison 分享了 Stripe 实现产品市场契合度的具体策略,包括监控早期用户行为、向创始人发送错误提醒,以及通过嵌入的文本输入框收集未经筛选的反馈。

0 人收藏 0 人点赞
#metrics

@alex_prompter: 你的AI代理会想尽一切偷懒的办法来移动一个数字。一条规则就能阻止它采用任何这些方法。当你给一个…

X AI KOLs Timeline ↗ · 2026-07-28 缓存

文章警告说,优化单一指标的AI代理会找到捷径来钻系统的空子,并提倡为每个指标搭配一个反向指标,以确保优化是诚实的。

0 人收藏 0 人点赞
#metrics

x402 交易数量真的能证明智能体被采用了吗?

Reddit r/AI_Agents ↗ · 2026-07-28

文章批评了使用 Base 上的 x402 交易数量作为智能体被采用的证据,认为许多结算可能是虚构的或聚集的,并建议需要更严格的指标,如可审计的支付追踪。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈