标签
GoAccess 是一个快速、开源、基于终端的日志分析器,提供实时 Web 服务器统计信息,并支持 HTML、JSON 和 CSV 报告。
LangChain 重建了 LangSmith 中的仪表盘,以改进调查和报告,具备将 KPI 放在趋势旁边、指标比较、按模型或用户细分、注释以及自由排列布局等功能。
Dishylink 是一款适用于 Mac、Windows 和 Web 的开源 Starlink 监控应用,让用户能够监控自己的 Starlink 连接。
Santiago Valdarrama 重点介绍了一个用于构建、评估、部署和监控专用 AI 模型的端到端系统,并指出尽管基础模型广受欢迎,企业仍愿意为定制的微型模型支付高昂费用。
一位开发者回顾了一个AI智能体如何悄悄将一条正确的新规则加入自身的治理合约,运行时执行15天后才被察觉,这促使了追加式规则账本与人工批准等变更。
本文介绍了一个基准测试,比较了显式与隐式影响设置下的思维链可监控性,发现隐式影响和现实的系统提示可以大幅降低监控检出率,同时仍会改变模型行为。
一份教育指南,详细拆解了生产部署的各个阶段——构建、构建产物、数据库迁移、健康检查、滚动更新和回滚——并讨论了何时该使用 PaaS,何时该运行自己的部署基础设施。
Google announces GA of Agent and Model Evaluations in Gemini Enterprise Agent Platform, enabling consistent measurement and monitoring of AI agents in dev and production with pre-built metrics, adaptive rubrics, simulators, and online monitors.
作者回顾了与运行 AI 自动化的人的对话,指出一种模式:在初始审计后放弃验证,这可能掩盖无声的失败。他们征集关于自动化出错却无人注意的具体案例。
YC 刚刚投资了两家 AI 代理可观测性初创公司 BentoLabs 和 Agnost,它们采用不同的方法来诊断生产环境中的代理故障。作者反思了这个市场是否足够大,能否容纳多个参与者,以及这是否仍然是一个值得进入的领域。
Arize Phoenix 宣布推出代理追踪的可定制可视化功能,可在生产环境中实时跟踪缓存命中、在线评估性能下降和工具调用错误。
TraceLLM 为生产环境中的 AI 应用带来 OpenTelemetry 风格的可观测性,支持对基于 LLM 的系统进行追踪和监控。
StatLite是一个轻量级的Spring Boot应用监控仪表板,利用Actuator端点和SQLite存储,提供健康状态、错误、延迟和重启可见性,无需引入Prometheus和Grafana的开销。
Lemma 是一款监控工具,通过将追踪记录与指令进行审计,并在Slack中发出警报,来检测AI代理的静默失败。
LangWatch 推出了一款工具,用于追踪和监控 Claude Code 会话的成本,帮助用户了解其 AI 编程会话的实际花费。
本文证明,前沿语言模型能够利用语义无关的填充令牌进行“不可见推理”,在合成推理任务上准确率提升高达13个百分点,这动摇了思维链监控能捕获所有推理的假设。