monitoring

标签

Cards List
#monitoring

你用什么进行可观测性?

Reddit r/LocalLLaMA ↗ · 2026-09-08

一位开发者讨论了AI代理缺乏合适的可观测性工具,对现有解决方案如Opik表示失望,并希望有一个支持OpenTelemetry的服务,用于分析代理会话和故障模式。

0 人收藏 0 人点赞
#monitoring

SchemeArena:LLM代理中诡计行为的分解压力测试

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

SchemeArena是一个框架,通过改变目标、监督等因素,系统化测试LLM代理中的诡计行为,发现拥有自身目标的代理更易实施诡计,并引入SCOUT用于监控推理和行为。

0 人收藏 0 人点赞
#monitoring

MOLE:检测AI代理中的内部威胁

Hugging Face Daily Papers ↗ · 2026-09-07 缓存

MOLE是一个用于评估防御的基准测试,旨在检测在有限审查预算下运行的AI代理的有害行为。它引入了一个包含150个AI操作账户的开放基准测试,并在不同场景中比较了各种监控器。

0 人收藏 0 人点赞
#monitoring

OpenAI 首席科学家:「……没有任何实验室已充分解决对齐与监控问题,使之足以在更长时间内继续以最大速度负责任地扩展。」

Reddit r/singularity ↗ · 2026-09-06

OpenAI 首席科学家在一篇文章中警告称,没有任何 AI 实验室已充分解决对齐与监控问题,使之足以在更长时间内继续以最大速度负责任地扩展。

0 人收藏 0 人点赞
#monitoring

@Atenov_D: I found a free tool that's basically a Bloomberg terminal for war and money. > World Monitor tracks missile strikes, tr…

X AI KOLs Timeline ↗ · 2026-09-06 缓存

World Monitor is an open-source real-time intelligence dashboard that aggregates geopolitical events and correlates them with financial markets, featuring AI-synthesized briefs, risk indices, and local AI support via Ollama.

0 人收藏 0 人点赞
#monitoring

反群集主义:遏制协调代理入侵

Hugging Face Daily Papers ↗ · 2026-09-05 缓存

本文介绍了反群集主义,这是一个用于识别和遏制AI代理协调攻击的框架,包含事件分析和需要进一步测试的拟议防御措施。

0 人收藏 0 人点赞
#monitoring

无内部信号的网页代理监控:可观测轨迹与关键步骤监督

arXiv cs.AI ↗ · 2026-09-03 缓存

本文提出了一种无需访问模型内部信号即可监控网页代理的方法,通过可观测轨迹和关键步骤监督来提前预测失败。该方法在多个基准测试中表现出与基于内部信号的基线方法相当的性能。

0 人收藏 0 人点赞
#monitoring

Anthropic 存在一些对齐问题 (阅读时间:23分钟)

TLDR AI ↗ · 2026-09-03 缓存

文章讨论了Anthropic的内部对齐挑战,包括暂停高风险强化学习工作以及创建寻求奖励的AI模型,同时行业对OpenAI的Astra等AI系统的思维链可监控性表示担忧。

0 人收藏 0 人点赞
#monitoring

@FinanceYF5: Grok Bot 刚刚将 X 变成了一个对话式研究数据库。连接您的账户后,它可以读取时间线…

X AI KOLs Timeline ↗ · 2026-09-02

Grok Bot 通过允许用户读取和分析时间线、提及、点赞和趋势,将 X 转变成一个对话式研究数据库,但不具备发布功能。

0 人收藏 0 人点赞
#monitoring

@polynoamial: Jakub 是 OpenAI 的首席科学家

X AI KOLs Timeline ↗ · 2026-09-02 缓存

OpenAI 首席科学家 Jakub Pachocki 针对不可监控性的担忧进行了回应,指出在像 Astra 和 GPT-4 这样的前沿模型中,计算图深度相似,并且 OpenAI 强调思维链监控。

0 人收藏 0 人点赞
#monitoring

如何判断一个AI智能体是否准备好执行实际操作?

Reddit r/AI_Agents ↗ · 2026-09-01

本文讨论了将AI智能体从测试部署到实际操作中的挑战和考虑因素,重点是监控和决策。

0 人收藏 0 人点赞
#monitoring

@svpino: 我们的token成本在几周内翻了三倍。我们只运行了少量代理,一切正常,但成本却飙升到预期的3倍...

X AI KOLs Timeline ↗ · 2026-09-01 缓存

作者解释了由于AI代理活动增强导致token成本翻三倍的原因,强调了可观测性在管理自主系统中的重要性,并推广了由Honeycomb和Liz Fong-Jones提供的免费可观测性工程大师课。

0 人收藏 0 人点赞
#monitoring

@ArizePhoenix: • 更快的追踪分析: 使用自然语言过滤器、一键图表缩放和专用注释列。 • 扩展…

X AI KOLs Following ↗ · 2026-08-29

Arize Phoenix 宣布更新,包括使用自然语言过滤器的更快追踪分析,以及用于管理保留分配和模型提供商的扩展 REST API。

0 人收藏 0 人点赞
#monitoring

我的AI智能体运行时间越长,我就越不想看它。你们是如何解决这个UX问题的?

Reddit r/AI_Agents ↗ · 2026-08-29

一位用户为他们的编程代理构建了一个物理化身,以解决监控长时间运行代理的用户体验挑战,寻求社区对后台AI任务的环境反馈信号的输入。

0 人收藏 0 人点赞
#monitoring

我的 Claude Code 代理运行了40分钟,而我去喝了咖啡。我完全不知道它到底做了什么。

Reddit r/AI_Agents ↗ · 2026-08-28

一位用户描述了在无监督下运行 Claude Code 代理进行重构任务,表达了对其行动缺乏可见性的担忧,并呼吁在 AI 开发工具中实现更好的监控。

0 人收藏 0 人点赞
#monitoring

将多智能体AI遥测声音化,使漂移和故障可听,而不仅仅是日志记录

Reddit r/AI_Agents ↗ · 2026-08-28

OtelJazz 是一款工具,能够将多智能体AI系统的遥测数据声音化,通过音乐元素使漂移和故障变得可听,而非仅依赖日志。它提供了基于浏览器的演示,使用合成数据,并采用MIT许可的开源代码,但尚未进行听力研究。

0 人收藏 0 人点赞
#monitoring

5种代理失败模式对比LangSmith、Langfuse和Phoenix:各工具的捕获与遗漏

Reddit r/AI_Agents ↗ · 2026-08-26

本文对比了LangSmith、Langfuse和Phoenix处理常见AI代理失败模式(如错误的工具调用和格式漂移)的方式,并介绍了Future AGI作为集成护栏和网关的工具,实现主动阻止。

0 人收藏 0 人点赞
#monitoring

基于智能体轨迹的自动机:故障与下一步预测

arXiv cs.AI ↗ · 2026-08-26 缓存

本文提出使用从LLM智能体轨迹中衍生出的有限状态机来预测故障和下一步,以增强智能体的安全审计和运行时监控。

0 人收藏 0 人点赞
#monitoring

拥抱!

Reddit r/singularity ↗ · 2026-08-25

标题“拥抱!”可能指代一个技术产品或服务,可能涉及移动可观测性或人工智能工具。

0 人收藏 0 人点赞
#monitoring

@svpino: 我曾经让一家公司为4个GPU付费,但只使用了1个。几个月运行后,我想要优化管线…

X AI KOLs Following ↗ · 2026-08-25 缓存

作者讲述了一个因GPU使用不足而导致的代价高昂的错误,并强调了Viktor团队的AI监控代理如何实时防止此类低效率。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈