reliability

标签

Cards List
#reliability

用于半导体热机械可靠性的递归Transformer

arXiv cs.LG · 2026-07-31 缓存

本文评估了递归权重共享Transformer架构作为参数高效的替代模型,用于半导体热机械可靠性预测,并在小型工程数据集上比较了性能、参数数量和计算成本。

0 人收藏 0 人点赞
#reliability

Saturation: How Your Software Will Fail at Scale

Lobsters Hottest · 2026-07-30 缓存

本文讨论软件系统在规模增长时因资源饱和而失效的现象,类比生物系统的极限,并介绍物理资源(CPU、内存、磁盘、网络)饱和和虚拟限制对系统可靠性的影响。

0 人收藏 0 人点赞
#reliability

没有停止策略的AI智能体只是一个昂贵的循环

Reddit r/AI_Agents · 2026-07-30

关于AI智能体可靠性的实用说明,主张生产环境中的智能体需要明确的门控机制,包括证据阈值、重试预算和影响评估,而不是仅依赖记忆来确定任务是否完成。

0 人收藏 0 人点赞
#reliability

Σ-Mem:面向基于LLM的多智能体系统的在线可靠性记忆

Hugging Face Daily Papers · 2026-07-30 缓存

本文介绍了Σ-Mem,一种用于基于LLM的多智能体系统的在线可靠性记忆,它跟踪同伴的历史能力表现及同伴之间的关系,通过谱界实现稳定自适应,并通过残差引导、路由和加权投票来改善协调性。

0 人收藏 0 人点赞
#reliability

为什么一个完美通过每个测试用例的智能体,在几百次真实对话后仍会偏离轨道?

Reddit r/AI_Agents · 2026-07-29

探讨了为什么在测试用例上表现完美的AI智能体在真实对话中常常失败,强调了分布偏移和过拟合等问题。

0 人收藏 0 人点赞
#reliability

相同问题,不同答案:超越准确性评估LLM的可靠性

arXiv cs.AI · 2026-07-28 缓存

本文研究了LLM在保持意义不变的改写下答案的变化,发现实例级行为不稳定(翻转率>23%),单提示准确性掩盖了显著的不一致性,而自我改写策略可以部分恢复潜在知识。

0 人收藏 0 人点赞
#reliability

将"人类拒绝"视为与"智能体故障"不同的故障模式——事实证明,这种区分在生产环境中非常重要

Reddit r/AI_Agents · 2026-07-27

讨论如何将'人类拒绝'视为与'智能体故障'不同的故障模式,这显著影响了AI智能体在生产环境中的可靠性和调试。

0 人收藏 0 人点赞
#reliability

AI代理开始看起来更像员工而非软件

Reddit r/artificial · 2026-07-26

文章认为,AI代理正从仅以智力评估转向需要操作可靠性、治理和团队整合,类似于人类员工,强调了新基础设施层的需求。

0 人收藏 0 人点赞
#reliability

我们花了太多时间构建智能体,而没有足够时间思考生产环境

Reddit r/AI_Agents · 2026-07-26

本文认为,AI社区过于专注于构建功能强大的智能体,而忽视了在生产环境中可靠部署它们所需的运维挑战,强调了增强可观测性、调试能力和系统稳健性的必要性。

0 人收藏 0 人点赞
#reliability

@SpaceX:飞行测试的成功来自于我们所学到的经验,今天的测试将帮助我们在……之前提高Starship的可靠性。

X AI KOLs Following · 2026-07-24

SpaceX表示,飞行测试的成功来自于学习,今天的测试将有助于提高Starship的可靠性,以服务于未来的轨道任务和Starlink部署。

0 人收藏 0 人点赞
#reliability

不要让模型编写审计日志

Reddit r/AI_Agents · 2026-07-24

本文警告不要将模型生成的叙述作为AI代理的权威审计日志,主张改为持久化原始工具调用数据,并建议通过简单的差异检查来发现不一致之处。

0 人收藏 0 人点赞
#reliability

智能体行业让栈溢出变得可收费——但谁拥有返回?

Reddit r/AI_Agents · 2026-07-24

对递归AI智能体系统中终止问题的分析,强调了智能体如何在仍选择有效动作的同时丢失已验证的位置,并质疑终止逻辑应位于智能体栈的何处。

0 人收藏 0 人点赞
#reliability

深度研究是否可靠?误导性知识会诱发错误结论

Hugging Face Daily Papers · 2026-07-23 缓存

本文介绍了 MisKnow-Agent,一个用于生成误导性知识以测试深度研究代理的框架,表明即使是有限的看似可信的错误信息暴露,也可能导致最终报告中的错误结论。

0 人收藏 0 人点赞
#reliability

AI代理中的操作幻觉与安全漂移

arXiv cs.AI · 2026-07-22 缓存

本文识别并描述了基于LLM的自主代理中的两种故障模式——安全漂移和操作幻觉——并提出了一种轻量级架构层,可在无假阳性情况下拦截违规行为。

0 人收藏 0 人点赞
#reliability

可靠性反向缩放:更大模型通过隐藏的自回归风险机制更快积累错误

arXiv cs.LG · 2026-07-22 缓存

本文发现,更大的语言模型存在一种隐藏的自回归风险机制,在该机制下,模型会承诺低概率词元,进而导致错误滚雪球式增长,使得可靠性随规模扩大而更快下降。研究表明,这种故障模式是因果性的、主导性的,并且对模型自身的自我监控不可见。

0 人收藏 0 人点赞
#reliability

仅供参考,你的代理可能显示为“在线”,但实际上已完全损坏

Reddit r/AI_Agents · 2026-07-21

提醒:AI代理可能看似在运行(“在线”),但实际上已损坏或故障,强调了需要更好的监控和验证。

0 人收藏 0 人点赞
#reliability

面向语言集成可靠性审计的多语言句子嵌入

arXiv cs.CL · 2026-07-21 缓存

本文评估了多语言句子嵌入能否在教育评估中替代翻译进行跨语言的语言集成可靠性审计,发现母语嵌入能紧密复现基于翻译的可靠性估计。

0 人收藏 0 人点赞
#reliability

多模态对话状态信号的可靠性如何?来自远程双人协作任务的证据

arXiv cs.CL · 2026-07-21 缓存

本文评估了用于测量远程双人协作任务中对话状态(如认知负荷和权力)的多模态特征的预测准确性、跨任务泛化能力和重测信度。研究结果表明,语言特征预测良好但泛化能力差,在控制说话者身份后声学可靠性下降,而交互特征提供了最可靠的信号。

0 人收藏 0 人点赞
#reliability

你不需要多智能体架构

Reddit r/AI_Agents · 2026-07-20

一篇文章指出多智能体架构常被过度使用,根据任务并行性和协调需求提供何时使用单智能体与多智能体架构的指南。

0 人收藏 0 人点赞
#reliability

AI代理失败本质上是分布式系统失败

Reddit r/AI_Agents · 2026-07-20

本文认为,AI代理系统中的失败可以通过分布式系统的视角来理解,并将代理行为与经典的分布式系统问题进行类比。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈