reliability

标签

Cards List
#reliability

还有人觉得 DeepSeek-V4-Flash 在非编程任务上不可靠吗?

Reddit r/LocalLLaMA · 22小时前

一位用户报告称,尽管 DeepSeek-V4-Flash-0731 在基准测试中得分很高,但在摘要、会议记录等非编程办公任务上却并不可靠,在概念提取和说话人理解方面表现不佳,而 Gemma-4-31B 的表现更好。

0 人收藏 0 人点赞
#reliability

一致性存在可计算的盲点:视觉语言图表读取中无标签可靠性的交换理论

arXiv cs.LG · 昨天 缓存

本文提出了一种用于视觉语言图表读取中无标签可靠性的交换理论,表明基于一致性的方法存在可计算的盲点,并引入了一种通过循环重标记增强的等变一致性评分。

0 人收藏 0 人点赞
#reliability

共识何时意味着正确性?通过语义保持的重渲染测量一致性与准确性的耦合

arXiv cs.LG · 昨天 缓存

本文介绍了RENDEQ,一种为科学图像生成渲染等价集的生成器,并测量了开放权重VLM中模型在语义保持的重渲染之间的一致性在多大程度上追踪正确性。研究发现,一致性仅在超过阈值时才证明正确性,而基于自一致性进行微调可能会损害准确率。

0 人收藏 0 人点赞
#reliability

PPDL:基于LLM的流程作为概率程序

arXiv cs.LG · 昨天 缓存

本文介绍了PPDL,一种用于编程基于LLM的流程的概率语言,使开发者能够在整个应用中量化和传播不确定性,并提供了关于定理证明的实验和案例研究。

0 人收藏 0 人点赞
#reliability

OrchestraBench:评估多智能体编排的故障模式、恢复与分解质量

arXiv cs.AI · 昨天 缓存

OrchestraBench 是一个新的基准测试,用于评估多智能体编排框架在故障模式、恢复和分解质量方面的表现,通过故障注入和级联半径指标来诊断流水线在何处以及为何失败。

0 人收藏 0 人点赞
#reliability

据最新生态级可靠性报告,x402 生态中半数端点无法访问

Reddit r/AI_Agents · 2天前

最新可靠性报告显示,约 72,000 个 x402 端点中 51% 不可达,仅有 67.8% 的收款钱包收到过付款,整个生态已结算 4,572 万美元,凸显了已列出端点与可用端点之间的差距。

0 人收藏 0 人点赞
#reliability

关系响应场:黑盒LLM响应一致性与恢复的通用理论

arXiv cs.CL · 2天前 缓存

本文介绍了关系响应场(RRF),这是一个理论框架,用于确定黑盒LLM响应在损坏情况下何时可以被可靠恢复,并建立了将响应一致性与真实性区分开的可辨识性条件和极小极大界。

0 人收藏 0 人点赞
#reliability

CARGO-VL:面向视觉-语言模型的反事实仲裁与风险约束组优化

arXiv cs.AI · 2天前 缓存

介绍了CARGO-VL,一种面向视觉-语言模型的组相对优化框架,通过反事实一致性和风险约束控制,改进对冲突图像-文本证据的处理以及不支持答案的回避,并提供了XMC冲突训练资源。

0 人收藏 0 人点赞
#reliability

为什么这么多智能体工具只是1:1的API封装?

Reddit r/AI_Agents · 3天前

这篇文章认为,许多AI智能体工具只是1:1的API封装,将分支逻辑推给大语言模型,导致失败。作者推荐任务形态的工具,比如upsert_contact,将搜索/创建/更新逻辑封装在代码中,传递已知上下文,校验输入,并返回结构化错误。

0 人收藏 0 人点赞
#reliability

你如何为智能体重试设置预算,同时不掩盖真正的失败?

Reddit r/AI_Agents · 3天前

询问开发人员如何为智能体重试设定预算,以区分瞬时故障和持久故障,以及哪些信号最能决定在生产环境中的智能体是停止还是重试。

0 人收藏 0 人点赞
#reliability

机器人能更可靠地找到停止时刻,却难以说明整体进展

Reddit r/ArtificialInteligence · 3天前

谷歌报告称,Gemini Robotics ER 2 能以高精度(91.3%)检测精确的停止时刻,但在对整体任务进度进行五档分类时可靠性却低得多(57.4%),这引发了关于完成检测是否应作为独立安全层的疑问。

0 人收藏 0 人点赞
#reliability

我查阅了396家金融科技公司的公开AI声明,只有143家能展示真正执行操作的智能体

Reddit r/AI_Agents · 4天前

对396家欧洲金融科技公司公开AI声明的分析发现,只有36%的公司展示了在生产环境中采取真实行动的智能体证据,其余都是Copilot。文章指出,关于生产智能体错误操作的事故处理机制几乎没有公开信息。

0 人收藏 0 人点赞
#reliability

Reliability Lessons From SQLite

Lobsters Hottest · 5天前 缓存

SQLite 开发者分享其可靠性经验,源自 DO-178B 航空电子标准,通过 100% MCDC 测试覆盖率确保代码质量,强调“没有测试过就不工作”的理念。

0 人收藏 0 人点赞
#reliability

我们构建了一个营收智能体。难点在于防止看似合理的草稿变成糟糕的行动。

Reddit r/AI_Agents · 5天前

构建营收智能体揭示出,最困难的挑战是防止看似合理但有缺陷的输出转化为实际行动。

0 人收藏 0 人点赞
#reliability

Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning

arXiv cs.CL · 5天前 缓存

This paper characterizes 'futile reasoning' in large language models, where models produce superficially valid but incorrect reasoning on tasks beyond their capability. They introduce CaRL, a capability-aligned reinforcement learning method that trains LLMs to abstain from futile reasoning while preserving performance.

0 人收藏 0 人点赞
#reliability

Mitigating Class-Tail Undercoverage in Medical Vision-Language Models under Clinical Shift

arXiv cs.LG · 5天前 缓存

Introduces CALCoDe, a post-hoc reliability layer for frozen medical vision-language models that mitigates class-tail undercoverage under clinical shift, achieving strong worst-class accepted coverage across multiple dermatology shifts and VLM backbones.

0 人收藏 0 人点赞
#reliability

我让智能体跑起来了,然后发现无聊的服务器杂事才是真正的问题

Reddit r/AI_Agents · 2026-07-31

一位开发者反思将 AI 智能体工作流迁移到服务器的经历,发现 systemd、日志、幂等性和故障告警这些枯燥的基础设施问题比智能体本身更重要。

0 人收藏 0 人点赞
#reliability

如果你自动化了某件事并停止检查,是错误停止了,还是只是你不再发现了?

Reddit r/AI_Agents · 2026-07-31

作者回顾了与运行 AI 自动化的人的对话,指出一种模式:在初始审计后放弃验证,这可能掩盖无声的失败。他们征集关于自动化出错却无人注意的具体案例。

0 人收藏 0 人点赞
#reliability

@thsottiaux:当我们开发出真正优秀的模型的那一天。会有迹象。尽管负载不断攀升,可靠性仍在提高。突然……

X AI KOLs Timeline · 2026-07-31 缓存

作者推测,真正先进的AI模型将表现出一些迹象,例如在负载不断增加的情况下可靠性提高、效率突然提升、性能变快以及重置。

0 人收藏 0 人点赞
#reliability

LayerRAG-Bench: A Cross-Layer Reliability Benchmark for Agentic Retrieval-Augmented Generation

arXiv cs.CL · 2026-07-31 缓存

Introduces LayerRAG-Bench, a cross-layer reliability benchmark for agentic retrieval-augmented generation systems, covering 9 fault scenarios and 38,880 records across nine models, with findings that schema normalization fixes schema drift but not stale, unauthorized, or wrong-session evidence.

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈