标签
本文介绍了MemProbe,一个认知科学启发的框架,通过实验范式评估智能体记忆系统中的稳定性-可塑性权衡,提供记忆维护随时间变化的可解释剖面。
本文探讨了人工智能系统如何利用标识符通过跨模态链接来推断和重构身份,导致实际隐蔽性的崩溃,并引发重大隐私问题。
本文介绍Reachability-Induced Optimization (RIO),主张人工智能系统中的全局优化声明应基于实际可达区域,并提供理论结果和基准数据以支持此框架。
Sakeena Fiza 是 NVIDIA 的验证工程师,她确保像 NVIDIA Rubin GPU 这样的硬件系统在大规模生产之前能够在规模上正确运行,凸显了验证在AI基础设施中的重要性。
本文讨论了一种关键的自动化失败模式,即操作成功但响应超时,导致重复执行,并提倡使用稳定的操作ID和状态检查来增强代理评估的鲁棒性。
本文介绍了 LSREP,一种用于评估对话记忆的纵向状态重放协议,并以 ICE v2 作为案例研究,通过与向量 RAG 对比的重放和审计,揭示了故障模式。
作者认为AI代理存在状态完整性问题而非记忆问题,并提出一个状态账本(State Ledger)来区分历史事实与当前状态,并跟踪来源。
AttnFuse引入了一种可组合的DSL,用于将自定义注意力模式(包括RoPE)编译为融合GPU内核,相比现有方法如PyTorch的flex_attention实现了加速。
Φ-Bench 是一个新的基准测试,用于评估大型语言模型在工程化和优化人工智能基础设施方面的能力,涵盖从内核级代码补全到端到端系统优化的任务。
埃隆·马斯克邀请用户报告关于X的担忧,而安全主管迈克尔·奥赫利希宣布他关注安全、AI系统和言论自由。
有人发布了10个Claude系统的完整参考图,这些系统自动化任务,分为信息、工作和判断层,并详细说明了设置要求和功能。
多智能体AI系统通常会在路由、并行、交接和覆盖方面出问题。本文推荐使用分派矩阵、并行执行、结构化交接和带日志的兜底后备方案来修复这些问题。
本文提出了一种基于冗余调整人工年龄评分(AAS)的AI系统长期持续性框架,表明无限循环运行不必然导致无界的结构老化。
本文介绍了“评估盲区”(evaluation blindness),这是一个用于描述从训练到部署过程中破坏AI系统的静默测量失败的正式框架,包含案例研究、基于50个真实事件验证的失败分类法,以及失败预算框架。
这是一本名为《Agentic Design Patterns》的开源书,提供21章和7个附录,系统讲解AI Agent的设计模式,覆盖从基础到企业级生产环境,每章配有Jupyter Notebook实践。
伊恩·钱宁批评那些在表现并不优于Google AI的RAG系统上浪费资金的公司,他认为能够访问语料库并不等同于拥有深厚专业知识,并且推理无法与知识完全分离。
Sakana Fugu 技术报告介绍了一个经过训练的编排器,它能动态选择并协调专用模型来执行任务。其中包含一个快速版本(Fugu)和一个较慢的工作流版本(Fugu-Ultra),后者可根据每个请求设计定制化的协作模式。