标签
该可视化项目展示了Los Angeles所有现存建筑,标注了每栋建筑的建造年份(从1880年到2026年),以展现城市发展过程。
本文介绍了Deep Persona,一个基于心理学的角色扮演代理架构,并提出了一个评估框架。对LLMs进行评估后发现,尽管语用流畅度高,但在情感表达方面存在系统性限制。
文章讨论了多代理RAG管道在生产中因同步工具调用和上下文膨胀而导致高延迟的原因,并提出了微代理、使用Redis缓存和异步处理等解决方案来提高性能。
本文探讨了AI智能体中的记忆是必不可少的,还是对不良架构的变通方案,并询问从业者在生产系统中需要持久化哪些内容。
本文识别了自我改进代理中LLM作为评判者系统的失败模式,并介绍了PROCTOR,一个具有确定性防护机制的架构来缓解这些问题。
作者批评了通过单一SDK为AI代理提供广泛访问个人账户的趋势,认为这在架构上不健全并带来安全风险,主张使用特定的、过期的权限。
Safin-1引入了一个基础模型家族,具备记忆原生状态演化,以实现内在安全能力,并使用MARCH架构进行选择性记忆检索和持久状态适应。
OpenAI 的 Astra 模型据说使用循环变换器架构以增强性能,但这可能会降低内部推理的可读性。据指出,它已达到关键网络安全能力阈值。
一种名为Mixture of Models (MoM)的新开源架构,专为大型语言模型设计,通过捆绑多个AI模型来实现类似专家混合模型的功能,现已发布在GitHub上。
这是一个讨论,旨在寻求将AI代理和LLM功能集成到现有产品中的最佳方法,重点关注架构、可靠性和维护经验。
Engrams 是一种架构创新,它使用 N-gram 表来从 transformer 模型中卸载记忆,通过释放参数用于计算,让较小模型能更好地推理。
推文赞扬了 Claude Managed Agent 架构,它优雅地处理了代理的复杂性,同时允许自定义,例如通过集成 Vercel 的 Chat SDK 来实现一个通用的聊天层。
本文认为,软件工程主要通过架构决策和权衡来管理复杂性,人工智能在代码生成方面很有效,但不擅长处理这些更高层次的方面。它强调了构建软件涉及关于约束、成本和演化的关键选择,而不仅仅是语法。
本文主张,比较WebSockets与Server-Sent Events时应聚焦于事件顺序和一致性问题,以避免产生不一致的用户界面,而非仅仅关注延迟或简洁性。
Qwen团队发布了一个开放权重模型Qwen 3.8 Flash Next,它在性能上以一半的参数超越DS V4 Flash,并且强于Opus 4.6,为Qwen 4架构提供了预览。
Qwen3.8-Flash-Next 引入了一种新的人工智能架构,专注于实现模型性能的极致成本效率。
本文是30天推断系列的一部分,解释了Transformer架构及其核心组件如自注意力和多头注意力,以及它在现代人工智能中的重要性。
本文主张,AI智能体中的上下文管理应被视为一个生命周期架构问题,并提出了智能体上下文管理框架,包含五个基本要素与一个参考实现,该实现已取得高基准测试分数。
论文介绍了'recirculation',这是一种针对基础模型的推理时架构增强技术,通过改进状态跟踪,显著降低了困惑度并提高了准确性,在生成过程中无额外延迟。