标签
Ix 是一款开源工具,可将软件架构映射为系统图,帮助 AI 模型更有效地理解代码库,同时将 token 使用量减少 30-99.7%。
OpenAI取消了免费ChatGPT用户的文本聊天限制,引入GPT-5.6 Luna模型作为默认模型,并新增Think按钮;同时Plus/Pro用户获得升级版GPT-5.6 Sol,并带有思考滑块。
《Quanta Magazine》的一篇文章探讨了AI推理研究的混乱现状,权衡了关于大型推理模型能力的相互矛盾的证据,以及它们的行为对真正推理意味着什么。
Anthropic 分享了他们的发现:通过观察 'J-space',可以看到 Claude 的内部推理步骤,包括检测代码错误和识别图像。
来自AI模型Claude Fable在Rust中设计一个全面的计算几何与物理模拟框架时的详细推理过程,其中融入了共形几何代数和层上同调等高级数学概念。
Obsidian 不仅仅是一个笔记应用,更是一个面向 AI 推理系统的上下文层,因为它以纯文本 Markdown 文件存储笔记,AI 可以直接无摩擦地读取。文章概述了将 Obsidian 转变为推理基础的三种构建方式,包括一个 CLAUDE.md 文件,用于向 AI 灌输个人思维模式。
这篇论文提出了Valid-Answer-Invalid-Reasoning (VAIR)基准测试,旨在揭示AI推理模型中的生成-评估差距,即模型可以生成正确答案,但无法检测出有缺陷的推理过程,暴露了答案确认偏差。
一项健康追踪服务,可读取寿命、心率、睡眠和恢复等信号并与用户基线对比,现已向所有人开放。推理步骤可在 Hugging Face 上审计,并通过 OpenMed_AI 的 PII 模型保护隐私。
本文介绍了UPBench,这是一个基准测试,用于评估大型语言模型在城市规划知识方面的表现,涵盖四个知识支柱和五个认知层次。研究发现,模型在高阶分析任务上表现优于事实回忆,并识别出如监管幻觉和实践智慧缺失等认知局限。
本文介绍了 EngVQA,一个用于评估视觉语言模型工程推理能力的多模态基准,以及一个 8 阶段自动评估框架,能够对推理失败进行细粒度分析。它揭示了当前 VLMs 在工程推理能力上的重大局限性。
BiNSGPS 是一个框架,在多模态 LLM 顾问与符号求解器之间引入双向交互机制,用于几何问题求解。该框架允许求解器将反馈传递回顾问,以纠正错误并生成辅助假设。在 Geometry3K 和 PGPS9K 基准测试上分别取得了 90.5% 和 90.1% 的最优性能。
介绍上下文相关的论证框架(CDAFs),该框架建模了智能体如何通过选择上下文来策略性地影响哪些攻击成功,从而实现基于价值的论证中不可能的操作场景。定义了ACTIVATION-MANIPULATION决策问题,并提供了基线复杂度界限。
对AI推理扩展论点的一个批判性观点,认为自回归LLM无法仅通过增加计算量来实现正确性,并强调替代架构如EBM和形式验证在关键应用中更为优越。
Aleph 是一个新型形式化推理AI系统,在主要基准测试中领先,证实了 Yann LeCun 对基于能量模型(EBM)的AI推理的强调。
Epoch 利用 GPT-5.5 识别出 FrontierMath 基准测试中约三分之一的问题存在致命错误,展示了该模型对评估标准进行合理性检查的能力。
Tim Gowers 报告称,他使用 ChatGPT 5.5 Pro 尝试解决由 Melvyn Nathanson 提出的数学开放性问题。
本文提出了一种全流程方案,用于向思维模型教授工具推理,该方法应用于 Qwen3 模型时,在 AIME 2025 等基准测试上实现了最先进的性能。