ai-reasoning

标签

Cards List
#ai-reasoning

@tom_doerr: Ix 将软件架构映射为系统图,以改善 AI 推理并减少 token 使用量。 https://gi…

X AI KOLs Timeline · 昨天 缓存

Ix 是一款开源工具,可将软件架构映射为系统图,帮助 AI 模型更有效地理解代码库,同时将 token 使用量减少 30-99.7%。

0 人收藏 0 人点赞
#ai-reasoning

ChatGPT为免费用户带来无限文本聊天

TechCrunch AI · 2天前 缓存

OpenAI取消了免费ChatGPT用户的文本聊天限制,引入GPT-5.6 Luna模型作为默认模型,并新增Think按钮;同时Plus/Pro用户获得升级版GPT-5.6 Sol,并带有思考滑块。

0 人收藏 0 人点赞
#ai-reasoning

AI推理是否因错误的原因而正确?

Hacker News Top · 2026-07-31 缓存

《Quanta Magazine》的一篇文章探讨了AI推理研究的混乱现状,权衡了关于大型推理模型能力的相互矛盾的证据,以及它们的行为对真正推理意味着什么。

0 人收藏 0 人点赞
#ai-reasoning

@sama: 哥布林级别的博文

X AI KOLs · 2026-07-30 缓存

声称GPT-5.6 Sol通过使用规范压缩实现跨多个上下文窗口的推理,在ARC-AGI-3上达到了最先进水平。

0 人收藏 0 人点赞
#ai-reasoning

我们能理解大语言模型是如何推理的吗?

Hacker News Top · 2026-07-12

本文探讨了理解大语言模型推理方式的现有努力和挑战,重点关注可解释性研究。

0 人收藏 0 人点赞
#ai-reasoning

@paul_cal: 这个作品看起来超酷,而 "J-space" 太棒了

X AI KOLs Timeline · 2026-07-07 缓存

Anthropic 分享了他们的发现:通过观察 'J-space',可以看到 Claude 的内部推理步骤,包括检测代码错误和识别图像。

0 人收藏 0 人点赞
#ai-reasoning

@doodlestein: https://x.com/doodlestein/status/2073825011249418358

X AI KOLs Timeline · 2026-07-05 缓存

来自AI模型Claude Fable在Rust中设计一个全面的计算几何与物理模拟框架时的详细推理过程,其中融入了共形几何代数和层上同调等高级数学概念。

0 人收藏 0 人点赞
#ai-reasoning

@DamiDefi: https://x.com/DamiDefi/status/2069709515721715954

X AI KOLs Timeline · 2026-06-24 缓存

Obsidian 不仅仅是一个笔记应用,更是一个面向 AI 推理系统的上下文层,因为它以纯文本 Markdown 文件存储笔记,AI 可以直接无摩擦地读取。文章概述了将 Obsidian 转变为推理基础的三种构建方式,包括一个 CLAUDE.md 文件,用于向 AI 灌输个人思维模式。

0 人收藏 0 人点赞
#ai-reasoning

@rohanpaul_ai: 这篇论文揭示了AI推理中的一个奇怪弱点:模型可以解决数学问题,却无法判断推理过程。令人不安的是…

X AI KOLs Following · 2026-06-16 缓存

这篇论文提出了Valid-Answer-Invalid-Reasoning (VAIR)基准测试,旨在揭示AI推理模型中的生成-评估差距,即模型可以生成正确答案,但无法检测出有缺陷的推理过程,暴露了答案确认偏差。

0 人收藏 0 人点赞
#ai-reasoning

@MaziyarPanahi:今天之前已有 110 多人申请早期访问,现已向所有人开放。它读取的指标包括寿命追踪、心脏、睡眠和恢复,并与你的基线进行比较……

X AI KOLs Following · 2026-06-16 缓存

一项健康追踪服务,可读取寿命、心率、睡眠和恢复等信号并与用户基线对比,现已向所有人开放。推理步骤可在 Hugging Face 上审计,并通过 OpenMed_AI 的 PII 模型保护隐私。

0 人收藏 0 人点赞
#ai-reasoning

AI能否像城市规划师一样推理?基于专业判断对大型语言模型进行基准测试

arXiv cs.CL · 2026-06-11 缓存

本文介绍了UPBench,这是一个基准测试,用于评估大型语言模型在城市规划知识方面的表现,涵盖四个知识支柱和五个认知层次。研究发现,模型在高阶分析任务上表现优于事实回忆,并识别出如监管幻觉和实践智慧缺失等认知局限。

0 人收藏 0 人点赞
#ai-reasoning

VLMs 是否像工程师一样推理?一个基准与分阶段评估

arXiv cs.AI · 2026-06-10 缓存

本文介绍了 EngVQA,一个用于评估视觉语言模型工程推理能力的多模态基准,以及一个 8 阶段自动评估框架,能够对推理失败进行细粒度分析。它揭示了当前 VLMs 在工程推理能力上的重大局限性。

0 人收藏 0 人点赞
#ai-reasoning

BiNSGPS:基于双向神经符号交互的几何问题求解

arXiv cs.AI · 2026-06-04 缓存

BiNSGPS 是一个框架,在多模态 LLM 顾问与符号求解器之间引入双向交互机制,用于几何问题求解。该框架允许求解器将反馈传递回顾问,以纠正错误并生成辅助假设。在 Geometry3K 和 PGPS9K 基准测试上分别取得了 90.5% 和 90.1% 的最优性能。

0 人收藏 0 人点赞
#ai-reasoning

选择视角:上下文相关论证中的策略性视角激活

arXiv cs.AI · 2026-06-01 缓存

介绍上下文相关的论证框架(CDAFs),该框架建模了智能体如何通过选择上下文来策略性地影响哪些攻击成功,从而实现基于价值的论证中不可能的操作场景。定义了ACTIVATION-MANIPULATION决策问题,并提供了基线复杂度界限。

0 人收藏 0 人点赞
#ai-reasoning

对于AI推理的“只需增加更多算力”的论点正变得越来越令人厌倦。

Reddit r/artificial · 2026-05-18

对AI推理扩展论点的一个批判性观点,认为自回归LLM无法仅通过增加计算量来实现正确性,并强调替代架构如EBM和形式验证在关键应用中更为优越。

0 人收藏 0 人点赞
#ai-reasoning

@Kseniase_: EBM强势回归!@ylecun多年来一直指出:AI推理需要先检查结构再作答的系统……

X AI KOLs Following · 2026-05-15 缓存

Aleph 是一个新型形式化推理AI系统,在主要基准测试中领先,证实了 Yann LeCun 对基于能量模型(EBM)的AI推理的强调。

0 人收藏 0 人点赞
#ai-reasoning

抽象论证中扩展的多样性

arXiv cs.AI · 2026-05-14 缓存

本文基于对称差引入了抽象论证中扩展的量化多样性概念,并对相关推理任务进行了系统的复杂性分类。

0 人收藏 0 人点赞
#ai-reasoning

GPT-5.5 被用于标记 FrontierMath 问题中的致命错误

Reddit r/singularity · 2026-05-12

Epoch 利用 GPT-5.5 识别出 FrontierMath 基准测试中约三分之一的问题存在致命错误,展示了该模型对评估标准进行合理性检查的能力。

0 人收藏 0 人点赞
#ai-reasoning

@wtgowers: 我也开始尝试让 AI 解决数学中的开放性问题。更准确地说,我把 Melvyn Nathanson 提出的几个问题提交给了 ChatGPT 5.5 Pro……

X AI KOLs Following · 2026-05-08 缓存

Tim Gowers 报告称,他使用 ChatGPT 5.5 Pro 尝试解决由 Melvyn Nathanson 提出的数学开放性问题。

0 人收藏 0 人点赞
#ai-reasoning

向思维模型教授工具推理:工具集成推理的全流程方案

arXiv cs.CL · 2026-05-08 缓存

本文提出了一种全流程方案,用于向思维模型教授工具推理,该方法应用于 Qwen3 模型时,在 AIME 2025 等基准测试上实现了最先进的性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈