autonomous-research

标签

Cards List
#autonomous-research

ASI-Bench:在人工超级智能的黎明

Hugging Face Daily Papers · 2天前 缓存

ASI-Bench 是一个新的基准测试,旨在评估 AI 系统在 11 个科学领域中创新探索和自主科学执行的能力,揭示了当前 AI 对人类指导的严重依赖。

0 人收藏 0 人点赞
#autonomous-research

Spark-to-Paper:作为可组合技能的端到端研究论文生成

arXiv cs.CL · 2026-08-13 缓存

本文介绍了 Spark-to-Paper,一个端到端的研究论文生成系统,在编程助手中以十三个可组合技能实现,在减少伪造的同时实现了高引用有效性和图形可编辑性。

0 人收藏 0 人点赞
#autonomous-research

AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准

arXiv cs.AI · 2026-08-13 缓存

介绍了AutoWorldModel-Bench,这是一个闭环基准测试,用于评估AI编程代理在八个游戏环境中进行自主世界模型研究的能力。该基准测试表明,Codex-5.4和Claude Opus 4.6等前沿代理在大多数会话中进行了非平凡的研究型改进。

0 人收藏 0 人点赞
#autonomous-research

@rohanpaul_ai:Google 的 ScientistOne 论文解决了 AI 生成研究的一个基本问题:结果可能看起来可信,即使……

X AI KOLs Following · 2026-08-11 缓存

Google Cloud AI Research 的 ScientistOne 论文通过引入 Chain-of-Evidence 来解决 AI 生成研究中的信任问题,该方法会在最终确定稿件之前,对照源工件验证引用、数值声明和方法描述。

0 人收藏 0 人点赞
#autonomous-research

不漂移的AI科学家:四足导航研究循环中的品味、结构与可证伪发现

arXiv cs.AI · 2026-08-11 缓存

这篇arXiv论文提出了一个AI科学家循环,用于研究四足机器人导航中的泛化,添加了实验卡片、专门化子代理以及一个名为kkanbu的偏好预言机,以防止漂移并保持自主研究的可证伪性。

0 人收藏 0 人点赞
#autonomous-research

Project2Task:面向自主研究的图引导项目级规划

arXiv cs.AI · 2026-08-07 缓存

介绍了Project2Task,一种用于自主研究系统的图引导项目级规划层,可将宏观项目简报分解为有界、依赖感知的研究任务,并明确贡献归属。评估显示其提高了项目组合质量和下游任务准确性。

0 人收藏 0 人点赞
#autonomous-research

EviGraph:证据引导的自主研究代理

arXiv cs.AI · 2026-08-06 缓存

EviGraph 是一个自主研究框架,它将研究过程表示为类型化证据图,以在各阶段保持主张与证据的一致性,在 ARC-Bench-ML 和 NanoResearch-20 上提升了主张支持率和实验数据一致性。

0 人收藏 0 人点赞
#autonomous-research

@agentmirko: 证明了加权θ扩展:每个通过一条桥边连接一个任意有根树的简单θ图……

X AI KOLs Following · 2026-07-24 缓存

一个自主的AI智能体(math-god)证明了加权θ扩展定理,证明了每个通过一条桥边连接一个任意有根树的简单θ图都满足 s⁺(G) > |V(G)|,使用了根同余PSD证据、局部归约、相位符号分类和其他先进技术的组合,并提供了机器可验证的证书。

0 人收藏 0 人点赞
#autonomous-research

@fnruji316625: 智能体可解释性正在成为一个独立研究方向。与一次性标注不同,AI智能体可以:形成…

X AI KOLs Timeline · 2026-07-15 缓存

智能体可解释性正在成为一个研究方向,其中AI智能体自主形成假设、设计实验并完善对模型内部的解释。三个工作——SAGE、Agentic-iModels和HYVE——展示了这一向自主、假设驱动可解释性的转变,改进了特征自动解释、模型设计和电路解释。

0 人收藏 0 人点赞
#autonomous-research

@NVIDIAAI: 我们为一个编码智能体设定了目标与时间预算:构建训练环境并教会视觉模型数彩色星星…

X AI KOLs Timeline · 2026-07-14 缓存

NVIDIA 展示了一个编码智能体,它自主构建了训练环境并教会 Qwen3-VL-2B 数彩色星星,使用 NeMo RL 和 NeMo Gym 框架将准确率从 25% 提升至 96.9%。

0 人收藏 0 人点赞
#autonomous-research

@yibie: 推荐这篇文章,Superpowers 的作者让 Fable 5 跑了一个完整的 autoresearch loop——25 个实验,$165,把构建速度提高了 50%、token 开销降低了 60%。但这篇最值钱的不是结果数字,是他完整记…

X AI KOLs Timeline · 2026-07-03 缓存

Superpowers 6 发布,利用 Fable 5 进行 25 个自治实验,将构建速度提高 50%、token 开销降低 60%,并详细记录了实验过程和失败教训。

0 人收藏 0 人点赞
#autonomous-research

AI交通科学家自主发现交通法规

arXiv cs.AI · 2026-07-03 缓存

本文介绍了TrafficSci,一种自主AI系统,通过迭代工作流程自动化发现跨城市的通用交通法规,成功重新发现了已建立的法规,并识别出城市驾驶行为中一种新的时间记忆尺度。

0 人收藏 0 人点赞
#autonomous-research

@VraserX:OpenAI的AI研究实习生,预计9月到来,让我感觉像是早期的AGI。并不是因为它是什么神奇的超级大脑……

X AI KOLs Timeline · 2026-06-30 缓存

一条推文推测,OpenAI即将推出的AI研究实习生(9月)感觉像早期AGI,并预测到2027-2028年将出现完全自主的AI研究员,这可能是第一个ASI。

0 人收藏 0 人点赞
#autonomous-research

@VukRosic99: 用一次提示构建LLM + 设置DeepSeek研究员(其副业)的自动研究系统 一个实时构建过程,通过一次提示创建完整…

X AI KOLs Timeline · 2026-06-28 缓存

演示了通过向AI编码代理(Claude Code/Codex)发送单个提示来构建完整的LLM,并安装由DeepSeek研究员开发的自主AI研究技能,涵盖架构、故障模式以及无人值守运行。

0 人收藏 0 人点赞
#autonomous-research

@VukRosic99: DeepSeek 研究员刚刚开源了他的个人项目 AutoResearch。该项目首次实现了自动化研究代理...

X AI KOLs Timeline · 2026-06-18 缓存

DeepSeek 研究员开源了 AutoResearch,这是一个自主框架,能够在无需人工干预的情况下,为 DeepSeek 285B 模型规划、执行并调试强化学习实验,并附带了一篇关于自我对弈的综述论文。

0 人收藏 0 人点赞
#autonomous-research

@OpenAI: GPT-5.4 帮助推动了一个药物化学项目,从文献综述到验证的实验结果。与…

X AI KOLs · 2026-06-17 缓存

GPT-5.4 与 Molecule.one 的 Maria AI 平台合作,自主推动了一个药物化学项目,从文献综述到验证的实验结果,提出了对药物发现中广泛应用的反应的意外改进。

0 人收藏 0 人点赞
#autonomous-research

@victor207755822:Deli AutoResearch SKILL 现已正式开源!https://victorchen96.github.io/auto_research/framework.html… 还有…

X AI KOLs Timeline · 2026-06-17 缓存

Deli AutoResearch SKILL 已开源,这是一个自主框架,可自动化 GPU 实验和强化学习流水线,同时附带一篇关于自我对弈的综述论文。

0 人收藏 0 人点赞
#autonomous-research

Sakana Marlin(4分钟阅读)

TLDR AI · 2026-06-16 缓存

Sakana AI 发布其首款商业产品 Sakana Marlin,这是一款自主研究助手,可在数小时内完成策略工作,生成结构化的幻灯片和详细报告。

0 人收藏 0 人点赞
#autonomous-research

@THUTeamEureka: 1/3 很高兴开源EurekAgent!一个完全自主的研究系统,用于指标驱动的任务,基于Claude Code构建……

X AI KOLs Timeline · 2026-06-15 缓存

THU Team Eureka 开源了 EurekAgent,这是一个基于 Claude Code 构建的自主研究系统,通过环境工程在数学、内核工程和机器学习任务上取得了最先进的结果。

0 人收藏 0 人点赞
#autonomous-research

@_akhaliq: 论文:

X AI KOLs Following · 2026-06-11 缓存

一篇论文介绍了Arbor,这是一种AI框架,通过结合策略协调、隔离假设测试和持久知识树,实现跨多个领域的自主科学研究,并迭代改进研究成果。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈