autonomous-research

标签

Cards List
#autonomous-research

Auto-RecSys:利用自主研究代理实现工业级推荐系统

arXiv cs.CL · 5天前 缓存

Auto-RecSys 是一个自主研究系统,用于自动化工业级推荐模型的长期实验,通过分布式执行、集中式记忆和认知程序分离来提高效率和可靠性。

0 人收藏 0 人点赞
#autonomous-research

数据高效语言建模:从前沿进展到原则指导的模型改进

arXiv cs.CL · 5天前 缓存

由求是引擎(Qiushi Engine)进行的自主研究项目对BabyLM 2026 Strict-Small进行了端到端的研究,通过原则指导的方法改进了数据高效的语言模型,并在公开快照中取得了最高分。

0 人收藏 0 人点赞
#autonomous-research

@AIatMeta:作为对我们推进AI研究前沿进展的检验,今年6月,我们派出了下一代自主……

X AI KOLs Timeline · 2026-09-05

Meta的自主AI研究系统AIRA₃在一场由NVIDIA主办的Kaggle竞赛中排名第8(约4000支参赛队伍),赢得金牌。该竞赛旨在对300亿参数的Nemotron模型进行微调,AIRA₃的表现优于拥有相同工具访问权限的人类竞争者。

0 人收藏 0 人点赞
#autonomous-research

GPT-6 Astra 在 Blender 中再现了艺术宫。

Reddit r/singularity · 2026-09-04

GPT-6 Astra 通过研究数百张参考照片、迭代3D场景并渲染视频,以极少的人工干预自主地在 Blender 中再现了艺术宫。

0 人收藏 0 人点赞
#autonomous-research

AI科学家任务控制(AIMC):用于人类监督自主科学发现的可视化分析

arXiv cs.AI · 2026-09-01 缓存

本文介绍了AIMC,一个用于人类监督自主科学发现的可视化分析框架,支持对AI生成的研究成果进行监控和理解。

0 人收藏 0 人点赞
#autonomous-research

我们正在设计一个微小的自主研究智能体

Reddit r/LocalLLaMA · 2026-08-29 缓存

Starpower Technology 开发了 arXiv-WVY-43M,这是一款微小的 43.5M 参数语言模型,基于 arXiv 标题和摘要从零开始训练,专为自主研究应用设计。

0 人收藏 0 人点赞
#autonomous-research

@crazydonkey200: 很高兴其他用户发现 Amplio 很有帮助。这是我们用于自主长期研究运行的主要工具,持续时间为数天至……

X AI KOLs Timeline · 2026-08-28 缓存

Amplio 是一个由 Google DeepMind 开源的轻量级、健壮的代理工具,用于自主长期 AI 研究运行,具有崩溃恢复功能和简单的步骤模型。

0 人收藏 0 人点赞
#autonomous-research

AI 智能体共同构建了一篇科学文献,该文献在 12 个数学问题中的 5 个上实现了新发现。

Reddit r/ArtificialInteligence · 2026-08-27 缓存

The Station 是一个开放世界多智能体环境,AI 智能体在其中自主构建科学文献,并在评估的 12 个数学问题中的 5 个上实现了新发现。

0 人收藏 0 人点赞
#autonomous-research

AutoResearch: 洞察引入,幻觉排除

Hugging Face Daily Papers · 2026-08-23 缓存

AutoResearch 引入了一个两阶段自主系统,通过集成生成和基于证据的执行来奠定研究理念的基础,以提高实验可靠性和减少幻觉。

0 人收藏 0 人点赞
#autonomous-research

NanoGPT 速跑前沿

Hacker News Top · 2026-08-22 缓存

本文报道了在nanoGPT优化器速度竞赛中,对18个前沿AI模型进行自主测试的比较,详细阐述了它们在缩小与人类记录差距方面的表现。

0 人收藏 0 人点赞
#autonomous-research

ASI-Bench:在人工超级智能的黎明

Hugging Face Daily Papers · 2026-08-18 缓存

ASI-Bench 是一个新的基准测试,旨在评估 AI 系统在 11 个科学领域中创新探索和自主科学执行的能力,揭示了当前 AI 对人类指导的严重依赖。

1 人收藏 1 人点赞
#autonomous-research

Spark-to-Paper:作为可组合技能的端到端研究论文生成

arXiv cs.CL · 2026-08-13 缓存

本文介绍了 Spark-to-Paper,一个端到端的研究论文生成系统,在编程助手中以十三个可组合技能实现,在减少伪造的同时实现了高引用有效性和图形可编辑性。

0 人收藏 0 人点赞
#autonomous-research

AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准

arXiv cs.AI · 2026-08-13 缓存

介绍了AutoWorldModel-Bench,这是一个闭环基准测试,用于评估AI编程代理在八个游戏环境中进行自主世界模型研究的能力。该基准测试表明,Codex-5.4和Claude Opus 4.6等前沿代理在大多数会话中进行了非平凡的研究型改进。

0 人收藏 0 人点赞
#autonomous-research

@rohanpaul_ai:Google 的 ScientistOne 论文解决了 AI 生成研究的一个基本问题:结果可能看起来可信,即使……

X AI KOLs Following · 2026-08-11 缓存

Google Cloud AI Research 的 ScientistOne 论文通过引入 Chain-of-Evidence 来解决 AI 生成研究中的信任问题,该方法会在最终确定稿件之前,对照源工件验证引用、数值声明和方法描述。

0 人收藏 0 人点赞
#autonomous-research

不漂移的AI科学家:四足导航研究循环中的品味、结构与可证伪发现

arXiv cs.AI · 2026-08-11 缓存

这篇arXiv论文提出了一个AI科学家循环,用于研究四足机器人导航中的泛化,添加了实验卡片、专门化子代理以及一个名为kkanbu的偏好预言机,以防止漂移并保持自主研究的可证伪性。

0 人收藏 0 人点赞
#autonomous-research

Project2Task:面向自主研究的图引导项目级规划

arXiv cs.AI · 2026-08-07 缓存

介绍了Project2Task,一种用于自主研究系统的图引导项目级规划层,可将宏观项目简报分解为有界、依赖感知的研究任务,并明确贡献归属。评估显示其提高了项目组合质量和下游任务准确性。

0 人收藏 0 人点赞
#autonomous-research

EviGraph:证据引导的自主研究代理

arXiv cs.AI · 2026-08-06 缓存

EviGraph 是一个自主研究框架,它将研究过程表示为类型化证据图,以在各阶段保持主张与证据的一致性,在 ARC-Bench-ML 和 NanoResearch-20 上提升了主张支持率和实验数据一致性。

0 人收藏 0 人点赞
#autonomous-research

@agentmirko: 证明了加权θ扩展:每个通过一条桥边连接一个任意有根树的简单θ图……

X AI KOLs Following · 2026-07-24 缓存

一个自主的AI智能体(math-god)证明了加权θ扩展定理,证明了每个通过一条桥边连接一个任意有根树的简单θ图都满足 s⁺(G) > |V(G)|,使用了根同余PSD证据、局部归约、相位符号分类和其他先进技术的组合,并提供了机器可验证的证书。

0 人收藏 0 人点赞
#autonomous-research

@fnruji316625: 智能体可解释性正在成为一个独立研究方向。与一次性标注不同,AI智能体可以:形成…

X AI KOLs Timeline · 2026-07-15 缓存

智能体可解释性正在成为一个研究方向,其中AI智能体自主形成假设、设计实验并完善对模型内部的解释。三个工作——SAGE、Agentic-iModels和HYVE——展示了这一向自主、假设驱动可解释性的转变,改进了特征自动解释、模型设计和电路解释。

0 人收藏 0 人点赞
#autonomous-research

@NVIDIAAI: 我们为一个编码智能体设定了目标与时间预算:构建训练环境并教会视觉模型数彩色星星…

X AI KOLs Timeline · 2026-07-14 缓存

NVIDIA 展示了一个编码智能体,它自主构建了训练环境并教会 Qwen3-VL-2B 数彩色星星,使用 NeMo RL 和 NeMo Gym 框架将准确率从 25% 提升至 96.9%。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈