@Xudong07452910: 如果你最近在关注 AI Scientist,我很推荐这篇文章。 现在很多 Research Agent 还是先生成大量实验和假设,再让 Judge 选最好的。 做研究往往是一次失败以后,能不能知道自己哪里理解错了,还有哪些地方没探索过。 …

X AI KOLs Timeline 新闻

摘要

这篇文章推荐关注AI Scientist,并讨论研究代理如何通过类比模糊测试来学习失败,从而绘制未知地图并指导后续实验。

如果你最近在关注 AI Scientist,我很推荐这篇文章。 现在很多 Research Agent 还是先生成大量实验和假设,再让 Judge 选最好的。 做研究往往是一次失败以后,能不能知道自己哪里理解错了,还有哪些地方没探索过。 文章把这件事类比成 fuzz testing,也就是不断用不同输入去试探系统。。 Fuzzer 大多数时候也找不到 bug,但 coverage 会持续告诉它哪里已经探索过,下一步该往哪里走。 Research Agent 可能也需要类似的反馈。 让每一次失败都更新一张「我还不知道什么」的地图,再用它决定下一个实验。 所以在 AI 真正发现人类不知道的东西之前,它可能得先学会发现自己不知道什么。
查看原文
查看缓存全文

缓存时间: 2026/08/21 09:10

如果你最近在关注 AI Scientist,我很推荐这篇文章。

现在很多 Research Agent 还是先生成大量实验和假设,再让 Judge 选最好的。

做研究往往是一次失败以后,能不能知道自己哪里理解错了,还有哪些地方没探索过。

文章把这件事类比成 fuzz testing,也就是不断用不同输入去试探系统。。

Fuzzer 大多数时候也找不到 bug,但 coverage 会持续告诉它哪里已经探索过,下一步该往哪里走。

Research Agent 可能也需要类似的反馈。

让每一次失败都更新一张「我还不知道什么」的地图,再用它决定下一个实验。

所以在 AI 真正发现人类不知道的东西之前,它可能得先学会发现自己不知道什么。

相似文章

@Xudong07452910: 哈佛这篇最新的 AutoScientists 很值得看,它让我感觉,AI 做研究这件事可能不会走向“一个超级 AI 科学家单挑全流程”,而是更像一个会自己组织起来的 AI 实验室。 这篇文章的核心是:让多个 Agent 共享实验状态,围绕…

X AI KOLs Timeline

哈佛大学的 AutoScientists 提出一种去中心化的多智能体团队方案,让多个 Agent 共享实验状态、自动组队并评审研究方案,在多个基准上显著优于现有方法。

@WWTLitee: 有没有什么办法让AI自主迭代优化? 有,来看看这个 autoresearch 它的核心不是让 AI 直接“发明论文”,而是把研究过程拆成一个可验证循环:人类写 program.md 给研究方向,AI agent 修改 http://tra…

X AI KOLs Timeline

介绍了autoresearch项目,它将AI研究过程拆解为可验证的循环(固定环境、单一可编辑文件、固定指标、Git回滚),使AI agent能进行可控、可复现的实验迭代;同时提及了12-factor-agents清单。

@Xudong07452910: 这篇论文很适合所有重度使用 Claude Code、Codex 或者其他AI Agent 的人看。 它研究的不是 Agent 在 benchmark 上怎么失败,而是一个更真实的问题: 在真实开发里,AI coding agent 到底是…

X AI KOLs Timeline

This paper analyzes 20,574 real-world coding-agent sessions to identify how AI agents misalign with developer intent, finding that constraint violations and inaccurate self-reporting are the most common failure modes, imposing trust and effort costs rather than irreversible damage.

@Xudong07452910: 推荐一本免费的 AI 书:《Agentic AI 漫游指南》。 我刚开始读,感觉它和很多「AI 入门指南」不太一样。 虽然也有基础知识,但作者明显没有把主要篇幅放在那些已经被反复讲过的概念上,而是一路讲到强化学习 RL、推理 Reason…

X AI KOLs Timeline

推荐一本免费的AI书《Agentic AI 漫游指南》,它深入讲解强化学习、推理、评测等概念,不同于普通入门指南,帮助理解AI工作机制。该书源自arXiv预印本。