self-improving-agents

标签

Cards List
#self-improving-agents

Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents

arXiv cs.AI · 3天前 缓存

This paper introduces SkillMisevo-Gym and SkillMisevo-Bench to study how self-improving LLM agents can evolve unsafe skills from compromised experience, plus SafeEvolve as a mitigation wrapper. Experiments across 25 agent-method configurations show skill misevolution is widespread and can persist across sessions, though SafeEvolve reduces fresh-session harm significantly.

0 人收藏 0 人点赞
#self-improving-agents

面向知识图谱问答的研究者智能体

arXiv cs.AI · 6天前 缓存

本文提出了一种自我改进的“研究者智能体”,用于知识图谱上的Text-to-SPARQL问答,该智能体能迭代优化自身的提示和工具。在DBpedia上进行评估,达到了0.22的准确率,并识别出谓词选择是主要瓶颈。

0 人收藏 0 人点赞
#self-improving-agents

@Xudong07452910: 最近发现 Stanford Online 把研究生课程 CS329A:Self-Improving AI Agents 的完整课程录像放到 YouTube 了,一共 9 讲。 这门课基本围绕一个问题展开:AI Agent 怎么通过和环境不…

X AI KOLs Timeline · 2026-08-10 缓存

斯坦福大学在 YouTube 上发布了研究生课程 CS329A: Self-Improving AI Agents 的完整录像,共 9 讲,涵盖测试时计算、验证器、强化学习、工具反馈、多步推理等主题,系统梳理了 Agent 自进化方向。

0 人收藏 0 人点赞
#self-improving-agents

@rohanpaul_ai: 一个自我改进的智能体可以保持其权重冻结,但仍然会因它学会信任的记忆而变得更糟。这些…

X AI KOLs Following · 2026-08-09 缓存

论文《Memory Reward Inflation in Self-Improving LLM Agents》表明,权重冻结的自我改进智能体仍可能因信任有缺陷的LLM生成的记忆分数而退化,模型认可自身31%–54%的错误答案。这种“回声差距”在更强的LLM中依然存在。

0 人收藏 0 人点赞
#self-improving-agents

@rvaniaaaa: 我查看过的几乎每个自我改进智能体都有同样缺失的部分。人们构建了发现部分。Scout 找到…

X AI KOLs Following · 2026-08-08 缓存

一条推文讨论了自我改进智能体缺失的部分:一个严格的审查关卡,要求经验丰富的工程师必须批准每个技能。它解释了不断增长的库如何提高发现和提取质量,由人类批准所有合并以保持系统的可信度。

0 人收藏 0 人点赞
#self-improving-agents

谁为评分者评分?自我改进大语言模型代理中评估指标与技能的协同进化

arXiv cs.AI · 2026-07-15 缓存

本文提出了一种在自我改进的大语言模型代理系统中协同进化评估指标和技能的方法,展示了指标是可以进化的,并且协同进化方法在代码生成、文本到SQL和报告生成任务中恢复了大部分由真实标签驱动的性能。

0 人收藏 0 人点赞
#self-improving-agents

今天,我们发布了 verifiers v1(3分钟阅读)

TLDR AI · 2026-07-14 缓存

Prime Intellect Lab 已结束测试,提供平台用于训练模型,支持多种架构和模态,助力自我改进的智能体。

0 人收藏 0 人点赞
#self-improving-agents

@loganthorneloe: https://x.com/loganthorneloe/status/2075684831233757275

X AI KOLs Timeline · 2026-07-10 缓存

本周精选五篇值得关注的AI文章,涵盖自我改进代理、Bun向Rust迁移、vLLM架构、编码评估基准以及代理自主性等级。

0 人收藏 0 人点赞
#self-improving-agents

@zodchiii: Anthropic x Google 刚刚发布了三个关于从头构建自我改进的智能体系统的研讨会:00:01 – 为什么多智能体……

X AI KOLs Timeline · 2026-07-10 缓存

Anthropic 和 Google 发布了三个免费的研讨会,主题是从头构建自我改进的智能体系统,涵盖多智能体的陷阱、技能差距以及构建自主智能体。

0 人收藏 0 人点赞
#self-improving-agents

@dair_ai: // MetaSkill-Evolve // 关于自我改进代理的优秀论文。大多数自我改进代理重写代理所做的并……

X AI KOLs Following · 2026-07-07 缓存

MetaSkill-Evolve 引入了一个递归的双时间尺度框架,用于LLM代理,使其能够同时进化任务技能和改进过程本身,在OfficeQA、SealQA和ALFWorld基准测试上取得了显著的准确性提升。

0 人收藏 0 人点赞
#self-improving-agents

Autoresearch:自我完善智能体背后的反馈循环(11分钟阅读)

TLDR AI · 2026-07-02 缓存

Introspection是一家由前xAI工程师创立的新AI初创公司,它推出了'autoresearch'——一种反馈循环系统,智能体通过信号、评估和人类输入来维护并完善自身,超越了传统的智能体框架。

0 人收藏 0 人点赞
#self-improving-agents

@DeRonin_: 如何自然地构建你自己的自我改进智能体:一个自我改进的智能体从自己的错误中学习并重写……

X AI KOLs Timeline · 2026-06-29 缓存

一份实用指南,解释了构建自我改进AI智能体的三个层级,从手动循环到自动化设计,并推荐了工具和框架。

0 人收藏 0 人点赞
#self-improving-agents

@Saboo_Shubham_:这就是2026年如何经营一家一人AI代理公司的方法。7个AI代理。10个定时任务。0名人类员工。每个角色都是……

X AI KOLs Following · 2026-06-29 缓存

一家一人公司完全由7个AI代理、10个定时任务运行,没有人类员工。这些代理通过Telegram自我评估和改进。

0 人收藏 0 人点赞
#self-improving-agents

@zostaff: 这篇论文完全改变了我对自我改进智能体的看法:初始化 -> 运行 -> 分析 -> 分支 -> 更新…

X AI KOLs Timeline · 2026-06-28 缓存

这篇论文提出了一种自我改进智能体的新颖蓝图,通过元智能体和反馈智能体结合支架编辑和权重训练,在AlphaFold的CUDA内核上实现了14倍加速。

0 人收藏 0 人点赞
#self-improving-agents

红皇后哥德尔机:共同进化的智能体及其评估者

arXiv cs.LG · 2026-06-26 缓存

本文介绍了红皇后哥德尔机(RQGM),这是一个在非平稳效用下进行递归自我改进的进化框架,其中智能体和评估者共同进化,提高了在编程任务、科学写作和奥林匹克级证明评分方面的性能。

0 人收藏 0 人点赞
#self-improving-agents

@yoheinakajima: 在 arxiv 论文 #2 中,我处理了论文 #1 中的最后一个主题:@activegraphai 作为自我改进代理的架构可供性 self-improv…

X AI KOLs Following · 2026-06-10 缓存

本文介绍了Regimes,一种基于ActiveGraph运行时的可审计、保留门控改进循环,用于自我改进代理。它通过在LongMemEval数据集上自主发现通过静态检查、沙盒执行和保留验证的提示修复,展示了适度的改进。

0 人收藏 0 人点赞
#self-improving-agents

EEVEE:面向现实世界中自改进代理的测试时提示学习

Hugging Face Daily Papers · 2026-06-09 缓存

EEVEE是一种新颖的测试时提示学习框架,专为LLM代理设计,通过任务聚类和共同演化的路由器-提示优化来处理异构数据流,在多个基准测试上实现了显著优于现有方法的改进。

0 人收藏 0 人点赞
#self-improving-agents

@dair_ai: 关于自我改进智能体的优秀论文:

X AI KOLs Following · 2026-06-07 缓存

本周一篇重要的AI论文探讨了自我改进智能体是否真正发现新知识,还是仅仅在重新混合现有信息。

0 人收藏 0 人点赞
#self-improving-agents

@omarsar0: 这是本周最突出的AI论文之一。(收藏) 它探讨了一个大多数自我改进的AI智能体都……

X AI KOLs Following · 2026-06-07 缓存

本文介绍了一个范畴论框架,用于区分自我改进的AI智能体中的真正科学发现与单纯的检索或搜索,利用范畴论来形式化状态转变。作者通过一个蛋白质力学示例展示了该框架:智能体在解决更难的问题时准确率下降,但其理论压缩了更多数据,表明真正的发现。

0 人收藏 0 人点赞
#self-improving-agents

@rohanpaul_ai: 更好的自我改进智能体需要更好的求解器,而非更大的更新编写模型。这挑战了常见的习惯……

X AI KOLs Following · 2026-06-05 缓存

本文厘清了自我改进的LLM智能体中进化器与智能体的角色,表明一个小型进化器可以编写足够好的更新,而中端智能体最能从中受益。论文建议将最强的模型用作任务执行器,而非更新编写器。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈