self-evolution

标签

Cards List
#self-evolution

基于电路锚点的安全进化

arXiv cs.CL · 4天前 缓存

本文提出了电路锚定进化(CAE),一种利用机制可解释性在大语言模型自我进化过程中识别并锚定一个微型安全电路的方法,防止模型误进化为能力强但危险的系统,同时保持能力。

0 人收藏 0 人点赞
#self-evolution

SkillHEX:通过假设驱动的自主探索与利用提升智能体技能

arXiv cs.AI · 4天前 缓存

SkillHEX提出了一种用于大语言模型智能体自主技能演化的闭环框架,利用假设驱动的自我验证和证据引导的树搜索来克服稀疏奖励挑战。在有限交互预算下,它在SkillsBench上优于现有自演化方法。

0 人收藏 0 人点赞
#self-evolution

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

arXiv cs.AI · 5天前 缓存

Argus is a persistent, self-evolving agentic runtime designed for long-horizon reasoning, using Manager, Planner, Engineer, and Reviewer roles with verification-gated persistence and pivoting. It demonstrates strong results across seven benchmark arenas, including ~78% on SWE-Bench Pro, while reducing token usage after runtime self-evolution.

0 人收藏 0 人点赞
#self-evolution

A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing

arXiv cs.AI · 5天前 缓存

This paper proposes A/B Agent, a closed-loop agent framework that organizes historical A/B testing knowledge into a hierarchical experience tree, retrieves transferable strategies via multi-path Tree-RAG, and self-evolves through online experiment feedback, achieving a 4.829% GMV improvement in a short-video e-commerce recommendation system.

0 人收藏 0 人点赞
#self-evolution

GDPevo:评估智能体在真实业务任务中的自我进化

Hugging Face Daily Papers · 2026-08-04 缓存

GDPevo是一个在真实业务任务上评估智能体自我进化的基准,涵盖CRM、ERP、金融、医疗、法律以及以数据为中心的工作流。作者发布了自动化流水线,并发现自我进化能将留出集准确率提升最多16.44个百分点,但智能体仍远低于全知的oracle上限。

0 人收藏 0 人点赞
#self-evolution

@Xudong07452910: 让模型自己出题、自己解题、自己训练,最怕的就是把错误题目也一起学进去。 Qwen 团队这篇论文提出 Skill Self-Play,给模型的自我进化加入了一套会持续更新的技能库。 训练中有三个角色: Proposer 根据技能生成刚好有挑…

X AI KOLs Timeline · 2026-08-02 缓存

Qwen 团队提出 Skill Self-Play 框架,通过 Proposer、Solver 和动态技能控制器协同自我对弈,在工具调用和推理任务上显著提升模型能力。

0 人收藏 0 人点赞
#self-evolution

重新思考自我进化:一种受约束的探索-利用过程以缓解技能过拟合

arXiv cs.AI · 2026-07-31 缓存

本文提出SkillBoost,一种三阶段的受约束探索-利用框架,用于缓解LLM智能体自我进化中的技能过拟合。它在23个模型-基准配置上达到了最先进的性能,并证明了优化后的技能可以迁移到其他智能体。

0 人收藏 0 人点赞
#self-evolution

从教训中进化:面向操作级表格问答的技能增强表格图推理

arXiv cs.AI · 2026-07-28 缓存

本文提出了一种新的任务——操作级表格问答(Operation-wise TableQA),具有细粒度的问题分类,并提出了SkillTGR,一种技能增强的表格图推理框架,该框架利用图遍历和分层技能库实现自进化推理,取得了优越的性能和效率。

0 人收藏 0 人点赞
#self-evolution

教导LLMs自我进化:通过强化学习培养核心元技能

arXiv cs.CL · 2026-07-27 缓存

本文提出MetaEvolve框架,利用强化学习训练LLMs掌握自我进化的元技能以实现迭代优化,在编码基准测试上取得了显著改进。

0 人收藏 0 人点赞
#self-evolution

技能自我对弈(Skill Self-Play):通过协同进化技能推动大语言模型能力前沿

Hugging Face Daily Papers · 2026-07-24 缓存

本文介绍了技能自我对弈(Skill-SP),这是一个协同进化框架,利用提议者、求解者和技能控制器来桥接结构化验证与开放式探索,从而提升大语言模型在工具使用和推理基准测试中的性能。

0 人收藏 0 人点赞
#self-evolution

基于未来反馈预测的可验证开放式对话技能自我进化

arXiv cs.CL · 2026-07-22 缓存

本文介绍了一种利用未来反馈预测实现开放式对话技能自我进化的方法,将对话反馈转化为固定的离线目标,从而无需实时流量即可进行可复现的技能优化。该方法在保护隐私的销售助手数据集上实现了超过75%的预测准确率。

0 人收藏 0 人点赞
#self-evolution

Cura 1T:面向智能体医疗的专用模型

arXiv cs.AI · 2026-07-20 缓存

Cura 1T 是一款专注于医疗领域的LLM,通过人工门控的自我进化循环进行训练,该循环在患者咨询、临床推理和智能体医疗任务上不断改进,在医学基准测试中取得了顶尖性能,同时保持了通用推理能力。

0 人收藏 0 人点赞
#self-evolution

ABot-AgentOS: 一种具有终身多模态记忆的通用机器人智能体操作系统

Hugging Face Daily Papers · 2026-07-11 缓存

本文介绍了ABot-AgentOS,一种具有终身多模态记忆的通用机器人智能体操作系统,并提出了用于评估长周期具身任务的EmbodiedWorldBench。实验表明,该系统在任务成功率和记忆基准测试中取得了显著改进,表明专用的智能体操作系统层能够增强执行能力和持久记忆。

0 人收藏 0 人点赞
#self-evolution

@vista8: 开源了,开源了! 是不是很讨厌AI味重的网页设计,也讨厌千篇一律的排版? 乔帮主测试对比了8个主流设计Skill,吸收各家所长,开源自用设计SKill:qiaomu-design 特色功能: 1. 风格试衣间:一句话需求生成四个设计Dem…

X AI KOLs Timeline · 2026-07-06 缓存

乔帮主开源了设计Skill qiaomu-design,提供风格试衣间、对抗AI味、自进化机制和成熟网站参考功能,支持GLM或Claude模型执行。

0 人收藏 0 人点赞
#self-evolution

AI交易中的Alpha奇点:通过智能体间自我进化实现市场推理的涌现

arXiv cs.AI · 2026-06-30 缓存

本文介绍了密封联合搜索(SJS)和Agora系统,其中五个专业化的LLM智能体类协作进化Alpha因子。在91天的CSI 1000留存集上,Agora实现了投资组合夏普比率+1.87,显著优于基线,并且发现的指标表现为系统的涌现属性。

0 人收藏 0 人点赞
#self-evolution

基于保留集选择的递归自我进化智能体

arXiv cs.AI · 2026-06-30 缓存

介绍RSEA,一种利用三层自然语言状态和保留集选择门防止退化的LLM智能体递归自我进化方法。在四个基准测试中评估,结果表明上下文进化依赖于基准,且严格的选择门对可靠性至关重要。

0 人收藏 0 人点赞
#self-evolution

逃离自我确认陷阱:面向智能体经验学习的执行-提炼-验证范式

Hugging Face Daily Papers · 2026-06-23 缓存

本文提出EDV框架,在执行-提炼-验证阶段使用多个异构智能体为LLM智能体构建可靠经验,防止自我确认错误,并提升在长周期基准测试上的性能。

0 人收藏 0 人点赞
#self-evolution

@bibryam: Autogenesis:自我演化型智能体协议 https://arxiv.org/abs/2604.15034 tl;dr:将每个智能体组件视为版本控制的资源,可自动改进与回滚

X AI KOLs Timeline · 2026-06-17 缓存

介绍了 Autogenesis 协议(AGP),这是一种自我演化型智能体协议,将组件的演化过程解耦,支持对基于 LLM 的多智能体系统中的提示词、智能体、工具、环境和记忆进行生命周期管理、版本追踪和安全回滚。

0 人收藏 0 人点赞
#self-evolution

迈向Vibe医学:一种用于临床决策支持的自进化多智能体框架

arXiv cs.AI · 2026-06-16 缓存

本文提出了VIBEMed,一种具有自进化机制和安全沙箱的多智能体框架,用于稳健的临床决策支持,集成了专门用于诊断、治疗计划以及随时间演化临床知识的智能体。

0 人收藏 0 人点赞
#self-evolution

主动式LLM智能体的通信策略演化

arXiv cs.AI · 2026-06-15 缓存

本文形式化了LLM智能体的通信策略,并提出了通信策略演化(CPE),一种通过 rollout 和提示级演化来优化通信策略的自我演化框架,在多种设置下实现了最佳任务成功率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈