标签
本文提出了一种用于Spotify对话推荐代理的合成数据生成管道和自我改进循环,显著提升了用户参与度和性能。
这条推文讨论了小规模AI的日益普及,并鼓励企业现在就构建自己的智能技术栈和流程,以便与未来先进的AI模型和代理协同扩展。
Anthropic 工程师公开了一项他们内部使用的简易技巧:利用外部记忆脚手架,让 Claude 代理将错误和改进记录在一个文件中,从而在无需重新训练模型的前提下持续提升性能。
Google 介绍了 RRSI,这是一种用于 AI 代理框架中规范化递归自改进的方法,可增强跨基准的迁移学习并减少过拟合。
MiMo-V2.6 引入了组间优势重分配,通过比较同级尝试和使用分级反馈来增强AI代理的强化学习,在多个任务领域显示稳定的性能提升。
MiMo-V2.6-Flash-RL 是一个多模态AI模型,通过扩展强化学习实现自我改进,采用稀疏混合专家架构,总参数3090亿,上下文长度为100万令牌。
贝拉克·奥巴马讨论了人工智能中的递归自我改进,强调了AI模型日益自我教学、减少人类在学习中的输入的快速转变。
该论文提出Self-Improvement via Fast Tree-search (SIFT)框架,利用LLM作为裁判高效评估编码代理中的自我修改,以更少的CPU时间和API成本实现更好的基准性能。
Anthropic 透露,其AI模型Claude正协助开发自身的下一个迭代版本,展示了AI驱动的自我增强方面的进展。
Sentient的新EvoSkill v2是一个开源框架,能从失败尝试中进化代理技能,展示了AI教练如何利用奖励破解,并强调了在评估中需要权力分立和强沙盒机制。
FinSkillOps 是一种用于SEC文件问答的多智能体系统,通过引入受控的技能管理实现自我演进,提升了金融问答系统的准确性和减少了错误。
本文介绍了一种名为递归自我改进快速树搜索(SIFT)的样本高效框架。该框架利用轻量级树搜索,由LLM-as-a-judge评估指导,以在预算约束下提升编码代理的性能,其资源成本低于现有方法。
Anthropic在一篇关于衡量AI发展速度的博客文章中报告称,其AI模型Claude目前引领了自身研发工作的26%,较六个月前的近乎零增长。
本文对AI时代的个人壁垒进行排名,将自我洗脑能力置于心理韧性、信用、执行力、判断力、信息筛选能力和信息不对称之上。
ScienceBuddy 引入了一种递归中递归的自我改进范式,用于交互式科学代理,通过研究员合作与反馈实现持续演进。
一位用户反思了被视作 AGI 的 AI 系统 Astra 如何未能解决他们的个人瓶颈,强调进步仍然依赖于个人努力。
该推文强调构建自定义AI智能体工具以优化性能,提到了Pi的应用,并讨论了自我改进算法和本地模型,以实现更好的控制和效率。
本文介绍了负向自蒸馏(NSD),这是一个通过偏离有缺陷的推理而非模仿特权解决方案来提升大语言模型推理能力的框架,在数学基准测试中持续优于现有方法。
Scaffold是一个视觉网络代理的自我改进框架,该框架归纳参数化技能,维护递归层次结构,并将技能蒸馏到模型权重中,在诸如WebArena等基准测试中实现了显著的性能提升。