@DeRonin_: 你理解Adaline刚刚发布了什么吗???智能体观察真实用户出了什么问题..对失败进行分组…
摘要
Adaline 2.0 是一个智能体自我改进层,它观察真实用户交互,按模式对失败进行聚类,每天自动编写数百个测试,并在部署前生成新的智能体候选版本供审批。
查看缓存全文
缓存时间: 2026/06/13 18:20
你知道Adaline刚刚发布了什么吗???这个智能体会观察真实用户哪里出问题… 按模式对失败进行分组… 然后每天自动编写数百个测试来捕获它们 [真正没人谈论的问题]:你的智能体每天处理数千次真实对话,这个月你大概只读了12条。每一个错误、每一个奇怪的回答、每一次逐渐变差的过程… 全都堆在没人打开的角落里。人人都想要更聪明的模型。没人有时间真正去看看智能体们在做什么。 [实际工作原理]: > 读取每一条消息、工具调用、技能、钩子、插件 > 将痕迹聚类为实际的智能体行为 > 生成团队根本想不到要测试的合成对抗案例 > 每天从你的真实生产流量中生成数百个全新评估 > 构建候选智能体并发送给你审批 评估曾是每个人都绕开的层级。 [我没想到的是]:没有东西会自行上线——智能体会构建自己的新版本…而你逐一审批后才让用户看到。它会自动变得更好,但你始终握有控制权。 [真正触动我的是]:“模型不再是瓶颈了。你才是。” 这说的就是我——我已经8个月没看过自己智能体的数据了。这是第一个终于解决了这个问题的东西。
Arsh Shah Dilbagi (@arshdilbagi): 隆重推出 Adaline 2.0 —— 智能体自我改进层
Adaline 将痕迹转化为行为, 行为暴露问题, 问题变成自动生成的评估+数据, Adaline 再生成新的候选智能体并测试它们。
你审查胜出的候选,然后发布!
相似文章
@dair_ai:来自Microsoft的关于提示优化的重磅论文。(收藏它)声称一个读取你日志的编码代理能胜过…
Microsoft 推出了 Coding-Agent Skill Distillation(CASD),这是一种提示优化方法,其中现成的编码代理分析代理日志以一次性写出优化的提示,性能优于之前的如 GEPA 和 SkillOpt 的技术,且成本更低。
在八个AI代理平台上运行一次构建。两个完成。如何捕捉那些报告成功的失败?
一位操作专业人员用相同任务测试了八个AI代理平台,发现只有两个成功完成,并强调了代理在失败时报告成功的问题,建议验证输出目标是关键。
你是否限制AI编码代理生成的PR大小以确保审查质量?
文章探讨了通过限制AI编码代理生成的PR大小来保持审查质量,寻求关于有效阈值和权衡的意见。
我们让编码智能体使用至少100个智能体来更新自身文档,它其实不需要100个。框架依然运作良好。
通过调用至少100个AI智能体更新自身文档,我们对一个开源编码智能体框架进行了压力测试,展示了其高效的并行任务处理能力,并发现了文档中的真实问题。
AI代理即将处理巨额资金,但责任问题无人解决
探讨AI代理在金融业务中的责任问题,强调记录操作与证明授权之间的差距,以及需要超越日志文件的更优解决方案。