标签
一篇论文发现,Self-Refine 和 Reflexion 等自我反思循环在 1.5B 到 7B 的开源模型上,以相同的 token 成本并未优于重复采样,所有 18 项自我检查比较均为负面结果。
LA-RL 提出了一种标签感知的自我反思框架,用于信息抽取中的强化学习,在命名实体识别、关系抽取和事件抽取任务上取得了持续改进,在分布外基准上 F1 提升高达 20。
构建无监督链上代币交易自主AI代理的经验教训,强调执行可靠性比模型聪明更重要,自我反思优于更大的上下文窗口,以及硬性护栏至关重要。
对仅依赖系统提示的简单AI代理架构的批评,认为概率性LLM需要自反思层和确定性门控以确保可靠的生产行为。作者介绍了Langoedge作为构建可信代理的解决方案。
一位用户分享了使用Fable的惊人体验,这款AI工具分析了他的全部工作经历并提供了深刻的个人见解,甚至超越了心理治疗的效果。
BaRA是一个框架,用于站点级网络数据采集,结合了有界BFS遍历和基于历史的自反思,在链接发现和可下载提取方面优于现有方法。
这篇文章讨论了已确认的研究发现:基于验证器的测试时计算扩展主导无验证器方法,并以Apodex等实际例子展示了分离验证过程带来的收益。它认为构建独立验证器是未来AI能力提升的关键路径。
解释了自反思ReAct循环在长时任务中失败的原因,并介绍了作为解决方案的AgentOS验证架构。
MetaResearcher 提出了一种框架,用于在对抗性虚拟环境中通过自我反思强化学习训练深度研究智能体,解决了静态环境和仅事实检索任务的局限性。
一个思想实验提出疑问:指示AI模型永远不要产生幻觉会触发其自我反思,还是会导致模型自我欺骗,相信自己没有产生幻觉?
介绍了SAGE,首个端到端的LLM驱动的多智能体框架用于欺诈检测,它使用数据诊断树和具有自然语言梯度的马尔可夫决策过程,在类别不平衡下优化模型。实验表明,在五个数据集上,与基线相比F1有显著提升。
AlphaGRPO 是一个新框架,将组相对策略优化(Group Relative Policy Optimization)应用于统一多模态模型(UMMs),通过自反式精炼和分解可验证奖励来增强生成效果。
这张图片的生成耗时约 11 分钟,期间它多次对自身输出进行审查和迭代。