self-reflection

标签

Cards List
#self-reflection

@omarsar0:终于有一篇好论文检验自我反思循环是否值得。设置:七种方法,1.5B、3B 的开源模型 ……

X AI KOLs Timeline · 6天前 缓存

一篇论文发现,Self-Refine 和 Reflexion 等自我反思循环在 1.5B 到 7B 的开源模型上,以相同的 token 成本并未优于重复采样,所有 18 项自我检查比较均为负面结果。

0 人收藏 0 人点赞
#self-reflection

LA-RL:面向信息抽取强化学习的标签感知自我反思

arXiv cs.CL · 2026-07-28 缓存

LA-RL 提出了一种标签感知的自我反思框架,用于信息抽取中的强化学习,在命名实体识别、关系抽取和事件抽取任务上取得了持续改进,在分布外基准上 F1 提升高达 20。

0 人收藏 0 人点赞
#self-reflection

从无监督24/7链上真实资金交易AI代理中汲取的教训

Reddit r/ArtificialInteligence · 2026-07-21

构建无监督链上代币交易自主AI代理的经验教训,强调执行可靠性比模型聪明更重要,自我反思优于更大的上下文窗口,以及硬性护栏至关重要。

0 人收藏 0 人点赞
#self-reflection

我们需要停止构建"Hope-and-Pray"式的AI代理。(为什么你的封装会崩溃。)

Reddit r/AI_Agents · 2026-07-11

对仅依赖系统提示的简单AI代理架构的批评,认为概率性LLM需要自反思层和确定性门控以确保可靠的生产行为。作者介绍了Langoedge作为构建可信代理的解决方案。

0 人收藏 0 人点赞
#self-reflection

@EXM7777: 等等……我还是不确定该怎么看待这件事 Fable刚刚浏览了我所有的工作成果,并告诉了我我是谁……

X AI KOLs Following · 2026-07-07 缓存

一位用户分享了使用Fable的惊人体验,这款AI工具分析了他的全部工作经历并提供了深刻的个人见解,甚至超越了心理治疗的效果。

0 人收藏 0 人点赞
#self-reflection

BaRA: BFS与反思网络数据采集代理

arXiv cs.AI · 2026-07-02 缓存

BaRA是一个框架,用于站点级网络数据采集,结合了有界BFS遍历和基于历史的自反思,在链接发现和可下载提取方面优于现有方法。

0 人收藏 0 人点赞
#self-reflection

基于验证器与无验证器的测试时扩展结果比人们认为的更早,并且它不断得到确认 [D]

Reddit r/MachineLearning · 2026-06-24

这篇文章讨论了已确认的研究发现:基于验证器的测试时计算扩展主导无验证器方法,并以Apodex等实际例子展示了分离验证过程带来的收益。它认为构建独立验证器是未来AI能力提升的关键路径。

0 人收藏 0 人点赞
#self-reflection

为什么自反思ReAct循环在长时任务中失败,以及我们为此构建的AgentOS验证架构

Reddit r/artificial · 2026-06-21

解释了自反思ReAct循环在长时任务中失败的原因,并介绍了作为解决方案的AgentOS验证架构。

0 人收藏 0 人点赞
#self-reflection

MetaResearcher:在对抗性虚拟环境中通过自我反思强化学习扩展深度研究

arXiv cs.AI · 2026-06-20 缓存

MetaResearcher 提出了一种框架,用于在对抗性虚拟环境中通过自我反思强化学习训练深度研究智能体,解决了静态环境和仅事实检索任务的局限性。

0 人收藏 0 人点赞
#self-reflection

如果你指示你的常用AI模型:‘绝对不要产生幻觉!!!’会发生什么

Reddit r/singularity · 2026-06-09

一个思想实验提出疑问:指示AI模型永远不要产生幻觉会触发其自我反思,还是会导致模型自我欺骗,相信自己没有产生幻觉?

0 人收藏 0 人点赞
#self-reflection

SAGE:一种由LLM驱动的自我反思智能体框架用于欺诈检测

arXiv cs.AI · 2026-06-09 缓存

介绍了SAGE,首个端到端的LLM驱动的多智能体框架用于欺诈检测,它使用数据诊断树和具有自然语言梯度的马尔可夫决策过程,在类别不平衡下优化模型。实验表明,在五个数据集上,与基线相比F1有显著提升。

0 人收藏 0 人点赞
#self-reflection

AlphaGRPO:通过分解可验证奖励释放统一多模态模型中的自反式生成能力

Hugging Face Daily Papers · 2026-05-12 缓存

AlphaGRPO 是一个新框架,将组相对策略优化(Group Relative Policy Optimization)应用于统一多模态模型(UMMs),通过自反式精炼和分解可验证奖励来增强生成效果。

0 人收藏 0 人点赞
#self-reflection

GPT-Image-2 现在会自行审查输出,并不断迭代,直到对输出结果的正确性满意为止。

Reddit r/singularity · 2026-04-21

这张图片的生成耗时约 11 分钟,期间它多次对自身输出进行审查和迭代。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈