标签
本文探讨了使AI代理在无监督情况下完成任务时所需的验证措施和证据,包括来源引用、行动预览、操作限制、步骤记录以及错误检测的实例。
该推文批评无人监管的AI代理容易出错,并提出解决方案如确定性监督和受控内存系统以提高可靠性。
介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。
一个真实案例揭示了AI代理“自主”(未经批准采取行动)与“无监督”(无人监管)之间的关键区别,当代理大规模自信地做错事时,会导致合规风险和客户损害。
本文介绍了Mining via Activation Geometry (MAG),这是一个无监督框架,通过自然语言指令从LLM激活中提取推理特征,从而实现激活引导和分类器探针的有效训练数据选择。
该推文强调了一项研究发现:无需视频训练或物理监督,即可从冻结图像编码器的几何结构中提取物理合理性的信号。
本文将对基于最优传输的幻觉检测扩展到NMT和抽象式摘要中的所有解码器层,发现检测主要集中在早期层,并且由于忠实性失败无法通过注意力集中检测到,几何信号在摘要任务中迁移效果不佳。
本文提出全局-局部不确定性(GLU),一种无监督单次评分方法,融合词元级局部熵与隐藏状态几何全局熵,用于LLM不确定性量化,证明两者近乎正交,共同捕捉自信但错误的失效模式。
本文提出无监督过程奖励模型(uPRM),通过利用LLM的下一个令牌概率识别错误推理步骤,从而消除人工标注需求,在准确率上相比LLM-as-a-Judge提升高达15%,并且作为验证器和奖励信号时表现与有监督PRM相当。
介绍了 LoVer,一种使用逻辑规则(否定一致性、组内一致性和组间一致性)来在无标签数据下提升大语言模型推理能力的无监督验证器,在推理基准测试中达到了接近监督验证器的性能。
一位开发者构建了一个无监督多智能体流水线,让 Claude 和 GPT-4 自主筹备并托管一档播客:自动选题、策划单集内容,并在 10 轮对话后输出文本转语音。