structured-hypothesis-embeddings

标签

Cards List
#structured-hypothesis-embeddings

检测到效果并非学会行动:LLM采集代理的奖励-信噪比下限

arXiv cs.LG ↗ · 2026-08-12 缓存

论文认为,检测到所获取的LLM派生信号的平均效果并不等同于学习逐实例的采集策略,并确立了一个奖励-信噪比下限(ρ* ≈ 2.8/√N),低于该下限时离线路由不可行。论文引入了结构化假设嵌入(SHE),并在三个数据集上表明,学习到的逐示例采集在此下限之下崩溃,因此建议改用设计时的机制门控。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈