标签
论文认为,检测到所获取的LLM派生信号的平均效果并不等同于学习逐实例的采集策略,并确立了一个奖励-信噪比下限(ρ* ≈ 2.8/√N),低于该下限时离线路由不可行。论文引入了结构化假设嵌入(SHE),并在三个数据集上表明,学习到的逐示例采集在此下限之下崩溃,因此建议改用设计时的机制门控。