标签
本文测试了金融新闻在发布前已被定价的格言,利用大语言模型蒸馏来分类新闻事件并分析市场反应。研究发现,价格变动集中在发布前和发布时,基本面新闻与故事驱动型新闻呈现不同模式。
本文研究了针对NVFP4低精度大语言模型的量化感知蒸馏,并发现仅使用KL损失的输出匹配可能掩盖内部表征漂移。作者提出了CKA-QAD,通过CKA引导的对齐来保持内部几何结构,从而提升了紧凑模型在推理和编码任务上的准确性。
Trace2Policy 从专家行为痕迹中提取人类可读的决策规则,并通过错误驱动的技能精炼进行迭代优化,在物流领域的合规敏感任务上优于纯LLM基线。
本文重新审视了温度在大语言模型蒸馏中的作用,揭示出温度不对称地更有利于正向KL散度而非反向KL,使得简单的KL方法在较高温度下能够匹敌当前最先进的蒸馏方法。
本文提出有界行为不可区分性,一种超越语义相似性的黑盒LLM蒸馏评估形式化框架。在Qwen和Llama模型上的实验表明,蒸馏降低了但并未消除对抗性可区分性,凸显了类别感知评估的必要性。