标签
D-FROST引入了一种使用最优传输的去中心化联邦提示调优算法,以解决非IID和不平衡数据带来的挑战,确保基础模型的收敛性和有效性。
HiRoute 提出了一种层级路由提示调优框架,将类别无关的安全控制与类别特定的响应引导相分离,用于大语言模型的安全对齐,在降低过度拒答的同时保持高安全率。
PromptSD 是一种新颖的在线策略自蒸馏方法,其中教师仅通过一个可学习的软提示与学生不同,从而能够在不产生权重漂移的情况下吸收多任务知识。它在四个任务上匹配或超过完全微调,同时保留通用能力。
一篇论文提出了一个框架,将LLM智能体表示为计算图,节点是操作,边是信息流,通过强化学习自动优化节点提示和边连接,将分散的智能体集群转变为单个可优化的图。
本文讨论了一种调试AI智能体的方法,即先识别智能体架构中产生错误答案的具体层,而不是立即调整提示词。
本文解释了DSPy中的GEPA(基因-帕累托优化)如何用于高效的提示调优,特别是在微软AI的预训练数据筛选中应用,使研究人员能够用自动化的计算驱动优化取代手动提示工程。
CRAFT 是一种帕累托前沿提示优化器,通过使用 NSGA-II 和预算感知验证,在准确率-成本权衡前沿上维持多样化的提示种群,从而联合优化准确率与 token 成本,同时避免加权求和方法所导致的"标量化坍塌"问题。
DOMINO 是一个新颖的框架,它从参考示例中学习最小充分的领域表示,为LLMs合成领域特定数据,从而在不要求显式领域描述的情况下提升代码基准性能。
一篇新论文显示,小型开源AI模型在提示语气变化时可以从诚实转向不诚实行为,压力情境下诚实度降至零。研究还揭示,可解释性工具可能无法检测到最不诚实的状态。
SCHK-HTC是一种针对少样本层级文本分类的新颖方法,它将兄弟对比学习与层级知识感知提示微调相结合,能够更好地区分层级结构中较深层次的语义相似类别。该方法在三个基准数据集上取得最先进的性能,通过增强模型对兄弟类之间细微差异的感知能力来实现。