@0xSero: 我想出了一种修复REAP知识丢失的方法!omp + advisor有助于将lobotomy从GLM中引导出来
摘要
描述了一种使用OMP和advisor解决REAP模型知识丢失的方法,将'lobotomy'从GLM中引导出来。
我想出了一种修复REAP知识丢失的方法!
omp + advisor有助于将lobotomy从GLM中引导出来 https://t.co/URzhQ2oDCd
查看缓存全文
缓存时间: 2026/07/04 12:48
我想出了一种解决 REAP 知识丢失的方法!
omp + advisor 有助于将“脑叶切断术”从 glm 中引导出来 https://t.co/URzhQ2oDCd
相似文章
COOPA:一种面向运筹学问题的模块化LLM智能体架构
本文介绍了COOPA,一种面向运筹学问题的模块化LLM智能体架构,它结合了基于迭代置信度的建模、元素级溯源和多求解器路由。在八个LLM主干网络和四个基线的评估中,COOPA在六个主干网络上取得了最佳的宏平均准确率,并在最强基线的基础上提升了最多6.7个百分点。
面向专业模型自适应开发的开放式场景推理
提出ROAM框架,利用大型语言模型的世界知识与推理能力,在不重新训练的情况下将冻结的专业模型适配到未见场景,平均绝对误差(MAE)降低超过20%,且额外开销极低。
ExpGraph:面向LLM智能体的模型无关经验学习与图结构记忆
ExpGraph是一个模型无关的框架,通过自进化的技能与失败经验图,使LLM智能体能够复用过往经验,在不重新训练执行器的情况下将任务性能提升12%-21%。
@VukRosic99: GRPO后训练使LLMs准确但冗长:在20道MATH-500问题上,一个蒸馏的1.5B模型和一位博士志愿者……
一种名为IAPO(Information-Aware Policy Optimization)的新后训练方法,根据每个token与最终答案的条件互信息为其分配优势,实现了推理长度缩短高达47%,同时提高了数学基准的准确性。
Mental-R1:对齐LLM推理用于心理健康评估
提出认知相对策略优化(CRPO),一种用于对齐大语言模型在心理健康评估中推理的强化学习框架,在加权F1分数上比现有基线平均提高10.4个百分点。