标签
本文进行了一项大规模实证研究,针对离线强化学习和模仿学习,分析了超过16万次训练运行,以理解超参数和数据集属性的影响,并介绍了JumpStart,这是一个用于可靠策略学习研究的资源套件。
Shantanu Goel 分享了一个优化 Qwen 3.8 Flash Next 在单个 DGX Spark 上的配置方案,已针对实际任务进行测试,并计划进一步进行基准测试。
本文为数据驱动算法设计中的多维超参数调优建立了紧确的泛化界,利用实代数几何和多区间下界框架解决理论缺口。
Meta最新论文显示,小型模型能够准确预测缩放规律,但需要更全面的超参数调优。研究发现,缩放规律在参数量约400万时开始显现,通过恰当调优其特征会变得更加清晰。
作者认为,对于样本量低于1万的数据集,QLoRA微调中常用的2e-4学习率过高,会导致过拟合和评估效果不佳,并建议使用更低的学习率,如1e-4。
本文确定了两种结构机制,导致多任务高斯过程在贝叶斯优化迁移学习中错误估计跨任务相关性,即使对于仿射相关的任务也是如此。作者提出了三种保守的补救措施来缓解这些问题。
本文讨论了使基于LLM的代理更具确定性的各种技术,例如黄金数据集、护栏、共识机制、回归测试、编码逻辑和超参数调优,并询问其他成功的方法。
本文提出使用LangGraph中的有状态ReAct智能体取代无状态自动研究模式,将每次迭代的令牌成本从O(n)降低至O(1),在超参数调优和代码优化基准测试中实现了52-90%的令牌减少。
一种利用贝叶斯概率上下文无关文法生成结构上类似物理方程的合成回归数据集的方法,该方法已在费曼语料库上得到验证,并证明对超参数调优有效。
一位用户发现,将学习率从2e-4降低到1e-4显著改善了Llama 3.1 8B在小型数据集(8k样本)上的QLoRA微调效果,防止了过拟合,并获得了更好的评估结果。
本文介绍了 AutoLLMResearch,这是一个智能体框架,旨在通过在低保真环境中学习并外推至高成本设置,实现昂贵的大型语言模型(LLM)实验配置的自动化。其目标是减少可扩展 LLM 研究中的计算浪费以及对专家直觉的依赖。