zeroth-order-optimization

标签

Cards List
#zeroth-order-optimization

SkillOpt-Lite: 通过一行指令实现更好更快的智能体自我进化

Hugging Face Daily Papers · 2026-07-03 缓存

SkillOpt-Lite 提出了一种用于自主智能体技能优化的最小可行流水线,通过将所有组件视为可编辑代码并集成到生产编码智能体中,实现更好更快的自我进化。它通过零阶优化形式化技能优化,并在基准测试上优于先前方法。

0 人收藏 0 人点赞
#zeroth-order-optimization

GRZO:面向大语言模型微调的群组相对零阶优化

arXiv cs.LG · 2026-06-03 缓存

GRZO是一种新颖的零阶优化方法,用于微调大语言模型,通过群组相对归一化降低方差,与MeZO相比实现了更高的准确性和内存效率。

0 人收藏 0 人点赞
#zeroth-order-optimization

对齐但脆弱:通过零阶优化增强LLM安全鲁棒性

arXiv cs.AI · 2026-05-29 缓存

本文提出了一个混合框架,结合一阶安全对齐与零阶微调,以增强LLM安全对齐在受到对齐后扰动时的鲁棒性。理论和实验结果表明,仅需少量微调步骤即可在保持安全性的同时提升鲁棒性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈