标签
VeriLoop E2 的发布,这是一个基于 Qwen3.8-27B 进行后训练的 27B LLM,采用了 VeriLoop-Governed Recurrence (VGR) 来管理状态转换并生成训练信号。
BenchEvolver 是一个进化框架,能够自动从现有编程问题中生成更难的题目,创建保持有效性和多样性的挑战性基准,同时支持模型自我改进和提升训练性能。
OpenAI 提出了迭代放大方法,用于训练 AI 系统处理复杂任务,通过递归地将任务分解为人类可以判断和解决的更小子任务,从零开始通过迭代组合构建训练信号。