rl-pipeline

标签

Cards List
#rl-pipeline

Show HN:我通过强化学习训练了一个智能体,它再用强化学习训练模型(花费 –$1.3k)

Hacker News Top ↗ · 2026-07-14 缓存

一位开发者构建了一个管道,其中经过强化学习训练的AI智能体创建并提交针对小模型的强化学习训练任务,并根据智能体的表现给予奖励。该项目完全开源,并展示了向保留任务的迁移能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈