用强化学习练出来的、再去训练模型的智能体。
Danau5tin/ai-trains-ai ↗, Python, MIT, 最近提交 2026年7月14日
一个用强化学习训练出来的代理,任务是用强化学习去训练别的模型。最耗研究者和开发者精力的那圈训练循环被整个交了出去:代理自己跑,看性能反馈,再据此调整训练策略。它给出的不是一件训练模型的工具,而是把“训练”这个角色本身学下来的结果。