強化学習で訓練したエージェントが、モデルを強化学習で訓練する。
Danau5tin/ai-trains-ai ↗, Python, MIT, 最終コミット 2026年7月14日
強化学習で訓練されたエージェントが、今度は別のモデルを強化学習で訓練します。研究者や開発者の手数を最も食う訓練ループを丸ごと引き受け、性能のフィードバックを見ながら訓練戦略を自分で調整していきます。差し出されているのはモデルを訓練する道具ではなく、訓練するという役割そのものを学習させた成果です。