用強化學習練出來的代理,工作是訓練別的模型。
Danau5tin/ai-trains-ai ↗, Python, MIT, 最近提交 2026年7月14日
一個用強化學習訓練出來的代理,它的工作是用強化學習去訓練別的模型。最耗研究者心力的那圈訓練迴圈整個交了出去:代理自己跑,讀效能回饋,再據此調整訓練策略。它給出的不是一件訓練模型的工具,而是把「訓練」這個角色本身學下來的結果。