DeepSeek-R1で使われた強化学習アルゴリズムGRPOの解説です。
引用をストックしました
引用するにはまずログインしてください
引用をストックできませんでした。再度お試しください
限定公開記事のため引用できません。