githubGitHubあり2026-07-24
stable-baselines3 — PyTorch version of Stable Baselines, reliable implementations of reinforcement learning algorithms.
このリポジトリでは、LLMベースのエージェントアプリケーションのための強化学習の橋渡しを提供しています。
強化学習
- 用途
- 強化学習を簡素化させる橋渡し
- 難易度
- Easy
- コスト
- High
→
「化学」の検索結果
5 件このリポジトリでは、LLMベースのエージェントアプリケーションのための強化学習の橋渡しを提供しています。
ARTは、多段強化学習トレーナーです。このトレーナーは、GRPOを使用して、現実世界のタスクに対して、多段強化学習を行うことができます。
P
ゲームの一般的な強化学習用エンドポインティであるEnvironmentおよびアルゴリズムの集合。
OpenRLHFは、Ray上に構築された強化学習フレームワークです。このフレームワークは、PPO、DAPO、REINFORCE++など、様々な強化学習アルゴリズムをサポートしています。