githubGitHubあり2026-09-09
PufferLib — Puffing up reinforcement learning
P
強化学習
- 用途
- 強化学習用ライブラリ
- 難易度
- Easy
- コスト
- Medium
→
「化学」の検索結果
8 件P
ARTは、多段強化学習トレーナーです。このトレーナーは、GRPOを使用して、現実世界のタスクに対して、多段強化学習を行うことができます。
このリポジトリでは、LLMベースのエージェントアプリケーションのための強化学習の橋渡しを提供しています。
ゲームの一般的な強化学習用エンドポインティであるEnvironmentおよびアルゴリズムの集合。
OpenRLHFは、Ray上に構築された強化学習フレームワークです。このフレームワークは、PPO、DAPO、REINFORCE++など、様々な強化学習アルゴリズムをサポートしています。
この研究では、熱帯気候の商業ビルでの冷房システムの制御に適した、コンテキストベースの品質多様性進化的強化学習を提案します。制御システムは、データドライブの稼働状況、日々の気象と負荷のシナリオ、コンテキスト無関係の行動記述
この研究では、LLMへの促進の強化学習を効率化する目的で、検索コストを削減するためのコスト意識のあるクロスタイア転送を提案します。検索コストは、促進の評価に伴うLLMの回答によって大きく異なるためです。このアプローチでは
ディナミカルシステムを化学的なパラフレーズで説明する手法を提案し、システムの