化学」の検索結果

8
githubGitHubあり2026-09-08

ART — Agent Reinforcement Trainer: train multi-step agents for real-world tasks using GRPO. Give your agents on-the-job training. Reinforcement learning for Qwen3.6, GPT-OSS, Llama, and more!

ARTは、多段強化学習トレーナーです。このトレーナーは、GRPOを使用して、現実世界のタスクに対して、多段強化学習を行うことができます。

自然言語処理大規模言語モデル強化学習
用途
多段強化学習トレーナー
難易度
Easy
コスト
High
githubGitHubあり2026-08-13

OpenRLHF — An Easy-to-use, Scalable and High-performance Agentic RL Framework based on Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)

OpenRLHFは、Ray上に構築された強化学習フレームワークです。このフレームワークは、PPO、DAPO、REINFORCE++など、様々な強化学習アルゴリズムをサポートしています。

深層学習Transformer画像
用途
強化学習フレームワーク
難易度
Easy
コスト
High
arxivPaper only2026-08-11

Contextual Quality-Diversity Evolutionary Reinforcement Learning for HVAC Control in Tropical Commercial Buildings

この研究では、熱帯気候の商業ビルでの冷房システムの制御に適した、コンテキストベースの品質多様性進化的強化学習を提案します。制御システムは、データドライブの稼働状況、日々の気象と負荷のシナリオ、コンテキスト無関係の行動記述

品質予測/異常検知強化学習方策勾配 (PPO / A3C)テキスト
用途
HVACシステムの制御
難易度
Hard
コスト
Medium
arxivPaper only2026-08-11

Optimize Cheap, Deploy Strong: Cost-Aware Cross-Tier Transfer for Evolutionary Optimization

この研究では、LLMへの促進の強化学習を効率化する目的で、検索コストを削減するためのコスト意識のあるクロスタイア転送を提案します。検索コストは、促進の評価に伴うLLMの回答によって大きく異なるためです。このアプローチでは

自然言語処理大規模言語モデル
用途
コスト削減のためのオプティミゼーション
難易度
Hard
コスト
High