130 articles

Category

強化学習

PPO、モデルベースRL、RLHFなど、制御・最適化・エージェント設計に関係する技術を扱います。

モデルフリー (DQN / SAC)方策勾配 (PPO / A3C)モデルベースRLHFマルチエージェント

人気記事

新着記事

未読 130
githubGitHubあり2026-07-24

paperless-ngx — A community-supported supercharged document management system: scan, index and archive all your documents

paperless-ngxは、コミュニティによってサポートされたスーパーチャージドのドキュメント管理システムで、ドキュメントのスキャン・インデックス・アーカイブが可能である。

強化学習方策勾配 (PPO / A3C)分類テキスト
用途
ドキュメント管理
難易度
Easy
コスト
Low
githubGitHubあり2026-07-23

qlib — Qlib is an AI-oriented Quant investment platform that aims to use AI tech to empower Quant Research, from exploring ideas to implementing productions. Qlib supports diverse ML modeling paradigms, including supervised learning, market dynamics modeling, and RL, and is now equipped with https://github.com/microsoft/RD-Agent to automate R&D process.

クエンティング投資プラットフォームを実現するためにAI技術を活用します。

強化学習方策勾配 (PPO / A3C)教師あり
用途
クエンティング投資プラットフォーム
難易度
Easy
コスト
Medium
arxivPaper only2026-07-22

Dreamer-CPC: Message Learning with World Models for Decentralized Multi-agent Reinforcement Learning

分散されたシステムにおける分散多エージェント強化学習を実現するための方法を提案している。この方法は、個々のエージェントがローカルな観測に基づいてメッセージを交換し、長期の経験を考慮したメッセージを学習することで、分散され

強化学習方策勾配 (PPO / A3C)埋め込み
用途
分散されたマルチエージェント強化学習
難易度
Hard
コスト
Low
arxivPaper only2026-07-22

Digital Twin Modeling of a Highly Automated Agricultural Tractor

このプロジェクトでは、農林業用自動化トラクターのデジタルツインモデリングが行われた。デジタルツインはCAN通信を使用することでトラクターの動きを模倣し、実際のトラクターの動作をシミュレートする。

強化学習画像
用途
農林業用自動化トラクターのデジタルツインモデリング
難易度
Hard
コスト
Medium
arxivPaper only2026-07-21

Boundary-Adapted PINNs for Elliptic Dirichlet Problems: $H^2(Ω)$ A Priori Error Bounds with Application to Mean Escape Time Computation

この研究では、Oceanモデルを使用して、オーシャンで不完全な観測を使用する可能性と、生成的ステートスペースモデルと最適化フレームワークを使用して直接不完全な観測から学習する能力を評価します。

強化学習方策勾配 (PPO / A3C)テキスト
用途
Oceanモデルにおける不完全な観測の使用
難易度
Hard
コスト
Medium
arxivPaper only2026-07-20

ConceptTree: Bringing Semantic Transparency to Black-Box Decision Making for Robotic Manipulation

この論文では、ConceptTreeというフレームワークを提案しています。このフレームワークは、人の見える概念を使用して、マニピュレーションの高位のスキル選択を表現し、透明性を高めます。

説明可能品質予測/異常検知強化学習方策勾配 (PPO / A3C)画像
用途
マニピュレーションの高位のスキル選択のための透明性の実現
難易度
Hard
コスト
High
arxivPaper only2026-07-15

Operator-Informed Gaussian Processes for Complex Helmholtz Wavefields: From Synthetic Benchmarks to In Vivo Brain Elastography

Helmholtz方程式は、時間共伴振波の伝播を記述する重要な方程式であり、媒質が損失した場合複素係数を持ちます。ここでは、空間での波場から波方程式を推測するために、物理知識に基づくGaussian Process(GP

少数データ向き強化学習マルチエージェント回帰テキスト
用途
复雑なHelmholtz波場のための物理知識に基づくGaussian Process
難易度
Hard
コスト
Medium
arxivPaper only2026-07-15

The Dynamic Verifiable Multi-Agent Human Agentic Loyalty Loop (DVM-HALL) Model and the Net Human-Agent Score (NHAS) in Autonomous Commerce

自動販売店で客と交わるAIロボットの信頼性を確立する必要がある。このモデルは、客とロボットの信頼関係を構築し、客の買い物をサポートすることを目的としている。

強化学習RLHF
用途
自動販売店で客と交わるAIロボットの信頼性の確立
難易度
Hard
コスト
Medium
githubGitHubあり2026-07-15

vowpal_wabbit — Vowpal Wabbit is a machine learning system which pushes the frontier of machine learning with techniques such as online, hashing, allreduce, reductions, learning2search, active, and interactive learning.

Vowpal Wabbitは、機械学習を進歩させるためのオンライン学習、ハッシュ、reduceなどの強力なアルゴリズムを含むシステムです。その結果、さまざまな問題に応じて、高品質な解決策を提供できます。

強化学習テキスト
用途
強い機械学習アルゴリズムを実行し複雑な問題を解決するためのシステム
難易度
Easy
コスト
Medium
arxivPaper only2026-07-14

Cycles in Liquid Democracy: A Game-Theoretic Justification

代表権という概念は、政治や経済のシステムで重要である。デリゲーション、または代表権の授与、はさまざまなシステムに現れる。デリゲーションを安全かつ効率的かつ有効に運用するために、意思決定者はデリゲーションを設計する際に考慮

品質予測/異常検知強化学習
用途
代表権の確保
難易度
Hard
コスト
Medium
arxivPaper only2026-06-30

A Large-Scale Empirical Evaluation of MMAO Under Fair-Budget Continuous and Discrete Benchmarks

この研究では、多様なベンチマークを用いて、Metabolic Multi-Agent Optimizer (MMAO)の適切性を評価します。MMAOは、複数エージェント間でリソースを分配するための閉ループのシステムです。

強化学習モデルフリー (DQN / SAC)
用途
適切な方法を用いてリソース分配を最適化する
難易度
Hard
コスト
Medium
arxivPaper only2026-06-30

A Contextual-Bandit Oversight Game with Two-Sided Informational Asymmetry

AIを援助するための意思決定者によるオーバーサイトの研究。AIが提案した行動の評価と決定を行うために、意思決定者とAIが情報を交流するオーバーサイトの実現を研究する。

品質予測/異常検知強化学習マルチエージェントテキスト
用途
AIを援助するための意思決定者によるオーバーサイトの研究
難易度
Hard
コスト
Medium
arxivPaper only2026-06-26

GTI-mSEMP Framework : A Proposed Framework to Simulate Malware Propagation with Inclusion of Attacker-Defender Strategy

マルウェアの感染は、ネットワーク全体に広がる可能性があります。既存のモデルの場合、脅威に対する防御戦略は静的なパラメータとして扱われますが、実際には攻撃方策と防御方策の間の競合関係に依存します。このため、ゲーム理論を用い

センサ/時系列強化学習
用途
マルウェアの感染をシミュレーションし、防御戦略を提案する
難易度
Hard
コスト
Medium