reinforcement」の検索結果

234
githubGitHubあり2026-07-24

paperless-ngx — A community-supported supercharged document management system: scan, index and archive all your documents

paperless-ngxは、コミュニティによってサポートされたスーパーチャージドのドキュメント管理システムで、ドキュメントのスキャン・インデックス・アーカイブが可能である。

強化学習方策勾配 (PPO / A3C)分類テキスト
用途
ドキュメント管理
難易度
Easy
コスト
Low
githubGitHubあり2026-07-24

ART — Agent Reinforcement Trainer: train multi-step agents for real-world tasks using GRPO. Give your agents on-the-job training. Reinforcement learning for Qwen3.6, GPT-OSS, Llama, and more!

ARTは、多段強化学習トレーナーです。このトレーナーは、GRPOを使用して、現実世界のタスクに対して、多段強化学習を行うことができます。

自然言語処理大規模言語モデル強化学習
用途
多段強化学習トレーナー
難易度
Easy
コスト
High
arxivPaper only2026-07-23

MIRROR: Learning from the Other View for Multi-Modal Reasoning

多モーダル理解技術のための新しいアプローチであるMIRROR(Learning from the Other View)を提案しました。MIRRORは、テキスト、図、テキストと図の組み合わせから同等の視点を提供することで

品質予測/異常検知自然言語処理大規模言語モデル画像テキストマルチモーダル
用途
多モーダル理解技術の開発
難易度
Hard
コスト
High
arxivPaper only2026-07-23

The Weight of Silence: A Causal Case for Weights Over the Scratchpad in Latent Chess Reasoning

ラテン言語モデルを使用すると、言語モデルの内部の計算結果を分析できる。計算結果は、連続ベクトル空間として実行される中間計算であり、これを分析すると、モデルがどのように結果を得ているかを明らかにできる。

MI向き自然言語処理ファインチューニングテキスト強化学習
用途
ラテン言語モデルの中間計算を分析する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

FORGE-plus: Force-Budgeted Recovery for Contact-Rich Assembly with a Frozen LLM Supervisor

強制制約に基づく強化学習を利用し、低コストで高精度の組み立てが可能になると同時に、組み立てに失敗してもロボットが安全に回避できるように、ロボットの制御のための強化学習を提案します。

自然言語処理大規模言語モデルテキスト強化学習
用途
非対称ロボット組み立て
難易度
Hard
コスト
High
githubGitHubあり2026-07-23

qlib — Qlib is an AI-oriented Quant investment platform that aims to use AI tech to empower Quant Research, from exploring ideas to implementing productions. Qlib supports diverse ML modeling paradigms, including supervised learning, market dynamics modeling, and RL, and is now equipped with https://github.com/microsoft/RD-Agent to automate R&D process.

クエンティング投資プラットフォームを実現するためにAI技術を活用します。

強化学習方策勾配 (PPO / A3C)教師あり
用途
クエンティング投資プラットフォーム
難易度
Easy
コスト
Medium
githubGitHubあり2026-07-23

ml-agents — The Unity Machine Learning Agents Toolkit (ML-Agents) is an open-source project that enables games and simulations to serve as environments for training intelligent agents using deep reinforcement learning and imitation learning.

Unityを使用してマシンラーニングエージェントを訓練して訓練できるツールです。

コンピュータビジョン3D・点群3D強化学習
用途
Unityでマシンラーニングエージェント
難易度
Easy
コスト
High
arxivPaper only2026-07-22

Dreamer-CPC: Message Learning with World Models for Decentralized Multi-agent Reinforcement Learning

分散されたシステムにおける分散多エージェント強化学習を実現するための方法を提案している。この方法は、個々のエージェントがローカルな観測に基づいてメッセージを交換し、長期の経験を考慮したメッセージを学習することで、分散され

強化学習方策勾配 (PPO / A3C)埋め込み
用途
分散されたマルチエージェント強化学習
難易度
Hard
コスト
Low
arxivPaper only2026-07-22

SLPO: Scaling Latent Reasoning via a Surrogate Policy

この研究では、ラベラーの品質が悪い場合の対策として、ラベラーの評価を自動化します。特に、ラベラーの評価はオブジェクト検出のタスクでは困難です。したがって、ラベラーの評価を自動化するために、画像認識のデータを分析してラベラ

説明可能自然言語処理プロンプトエンジニアリング強化学習
用途
ラベル付けの品質を確保し、品質管理が必要な画像認識
難易度
Hard
コスト
Medium
arxivPaper only2026-07-22

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

ビデオキャプション生成には、空間と時刻の理解が重要です。PercepCapアルゴリズムは、ビデオ入力を空間時刻認識に分解することで、生成されたキャプションの理解度が向上するとともに、空間時刻の誤差をより正確に検出でき、キ

品質予測/異常検知自然言語処理大規模言語モデル生成動画強化学習
用途
ビデオキャプション生成のための構造化された空間時刻の理解
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

自動運転システムには、道路のトポロジー(ドライバブルレーンとその接続性)を理解する機能が必要です。最近の検出モデルは360度の前方視野からボリュームイメージを取得することで、道路上のレーンのトポロジーを推測することができ

自然言語処理RAG画像テキストマルチモーダル
用途
道路のトポロジー認識を改善
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Digital Twin Modeling of a Highly Automated Agricultural Tractor

このプロジェクトでは、農林業用自動化トラクターのデジタルツインモデリングが行われた。デジタルツインはCAN通信を使用することでトラクターの動きを模倣し、実際のトラクターの動作をシミュレートする。

強化学習画像
用途
農林業用自動化トラクターのデジタルツインモデリング
難易度
Hard
コスト
Medium
arxivPaper only2026-07-21

Boundary-Adapted PINNs for Elliptic Dirichlet Problems: $H^2(Ω)$ A Priori Error Bounds with Application to Mean Escape Time Computation

この研究では、Oceanモデルを使用して、オーシャンで不完全な観測を使用する可能性と、生成的ステートスペースモデルと最適化フレームワークを使用して直接不完全な観測から学習する能力を評価します。

強化学習方策勾配 (PPO / A3C)テキスト
用途
Oceanモデルにおける不完全な観測の使用
難易度
Hard
コスト
Medium
arxivPaper only2026-07-21

The Price of Reasoning: Cost-Quality Tradeoffs in Reinforcement Learning for Neural Machine Translation

この研究では、学生チームのテーブル演習(TTX)における評価方法を提案し、複雑でオープンエンドな状況にあるチームの行動とコミュニケーションを記録できるTTX学習プラットフォームを使用します。

品質予測/異常検知自然言語処理大規模言語モデル翻訳テキスト強化学習
用途
計算機教育のチーム問題解決能力評価
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

Reasoning Before Translation: Enhancing Legal Machine Translation with Structured Reasoning

この研究では、平衡方程式を満たすPINNs(物理基準付きニューラルネットワーク)を使用して、平均脱出時間の計算を目的とした椭球型境界条件付きPINNsを提案し、PINNsを使用した計算と実験室データを比較します。

品質予測/異常検知自然言語処理ファインチューニング翻訳テキスト強化学習
用途
平均脱出時間計算を目的とした椭円型境界条件付きPINNs
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning

離散RLは、長所と短所を含む複雑なランク付けゴールの最適化に効果があります。しかし、その計算コストは通常高く、自動微分化などの複雑なグラadientsの計算アラウンドを必要とします。この文書では、長所と短所を含むランク付

説明可能深層学習Transformer生成強化学習
用途
離散RLアルゴリズムの性能アップデート
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

オリジナルのデータとZoom-Inのツールを組み合わせた方法、OmniReasonerを提案する。これにより、オリンモードルLLMsの長いオーディオビデオの論理的推論を改善できる。

MI向き品質予測/異常検知自然言語処理大規模言語モデル画像音声動画
用途
長いオーディオビデオの論理的推論を改善する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation

この文書では、閉回路交通シナリオ生成のための変分ベースのアプローチ「E2E-CDiff」を提案しました。これを使用すると、実世界に近い交通ルールを生成したり、交通ルールを操作することができるようになります。

生成AI拡散モデル生成画像
用途
自動運転データの生成
難易度
Hard
コスト
High
arxivPaper only2026-07-20

LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

この研究では、ルビック評価を含む非確認タスクの最適化を目的とします。従来のRLには、モデル評価の情報が使われるだけですが、モデル自身は反省や自己改善はすることがありません。ここでは、LJMをコーチとみなして、モデルが反省

品質予測/異常検知深層学習軽量化・量子化テキスト強化学習
用途
ルビック評価を含む非確認タスクの最適化
難易度
Hard
コスト
High
arxivPaper only2026-07-20

ConceptTree: Bringing Semantic Transparency to Black-Box Decision Making for Robotic Manipulation

この論文では、ConceptTreeというフレームワークを提案しています。このフレームワークは、人の見える概念を使用して、マニピュレーションの高位のスキル選択を表現し、透明性を高めます。

説明可能品質予測/異常検知強化学習方策勾配 (PPO / A3C)画像
用途
マニピュレーションの高位のスキル選択のための透明性の実現
難易度
Hard
コスト
High
arxivPaper only2026-07-20

Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning

複数タスク間の説明性を提供するための逆強化学習は、複数タスク間の説明性を提供することによって、複雑なタスクを解決することに関与していますが、この研究では、複数タスク間の説明性を提供するための逆強化学習の新たなアプローチを

少数データ向き自然言語処理RAG強化学習
用途
複数タスク間の説明性のための逆強化学習のための新たなアプローチ
難易度
Hard
コスト
Low
arxivPaper only2026-07-20

Predictive Training with Latent Imagination for Visual Quadruped Navigation

四足ロボットのナビゲーションのための予測的推論方法が提案されます。ロボットは、現在の観察と短期的な記憶によってアクションを選択しますが、障害物の発展を予測することができないため、このアプローチには課題があります。この課題

深層学習Transformer画像
用途
ロボットのナビゲーション
難易度
Hard
コスト
High
arxivPaper only2026-07-16

PAC Learning in Turn-Based Stochastic Games with Reachability Objectives: A Decentralized Private Approach via Expected Conditional Distance

この研究は、多人数確率ゲームへのPAC学習を研究することに関心があります。PAC学習は、機械学習モデルの確信度を高めると同時に、モデルの誤差を低下させるものです。

コンピュータビジョンセグメンテーション強化学習
用途
多人数確率ゲームへのPAC学習を研究する
難易度
Hard
コスト
Medium
arxivPaper only2026-07-15

Operator-Informed Gaussian Processes for Complex Helmholtz Wavefields: From Synthetic Benchmarks to In Vivo Brain Elastography

Helmholtz方程式は、時間共伴振波の伝播を記述する重要な方程式であり、媒質が損失した場合複素係数を持ちます。ここでは、空間での波場から波方程式を推測するために、物理知識に基づくGaussian Process(GP

少数データ向き強化学習マルチエージェント回帰テキスト
用途
复雑なHelmholtz波場のための物理知識に基づくGaussian Process
難易度
Hard
コスト
Medium
arxivPaper only2026-07-15

The Dynamic Verifiable Multi-Agent Human Agentic Loyalty Loop (DVM-HALL) Model and the Net Human-Agent Score (NHAS) in Autonomous Commerce

自動販売店で客と交わるAIロボットの信頼性を確立する必要がある。このモデルは、客とロボットの信頼関係を構築し、客の買い物をサポートすることを目的としている。

強化学習RLHF
用途
自動販売店で客と交わるAIロボットの信頼性の確立
難易度
Hard
コスト
Medium
githubGitHubあり2026-07-15

vowpal_wabbit — Vowpal Wabbit is a machine learning system which pushes the frontier of machine learning with techniques such as online, hashing, allreduce, reductions, learning2search, active, and interactive learning.

Vowpal Wabbitは、機械学習を進歩させるためのオンライン学習、ハッシュ、reduceなどの強力なアルゴリズムを含むシステムです。その結果、さまざまな問題に応じて、高品質な解決策を提供できます。

強化学習テキスト
用途
強い機械学習アルゴリズムを実行し複雑な問題を解決するためのシステム
難易度
Easy
コスト
Medium
arxivPaper only2026-07-14

Cycles in Liquid Democracy: A Game-Theoretic Justification

代表権という概念は、政治や経済のシステムで重要である。デリゲーション、または代表権の授与、はさまざまなシステムに現れる。デリゲーションを安全かつ効率的かつ有効に運用するために、意思決定者はデリゲーションを設計する際に考慮

品質予測/異常検知強化学習
用途
代表権の確保
難易度
Hard
コスト
Medium
arxivPaper only2026-07-07

6G Sensing Security: Distributed Game-Theoretic RL for Urban Beamforming and Attacker Detection

Next-generation wireless networksにおける分散型ゲーム理論を用いた6Gのセキュリティを研究します。分散型ゲーム理論は、6Gの通信システムが環境の認識とデータの伝送両方を実現するために必要な

センサ/時系列深層学習軽量化・量子化検出生成強化学習
用途
6Gにおける分散型ゲーム理論
難易度
Hard
コスト
Medium
arxivPaper only2026-07-07

Strategic Bargaining in Multi-Buyer Markets: Reinforcement Learning from Verifiable Rewards for LLM Negotiations

複数の買い手を持つ市場における交渉システムを構築します。マーケットの規模を知り切れていない場合、セラーの損失が生じます。セラーは市場の規模を測る必要がありますが、これは複数の買い手を持つ場合に困難です。

自然言語処理大規模言語モデルテキスト強化学習
用途
複数の買い手を持つ市場における交渉
難易度
Hard
コスト
High
arxivPaper only2026-07-02

Hybridizing a Grouping Metaheuristic with Reinforcement Learning for the One-Dimensional Bin Packing Problem

1D バイナリング パッキング問題(1D-BPP)とは、さまざまな用途に多く応用される、分配不可能なNP困難な組合せ最適化問題である。この研究では、Falkenauerのハイブリッドグループゲンエイリアスアリファメント(

表形式向き品質予測/異常検知自然言語処理RAG生成表形式強化学習
用途
1D バイナリング パッキング
難易度
Hard
コスト
Low
arxivPaper only2026-06-30

A Large-Scale Empirical Evaluation of MMAO Under Fair-Budget Continuous and Discrete Benchmarks

この研究では、多様なベンチマークを用いて、Metabolic Multi-Agent Optimizer (MMAO)の適切性を評価します。MMAOは、複数エージェント間でリソースを分配するための閉ループのシステムです。

強化学習モデルフリー (DQN / SAC)
用途
適切な方法を用いてリソース分配を最適化する
難易度
Hard
コスト
Medium
arxivPaper only2026-06-30

A Contextual-Bandit Oversight Game with Two-Sided Informational Asymmetry

AIを援助するための意思決定者によるオーバーサイトの研究。AIが提案した行動の評価と決定を行うために、意思決定者とAIが情報を交流するオーバーサイトの実現を研究する。

品質予測/異常検知強化学習マルチエージェントテキスト
用途
AIを援助するための意思決定者によるオーバーサイトの研究
難易度
Hard
コスト
Medium
arxivPaper only2026-06-26

GTI-mSEMP Framework : A Proposed Framework to Simulate Malware Propagation with Inclusion of Attacker-Defender Strategy

マルウェアの感染は、ネットワーク全体に広がる可能性があります。既存のモデルの場合、脅威に対する防御戦略は静的なパラメータとして扱われますが、実際には攻撃方策と防御方策の間の競合関係に依存します。このため、ゲーム理論を用い

センサ/時系列強化学習
用途
マルウェアの感染をシミュレーションし、防御戦略を提案する
難易度
Hard
コスト
Medium