arxivGitHubあり2026-09-03
Subspace Inference Enables Efficient Active Reward Learning from Preferences
Reinforcement learning from human feedback (RLHF) has emerged as a powerful yet sample-inefficient approach fo
少数データ向き条件最適化深層学習軽量化・量子化強化学習
- 用途
- 技術検証・論文読解補助
- 難易度
- Hard
- コスト
- Medium
→