huggingfaceHugging Faceあり2026-07-20
Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift
We propose Token-Level Off-Policy Labeling (TOPL), an off-policy training paradigm that reframes post-training
説明可能自然言語処理ファインチューニング分類生成異常検知
- 用途
- 分類
- 難易度
- Easy
- コスト
- High
→