qa」の検索結果

4
arxivGitHubあり2026-07-24

Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs

この研究では、遥宙イメージングモデルの特化を支援するための能力ギャップドリブン訓練法を提案し、遥宙イメージングモデルの特化において、従来のfine-tuning法に比べて性能が向上することを示しました。

センサ/時系列品質予測/異常検知自然言語処理大規模言語モデル生成画像テキスト
用途
遥宙イメージングの特化を支援する能力ギャップドリブン訓練
難易度
Hard
コスト
High
arxivGitHubあり2026-07-24

Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

多モードチェーンオブサウンドの推論には、視覚的およびテキスト的 cueをステップアップの推論で統合することが含まれます。 しかし、小型のモデルでは、モダリティ間の融合は小さなcross-modalの違いに抑圧されます。

深層学習軽量化・量子化生成画像テキスト
用途
可視化サリエンシーをsteeringする
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning

長形推論のための言語モデルが、提供されたコンテキストから乖離した論理を生成する可能性があることを指摘し、コンテキストと推論論理をより適切に融合するため、 REFACT (REstating Facts in Adapti

自然言語処理大規模言語モデル生成テキスト
用途
Chain-Of-Thought (CoT) の改善
難易度
Hard
コスト
High
arxivGitHubあり2026-07-22

ReferTrack: Referring Then Tracking for Embodied Visual Tracking

ReferTrack は、自然言語で対象の車両に付近する自動車を追従させるシステムである。このシステムでは、対象の車両に付近する自動車を認識する後、自動車の動きを予測する。

自然言語処理プロンプトエンジニアリング検出画像テキスト
用途
自動車が対象の車両に付きそわせるシステム
難易度
Hard
コスト
High