qa」の検索結果

46
arxivGitHubあり2026-07-24

Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs

この研究では、遥宙イメージングモデルの特化を支援するための能力ギャップドリブン訓練法を提案し、遥宙イメージングモデルの特化において、従来のfine-tuning法に比べて性能が向上することを示しました。

センサ/時系列品質予測/異常検知自然言語処理大規模言語モデル生成画像テキスト
用途
遥宙イメージングの特化を支援する能力ギャップドリブン訓練
難易度
Hard
コスト
High
arxivGitHubあり2026-07-24

Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

多モードチェーンオブサウンドの推論には、視覚的およびテキスト的 cueをステップアップの推論で統合することが含まれます。 しかし、小型のモデルでは、モダリティ間の融合は小さなcross-modalの違いに抑圧されます。

深層学習軽量化・量子化生成画像テキスト
用途
可視化サリエンシーをsteeringする
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Best-of-Evidence: Best-of-N Selection under Partial Verification

モデル出力の選択のためのBoN(ベストオブナ)を、部分検証が含まれるビジョン言語タスクに適用する。この方法により、モデル出力を効率化できる。

品質予測/異常検知コンピュータビジョンセグメンテーション生成マルチモーダル
用途
部分検証を含むビジョン言語タスクを効率化する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning

現在のRLアルゴリズムは、長期視野を持つ長いロールアウトを生成することが困難な时候が多く、そのため同じような失敗を繰り返し、非情報的ロールアウトと無意味のロールアウトを生み出している。しかし、スキルを内在化するスキル集中

自然言語処理大規模言語モデルテキスト強化学習
用途
長期視野を持つRLを改善する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

MedGame: Storytelling Gamification Empowered by Large Language Models for Medical Education

Large Language Models (LLMs) は医学教育に大きな可能性を持っていますが、現在のシステムでは、質問に答えるか一時的なフィードバックしか行なわれていません。一方、臨床病例を決定センターへの学習トレ

自然言語処理大規模言語モデル生成QAテキスト
用途
医学教育への Large Language ModeL の適用
難易度
Hard
コスト
High
arxivPaper only2026-07-23

When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs

この論文では、大規模言語モデル (LLMs) が日常的な文化的知識を評価する能力に着目しています。ここで、TriviaRoomQA というクイズスタイルで問題を提示して、LLMs が日常的な文化的知識をどのように評価する

自然言語処理大規模言語モデルテキスト
用途
大規模言語モデルにおける日常生活の知識の評価
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning

長形推論のための言語モデルが、提供されたコンテキストから乖離した論理を生成する可能性があることを指摘し、コンテキストと推論論理をより適切に融合するため、 REFACT (REstating Facts in Adapti

自然言語処理大規模言語モデル生成テキスト
用途
Chain-Of-Thought (CoT) の改善
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Quality-Aware Multimodal Fusion Reveals Implicit Identity in Valence-Arousal Features

この研究では、感情と気分の表現を分析し、顔の感情とアウトルの視聴動作とアウトルの視聴動作の結びつきを用いて、多モーダル表現を取得しました。提案された方法は、不完全な視聴動作、遮断、不良照明などの変動に対して、高い

品質予測/異常検知深層学習正規化・最適化手法分類画像テキスト
用途
感情と気分の识別
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Do Pathology Vision-Language Models Truly See Pathology?

パスロジは、現在、パスロジ認識のための画像言語モデルを評価するために広く使用されていますが、この研究では、パスロジ認識において画像言語モデルの視覚知覚が機能していることを疑問に問っています。

自然言語処理大規模言語モデル画像テキストマルチモーダル
用途
パスロジの認識
難易度
Hard
コスト
High
arxivPaper only2026-07-22

HalluTruthQA: A Fine-Grained Benchmark for Hallucination Detection, Localization, and Explanation in Arabic Question Answering

大きな言語モデルは真実の情報を提供できるように見えますが、実際は虚偽情報を提供することが多く、これを検知、検出、および検証するための基準を作成するため、HalluTruthQAが開発されました。

自然言語処理大規模言語モデル検出QAテキスト
用途
仮想の答えを検知、検出、および検証するための基準を作成する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Reinforcement Learning for Large Language Model Selective Evidence Adoption from Contaminated Retrieval Results

リトリーウードされた大規模な言語モデルは、有益な情報と誤った情報の混在するコンテキストに対処するのに苦労しています。拒否することで有益な情報を捨てることになるし、無条件に採用すると不正確または危険な回答が得られます。正確

自然言語処理大規模言語モデルテキスト強化学習
用途
有害な情報の選択性的な採用
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Reference-Free Evaluation of Reasoning in Open-Ended Question Answering

この研究では、AI生成物の論理的評価に必要なものとして、生成物がどうやって結果を得るのかを明らかにすることの重要性を強調しています。この研究では生成物を分解し、その論理的な構造を理解するために自然言語推論を利用し、生成物

自然言語処理大規模言語モデルQAテキスト
用途
AI生成物の論理的評価
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

ビデオキャプション生成には、空間と時刻の理解が重要です。PercepCapアルゴリズムは、ビデオ入力を空間時刻認識に分解することで、生成されたキャプションの理解度が向上するとともに、空間時刻の誤差をより正確に検出でき、キ

品質予測/異常検知自然言語処理大規模言語モデル生成動画強化学習
用途
ビデオキャプション生成のための構造化された空間時刻の理解
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?

画像理解のための多モーダルラージランゲージモデルは、強力ですが、まだ能力と限界については明確な理解が不足しています。この論文では、多モーダルラージランゲージモデルが画像理解においてどの程度の能力と限界を持つか、を分析し、

センサ/時系列深層学習軽量化・量子化QA画像テキスト
用途
画像理解における多モーダルラージランゲージモデルの能力と限界
難易度
Hard
コスト
High
arxivGitHubあり2026-07-22

ReferTrack: Referring Then Tracking for Embodied Visual Tracking

ReferTrack は、自然言語で対象の車両に付近する自動車を追従させるシステムである。このシステムでは、対象の車両に付近する自動車を認識する後、自動車の動きを予測する。

自然言語処理プロンプトエンジニアリング検出画像テキスト
用途
自動車が対象の車両に付きそわせるシステム
難易度
Hard
コスト
High
arxivPaper only2026-07-21

MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings

この研究では、現時点の多モーダル言語モデルが人間が持つ社会的理解力を取り入れるための方法が提案され、多人数の会議のような複雑な状況を考慮して、モデルが他の人の信念、意図、知識を理解する能力が向上する。

自然言語処理大規模言語モデルQAテキスト音声
用途
多モーダル言語モデルが人間が持つ社会的理解力に近づく方法
難易度
Hard
コスト
High
arxivPaper only2026-07-21

MIRA-Ev:A Benchmark for Granular Evidence Detection and Relational Reasoning in Clinical Exams

この研究では、臨床評価が主にMCQAに頼っているものの、モデルがどのような観点で回答を裏付けるかを検出できない問題に対処するために、マイクロドタイルと関係的推論のBENCHMARKであるMIRA-Evが提案された。

生成AIGAN分類検出QA
用途
マイクロドタイルの発見と関係的推論
難易度
Hard
コスト
Low
arxivPaper only2026-07-21

DAIS: Dependency-Aware Intermediate QA Supervision for Complex Reasoning

この研究では、Chain-of-Thought (CoT) スーパーヒバテーションでは、最終的な答えに到達するまでの理由を公開することで、中間的には提供される理由の質を強力にし、しかし、多くの場合には、前のステージに到達

深層学習軽量化・量子化テキスト
用途
QAにおけるメモリ補助システムの開発
難易度
Hard
コスト
High
arxivPaper only2026-07-21

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation

既存のロボットデータセットは高コスト、高度個別性、不足しているフィンガープリント構造を持ったものが多い。これらの問題を解決するために、RoboInter1.0に基づいて、RoboInter1.5を提案します。RoboIn

説明可能自然言語処理RAGセグメンテーション
用途
体系の世界モデリングを解決する
難易度
Hard
コスト
Low