LLM」の検索結果

250
arxivPaper only2026-07-23

MIRROR: Learning from the Other View for Multi-Modal Reasoning

多モーダル理解技術のための新しいアプローチであるMIRROR(Learning from the Other View)を提案しました。MIRRORは、テキスト、図、テキストと図の組み合わせから同等の視点を提供することで

品質予測/異常検知自然言語処理大規模言語モデル画像テキストマルチモーダル
用途
多モーダル理解技術の開発
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Position Bias is Hidden Behind Ceiling Effects: A Permutation Diagnostic for LLM Benchmarks

LLM(言語モデル)の評価における位置バイアスを分析するための方法を提案した研究で、この方法により、位置バイアスが評価結果にどのような影響を与えるかが明らかにできる。

自然言語処理大規模言語モデル検出生成
用途
LLMの評価における位置バイアスを分析する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

From Resource Flow to Executable Tests: Petri-Net-Guided LLM Test Generation for Concurrent Stateful Rust APIs

この研究は、リソースフローの動作を表すPetriネットと、APIを操作するためのテストを自動生成する方法を提案した。方法は、APIの機能をテストするためのシナリオを生成し、テストが正しく実行されるようにした。

自然言語処理大規模言語モデル生成テキスト
用途
共時進行のコンカURRENCYAPIのテスト
難易度
Hard
コスト
High
arxivPaper only2026-07-23

An LLM-Driven Workflow for Automated Process Control Strategy Generation and Tuning from Dynamic Process Models

このプロセスでは、大規模言語モデルを使用して、ダイナミックプロセスモデルに基づいて自動化された制御戦略を生成します。

少数データ向きCPUで試しやすい条件最適化自然言語処理大規模言語モデル生成
用途
オートメーションされた制御戦略の生成
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Safeguards for Speech2Speech LLM-Assistants: A Case Study in Automotive Applications

S2S (Speech-to-Speech) LLMアシスタントを利用して、人間のような話し方をすることができますが、安全対策の実装が困難です。この研究では、S2S LLMアシスタントの安全対策を2つのアプローチで実現し

自然言語処理大規模言語モデルテキスト音声
用途
S2S LLMアシスタントの安全対策
難易度
Hard
コスト
High
arxivPaper only2026-07-23

V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure

ビデオLMMの安全性を確認するために、新しい診断フレームワークを提案します。これらのフレームワークは、モデルの挙動、理解、セマンティクスを同時に考慮します。

自然言語処理大規模言語モデル画像テキスト動画
用途
ビデオ安全性デ-カリブレーションの診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Search Hardness-Aware LLM-Based Problem Formulation for Expensive Simulation-Driven Design

シミュレーション駆動設計では、高精度なシミュレーションを少なくすることで設計を実現しています。既存の手法では、その問題に取り組むために最適化アルゴリズムが改善されてきましたが、問題の定義自体は検討されていません。この論文

深層学習軽量化・量子化生成
用途
コスト削減的なシミュレーション駆動設計
難易度
Hard
コスト
High
arxivPaper only2026-07-23

MedGame: Storytelling Gamification Empowered by Large Language Models for Medical Education

Large Language Models (LLMs) は医学教育に大きな可能性を持っていますが、現在のシステムでは、質問に答えるか一時的なフィードバックしか行なわれていません。一方、臨床病例を決定センターへの学習トレ

自然言語処理大規模言語モデル生成QAテキスト
用途
医学教育への Large Language ModeL の適用
難易度
Hard
コスト
High
arxivPaper only2026-07-23

When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs

この論文では、大規模言語モデル (LLMs) が日常的な文化的知識を評価する能力に着目しています。ここで、TriviaRoomQA というクイズスタイルで問題を提示して、LLMs が日常的な文化的知識をどのように評価する

自然言語処理大規模言語モデルテキスト
用途
大規模言語モデルにおける日常生活の知識の評価
難易度
Hard
コスト
High
arxivPaper only2026-07-23

An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

この論文では、音声字幕の評価手法が提案され、音声字幕の評価において既存の手法の制約を克服することを目指しました。提案されたフレームワークは音声字幕の各側面を評価し、質問回答型の評価手法ではなく字幕の中立性を評価することが

センサ/時系列自然言語処理大規模言語モデル生成テキスト音声
用途
音声字幕の評価フレームワークの構築
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning

長形推論のための言語モデルが、提供されたコンテキストから乖離した論理を生成する可能性があることを指摘し、コンテキストと推論論理をより適切に融合するため、 REFACT (REstating Facts in Adapti

自然言語処理大規模言語モデル生成テキスト
用途
Chain-Of-Thought (CoT) の改善
難易度
Hard
コスト
High
arxivPaper only2026-07-23

HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models

大規模言語モデルはさまざまな画像をテキストに変換する上で優れた性能を示しているが、発生するホログラフィックな診断にはまだ解決策が必要です。この研究では、主流の粗い検出方法の欠点を補うため、細部の診断方法を提案しています。

説明可能自然言語処理大規模言語モデル分類検出生成
用途
ホログラフィックハロウィーンの診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models

大規模言語モデルのハロウィーン診断では、対象の 3D 空間関係を推論する際に、視覚化が欠如していることが問題となります。この研究では、これらのハロウィーンを軽減するためのアプローチを提案しています。

自然言語処理大規模言語モデル画像テキスト3D
用途
3D空間推論のハロウィーン診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs

大規模言語モデルの圧縮には、モデルのパフォーマンスが低下する可能性があるため、量化の保護が重要です。この研究では、Fisher加重チャネル感受性を用い、MLLMの量化を安定させるためのC-PTQをプロPOSEしています。

深層学習Transformerテキストマルチモーダル
用途
大規模言語モデル圧縮
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

空間理解は、物理世界と静的のセマンティック理解の間でつながるために不可欠です。多くの空間タスクは、場所、領域、パスの自然な表現は、ポインティングやマーキングなど、連続的な視覚的シーンで行われることが多いが、現行の空間推論

自然言語処理大規模言語モデル生成画像テキスト
用途
空間理解
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Do Pathology Vision-Language Models Truly See Pathology?

パスロジは、現在、パスロジ認識のための画像言語モデルを評価するために広く使用されていますが、この研究では、パスロジ認識において画像言語モデルの視覚知覚が機能していることを疑問に問っています。

自然言語処理大規模言語モデル画像テキストマルチモーダル
用途
パスロジの認識
難易度
Hard
コスト
High
arxivPaper only2026-07-23

FORGE-plus: Force-Budgeted Recovery for Contact-Rich Assembly with a Frozen LLM Supervisor

強制制約に基づく強化学習を利用し、低コストで高精度の組み立てが可能になると同時に、組み立てに失敗してもロボットが安全に回避できるように、ロボットの制御のための強化学習を提案します。

自然言語処理大規模言語モデルテキスト強化学習
用途
非対称ロボット組み立て
難易度
Hard
コスト
High
arxivPaper only2026-07-22

TriAgent: Divergence-Aware Multi-Agent Committees for Cost-Efficient Financial Sentiment Analysis

生産的言語モデルの利用による金銭的感情分析に対処するための方法を提案している。複数のエージェントを活用したコミティー方式を使用し、さまざまな粒度のテキストデータに対応できるように、単語レベルのルールベースアプローチ、句節

深層学習Transformer検出テキスト
用途
金融分野の感情分析
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PoTRE: Test-Time Reasoning inspired by Cognitive Heterogeneity

モデルの脆弱性を解決するために、四つのエージェントに分割される多様なフレームワークPoTREを導入した。モデルの推論能力を強化し、単一のストリーミングアプローチよりも複雑な理論的制約とアブストラクションに抵抗できるように

表形式向き自然言語処理大規模言語モデル生成テキスト
用途
複雑な推論力のあるタスクの解決
難易度
Hard
コスト
High
arxivPaper only2026-07-22

The Ethics of Autonomous AI Agents for Offensive Security

侵攻テストツールが異なっている点、決定主義的な性質、狭く特定されたスコープ、専門技術の操作を用いたものと異なり、LLM駆動の自治的セキュリティツールは3つの次元で不確実性を示した。政策決定への説明が困難、影響の開放性、行

自然言語処理大規模言語モデルテキスト
用途
自律的セキュリティツールの倫理的考慮
難易度
Hard
コスト
High
arxivPaper only2026-07-22

On the Systematic Challenges of Culturally Loaded Machine Translation: Dream of the Red Chamber as the Cultural Lens

文化的意味の表現が表現された翻訳には、翻訳システムが表現する意味を理解するために、表現の文化的背景を考慮する必要があることを指摘した。文化的背景が表現されている表現された翻訳には、いくつかの課題があり、LLMベースの翻訳

品質予測/異常検知自然言語処理大規模言語モデル翻訳テキスト
用途
文化的意味の表現
難易度
Hard
コスト
High
arxivPaper only2026-07-22

DQAOA-GPT: AI-Accelerated Distributed Quantum Optimization for Combinatorial Problems

組み合わせ方程式の最適化を解くための新しいフレームワークを提示した。分布される量子アルゴリズムの局所的な制限に直面する際、最適化の解を導けるために、分布される量子近似最適化アプローチと深層学習アルゴリズムを組み合わせた。

品質予測/異常検知自然言語処理大規模言語モデル生成
用途
方程式組み合わせの最適化
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Small, Free, and Effective: Orchestrating Open-Weight Small Language Models to Outperform Single LLM for Malware Analysis

分析報告の迅速な解釈が求められるときに行われるマルウェア分析を実現するために、閉じた重みの大きい言語モデルを使用しないことが多い。オープン重みの言語モデルは、マルウェア分析のために適切な言語能力と、閉じた重みの大きい言語

自然言語処理大規模言語モデルテキスト
用途
マルウェア分析のための小規模な言語モデル
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

危険な問題に対する正しい答えを提供する大きな言語モデルと費用の効率が良い、小さな言語モデルを協力させる技術が開発されました。

深層学習軽量化・量子化生成テキスト
用途
小さな言語モデルを大きい言語モデルと協力させる手法が効率的かつ安全に実装される
難易度
Hard
コスト
High
arxivPaper only2026-07-22

HalluTruthQA: A Fine-Grained Benchmark for Hallucination Detection, Localization, and Explanation in Arabic Question Answering

大きな言語モデルは真実の情報を提供できるように見えますが、実際は虚偽情報を提供することが多く、これを検知、検出、および検証するための基準を作成するため、HalluTruthQAが開発されました。

自然言語処理大規模言語モデル検出QAテキスト
用途
仮想の答えを検知、検出、および検証するための基準を作成する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

TINY_SCHILLER: A Drop-In German Drama Corpus for Small Language Models

小さな言語モデルに対するドロップインコーパス、tiny_schillerを導入し、単一ファイルで利用できるようにし、言語モデルを簡単にprototyping、fine-tuning、教育、研究に利用できるようにする。

自然言語処理大規模言語モデルテキスト
用途
ナイーブな言語モデルに対するドロップインコーパスの提供
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

3D オキュピエンシー予測には、物体の配置と密度を解釈するための視覚的手法が必要です。従来の方法では、計算コストが高くなりすぎていたが、新しく提案されたGaussianSeedアルゴリズムは、層を階層化することで、計算コ

品質予測/異常検知自然言語処理大規模言語モデル生成テキスト
用途
3次元空間における物体の配置と密度の予測
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Reference-Free Evaluation of Reasoning in Open-Ended Question Answering

この研究では、AI生成物の論理的評価に必要なものとして、生成物がどうやって結果を得るのかを明らかにすることの重要性を強調しています。この研究では生成物を分解し、その論理的な構造を理解するために自然言語推論を利用し、生成物

自然言語処理大規模言語モデルQAテキスト
用途
AI生成物の論理的評価
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

ビデオキャプション生成には、空間と時刻の理解が重要です。PercepCapアルゴリズムは、ビデオ入力を空間時刻認識に分解することで、生成されたキャプションの理解度が向上するとともに、空間時刻の誤差をより正確に検出でき、キ

品質予測/異常検知自然言語処理大規模言語モデル生成動画強化学習
用途
ビデオキャプション生成のための構造化された空間時刻の理解
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

多モーダルラージランゲージモデルは、視覚言語タスクに強いですが、高い推論コストで問題となっています。Look Less, Think Fasterアルゴリズムは、単位次元を個別に最適化することで、多モーダルラージランゲー

深層学習軽量化・量子化画像テキストマルチモーダル
用途
多モーダルラージランゲージモデルによる視覚言語タスクでのコスト削減
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?

画像理解のための多モーダルラージランゲージモデルは、強力ですが、まだ能力と限界については明確な理解が不足しています。この論文では、多モーダルラージランゲージモデルが画像理解においてどの程度の能力と限界を持つか、を分析し、

センサ/時系列深層学習軽量化・量子化QA画像テキスト
用途
画像理解における多モーダルラージランゲージモデルの能力と限界
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos

この研究では、ドローンで小さな物体を認識することを目的としたメモリ拡張型大規模言語モデルを開発しました。このモデルは、複雑なドローンの場面で、ユーザーの指示に従って物体を識別できるようになります。

自然言語処理大規模言語モデルセグメンテーション画像テキスト
用途
ドローンで物体認識を実行する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Optimizing Regret

決定関数とコストの関数間の共変性により、損失関数を最適化することで、適切な行動決定を可能にすることができます。また、これに基づいて、共変性の傾向を最適化する方向性を考察し、正確に予測された結果を持つモデルを導出するのに役

自然言語処理大規模言語モデル
用途
適切な行動決定のための損失関数の最適化
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Agents in the Wild: Where Research Meets Deployment

分散型言語モデル(LLM)やコンテキストを活用するエージェントは、製品開発やファイナンス分野で活用されている。エージェントを実用化するには、堅牢性、安全性、信頼性を確保することが大切となる。 このチュートリアルでは、エー

自然言語処理大規模言語モデルテキスト
用途
エージェントの実践
難易度
Hard
コスト
High
arxivPaper only2026-07-21

The Price of Reasoning: Cost-Quality Tradeoffs in Reinforcement Learning for Neural Machine Translation

この研究では、学生チームのテーブル演習(TTX)における評価方法を提案し、複雑でオープンエンドな状況にあるチームの行動とコミュニケーションを記録できるTTX学習プラットフォームを使用します。

品質予測/異常検知自然言語処理大規模言語モデル翻訳テキスト強化学習
用途
計算機教育のチーム問題解決能力評価
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Reasoning Error from Known Fact: Step-Level Self-Consistency Group Relative Policy Optimization for LLM

人間は、大きな言語モデルを使って長い論理的推論を行うが、このような推論の結果は正しくない可能性がある。ここでは、これらの発言を検証する手法を提唱する。

自然言語処理大規模言語モデルテキスト
用途
大型言語モデルの中での論理的推論を検証する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

HindsightBench: A Black-Box Behavioral Audit Protocol for Parametric Hindsight in Time-Indexed LLM Decision Tasks

大規模言語モデルは、決定タスクを遂行する過程で、実行された事実を含むパラメトリックな知識を漏らす傾向にある。大規模言語モデルが実際にどのような意思決定タスクを遂行したかを検証するのは困難であるものの、これが確かに事実であ

深層学習軽量化・量子化生成テキスト
用途
LLMによる金融意思決定タスクの検証
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

オリジナルのデータとZoom-Inのツールを組み合わせた方法、OmniReasonerを提案する。これにより、オリンモードルLLMsの長いオーディオビデオの論理的推論を改善できる。

MI向き品質予測/異常検知自然言語処理大規模言語モデル画像音声動画
用途
長いオーディオビデオの論理的推論を改善する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

LLM Detection as an Intervention: Downstream Impact under Strategic User Behavior

LLMが広く使用されるようになり、LLMを識別するツールが開発されている。 しかし、識別システムは、使用者の行動に影響を与えている。つまり、識別システムが機能しないと、ユーザが別のシステムを使用することに関連し、最終的な

品質予測/異常検知自然言語処理大規模言語モデル検出
用途
LLMを識別
難易度
Hard
コスト
High
arxivPaper only2026-07-20

How Does Alignment Tuning Shape Representations of Sycophancy and Related Cue-Induced Biases in LLMs?

研究では、LLMの不正回答を起こす根本原因を探りました。モデルを5つの家族と7つのBCTバイアスのタイプで検討すると、モデル内の特定のパターンが見つかりました。このパターンが不正回答の根本原因となります。

少数データ向き自然言語処理大規模言語モデル
用途
LLMの不正回答の根本原因の特定
難易度
Hard
コスト
High
arxivPaper only2026-07-20

LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

この研究では、ルビック評価を含む非確認タスクの最適化を目的とします。従来のRLには、モデル評価の情報が使われるだけですが、モデル自身は反省や自己改善はすることがありません。ここでは、LJMをコーチとみなして、モデルが反省

品質予測/異常検知深層学習軽量化・量子化テキスト強化学習
用途
ルビック評価を含む非確認タスクの最適化
難易度
Hard
コスト
High
arxivPaper only2026-07-20

VDAR-Router: Adaptive LLMs Routing via Verbalized Query Difficulty Analysis Retrieval

大きな言語モデルは実用システムで増えているため、費用対効果のあるモデルを選択することが重要になる。モデルを割り当てるためにLKM路線が提案された。しかし、既存の路線方法は入力問に基づいてモデルを選択し、モデルに適合しない

深層学習軽量化・量子化テキスト
用途
model routingの問題を解決
難易度
Hard
コスト
High
arxivPaper only2026-07-20

Receiver-Centered Robot-to-Human Handover with Grasp-Aware Object Orientation

共役ロボットは、人間オペレータと同梱するワークスペースを共有し、機械手のハンドオーバーなどの安全性の高いマイクロイベント頻繁に発生します。但し、従来の静的なハンドオーバーは、非対称の産業工具を取り扱う際、不自然な抓を持つ

自然言語処理大規模言語モデル分類3D
用途
道具のハンドオーバー
難易度
Hard
コスト
High
arxivPaper only2026-07-17

Vision-Language-Motion Maps: An Open-Vocabulary, Uncertainty-Aware, Queryable Motion Attribute for 3D Scene Maps

この研究では、動的なシナリオを分析するために可視化した地図上にMotion Attributeを付与し、Language QueryによるMotion Attributeフィルタを使用して分析することができます。

自然言語処理大規模言語モデル3Dマルチモーダル
用途
可視化した地図上での動的なシナリオの分析
難易度
Hard
コスト
High
arxivPaper only2026-07-16

Sharp Stability Threshold and Certification for Designing Stable Residual Architectures

弾性的深層ネットワークの安定性に関連する問題を解決するための新しい原理が提案されました。この原理は、入力量のエクスポネンシャルに基づく安定性しきい値が得られます。この安定しきい値は、各残差ブロックの速度場の入力量のエクス

MI向き深層学習Transformer
用途
安定性問題の解決
難易度
Hard
コスト
High
arxivPaper only2026-07-13

Long-Memory Reservoir Computing for Data-Scarce Dengue Forecasting

大型言語モデル(LLM)は最近急速に普及していますが、その推論に際してはAI加速器が必要になります。トークンフェーズはLSTMなどのニューラルネットワークで処理される分野ですが、現在AI加速器におけるこの分野の効率を向上

センサ/時系列深層学習RNN / LSTM回帰予測時系列
用途
AI加速器でのLLMトークンフェーズを最適化する
難易度
Hard
コスト
High
arxivPaper only2026-07-07

Strategic Bargaining in Multi-Buyer Markets: Reinforcement Learning from Verifiable Rewards for LLM Negotiations

複数の買い手を持つ市場における交渉システムを構築します。マーケットの規模を知り切れていない場合、セラーの損失が生じます。セラーは市場の規模を測る必要がありますが、これは複数の買い手を持つ場合に困難です。

自然言語処理大規模言語モデルテキスト強化学習
用途
複数の買い手を持つ市場における交渉
難易度
Hard
コスト
High
arxivPaper only2026-07-06

Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

本研究では、推論プロセスの検証を目的とした Heaviside 不連続性の考慮を提案する。これにより、推論プロセスにおける潜在的なミスを検出した上で、正しい出力を生成することができる。

深層学習軽量化・量子化テキスト
用途
大容量言語モデルでの推論の検証
難易度
Hard
コスト
High
arxivPaper only2026-06-23

Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War

大規模言語モデルの戦略1対1ベンチマークであるAge of LLMを紹介。マインスイーパーゲームを想定し、フォーゲットオブラーサー、マインスイーパー対戦、JSONスキーマへの従属性という三つのストレスアウトを設定。

自然言語処理大規模言語モデルテキスト
用途
マインスイーパーゲーム用ベンチマーク
難易度
Hard
コスト
High
arxivPaper only2026-06-13

Large Language Model-Driven Cooperative Operator Ensemble Evolution for Permutation Flow Shop Scheduling

この研究では、PFSPのIterated Greedy (IG) アルゴリズムのパフォーマンスを改善するために、Large Language Model-Driven Cooperative Operator Ensem

少数データ向きCPUで試しやすい品質予測/異常検知自然言語処理大規模言語モデルテキスト
用途
PFSPのIterated Greedy (IG) アルゴリズムのパフォーマンスを改善すること。
難易度
Hard
コスト
High
arxivPaper only2026-06-12

MeEvo: Metacognitive Evolution Combined with Natural Evolution for Automatic Heuristic Design

この研究では、自動補助関数設計(AHD)についての研究を行った。AHDは、マシン学習が可能になる以前から研究されていたトピックであり、マシン学習によって、AHDがさらに活用可能になった。この研究では、AHDにおけるメタ認

品質予測/異常検知自然言語処理大規模言語モデル生成テキスト
用途
自動補助関数設計
難易度
Hard
コスト
High