multimodal」の検索結果

184
githubGitHubあり2026-07-24

transformers — 🤗 Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.

🤗 Transformersは、テキスト・ビジョン・音声など複雑なモデル定義をサポートするフレームワークで、インフェレンスターやトレーニングに使用できる。

深層学習Transformer分類テキスト音声
用途
機械学習モデル定義
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

Medical_Image_Analysis — Foundation models based medical image analysis

医学画像分析は、医療の診断や治療を支援するために画像に記載されたデータから情報を抽出する研究分野です。この研究では、foundation modelsを用い、医療画像分析のための新しいアプローチを提案しました。found

自然言語処理大規模言語モデル生成画像テキスト
用途
医学画像分析
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

sglang — SGLang is a high-performance serving framework for large language models and multimodal models.

SGLangは、大規模言語モデルのサービングフレームワークです。このライブラリは、高性能なサービスフレームワークで、大規模言語モデルのサービングをサポートしています。

深層学習Transformer画像テキストマルチモーダル
用途
大規模言語モデルのサービングフレームワーク
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

ai-agent-book — 《深入理解 AI Agent:设计原理与工程实践》(李博杰 著)开源主仓库:全书正文、编译版 PDF 与按章配套代码

この論文では、現在のVision-Language-Benchmark(VLB)を超える、MLLMがアクティブな観察を実演できるようにするためのバenchmark、ActiveVisionを提案する。このActiveVi

自然言語処理大規模言語モデルテキストマルチモーダル
用途
弁論の実際的な対象を形成するためにAIが活用される
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

lance — Open Lakehouse Format for Multimodal AI. Convert from Parquet in 2 lines of code for 100x faster random access, vector index, and data versioning. Compatible with Pandas, DuckDB, Polars, Pyarrow, and PyTorch with more integrations coming..

マルチモーダルAIに適したオープンレイクハウスフォーマットです。このフォーマットでは、パレットからデータを2行のコードで変換することができ、100倍速くなります。また、ベクトルインデックスやデータバージョニングが可能です

自然言語処理大規模言語モデルマルチモーダル
用途
オープンレイクハウスフォーマット
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

haystack — Open-source AI orchestration framework for building context-engineered, production-ready LLM applications. Design modular pipelines and agent workflows with explicit control over retrieval, routing, memory, and generation. Built for scalable agents, RAG, multimodal applications, semantic search, and conversational systems.

オープンソースのAIオーケストレーションフレームワークです。LLMアプリケーションの構築に必要なパイプラインやエージェントワークフローの設計ができるようになっています。

深層学習Transformer生成要約テキスト
用途
LLMアプリケーションの構築
難易度
Easy
コスト
High
arxivPaper only2026-07-23

MIRROR: Learning from the Other View for Multi-Modal Reasoning

多モーダル理解技術のための新しいアプローチであるMIRROR(Learning from the Other View)を提案しました。MIRRORは、テキスト、図、テキストと図の組み合わせから同等の視点を提供することで

品質予測/異常検知自然言語処理大規模言語モデル画像テキストマルチモーダル
用途
多モーダル理解技術の開発
難易度
Hard
コスト
High
arxivPaper only2026-07-23

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

大規模な言語モデルを用いた推論技術のための新しいアプローチであるX$^3$-OPD(Distilling Reasoning into Large Audio-Language Models via On-Policy

センサ/時系列品質予測/異常検知深層学習軽量化・量子化テキスト音声マルチモーダル
用途
大規模な言語モデルを用いた推論技術の開発
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Best-of-Evidence: Best-of-N Selection under Partial Verification

モデル出力の選択のためのBoN(ベストオブナ)を、部分検証が含まれるビジョン言語タスクに適用する。この方法により、モデル出力を効率化できる。

品質予測/異常検知コンピュータビジョンセグメンテーション生成マルチモーダル
用途
部分検証を含むビジョン言語タスクを効率化する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

OpenForgeRL: Train Harness-native Agents in Any Environment

OpenForgeRLは、ハーネス付きエージェントを訓練するためのフレームワークを提供する。これにより、エージェントが複雑なトラジショナルハーネスを利用して、外部システムと協力し、複数のタスクを同時に解決できるようになっ

深層学習軽量化・量子化マルチモーダル
用途
ハーネス付きエージェントのトレーニング
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Beyond Independent Optimization: Compression, MoE Routing, and Quantization Interactions in Multimodal Edge Intelligence

効率的な多モードの推論は、モデルの性能やFLOPCOuntだけでなく、移動、キャッシュ、変形、量化された表現を保存するコストやメモリ、エネルギーに関する制約にも制限されています。この論文では、最近のビジュアルトークン圧縮

品質予測/異常検知深層学習Transformer画像テキスト動画
用途
分析的コストと効率性を向上させるための多モードのエッジAIの効率化
難易度
Hard
コスト
High
arxivPaper only2026-07-23

MedGame: Storytelling Gamification Empowered by Large Language Models for Medical Education

Large Language Models (LLMs) は医学教育に大きな可能性を持っていますが、現在のシステムでは、質問に答えるか一時的なフィードバックしか行なわれていません。一方、臨床病例を決定センターへの学習トレ

自然言語処理大規模言語モデル生成QAテキスト
用途
医学教育への Large Language ModeL の適用
難易度
Hard
コスト
High
arxivPaper only2026-07-23

An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

この論文では、音声字幕の評価手法が提案され、音声字幕の評価において既存の手法の制約を克服することを目指しました。提案されたフレームワークは音声字幕の各側面を評価し、質問回答型の評価手法ではなく字幕の中立性を評価することが

センサ/時系列自然言語処理大規模言語モデル生成テキスト音声
用途
音声字幕の評価フレームワークの構築
難易度
Hard
コスト
High
arxivPaper only2026-07-23

MemTools: A Unified Research Framework for Interoperable Agent Memory

この論文では、記憶システムをサポートするフレームワークMemToolsが構築され、記憶システムの開発を容易にすることを目指しました。これにより開発者は、記憶システムの各コンポーネントを開発およびテストしやすくなり、設計と

自然言語処理RAGマルチモーダル
用途
エージェントの記憶をサポートするフレームワークの構築
難易度
Hard
コスト
High
arxivPaper only2026-07-23

HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models

大規模言語モデルはさまざまな画像をテキストに変換する上で優れた性能を示しているが、発生するホログラフィックな診断にはまだ解決策が必要です。この研究では、主流の粗い検出方法の欠点を補うため、細部の診断方法を提案しています。

説明可能自然言語処理大規模言語モデル分類検出生成
用途
ホログラフィックハロウィーンの診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models

大規模言語モデルのハロウィーン診断では、対象の 3D 空間関係を推論する際に、視覚化が欠如していることが問題となります。この研究では、これらのハロウィーンを軽減するためのアプローチを提案しています。

自然言語処理大規模言語モデル画像テキスト3D
用途
3D空間推論のハロウィーン診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs

大規模言語モデルの圧縮には、モデルのパフォーマンスが低下する可能性があるため、量化の保護が重要です。この研究では、Fisher加重チャネル感受性を用い、MLLMの量化を安定させるためのC-PTQをプロPOSEしています。

深層学習Transformerテキストマルチモーダル
用途
大規模言語モデル圧縮
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Do Pathology Vision-Language Models Truly See Pathology?

パスロジは、現在、パスロジ認識のための画像言語モデルを評価するために広く使用されていますが、この研究では、パスロジ認識において画像言語モデルの視覚知覚が機能していることを疑問に問っています。

自然言語処理大規模言語モデル画像テキストマルチモーダル
用途
パスロジの認識
難易度
Hard
コスト
High
arxivPaper only2026-07-23

RL-MACRO: A Cybernetic Closed-Loop Intelligence Framework for Multimodal Adaptive Robotic Craniotomy

クロアニオトミーの手術を自動化するために、複数のモジュールから形成されるサイバネティックなクローゼッドループのフレームワークを提案します。このフレームワークは、ツールと組織との対話を通じて、ツールと組織の相互作用に対して

センサ/時系列深層学習CNN音声マルチモーダル
用途
クロアニオトミー手術の自動化
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory Adjustment

人間の知能を模倣するクロアニオトミー手術のフレームワークを提案します。このフレームワークは、前方計画と後方実行を組み合わせて、手術中に手術台の位置を自動的に調整することで、人間と同様の安全で効率的な手順を実現します。

センサ/時系列深層学習Transformer検出画像音声
用途
クロアニオトミー手術の自動化
難易度
Hard
コスト
High
arxivPaper only2026-07-23

ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments

オブジェクト目標のナビゲーションにおける、動的な避け方とマルチフロア環境を考慮した、ゼロショットオブジェクトナビゲーションのフレームワークを提案します。このフレームワークでは、動的な人々とマルチフロア環境を考慮しながら、

自然言語処理ファインチューニングテキスト3Dマルチモーダル
用途
マルチフロアにおけるオブジェクト目標のナビゲーション
難易度
Hard
コスト
High
arxivGitHubあり2026-07-22

Antigen-specific Antibody Multi-modal Foundation Model for Functional Antibody Design

この研究では、抗原特異性抗体を設計するために、抗原および抗体の間でエピトープレベルでのペアリングが必要であることを考慮した、抗原特異性の抗体多モーダルファンデーションモデル(AAMFM)を提案しました。

自然言語処理RAG分類生成テキスト
用途
抗原特異性抗体設計
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Hypothesis-and-Refinement Learning of Organic Structures from Multimodal Spectroscopic Data

分子構造を決定するために、スペクトルデータから自動的な構造解析を実施するための方法を提案している。この方法は、スペクトルデータに基づいてヒントと改良を繰り返すことで、分子構造を決定するもので、分子の可能性の広範な構造スペ

MI向き自然言語処理ファインチューニング生成テキストマルチモーダル
用途
分子構造の解析
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

多モーダルラージランゲージモデルは、視覚言語タスクに強いですが、高い推論コストで問題となっています。Look Less, Think Fasterアルゴリズムは、単位次元を個別に最適化することで、多モーダルラージランゲー

深層学習軽量化・量子化画像テキストマルチモーダル
用途
多モーダルラージランゲージモデルによる視覚言語タスクでのコスト削減
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?

画像理解のための多モーダルラージランゲージモデルは、強力ですが、まだ能力と限界については明確な理解が不足しています。この論文では、多モーダルラージランゲージモデルが画像理解においてどの程度の能力と限界を持つか、を分析し、

センサ/時系列深層学習軽量化・量子化QA画像テキスト
用途
画像理解における多モーダルラージランゲージモデルの能力と限界
難易度
Hard
コスト
High
arxivPaper only2026-07-22

STEREOFLOW: Progressive Stereo Matching with StereoDiT and Transition Flow Matching

ステレオマッチングは3次元再構成において重要なタスクです。この研究では、ステレオマッチングを確率的生成タスクと組み合わせ、オブジェクト検出の向上を目的として、ステレオマッチングフレームワークと潜在分配を統合する方法を提案

深層学習Transformer生成回帰画像
用途
オブジェクト検出の向上
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos

この研究では、ドローンで小さな物体を認識することを目的としたメモリ拡張型大規模言語モデルを開発しました。このモデルは、複雑なドローンの場面で、ユーザーの指示に従って物体を識別できるようになります。

自然言語処理大規模言語モデルセグメンテーション画像テキスト
用途
ドローンで物体認識を実行する
難易度
Hard
コスト
High
arxivGitHubあり2026-07-22

Silent Failures in Multimodal Agentic Search:A Diagnostic Taxonomy and Cross-Judge Evaluation

この研究では、可視化された質問への対応を評価するために、新しい方法を提案しました。この方法は、質問への回答の正確性だけでなく、質問への回答のパターンや特徴も評価することができます。

品質予測/異常検知コンピュータビジョンマルチモーダルQA画像
用途
可視化された質問への対応を評価する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

自動運転システムには、道路のトポロジー(ドライバブルレーンとその接続性)を理解する機能が必要です。最近の検出モデルは360度の前方視野からボリュームイメージを取得することで、道路上のレーンのトポロジーを推測することができ

自然言語処理RAG画像テキストマルチモーダル
用途
道路のトポロジー認識を改善
難易度
Hard
コスト
High
arxivPaper only2026-07-22

DRGBT-1K: A Large-scale High-quality Benchmark for Dynamic RGBT Tracking

地上を表す重力式マップの高解像度版が、多くの用途で役立ちます。たとえば、市区町村の変化を監視したり、エネルギー対策を向上させたり、温室効果ガスの排出量を追跡したりすることができます。4つの主要な全世界建物Rasterデー

センサ/時系列品質予測/異常検知コンピュータビジョン物体検出検出マルチモーダル
用途
宇宙に分布する建物の面積を正確に推定する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

Language-Guided Grasping は、複雑なシーンで物体の把持を行うために、視覚言語モデル(VLM)を用いる。このアプローチでは、VLM は直接把持を予測するのではなく、3 次元空間における把持の位置を指

深層学習軽量化・量子化生成テキスト3D
用途
複雑なシーンで物体の把持を実現
難易度
Hard
コスト
High
arxivGitHubあり2026-07-22

ReferTrack: Referring Then Tracking for Embodied Visual Tracking

ReferTrack は、自然言語で対象の車両に付近する自動車を追従させるシステムである。このシステムでは、対象の車両に付近する自動車を認識する後、自動車の動きを予測する。

自然言語処理プロンプトエンジニアリング検出画像テキスト
用途
自動車が対象の車両に付きそわせるシステム
難易度
Hard
コスト
High
arxivPaper only2026-07-22

SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation

SOPD-SocialNav は、学習モデルを小さなロボットに伝える技術であり、ロボットが環境と人間の行動を理解し、ナビゲーションが行えるようにする。

深層学習軽量化・量子化テキストマルチモーダル
用途
ソーシャルなナビゲーションのための学習モデルを小さなロボットに伝える技術
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

Clinical Pathways は、ロボットが実際の環境で安全に動作するためのシステムである。これは、ロボットが病室で安全に作業し、医療スタッフや患者を守る。

品質予測/異常検知コンピュータビジョン動画認識検出異常検知マルチモーダル
用途
医療機関で使うロボットの安全性を確保するためのシステム
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

オリジナルのデータとZoom-Inのツールを組み合わせた方法、OmniReasonerを提案する。これにより、オリンモードルLLMsの長いオーディオビデオの論理的推論を改善できる。

MI向き品質予測/異常検知自然言語処理大規模言語モデル画像音声動画
用途
長いオーディオビデオの論理的推論を改善する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation

無線無人飛行機のルートプランニングでは、視空間と言語モデルを利用して安全なルートを生成する必要がある。この問題を解決するために、テスト時にモデルをスケールアップさせる方法を提案する。

コンピュータビジョンマルチモーダルテキスト
用途
無線無人飛行機のルートプランニングを改善する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency

自動運転のための計画とは、状況理解、タイムリーな推論、行動選択というものがあるが、しかし、これらの要素を組み合わせるのは難しい。これを解決するために、シーン理解を分離することによって、計画を安全かつ有効性のあるものにする

深層学習軽量化・量子化画像テキストマルチモーダル
用途
自動運転のための分離された計画システムを提案する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory

World Action Models(WAMs)は、ロボットマニピュレーションをモデル化するパラダイム。WAMsは、視覚ステートトランジションとロボットアクションを同時にモデル化する。しかし、既存のWAMsは、一定の時

自然言語処理プロンプトエンジニアリング画像テキスト動画
用途
多目的マニピュレーション問題を解決する
難易度
Hard
コスト
High
arxivPaper only2026-07-20

Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models

この研究では、混乱のないターゲットに可視化言語アクションモデルを適応させることを目的として、3つのモデルを使用して研究を行った。3つのモデルは、観察から直接行動へのマッピング、テキストチャインオブスロット、潜在的な反復ル

自然言語処理RAGテキストマルチモーダル
用途
可視化言語アクションモデルを混乱のないターゲットに適応させる
難易度
Hard
コスト
High
arxivPaper only2026-07-20

From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation

この論文では、ラインダブルロボットのための自発的アクション生成を実現することを目標とし、vision-language 指向性の指令によりロボットが自発的に動作することができることを示します。

コンピュータビジョン3D・点群生成画像3D
用途
ラインダブルロボットのための自発的アクション生成
難易度
Hard
コスト
High
arxivPaper only2026-07-17

Vision-Language-Motion Maps: An Open-Vocabulary, Uncertainty-Aware, Queryable Motion Attribute for 3D Scene Maps

この研究では、動的なシナリオを分析するために可視化した地図上にMotion Attributeを付与し、Language QueryによるMotion Attributeフィルタを使用して分析することができます。

自然言語処理大規模言語モデル3Dマルチモーダル
用途
可視化した地図上での動的なシナリオの分析
難易度
Hard
コスト
High
arxivPaper only2026-07-17

BayesContact: Uncertain Pose Estimation via Visuo-Tactile Proposals and Simulation-based Inference

この研究では、Vision-とTactile-based ProposalとSimulation-based Inferenceを組み合わせ、物体の位置と姿勢を推定する方法、BayesContactを提案しています。

センサ/時系列コンピュータビジョンセグメンテーションマルチモーダル
用途
視覚情報と触覚情報の融合によるロボットの動きの推定
難易度
Hard
コスト
High
arxivPaper only2026-07-16

Diffusion models recover accurate mixture weights despite score function insensitivity

スコアベース生成モデルにおけるモード分解能の向上を目的とした研究で、モード分解能がスコア関数に依存しておらず、生成サンプルから混合重みを推測できることを明らかにした。

深層学習Transformer生成マルチモーダル
用途
スコアベース生成モデルにおけるモード分解能の向上
難易度
Hard
コスト
High
arxivPaper only2026-07-13

Markov Chain Monte Carlo with Diffusion Paths

この研究では、マルコフ連鎖モンテカルロ法を改良し、多モーダル分布からサンプリングする能力を高めるための新しいアプローチを提案した。このアプローチでは、微分のノイズパスを使用することで、モデルの収束を高速化し、多モーダル分

自然言語処理ファインチューニングマルチモーダル
用途
マルコフ連鎖モンテカルロ
難易度
Hard
コスト
High
githubGitHubあり2026-07-10

multimind-sdk — Your SDK solves all of this. One interface. Unified logic. Local + hosted models. Fine-tuning. Agent tools. Enterprise-ready. Hybrid RAG.Star 🌟 if you like it!

GUI操作自動化に伴う停止判定、復讐、再検索に関する問題を解決し、 GUI操作自動化を実現するためのフレームワークを開発します。

自然言語処理大規模言語モデルマルチモーダル
用途
GUI操作自動化ツール
難易度
Easy
コスト
High
githubGitHubあり2026-07-03

EEGUnity — An open source tool for large-scale EEG datasets processing

ビデオ diffusioin trasformerは、ビデオの長さに依存しない推論能力を持っているが、この長さのエキサポレーションは実際には困難なものである。RIFLExという手法を開発し、ビデオ長さのエキサポレーション

コンピュータビジョンマルチモーダル
用途
ビデオ diffusioin trasformerで長さのエキサポレーション
難易度
Easy
コスト
High