3d」の検索結果

95
arxivPaper only2026-07-23

GrainGS: Gradient-Decoupled Gaussian Splatting for Efficient Dynamic Novel View Synthesis

3Dガウシアンスプレイティングによる動的なシーン再構成は、動的なモーションモデリング、構造的安定性とコンパクトな表現のバランスをとることが求められる。実際、既存のprimitive毎に実際に実装されている方法はローカルの

品質予測/異常検知深層学習軽量化・量子化生成3D
用途
3D Gaussian Splatting動的シーン再構成
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

DAPM: UAV Monocular Depth Estimation from Any Height, Pitch, Roll and FOV

UAVは、高度、ピッチ、ロール、FOVの変動を含む高度なカメラポーズにおいて動作するため、非対称分布の深さが含まれる広範な空中画像におけるモノラル深度推定を実現するには、高度な深度推定手法が必要である。ほとんどの推定手法

深層学習軽量化・量子化画像3D
用途
UAV用モノラル深度推定
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Loss Landscape Topology Reveals Why Simple Baselines are Competitive at 3D Point Cloud Segmentation Under Class Imbalance

3D点群のセグメンテーションではクラス不均衡が発生し、有効な解決策が必要です。この研究では、11 つの不均衡対策を 2D のコンピュータビジョンとは異なる 3D の上で評価し、標準的な交差エントロピーと均衡の重み付けが競

コンピュータビジョンセグメンテーションテキスト3D
用途
3D点群のセグメンテーション
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models

大規模言語モデルのハロウィーン診断では、対象の 3D 空間関係を推論する際に、視覚化が欠如していることが問題となります。この研究では、これらのハロウィーンを軽減するためのアプローチを提案しています。

自然言語処理大規模言語モデル画像テキスト3D
用途
3D空間推論のハロウィーン診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects

自動化された生理学ラボでは、透明なプラスチック製品を認識、位置付け、操作するために視覚知覚が必要ですが、対象となる高品質のリアルワールドデータセットは現在限られています。この研究では、複雑なマルチオブジェクトのシーンを扱

品質予測/異常検知コンピュータビジョンセグメンテーション画像3D
用途
膚質物体の可視化
難易度
Hard
コスト
High
arxivPaper only2026-07-23

ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments

オブジェクト目標のナビゲーションにおける、動的な避け方とマルチフロア環境を考慮した、ゼロショットオブジェクトナビゲーションのフレームワークを提案します。このフレームワークでは、動的な人々とマルチフロア環境を考慮しながら、

自然言語処理ファインチューニングテキスト3Dマルチモーダル
用途
マルチフロアにおけるオブジェクト目標のナビゲーション
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

3D オキュピエンシー予測には、物体の配置と密度を解釈するための視覚的手法が必要です。従来の方法では、計算コストが高くなりすぎていたが、新しく提案されたGaussianSeedアルゴリズムは、層を階層化することで、計算コ

品質予測/異常検知自然言語処理大規模言語モデル生成テキスト
用途
3次元空間における物体の配置と密度の予測
難易度
Hard
コスト
High
arxivPaper only2026-07-22

STEREOFLOW: Progressive Stereo Matching with StereoDiT and Transition Flow Matching

ステレオマッチングは3次元再構成において重要なタスクです。この研究では、ステレオマッチングを確率的生成タスクと組み合わせ、オブジェクト検出の向上を目的として、ステレオマッチングフレームワークと潜在分配を統合する方法を提案

深層学習Transformer生成回帰画像
用途
オブジェクト検出の向上
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Look Before You Edit: Attention-Guided Camera Placement and Multi-View Alignment for 3D Gaussian Splatting Editing

DRGBTトラッキングの分野では、目標物を変動するセンシングモデリティと観測プラットフォームの条件下で追跡することが求められます。ドリフト、視線、時間の条件変化に関しても検討が必要です。ただし、現在のバenchmarkで

深層学習Transformerテキスト3D
用途
DRGBTトラッキングを改善
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Global Building Area Estimation Products: How Accurate Are They?

大規模視点合成モデルは、視点間の注意を交差させることで、未知の視点から3Dシーンを推論します。近年、そのようなモデルはRGB情報だけで3Dの空間関係を学習することができたため、近年の研究者たちは、3Dセグメンテーションに

コンピュータビジョン
用途
新たな視点から3Dシーンを推論する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation

自律ロボットには、障害物や事故の回避能力が必要です。これは、障害物や事故の回避能力が強化されていれば、障害物や事故に対しての対策がより効果的になります。障害物や事故の回避能力が強まることで、ロボットが障害物や事故から安全

品質予測/異常検知自然言語処理ファインチューニング生成セグメンテーション画像
用途
自動ロボットが障害物や事故を回避できるようにする
難易度
Hard
コスト
High
arxivPaper only2026-07-22

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

Language-Guided Grasping は、複雑なシーンで物体の把持を行うために、視覚言語モデル(VLM)を用いる。このアプローチでは、VLM は直接把持を予測するのではなく、3 次元空間における把持の位置を指

深層学習軽量化・量子化生成テキスト3D
用途
複雑なシーンで物体の把持を実現
難易度
Hard
コスト
High
arxivPaper only2026-07-21

From Distances to Trajectories: Real-Time Signed Distance Function Mapping and Distance-Accelerated Motion Planning for UAVs

難しい環境で運用するためには、自動空飛ブイロード(UAV)が実際に障害物に存在する距離を判断し、安全な軌跡を計画することが求められる。 これを行うために、複数のステージ(マッピングと計画)を連続化した、サイン・ディスタン

コンピュータビジョンセグメンテーション検出3D
用途
UAVの安全な運用
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Anatomy-Aware 3D Mesh Refinement of Pericardium Segmentations on Computed Tomography

心臓の囲みの区別は、食道肥厚の測定に重要であるが、しかし、これを正確に区別することは難しい。これを解決するために、周囲の解剖学的構造を利用して囲みの区別を改善する方法を提案する。

自然言語処理RAGセグメンテーション画像テキスト
用途
心臓CT画像から心臓の囲みを正確に区別する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Beyond Transformers: Linear Attention Policy for Open-Vocabulary Object Goal Navigation

オープン・バグナビゲーションには、エージェントへの部分観測が含まれます。パフォーマンスの向上のために、内部状態更新が重要です。これを実現するには、ポリシーネットワークの更新が必要です。最近のアプローチでは、トランスフォー

深層学習Transformerテキスト3D
用途
オープン・バグナビゲーション問題を解決する
難易度
Hard
コスト
High
arxivPaper only2026-07-20

Calibrated Alzheimer's Conversion Risk in Mild Cognitive Impairment: Persistent Homology of Clinical Trajectories with Conformal Guarantees

この論文では、アルツハイマー病の予測を行うためにPersistent HomologyとConformal Guaranteeという手法を提案する。この手法は、アルツハイマー病の予測を行うために、時間的な軌道を分析するこ

説明可能自然言語処理RAG3D
用途
アルツハイマー病の予測を行う
難易度
Hard
コスト
High
arxivPaper only2026-07-20

Lifelong Localization in Dynamic Indoor Environments Combining Odometry with Sparse Distance Sampling

自律ロボットの位置決めは、ロボットナビゲーションの主要なタスクです。ロボットが予測できない、非静的な障害物、またはロボットが未知の環境に入ることが多い。この研究では、ロボットのオドメトリと距離サンプリングを組み合わせて、

センサ/時系列自然言語処理RAG検出3D
用途
自律ロボットの位置推定
難易度
Hard
コスト
High
arxivPaper only2026-07-20

Receiver-Centered Robot-to-Human Handover with Grasp-Aware Object Orientation

共役ロボットは、人間オペレータと同梱するワークスペースを共有し、機械手のハンドオーバーなどの安全性の高いマイクロイベント頻繁に発生します。但し、従来の静的なハンドオーバーは、非対称の産業工具を取り扱う際、不自然な抓を持つ

自然言語処理大規模言語モデル分類3D
用途
道具のハンドオーバー
難易度
Hard
コスト
High
arxivPaper only2026-07-20

From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation

この論文では、ラインダブルロボットのための自発的アクション生成を実現することを目標とし、vision-language 指向性の指令によりロボットが自発的に動作することができることを示します。

コンピュータビジョン3D・点群生成画像3D
用途
ラインダブルロボットのための自発的アクション生成
難易度
Hard
コスト
High
arxivPaper only2026-07-17

Cluster-Aware Matching via Laplacian Optimal Transport

この論文では、インフラリーダーの観点から安全交通のアセスメントを行うためのフレームワーク、PRISAを提案する。このフレームワークは、道路状況の観測と交通安全の評価を提供し、交通渋滞や事故を予測することで安全交通の実現を

説明可能品質予測/異常検知自然言語処理RAG3D
用途
交通渋滞や事故を予測するためのインフラリーダーによる監視技術の開発
難易度
Hard
コスト
High
arxivPaper only2026-07-17

Vision-Language-Motion Maps: An Open-Vocabulary, Uncertainty-Aware, Queryable Motion Attribute for 3D Scene Maps

この研究では、動的なシナリオを分析するために可視化した地図上にMotion Attributeを付与し、Language QueryによるMotion Attributeフィルタを使用して分析することができます。

自然言語処理大規模言語モデル3Dマルチモーダル
用途
可視化した地図上での動的なシナリオの分析
難易度
Hard
コスト
High
arxivGitHubあり2026-07-17

DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction

多タスク学習はロボティクスの視覚理解系で、セマンティック セグメンテーションと深度推定の統合をサポートします。視覚基底モデル(VFM)は強力な特徴エンコーダとして広く採用されていますが、既存のデコード戦略は重要なボトルネ

深層学習Transformerセグメンテーション動画3D
用途
ロボティクスの多タスク学習による3D空間理解
難易度
Hard
コスト
High