245 articles

Category

コンピュータビジョン

画像分類、検出、セグメンテーション、動画認識など、視覚AIの実装と評価に関係する技術群です。

物体検出セグメンテーション画像分類3D・点群動画認識マルチモーダル

人気記事

新着記事

未読 245
githubGitHubあり2026-07-24

cvat — Computer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.

CVATは、機械学習用の業界標準のデータエンジンです。さまざまなスケールのチームが使用し、さまざまなスケールのデータに対応しています。

品質予測/異常検知コンピュータビジョンセグメンテーション分類検出画像
用途
データのラベル付けと管理
難易度
Easy
コスト
High
arxivPaper only2026-07-23

Barzilai-Borwein Fails Superlinear Convergence on an Open Set of Quadratics for Every Dimension $n\geq 4$

バルザリ=ボレイン法のスーパー非線形収束問題に関する論文を発表しました。この論文では、バルザリ=ボレイン法が非線形収束できないオープン集合のすべての二次型問題に対してスーパー非線形収束できないことを示しました。これは、強

コンピュータビジョンセグメンテーション
用途
最適化アルゴリズムの検証
難易度
Hard
コスト
Medium
arxivPaper only2026-07-23

Climate-resilient electric vehicle charging infrastructure for sustainable cities: An interpretable causal-ensemble framework for preventive maintenance and low-carbon mobility

都市の電気自動車充電インフラは、可及的速やかに故障を予測・修理することで、耐久性と低炭素化を向上させる必要がある。機械学習を用い、故障を予測するモデルの開発を研究した。

説明可能センサ/時系列コンピュータビジョン動画認識予測テキスト
用途
都市の電気自動車充電インフラの耐久性向上
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Context-weighted Discrete Flow Matching

ディスクリートフロー・マッチングにおけるコンテキストの正しい有用性の利用を検討した。この研究では、ディスクリートフロー・マッチングのモデルの正確さを高めるためにコンテキストの有用性を適切に利用する方法を提案した。

品質予測/異常検知コンピュータビジョンセグメンテーション生成テキスト
用途
ディスクリートフロー・マッチングにおけるコンテキストの有用性
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Best-of-Evidence: Best-of-N Selection under Partial Verification

モデル出力の選択のためのBoN(ベストオブナ)を、部分検証が含まれるビジョン言語タスクに適用する。この方法により、モデル出力を効率化できる。

品質予測/異常検知コンピュータビジョンセグメンテーション生成マルチモーダル
用途
部分検証を含むビジョン言語タスクを効率化する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

The Second LoViF 2026 Challenge on Real-World All-in-One Image Restoration: Methods and Results

LoViF の 2 回目のチャレンジでは、画像修復に新たなアプローチを提案しています。実世界の画像を修復するための包括的な評価基準を提供しており、低光照度、ハッジ、雨、雪などのさまざまな障害に対する解決策を研究者に求めて

コンピュータビジョン画像
用途
画像修復
難易度
Hard
コスト
Medium
arxivPaper only2026-07-23

Loss Landscape Topology Reveals Why Simple Baselines are Competitive at 3D Point Cloud Segmentation Under Class Imbalance

3D点群のセグメンテーションではクラス不均衡が発生し、有効な解決策が必要です。この研究では、11 つの不均衡対策を 2D のコンピュータビジョンとは異なる 3D の上で評価し、標準的な交差エントロピーと均衡の重み付けが競

コンピュータビジョンセグメンテーションテキスト3D
用途
3D点群のセグメンテーション
難易度
Hard
コスト
High
arxivPaper only2026-07-23

The RealDefocus Benchmark for Defocus Deblurring

ドリフス脱失は画像を再構築するために不可欠ですが、再構築画像とドリフス画像のペアリングや標準化されたプロトコルなどの要件を満たすデータセットが不足しているため、評価が難しいです。この研究では、レアルワールドに基づくドリフ

品質予測/異常検知コンピュータビジョン画像
用途
ドリフス脱失の解除
難易度
Hard
コスト
High
arxivPaper only2026-07-23

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects

自動化された生理学ラボでは、透明なプラスチック製品を認識、位置付け、操作するために視覚知覚が必要ですが、対象となる高品質のリアルワールドデータセットは現在限られています。この研究では、複雑なマルチオブジェクトのシーンを扱

品質予測/異常検知コンピュータビジョンセグメンテーション画像3D
用途
膚質物体の可視化
難易度
Hard
コスト
High
githubGitHubあり2026-07-23

ml-agents — The Unity Machine Learning Agents Toolkit (ML-Agents) is an open-source project that enables games and simulations to serve as environments for training intelligent agents using deep reinforcement learning and imitation learning.

Unityを使用してマシンラーニングエージェントを訓練して訓練できるツールです。

コンピュータビジョン3D・点群3D強化学習
用途
Unityでマシンラーニングエージェント
難易度
Easy
コスト
High
arxivPaper only2026-07-22

Statevector-Referenced Geometry Survival of a Four-Qubit ZZ Quantum Kernel on IBM Quantum Hardware: A Fixed-Subset Diagnostic Across Three Execution Configurations

この研究では、IBM Quantum ハードウェア上で実行される4キュビットの量子カーネルについて、スルーハードウェアで状態ベクトルを使用して、グラム行列における幾何学的情報の実行時の正確性を検証した。

品質予測/異常検知コンピュータビジョンセグメンテーション分類予測
用途
クラウド上の量子コンピュータの実行環境への適切化
難易度
Hard
コスト
Low
arxivPaper only2026-07-22

Nuclear Quantum Effects as a Denoising Problem

この研究では、核量子効果をシミュレートするために、画像時刻パス積分を利用した分散機械学習アルゴリズムを提案します。このアルゴリズムは、分散機械学習を利用して核量子効果をシミュレートすることに成功し、核量子効果に関連する問

MI向きコンピュータビジョンセグメンテーション生成テキスト
用途
核量子効果のシミュレーション
難易度
Hard
コスト
High
arxivPaper only2026-07-22

RALS: Resources and Baselines for Romanian Automatic Lexical Simplification

文語の簡素化は、言語学習者の理解を促進するための有効な手法ですが、現在実際に有効であるかどうかが確立されていません。ルーマニア語で文語の簡素化に関する基準とリソースが作成されました。

コンピュータビジョンセグメンテーションテキスト
用途
文語の簡素化のためのルーマニア語のリソースと基準
難易度
Hard
コスト
Medium
arxivPaper only2026-07-22

Self Gradient Forcing: Native Long Video Extrapolation

長時間ビデオエクストラポレーションには、高度な視覚的知能が必要です。Self Gradient Forcingアルゴリズムは、学生モデルを教師モデルから生成される歴史の下で学習させることで、長時間ビデオエクストラポレーシ

コンピュータビジョンセグメンテーション生成テキスト動画
用途
長時間ビデオエクストラポレーションのための自力勾配強制
難易度
Hard
コスト
High
arxivGitHubあり2026-07-22

Silent Failures in Multimodal Agentic Search:A Diagnostic Taxonomy and Cross-Judge Evaluation

この研究では、可視化された質問への対応を評価するために、新しい方法を提案しました。この方法は、質問への回答の正確性だけでなく、質問への回答のパターンや特徴も評価することができます。

品質予測/異常検知コンピュータビジョンマルチモーダルQA画像
用途
可視化された質問への対応を評価する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

DRGBT-1K: A Large-scale High-quality Benchmark for Dynamic RGBT Tracking

地上を表す重力式マップの高解像度版が、多くの用途で役立ちます。たとえば、市区町村の変化を監視したり、エネルギー対策を向上させたり、温室効果ガスの排出量を追跡したりすることができます。4つの主要な全世界建物Rasterデー

センサ/時系列品質予測/異常検知コンピュータビジョン物体検出検出マルチモーダル
用途
宇宙に分布する建物の面積を正確に推定する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Global Building Area Estimation Products: How Accurate Are They?

大規模視点合成モデルは、視点間の注意を交差させることで、未知の視点から3Dシーンを推論します。近年、そのようなモデルはRGB情報だけで3Dの空間関係を学習することができたため、近年の研究者たちは、3Dセグメンテーションに

コンピュータビジョン
用途
新たな視点から3Dシーンを推論する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Extreme-RGMT: Continual Learning of Highly Dynamic Skills for Robust Generalist Humanoid Control

Extreme-RGMT は、高動的運動を複数のエンバーでロボットが実行できる制御システムである。ロボットは一般目的(一般運動)と専門的な運動能力(専門的な目的)を両方持つことができ、人工的な環境で人間が実行する運動を学

コンピュータビジョンセグメンテーション
用途
人物の高動的運動を複数のエンバーするロボット制御
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

Clinical Pathways は、ロボットが実際の環境で安全に動作するためのシステムである。これは、ロボットが病室で安全に作業し、医療スタッフや患者を守る。

品質予測/異常検知コンピュータビジョン動画認識検出異常検知マルチモーダル
用途
医療機関で使うロボットの安全性を確保するためのシステム
難易度
Hard
コスト
High
githubGitHubあり2026-07-22

Awesome-CVPR2026-CVPR2025-ICCV2025-CVPR2024-ECCV2026-ECCV2024-AIGC — A Collection of Papers and Codes for CVPR2026/CVPR2025/ICCV2025/CVPR2024/ECCV2026/ECCV2024 AIGC

CVPRに基づくAIを取り入れるための資料集を提供します。CVPR 2026、2025、2024、およびECCV 2024に基づくAIGCに関する研究論文とソフトウェアコードを含みます。

コンピュータビジョン3D・点群生成画像動画
用途
AIをCVPRに応用する
難易度
Easy
コスト
High
arxivPaper only2026-07-21

The Price of Hidden Curvature: An $\widetildeΩ (d^{5/4} \sqrt{T})$ Lower Bound for Bandit Convex Optimization

この文書では、バンディット型凸最適化の最小公倍数期待誤差について、最初の非ゼロの誤差下限を提案しました。これは、2次元空間で構成された凸関数のハードクラスであり、ドメインのサイズdとデータ数Tの関数です。

コンピュータビジョンセグメンテーション
用途
バンディット型凸最適化の下限
難易度
Hard
コスト
Medium
arxivPaper only2026-07-21

Selection Shapes the Boundary: A Preregistered Replication of Monotonicity and Label Agreement in Unselected NLI Populations

人間が与えるラベル相違を研究した研究では、主に分異議のあるデータを選んで分析したところ、非上昇漸近性オペレータを持つ仮説がChaosNLIで低いラベル相互に関連性があると結論づけた。しかしながら、データが選択されていない

品質予測/異常検知コンピュータビジョンセグメンテーション分類テキスト
用途
NLIデータのラベル相違の境界の検証
難易度
Hard
コスト
Low
arxivPaper only2026-07-21

ERank in Latent Space as an Image-Complexity and Richness Measure

計算機ビジョンと画像認識では、画像の視覚的なリッチネスを評価するために有用な指標が求められるが、これまでの指標は制限があった。この問題を解決するために、チャンネル空間の分散を利用した指標を提案する。

コンピュータビジョンセグメンテーション分類画像
用途
画像の視覚的なリッチネスを評価するための新しい指標を提案する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

From Distances to Trajectories: Real-Time Signed Distance Function Mapping and Distance-Accelerated Motion Planning for UAVs

難しい環境で運用するためには、自動空飛ブイロード(UAV)が実際に障害物に存在する距離を判断し、安全な軌跡を計画することが求められる。 これを行うために、複数のステージ(マッピングと計画)を連続化した、サイン・ディスタン

コンピュータビジョンセグメンテーション検出3D
用途
UAVの安全な運用
難易度
Hard
コスト
High
arxivPaper only2026-07-21

No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation

無線無人飛行機のルートプランニングでは、視空間と言語モデルを利用して安全なルートを生成する必要がある。この問題を解決するために、テスト時にモデルをスケールアップさせる方法を提案する。

コンピュータビジョンマルチモーダルテキスト
用途
無線無人飛行機のルートプランニングを改善する
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor Fusion

この研究では、高空飛行の無信号位置指示のNGPS (Next-Generation Positioning System)というフレームワークを提案しました。NGPSは、GPSの信号を利用せずに位置推定を可能にします。N

センサ/時系列コンピュータビジョン動画認識検出生成画像
用途
高空飛行の無信号位置指示
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Motion Primitive Discovery in a Humanoid Robot via Self-Organising Maps for Phase Recognition

行動モーター特徴は、社会認知や人間ロボットインターフェースなどの行動認識の核心です。人間ロボットのNICO用に、2段階のアーキテクチャを提案します。1段階目では、腕の移動を学習するSOMと、手の移動を学習するSOMを使用

コンピュータビジョン動画認識分類テキスト動画
用途
マニピュレーターの動作モーター特徴を解決する
難易度
Hard
コスト
High
arxivPaper only2026-07-20

Optimizing the Preconditioner: A Black-box Online-to-Nonconvex Conversion with Static Regret Minimization Oracles

この研究では、非凸最適化をオナミ式最適化と変換する方法を提案します。この変換は、静的遺憲最適化の学習者が順列的グレードトラッカーを維持し、静的遺憲最適化では選択できるプレダクターコンパラタートを選択することで実現されます

コンピュータビジョンセグメンテーション
用途
非凸最適化のバックボックス変換
難易度
Hard
コスト
Medium
arxivPaper only2026-07-20

UMCP: A Unified Multi-Task Collaborative Perception Network for Luggage Trolley Pose Estimation

ロボット車の視覚システムは、高精度でリアルタイム性能を持つロジスティクス車両の位置検出を実現する必要があります。従来の手法では、複数のモデルが連続してインフェレンズされ、インフェレンスラティシーが増加し、高規模デプロイメ

コンピュータビジョン物体検出検出画像
用途
luggage trolleyの位置推定
難易度
Hard
コスト
Medium
arxivPaper only2026-07-20

From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation

この論文では、ラインダブルロボットのための自発的アクション生成を実現することを目標とし、vision-language 指向性の指令によりロボットが自発的に動作することができることを示します。

コンピュータビジョン3D・点群生成画像3D
用途
ラインダブルロボットのための自発的アクション生成
難易度
Hard
コスト
High
arxivPaper only2026-07-17

On the Role of Normalization in Binary Iterative Hard Thresholding for 1-bit Compressed Sensing

1ビット圧縮センシングは、情報が圧縮された状態で保存され、データ量の最適化が必要で、この問題を解決するために、Binary Iterative Hard Thresholding(BIHT)を最適化する方法を提案。

説明可能センサ/時系列コンピュータビジョンセグメンテーション
用途
1ビット圧縮センシングの最適化
難易度
Hard
コスト
Medium
arxivPaper only2026-07-17

BayesContact: Uncertain Pose Estimation via Visuo-Tactile Proposals and Simulation-based Inference

この研究では、Vision-とTactile-based ProposalとSimulation-based Inferenceを組み合わせ、物体の位置と姿勢を推定する方法、BayesContactを提案しています。

センサ/時系列コンピュータビジョンセグメンテーションマルチモーダル
用途
視覚情報と触覚情報の融合によるロボットの動きの推定
難易度
Hard
コスト
High
arxivPaper only2026-07-16

Delocalization of bias in unadjusted Hamiltonian Monte Carlo and underdamped Langevin

この研究では、調整されていない HMC と Langevin Sampler の偏りの解消について議論しました。調整されていないサンプラーは、通常、偏りのあるものであることが知られています。この研究

コンピュータビジョンセグメンテーション検出
用途
HMC と Langevin Sampler の偏りの解消
難易度
Hard
コスト
Medium
arxivPaper only2026-07-16

Post Hoc Inference for Component Attribution in Multivariate Change-Point Detection

時系列データを観察し、その中に分割が起こっているかどうかを検知する方法はある。時間系列変化点を検知することができ、変化点の位置がどこにあるかを推定することができる。

センサ/時系列コンピュータビジョンセグメンテーション検出時系列
用途
時系列データの分割探知
難易度
Hard
コスト
Low
arxivPaper only2026-07-16

Precise sample covariance spectral norm error -- an RDT view

この研究では、サンプル協方差行列の精度を向上させる方法を検討しました。特に、サンプルサイズが小さく、収集されたデータの特性から、正解率の期待値は小さい場合に、問題が最も発生しやすくなる可能性があります。この研究では、正解

コンピュータビジョンセグメンテーションテキスト
用途
サンプル协方差行列の精度を向上させる
難易度
Hard
コスト
Medium
arxivPaper only2026-07-16

PAC Learning in Turn-Based Stochastic Games with Reachability Objectives: A Decentralized Private Approach via Expected Conditional Distance

この研究は、多人数確率ゲームへのPAC学習を研究することに関心があります。PAC学習は、機械学習モデルの確信度を高めると同時に、モデルの誤差を低下させるものです。

コンピュータビジョンセグメンテーション強化学習
用途
多人数確率ゲームへのPAC学習を研究する
難易度
Hard
コスト
Medium
arxivPaper only2026-07-15

Non-Expansive Two-Time-Scale Stochastic Approximation: A Fixed-Schedule One-Quarter Barrier and Bias-Corrected Acceleration

不拡張確率過程を用いた解析を行い、時刻スケールに基づいて過程を分解します。この分解により、遅いスケールに基づく収束の分析が実現されます。

コンピュータビジョンセグメンテーション
用途
多相の時刻スケールをもつ不拡張確率過程の解析
難易度
Hard
コスト
Medium
arxivPaper only2026-07-13

Difference-Driven Gating: Adaptive Feature Fusion for U-Net Decoder

この研究では、新しい特徴融合手法を提案した。この手法は、上からの特徴と下からの特徴の関係性を考慮することで、特徴を効率的に融合し、三次元データを2次元サムライグラフにコンパクトに表現する機能をもたらせる。

センサ/時系列コンピュータビジョンセグメンテーション画像音声
用途
特徴融合
難易度
Hard
コスト
Medium
arxivPaper only2026-07-10

Deep Gaussian Processes on Directed Acyclic Graphs

この研究は、多くの現実世界のプロセスがディレクトグラフ(DAG)上で実装できることを証明しました。 DAG上の関数の部分観測、観測のノイズや不規則な測定値は、機能の再構成、不確実性の伝播、推定に大きな障壁となることがあり

説明可能コンピュータビジョンセグメンテーション
用途
DAG上での実験結果の再構成
難易度
Hard
コスト
Medium
arxivPaper only2026-07-06

A Large-Scale Sparse Multiobjective Optimization Algorithm Based on Optimal Performance Scores

この論文では、大規模スパース多目標最適化の問題に取り組むために、新しく提唱された適応可能な初期値生成アルゴリズムを提案し、アルゴリズムの効率とパフォーマンスを評価する。

品質予測/異常検知コンピュータビジョンセグメンテーション生成
用途
大規模スパース多目標最適化
難易度
Hard
コスト
Medium
githubGitHubあり2026-07-03

EEGUnity — An open source tool for large-scale EEG datasets processing

ビデオ diffusioin trasformerは、ビデオの長さに依存しない推論能力を持っているが、この長さのエキサポレーションは実際には困難なものである。RIFLExという手法を開発し、ビデオ長さのエキサポレーション

コンピュータビジョンマルチモーダル
用途
ビデオ diffusioin trasformerで長さのエキサポレーション
難易度
Easy
コスト
High
arxivPaper only2026-07-01

Online Fair Division Meets Reordering Buffers

この研究では、個人的な価値が付与されたアイテムを公平に分配する問題を研究します。アイテムは個人の価値を付与することがあり、アイテムの分配が公平または公正ではない場合があります。この研究では、分配に公平性を考慮する方法を提

コンピュータビジョンセグメンテーション
用途
分配問題の公平性
難易度
Hard
コスト
Medium
arxivPaper only2026-06-26

Discrete Event Population Updates: finding game theoretic emergent behaviour in queueing systems with simulation

カウントアップし合うゲームでは、プレイヤーが行動を決定し、他のプレイヤーにも反映されるメカニズムが含まれます。ゲーム理論を用いて、プレイヤーがどのような戦略で行動するかを分析し、それを計算を含むモデルとして表現することで

MI向きコンピュータビジョンセグメンテーション
用途
カウントアップし合うゲームの分析
難易度
Hard
コスト
Medium