video」の検索結果

134
githubGitHubあり2026-07-24

cvat — Computer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.

CVATは、機械学習用の業界標準のデータエンジンです。さまざまなスケールのチームが使用し、さまざまなスケールのデータに対応しています。

品質予測/異常検知コンピュータビジョンセグメンテーション分類検出画像
用途
データのラベル付けと管理
難易度
Easy
コスト
High
arxivPaper only2026-07-23

Climate-resilient electric vehicle charging infrastructure for sustainable cities: An interpretable causal-ensemble framework for preventive maintenance and low-carbon mobility

都市の電気自動車充電インフラは、可及的速やかに故障を予測・修理することで、耐久性と低炭素化を向上させる必要がある。機械学習を用い、故障を予測するモデルの開発を研究した。

説明可能センサ/時系列コンピュータビジョン動画認識予測テキスト
用途
都市の電気自動車充電インフラの耐久性向上
難易度
Hard
コスト
High
arxivPaper only2026-07-23

GraphVid: Interactive Graph-Controllable Video Generation

GraphVidは、グラフと文本から生成することができ、オブジェクトの複数の移動を正確に制御することができる。グラフではオブジェクトの動きを表す情報を保存し、文から生成の制約を指定することができる。

品質予測/異常検知生成AI動画生成生成画像テキスト
用途
コントロール可能なビデオ生成
難易度
Hard
コスト
High
arxivPaper only2026-07-23

ElasticTTT: Prior-Preserving Test-Time Tuning for Video Editing

ElasticTTTは、プログラムがテストのときに動作を調整できるようにした。方法は、テストのときにモデルが前のサンプルの情報と現在の情報を組み合わせて、ビデオを編集する際に正しく動作するようにした。

生成AI拡散モデル生成テキスト動画
用途
ビデオ編集時のテスト タイムチューニング
難易度
Hard
コスト
High
arxivPaper only2026-07-23

V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure

ビデオLMMの安全性を確認するために、新しい診断フレームワークを提案します。これらのフレームワークは、モデルの挙動、理解、セマンティクスを同時に考慮します。

自然言語処理大規模言語モデル画像テキスト動画
用途
ビデオ安全性デ-カリブレーションの診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Beyond Independent Optimization: Compression, MoE Routing, and Quantization Interactions in Multimodal Edge Intelligence

効率的な多モードの推論は、モデルの性能やFLOPCOuntだけでなく、移動、キャッシュ、変形、量化された表現を保存するコストやメモリ、エネルギーに関する制約にも制限されています。この論文では、最近のビジュアルトークン圧縮

品質予測/異常検知深層学習Transformer画像テキスト動画
用途
分析的コストと効率性を向上させるための多モードのエッジAIの効率化
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Sidewalk Moments: Are Richer Representations Always More Human-Aligned? Evidence from City-Walk Videos

この研究では、都市ウォークビデオを分析するために、4つのモダリティの表現(スペース時領域情報、時間平均画像、オーディオ符号化、テキストベースの表現)を使用しました。

MI向き品質予測/異常検知深層学習Transformer分類画像テキスト
用途
都市ウォークビデオの分析
難易度
Hard
コスト
High
githubGitHubあり2026-07-23

Causal-Forcing — [ICML 2026] Official codebase for "Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation" & Causal Forcing++

この論文では、Causal-Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive

品質予測/異常検知深層学習軽量化・量子化生成テキスト動画
用途
高品質のビデオ生成を実現する。
難易度
Easy
コスト
High
arxivPaper only2026-07-22

StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation

オフラインでの短時間の視覚生成が一般的な人間の行動の分析では、人間の行動の長期的な視覚生成は、実践的な長時間の視覚生成では実行不能である。StreamHOI は、人間間の視覚的な行動の生成を生成したいくつの画像を使用して

MI向き品質予測/異常検知深層学習Transformer生成画像動画
用途
人物間の相互作用による視覚生成
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

ビデオキャプション生成には、空間と時刻の理解が重要です。PercepCapアルゴリズムは、ビデオ入力を空間時刻認識に分解することで、生成されたキャプションの理解度が向上するとともに、空間時刻の誤差をより正確に検出でき、キ

品質予測/異常検知自然言語処理大規模言語モデル生成動画強化学習
用途
ビデオキャプション生成のための構造化された空間時刻の理解
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Self Gradient Forcing: Native Long Video Extrapolation

長時間ビデオエクストラポレーションには、高度な視覚的知能が必要です。Self Gradient Forcingアルゴリズムは、学生モデルを教師モデルから生成される歴史の下で学習させることで、長時間ビデオエクストラポレーシ

コンピュータビジョンセグメンテーション生成テキスト動画
用途
長時間ビデオエクストラポレーションのための自力勾配強制
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos

この研究では、ドローンで小さな物体を認識することを目的としたメモリ拡張型大規模言語モデルを開発しました。このモデルは、複雑なドローンの場面で、ユーザーの指示に従って物体を識別できるようになります。

自然言語処理大規模言語モデルセグメンテーション画像テキスト
用途
ドローンで物体認識を実行する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Robots Acquire Manipulation Skills in Seconds from a Single Human Video

HOST は、ロボットが人間の動作からスキルをすぐに習得できるシステムである。このシステムでは、ロボットは単一の人間の動作ビデオからスキルを習得し、既に習得したスキルを維持する。

自然言語処理RAG動画
用途
ロボットが人間の動作からスキルをすぐに習得できるシステム
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

Clinical Pathways は、ロボットが実際の環境で安全に動作するためのシステムである。これは、ロボットが病室で安全に作業し、医療スタッフや患者を守る。

品質予測/異常検知コンピュータビジョン動画認識検出異常検知マルチモーダル
用途
医療機関で使うロボットの安全性を確保するためのシステム
難易度
Hard
コスト
High
githubGitHubあり2026-07-22

Awesome-CVPR2026-CVPR2025-ICCV2025-CVPR2024-ECCV2026-ECCV2024-AIGC — A Collection of Papers and Codes for CVPR2026/CVPR2025/ICCV2025/CVPR2024/ECCV2026/ECCV2024 AIGC

CVPRに基づくAIを取り入れるための資料集を提供します。CVPR 2026、2025、2024、およびECCV 2024に基づくAIGCに関する研究論文とソフトウェアコードを含みます。

コンピュータビジョン3D・点群生成画像動画
用途
AIをCVPRに応用する
難易度
Easy
コスト
High
arxivGitHubあり2026-07-21

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

オリジナルのデータとZoom-Inのツールを組み合わせた方法、OmniReasonerを提案する。これにより、オリンモードルLLMsの長いオーディオビデオの論理的推論を改善できる。

MI向き品質予測/異常検知自然言語処理大規模言語モデル画像音声動画
用途
長いオーディオビデオの論理的推論を改善する
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor Fusion

この研究では、高空飛行の無信号位置指示のNGPS (Next-Generation Positioning System)というフレームワークを提案しました。NGPSは、GPSの信号を利用せずに位置推定を可能にします。N

センサ/時系列コンピュータビジョン動画認識検出生成画像
用途
高空飛行の無信号位置指示
難易度
Hard
コスト
High
arxivPaper only2026-07-21

WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory

World Action Models(WAMs)は、ロボットマニピュレーションをモデル化するパラダイム。WAMsは、視覚ステートトランジションとロボットアクションを同時にモデル化する。しかし、既存のWAMsは、一定の時

自然言語処理プロンプトエンジニアリング画像テキスト動画
用途
多目的マニピュレーション問題を解決する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Motion Primitive Discovery in a Humanoid Robot via Self-Organising Maps for Phase Recognition

行動モーター特徴は、社会認知や人間ロボットインターフェースなどの行動認識の核心です。人間ロボットのNICO用に、2段階のアーキテクチャを提案します。1段階目では、腕の移動を学習するSOMと、手の移動を学習するSOMを使用

コンピュータビジョン動画認識分類テキスト動画
用途
マニピュレーターの動作モーター特徴を解決する
難易度
Hard
コスト
High
arxivPaper only2026-07-20

O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

工場の中の異常が検出されるように設計された機械学習モデルを提案しています。通常の方法では、モデルはビデオ内のすべての内容を考慮し、複雑な問題を解決することは困難です。提案されたモデルのアプローチは、オブジェクトを検出して

説明可能品質予測/異常検知自然言語処理ファインチューニング検出異常検知テキスト
用途
産業ビデオの異常発生検出
難易度
Hard
コスト
High
arxivPaper only2026-07-20

Leveraging Two Robotic Arms for Tight Assembly Performance Gains

この研究では、2 つのロボット腕を同時に使用することで、緊張組立て操作のパフォーマンスを向上させる end-to-end フレームワークを提供します。ロボット腕は、 CAD モデルの数字、そして望ましい組み立て状態に置か

品質予測/異常検知自然言語処理RAG動画
用途
2本のロボットアームによる組み立て
難易度
Hard
コスト
High
arxivGitHubあり2026-07-17

DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction

多タスク学習はロボティクスの視覚理解系で、セマンティック セグメンテーションと深度推定の統合をサポートします。視覚基底モデル(VFM)は強力な特徴エンコーダとして広く採用されていますが、既存のデコード戦略は重要なボトルネ

深層学習Transformerセグメンテーション動画3D
用途
ロボティクスの多タスク学習による3D空間理解
難易度
Hard
コスト
High
githubGitHubあり2026-07-14

memvid — Memory layer for AI Agents. Replace complex RAG pipelines with a serverless, single-file memory layer. Give your agents instant retrieval and long-term memory.

MemVidは、サーバーレスで単一ファイルの記憶層を提案し、AIエージェントが即時検索と長期的な記憶を持つようにする記憶層です。

自然言語処理大規模言語モデル生成テキスト動画
用途
AIエージェントの記憶を管理する
難易度
Easy
コスト
High