image」の検索結果

327
githubGitHubあり2026-07-24

Medical_Image_Analysis — Foundation models based medical image analysis

医学画像分析は、医療の診断や治療を支援するために画像に記載されたデータから情報を抽出する研究分野です。この研究では、foundation modelsを用い、医療画像分析のための新しいアプローチを提案しました。found

自然言語処理大規模言語モデル生成画像テキスト
用途
医学画像分析
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

cvat — Computer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.

CVATは、機械学習用の業界標準のデータエンジンです。さまざまなスケールのチームが使用し、さまざまなスケールのデータに対応しています。

品質予測/異常検知コンピュータビジョンセグメンテーション分類検出画像
用途
データのラベル付けと管理
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

sglang — SGLang is a high-performance serving framework for large language models and multimodal models.

SGLangは、大規模言語モデルのサービングフレームワークです。このライブラリは、高性能なサービスフレームワークで、大規模言語モデルのサービングをサポートしています。

深層学習Transformer画像テキストマルチモーダル
用途
大規模言語モデルのサービングフレームワーク
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

qdrant — Qdrant - High-performance, massive-scale Vector Database and Vector Search Engine for the next generation of AI. Also available in the cloud https://cloud.qdrant.io/

このリポジトリでは、データとAIアルゴリズムを製品化するためのプラットフォームであるTaipyを提供しています。

自然言語処理埋め込み・検索生成画像
用途
AIアプリケーションを製品化するためのプラットフォーム
難易度
Easy
コスト
Low
githubGitHubあり2026-07-24

presidio — An open-source framework for detecting, redacting, masking, and anonymizing sensitive data (PII) across text, images, and structured data. Supports NLP, pattern matching, and customizable pipelines.

presidioは、テキスト、画像、構造化データを含む敏感データを検出、削除、マスク、アノニマイズするオープンソースフレームワークです。自然言語処理、パターンマッチング、カスタマイズ可能なパイプラインをサポートします。

表形式向き深層学習Transformer分類検出画像
用途
データのプライバシーを保護する
難易度
Easy
コスト
Low
arxivPaper only2026-07-23

Synthetic data generation framework for quality control automation in gravure printing

印刷品質管理技術のための新しいアプローチであるシンセティック データ生成フレームワークを提案しました。このフレームワークは、ロトグラビューグラビング技術における品質管理のためのシンセティック データを生成することで、印刷

品質予測/異常検知画像検査深層学習Transformer検出生成画像
用途
印刷品質管理技術の開発
難易度
Hard
コスト
High
arxivPaper only2026-07-23

MIRROR: Learning from the Other View for Multi-Modal Reasoning

多モーダル理解技術のための新しいアプローチであるMIRROR(Learning from the Other View)を提案しました。MIRRORは、テキスト、図、テキストと図の組み合わせから同等の視点を提供することで

品質予測/異常検知自然言語処理大規模言語モデル画像テキストマルチモーダル
用途
多モーダル理解技術の開発
難易度
Hard
コスト
High
arxivPaper only2026-07-23

GraphVid: Interactive Graph-Controllable Video Generation

GraphVidは、グラフと文本から生成することができ、オブジェクトの複数の移動を正確に制御することができる。グラフではオブジェクトの動きを表す情報を保存し、文から生成の制約を指定することができる。

品質予測/異常検知生成AI動画生成生成画像テキスト
用途
コントロール可能なビデオ生成
難易度
Hard
コスト
High
arxivPaper only2026-07-23

V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure

ビデオLMMの安全性を確認するために、新しい診断フレームワークを提案します。これらのフレームワークは、モデルの挙動、理解、セマンティクスを同時に考慮します。

自然言語処理大規模言語モデル画像テキスト動画
用途
ビデオ安全性デ-カリブレーションの診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Beyond Independent Optimization: Compression, MoE Routing, and Quantization Interactions in Multimodal Edge Intelligence

効率的な多モードの推論は、モデルの性能やFLOPCOuntだけでなく、移動、キャッシュ、変形、量化された表現を保存するコストやメモリ、エネルギーに関する制約にも制限されています。この論文では、最近のビジュアルトークン圧縮

品質予測/異常検知深層学習Transformer画像テキスト動画
用途
分析的コストと効率性を向上させるための多モードのエッジAIの効率化
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

Inference-Time Scaling of Diffusion Models via Progressive Seed Pruning

ディフュージョンモデルにおける初期的なNoise Seed の影響が、モデルが生成する高質のイメージに大きく影響していることを提示し、Seed Search 時の時間的負荷を削減するための方法を提案した。

品質予測/異常検知深層学習軽量化・量子化生成画像テキスト
用途
ディフュージョンモデルのサケリング
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

DAPM: UAV Monocular Depth Estimation from Any Height, Pitch, Roll and FOV

UAVは、高度、ピッチ、ロール、FOVの変動を含む高度なカメラポーズにおいて動作するため、非対称分布の深さが含まれる広範な空中画像におけるモノラル深度推定を実現するには、高度な深度推定手法が必要である。ほとんどの推定手法

深層学習軽量化・量子化画像3D
用途
UAV用モノラル深度推定
難易度
Hard
コスト
High
arxivPaper only2026-07-23

The Second LoViF 2026 Challenge on Real-World All-in-One Image Restoration: Methods and Results

LoViF の 2 回目のチャレンジでは、画像修復に新たなアプローチを提案しています。実世界の画像を修復するための包括的な評価基準を提供しており、低光照度、ハッジ、雨、雪などのさまざまな障害に対する解決策を研究者に求めて

コンピュータビジョン画像
用途
画像修復
難易度
Hard
コスト
Medium
arxivPaper only2026-07-23

HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models

大規模言語モデルはさまざまな画像をテキストに変換する上で優れた性能を示しているが、発生するホログラフィックな診断にはまだ解決策が必要です。この研究では、主流の粗い検出方法の欠点を補うため、細部の診断方法を提案しています。

説明可能自然言語処理大規模言語モデル分類検出生成
用途
ホログラフィックハロウィーンの診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models

大規模言語モデルのハロウィーン診断では、対象の 3D 空間関係を推論する際に、視覚化が欠如していることが問題となります。この研究では、これらのハロウィーンを軽減するためのアプローチを提案しています。

自然言語処理大規模言語モデル画像テキスト3D
用途
3D空間推論のハロウィーン診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

The RealDefocus Benchmark for Defocus Deblurring

ドリフス脱失は画像を再構築するために不可欠ですが、再構築画像とドリフス画像のペアリングや標準化されたプロトコルなどの要件を満たすデータセットが不足しているため、評価が難しいです。この研究では、レアルワールドに基づくドリフ

品質予測/異常検知コンピュータビジョン画像
用途
ドリフス脱失の解除
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

空間理解は、物理世界と静的のセマンティック理解の間でつながるために不可欠です。多くの空間タスクは、場所、領域、パスの自然な表現は、ポインティングやマーキングなど、連続的な視覚的シーンで行われることが多いが、現行の空間推論

自然言語処理大規模言語モデル生成画像テキスト
用途
空間理解
難易度
Hard
コスト
High
arxivPaper only2026-07-23

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects

自動化された生理学ラボでは、透明なプラスチック製品を認識、位置付け、操作するために視覚知覚が必要ですが、対象となる高品質のリアルワールドデータセットは現在限られています。この研究では、複雑なマルチオブジェクトのシーンを扱

品質予測/異常検知コンピュータビジョンセグメンテーション画像3D
用途
膚質物体の可視化
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Do Pathology Vision-Language Models Truly See Pathology?

パスロジは、現在、パスロジ認識のための画像言語モデルを評価するために広く使用されていますが、この研究では、パスロジ認識において画像言語モデルの視覚知覚が機能していることを疑問に問っています。

自然言語処理大規模言語モデル画像テキストマルチモーダル
用途
パスロジの認識
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Unsupervised Metal Artifact Reduction in Dental CBCT using Fine-tuned Cycle-Consistent Adversarial Networks

この研究では、歯科CBCT画像中のメタルアーティファクトを除去するための循環互換的アドバーサリアルネットワーク(CycleGAN)を提案します。CycleGANを使用すると、メタルアーティファクトを除去した後、CBCT画

品質予測/異常検知自然言語処理RAG生成画像教師なし
用途
メタルアーティファクトの除去
難易度
Hard
コスト
Low
arxivPaper only2026-07-23

Sidewalk Moments: Are Richer Representations Always More Human-Aligned? Evidence from City-Walk Videos

この研究では、都市ウォークビデオを分析するために、4つのモダリティの表現(スペース時領域情報、時間平均画像、オーディオ符号化、テキストベースの表現)を使用しました。

MI向き品質予測/異常検知深層学習Transformer分類画像テキスト
用途
都市ウォークビデオの分析
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory Adjustment

人間の知能を模倣するクロアニオトミー手術のフレームワークを提案します。このフレームワークは、前方計画と後方実行を組み合わせて、手術中に手術台の位置を自動的に調整することで、人間と同様の安全で効率的な手順を実現します。

センサ/時系列深層学習Transformer検出画像音声
用途
クロアニオトミー手術の自動化
難易度
Hard
コスト
High
arxivPaper only2026-07-23

GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning

視覚モータリティポリシーを学習する際、人間が視覚アタッチメントを理解し、修正できるようにするため、視覚アタッチメントを明示的にしたフレームワークを提案します。

説明可能生成AI拡散モデル異常検知画像
用途
ロボットマニュピュレーションの視覺アタッチメント
難易度
Hard
コスト
High
arxivPaper only2026-07-23

TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation

オートメーションされたマニピュレーションを目的とした、大規模なテーブルトップのデータセットであるTableVerse を提案します。このデータセットには、物理的に可能な実世界のレイアウトを生成する実用的な方法が含まれてお

品質予測/異常検知自然言語処理RAG生成画像テキスト
用途
オートメーションされたマニピュレーションのためのテーブル環境の生成
難易度
Hard
コスト
Low
githubGitHubあり2026-07-23

unstructured — Convert documents to structured data effortlessly. Unstructured is open-source ETL solution for transforming complex documents into clean, structured formats for language models. Visit our website to learn more about our enterprise grade Platform product for production grade workflows, partitioning, enrichments, chunking and embedding.

ドキュメントを構造化するために使えるオープンソースのETLソリューション。

表形式向き自然言語処理大規模言語モデル画像テキスト表形式
用途
ドキュメントの構造化
難易度
Easy
コスト
High
arxivPaper only2026-07-22

Multi-modal transformer for signal classification in nanopore blockade experiments

この研究では、ナノポア測定器から得られる複雑な信号を分析するために、多モーダル変換ニューラルネットワーク (Multi-modal Transformer) を提案し、信号分類の精度を向上させた。

MI向きセンサ/時系列深層学習Transformer分類画像時系列
用途
ナノポア測定器における信号の分類
難易度
Hard
コスト
Low
arxivPaper only2026-07-22

StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation

オフラインでの短時間の視覚生成が一般的な人間の行動の分析では、人間の行動の長期的な視覚生成は、実践的な長時間の視覚生成では実行不能である。StreamHOI は、人間間の視覚的な行動の生成を生成したいくつの画像を使用して

MI向き品質予測/異常検知深層学習Transformer生成画像動画
用途
人物間の相互作用による視覚生成
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

多モーダルラージランゲージモデルは、視覚言語タスクに強いですが、高い推論コストで問題となっています。Look Less, Think Fasterアルゴリズムは、単位次元を個別に最適化することで、多モーダルラージランゲー

深層学習軽量化・量子化画像テキストマルチモーダル
用途
多モーダルラージランゲージモデルによる視覚言語タスクでのコスト削減
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?

画像理解のための多モーダルラージランゲージモデルは、強力ですが、まだ能力と限界については明確な理解が不足しています。この論文では、多モーダルラージランゲージモデルが画像理解においてどの程度の能力と限界を持つか、を分析し、

センサ/時系列深層学習軽量化・量子化QA画像テキスト
用途
画像理解における多モーダルラージランゲージモデルの能力と限界
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Importance-Aware OBS Pruning for Diffusion Models

セグメンテーションのパフォーマンスの向上と計算的リソースの削減を目的として、Lean-SAM2は対象領域をアサインする対象アンバウンダリーセグメンテーション(SAM2)にターゲットアンチャイニングされたメモリとエンコーダ

深層学習軽量化・量子化生成画像
用途
画像のセグメンテーションに効率を実現
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Toward Seasonal Guidelines for Robust Deep-Learning Sentinel-2 Building Detection in Different Area Types

OffNadirLocは地学化におけるオフナジアムの視点を考慮するための基準セットを提案します。これにより、ドローンと衛星画像の交差視点地学化プロセスでは重要な構造的シーン理解と内部ドメイン間の関係的制約に重点を置くこと

深層学習CNN分類検出セグメンテーション
用途
ドローンから衛星画像への地学化の改善
難易度
Hard
コスト
High
arxivPaper only2026-07-22

STEREOFLOW: Progressive Stereo Matching with StereoDiT and Transition Flow Matching

ステレオマッチングは3次元再構成において重要なタスクです。この研究では、ステレオマッチングを確率的生成タスクと組み合わせ、オブジェクト検出の向上を目的として、ステレオマッチングフレームワークと潜在分配を統合する方法を提案

深層学習Transformer生成回帰画像
用途
オブジェクト検出の向上
難易度
Hard
コスト
High
arxivPaper only2026-07-22

OffNadirLoc: Benchmark and Framework for Challenging UAV-to-Satellite Geo-Localization under Large Off-Nadir Views

OffNadirLocは交差視点地理位置を推定するための基準セットを提案します。これにより、ドローンと衛星画像の交差視点地理位置推定プロセスでは重要な構造的シーン理解と内部ドメイン間の関係制約に焦点を当てることができます

自然言語処理プロンプトエンジニアリング検出画像テキスト
用途
ユーザー間の地理的位置の推定改善
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PRISM-DR: Per-lesion Retinal Inference with Specialist Models for Diabetic Retinopathy

この研究では、糖尿病性黄斑病変の検出を目的としたPRISM-DRシステムを開発しました。このシステムは、医師が見逃す可能性がある小さな低コントラストな病変を見つけるのに役立ちます。

少数データ向きCPUで試しやすい条件最適化自然言語処理ファインチューニング検出生成画像
用途
糖尿病性黄斑病変を検出する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos

この研究では、ドローンで小さな物体を認識することを目的としたメモリ拡張型大規模言語モデルを開発しました。このモデルは、複雑なドローンの場面で、ユーザーの指示に従って物体を識別できるようになります。

自然言語処理大規模言語モデルセグメンテーション画像テキスト
用途
ドローンで物体認識を実行する
難易度
Hard
コスト
High
arxivGitHubあり2026-07-22

Silent Failures in Multimodal Agentic Search:A Diagnostic Taxonomy and Cross-Judge Evaluation

この研究では、可視化された質問への対応を評価するために、新しい方法を提案しました。この方法は、質問への回答の正確性だけでなく、質問への回答のパターンや特徴も評価することができます。

品質予測/異常検知コンピュータビジョンマルチモーダルQA画像
用途
可視化された質問への対応を評価する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

自動運転システムには、道路のトポロジー(ドライバブルレーンとその接続性)を理解する機能が必要です。最近の検出モデルは360度の前方視野からボリュームイメージを取得することで、道路上のレーンのトポロジーを推測することができ

自然言語処理RAG画像テキストマルチモーダル
用途
道路のトポロジー認識を改善
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Physics-Aware Complex-Valued State Space Model with Scattering-Prior Feature Modulation for PolSAR Image Classification

この研究では、地象性AIにおける物理的知識を使用してポーラリメトリック合成開口ラダール画像を分類するための新しいモデルを提案しました。このモデルは、ラダール画像を物理的なプロセスと関連付けることができます。

深層学習軽量化・量子化分類埋め込み画像
用途
ポーラリメトリック合成開口ラダール画像の分類
難易度
Hard
コスト
Low
arxivPaper only2026-07-22

Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation

自律ロボットには、障害物や事故の回避能力が必要です。これは、障害物や事故の回避能力が強化されていれば、障害物や事故に対しての対策がより効果的になります。障害物や事故の回避能力が強まることで、ロボットが障害物や事故から安全

品質予測/異常検知自然言語処理ファインチューニング生成セグメンテーション画像
用途
自動ロボットが障害物や事故を回避できるようにする
難易度
Hard
コスト
High
arxivGitHubあり2026-07-22

ReferTrack: Referring Then Tracking for Embodied Visual Tracking

ReferTrack は、自然言語で対象の車両に付近する自動車を追従させるシステムである。このシステムでは、対象の車両に付近する自動車を認識する後、自動車の動きを予測する。

自然言語処理プロンプトエンジニアリング検出画像テキスト
用途
自動車が対象の車両に付きそわせるシステム
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Digital Twin Modeling of a Highly Automated Agricultural Tractor

このプロジェクトでは、農林業用自動化トラクターのデジタルツインモデリングが行われた。デジタルツインはCAN通信を使用することでトラクターの動きを模倣し、実際のトラクターの動作をシミュレートする。

強化学習画像
用途
農林業用自動化トラクターのデジタルツインモデリング
難易度
Hard
コスト
Medium
arxivPaper only2026-07-22

V2F: Vision-Informed Grasp Force Prediction for Damage-Aware Robotic Handling of Date Fruits

V2F は、日用消費財をロボットで取扱するためのシステムである。このシステムでは、ロボットが消費財を取扱うときに必要な力を予測し、物体を傷つけたり、物を作れなかったりするのを防ぐ。

自然言語処理RAGセグメンテーション画像
用途
日用消費財をロボットで取扱するためのシステム
難易度
Hard
コスト
Low
githubGitHubあり2026-07-22

Awesome-CVPR2026-CVPR2025-ICCV2025-CVPR2024-ECCV2026-ECCV2024-AIGC — A Collection of Papers and Codes for CVPR2026/CVPR2025/ICCV2025/CVPR2024/ECCV2026/ECCV2024 AIGC

CVPRに基づくAIを取り入れるための資料集を提供します。CVPR 2026、2025、2024、およびECCV 2024に基づくAIGCに関する研究論文とソフトウェアコードを含みます。

コンピュータビジョン3D・点群生成画像動画
用途
AIをCVPRに応用する
難易度
Easy
コスト
High
arxivGitHubあり2026-07-21

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

オリジナルのデータとZoom-Inのツールを組み合わせた方法、OmniReasonerを提案する。これにより、オリンモードルLLMsの長いオーディオビデオの論理的推論を改善できる。

MI向き品質予測/異常検知自然言語処理大規模言語モデル画像音声動画
用途
長いオーディオビデオの論理的推論を改善する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

ERank in Latent Space as an Image-Complexity and Richness Measure

計算機ビジョンと画像認識では、画像の視覚的なリッチネスを評価するために有用な指標が求められるが、これまでの指標は制限があった。この問題を解決するために、チャンネル空間の分散を利用した指標を提案する。

コンピュータビジョンセグメンテーション分類画像
用途
画像の視覚的なリッチネスを評価するための新しい指標を提案する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Anatomy-Aware 3D Mesh Refinement of Pericardium Segmentations on Computed Tomography

心臓の囲みの区別は、食道肥厚の測定に重要であるが、しかし、これを正確に区別することは難しい。これを解決するために、周囲の解剖学的構造を利用して囲みの区別を改善する方法を提案する。

自然言語処理RAGセグメンテーション画像テキスト
用途
心臓CT画像から心臓の囲みを正確に区別する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency

自動運転のための計画とは、状況理解、タイムリーな推論、行動選択というものがあるが、しかし、これらの要素を組み合わせるのは難しい。これを解決するために、シーン理解を分離することによって、計画を安全かつ有効性のあるものにする

深層学習軽量化・量子化画像テキストマルチモーダル
用途
自動運転のための分離された計画システムを提案する
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor Fusion

この研究では、高空飛行の無信号位置指示のNGPS (Next-Generation Positioning System)というフレームワークを提案しました。NGPSは、GPSの信号を利用せずに位置推定を可能にします。N

センサ/時系列コンピュータビジョン動画認識検出生成画像
用途
高空飛行の無信号位置指示
難易度
Hard
コスト
High
arxivPaper only2026-07-21

WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory

World Action Models(WAMs)は、ロボットマニピュレーションをモデル化するパラダイム。WAMsは、視覚ステートトランジションとロボットアクションを同時にモデル化する。しかし、既存のWAMsは、一定の時

自然言語処理プロンプトエンジニアリング画像テキスト動画
用途
多目的マニピュレーション問題を解決する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation

この文書では、閉回路交通シナリオ生成のための変分ベースのアプローチ「E2E-CDiff」を提案しました。これを使用すると、実世界に近い交通ルールを生成したり、交通ルールを操作することができるようになります。

生成AI拡散モデル生成画像
用途
自動運転データの生成
難易度
Hard
コスト
High
arxivPaper only2026-07-20

Recti-Q: Feature-Space Rectification for Out-of-Distribution-Robust Quantized Perception in Edge Robotics

エッジロボチクスでの画像認識精度を安定させ、その安定性を確保するために、量化後のパフォーマンスを向上させ、分散型データ量化を実現し、分布シフトの影響を緩和する、新しい機械学習アプローチを提案します。

センサ/時系列深層学習Transformer分類異常検知画像
用途
エッジロボチクスでの画像認識の安定性
難易度
Hard
コスト
High
arxivPaper only2026-07-20

UMCP: A Unified Multi-Task Collaborative Perception Network for Luggage Trolley Pose Estimation

ロボット車の視覚システムは、高精度でリアルタイム性能を持つロジスティクス車両の位置検出を実現する必要があります。従来の手法では、複数のモデルが連続してインフェレンズされ、インフェレンスラティシーが増加し、高規模デプロイメ

コンピュータビジョン物体検出検出画像
用途
luggage trolleyの位置推定
難易度
Hard
コスト
Medium
arxivPaper only2026-07-20

ConceptTree: Bringing Semantic Transparency to Black-Box Decision Making for Robotic Manipulation

この論文では、ConceptTreeというフレームワークを提案しています。このフレームワークは、人の見える概念を使用して、マニピュレーションの高位のスキル選択を表現し、透明性を高めます。

説明可能品質予測/異常検知強化学習方策勾配 (PPO / A3C)画像
用途
マニピュレーションの高位のスキル選択のための透明性の実現
難易度
Hard
コスト
High
arxivPaper only2026-07-20

From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation

この論文では、ラインダブルロボットのための自発的アクション生成を実現することを目標とし、vision-language 指向性の指令によりロボットが自発的に動作することができることを示します。

コンピュータビジョン3D・点群生成画像3D
用途
ラインダブルロボットのための自発的アクション生成
難易度
Hard
コスト
High
arxivPaper only2026-07-20

Seg2Grasp: A Robust Modular Suction Grasping in Bin Picking

採掘ロボットの性能向上を目指したSeg2Graspを構築し、セグメンテーション、グレイシング、クラスフィルタリングの3つのモジュールで構成されます。セグメンテーションモジュールではTransformerを利用したオブジェ

深層学習Transformer分類検出セグメンテーション
用途
採掘ロボットがオブジェクトを取り上げる能力の向上
難易度
Hard
コスト
Low
arxivPaper only2026-07-20

Predictive Training with Latent Imagination for Visual Quadruped Navigation

四足ロボットのナビゲーションのための予測的推論方法が提案されます。ロボットは、現在の観察と短期的な記憶によってアクションを選択しますが、障害物の発展を予測することができないため、このアプローチには課題があります。この課題

深層学習Transformer画像
用途
ロボットのナビゲーション
難易度
Hard
コスト
High
githubGitHubあり2026-07-16

pytorch-image-models — The largest collection of PyTorch image encoders / backbones. Including train, eval, inference, export scripts, and pretrained weights -- ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (ViT), MobileNetV4, MobileNet-V3 & V2, RegNet, DPN, CSPNet, Swin Transformer, MaxViT, CoAtNet, ConvNeXt, and more

PyTorchで使用できる画像エンコーダとバックボーンの最大のコレクションです。トレーニング、評価、推論など様々なスクリプトや事前の重み付きデータが含まれます。

深層学習Transformer分類画像
用途
PyTorchで使用できる画像エンコーダとバックボーン
難易度
Easy
コスト
High
githubGitHubあり2026-07-14

OpenRLHF — An Easy-to-use, Scalable and High-performance Agentic RL Framework based on Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)

OpenRLHFは、Ray上に構築された強化学習フレームワークです。このフレームワークは、PPO、DAPO、REINFORCE++など、様々な強化学習アルゴリズムをサポートしています。

深層学習Transformer画像
用途
強化学習フレームワーク
難易度
Easy
コスト
High
arxivPaper only2026-07-13

Difference-Driven Gating: Adaptive Feature Fusion for U-Net Decoder

この研究では、新しい特徴融合手法を提案した。この手法は、上からの特徴と下からの特徴の関係性を考慮することで、特徴を効率的に融合し、三次元データを2次元サムライグラフにコンパクトに表現する機能をもたらせる。

センサ/時系列コンピュータビジョンセグメンテーション画像音声
用途
特徴融合
難易度
Hard
コスト
Medium
githubGitHubあり2026-07-10

pytorch-grad-cam — Advanced AI Explainability for computer vision. Support for CNNs, Vision Transformers, Classification, Object detection, Segmentation, Image similarity and more.

このライブラリは、コンピューター ビジョンのための高度なAI解釈と可視化ソリューションです。このライブラリは、CNN、ビジョン トランスフォーム、分類、物体検出、分割、画像類似度など、さまざまなコンピューター ビジョンの

深層学習Transformer分類検出セグメンテーション
用途
AIの解釈と可視化ソリューション
難易度
Easy
コスト
Low
arxivPaper only2026-07-06

An event-driven framework for fly-inspired visual motion detection

イベントベースセンシングの活用と生物学的インスピレーションを利用した障害物検出を実現するために、飛行経路を用いた新しいアプローチが提案される。このアプローチは、イベントベースセンシングの活用と生物学的インスピレーションを

説明可能センサ/時系列深層学習Transformer検出画像
用途
イベントベースセンシングと飛行経路を用いた動的環境での障害物検出
難易度
Hard
コスト
High
githubGitHubあり2026-07-03

EEGUnity — An open source tool for large-scale EEG datasets processing

ビデオ diffusioin trasformerは、ビデオの長さに依存しない推論能力を持っているが、この長さのエキサポレーションは実際には困難なものである。RIFLExという手法を開発し、ビデオ長さのエキサポレーション

コンピュータビジョンマルチモーダル
用途
ビデオ diffusioin trasformerで長さのエキサポレーション
難易度
Easy
コスト
High
arxivPaper only2026-06-11

ReSCom: A Reconfigurable Spiking Neural Network Accelerator Using Stochastic Computing

スパイクニューラルネットワークは、エネルギー効率のよいAIモデルです。この研究では、スパイクニューラルネットワークのアクセラレータを実装し、その性能をテストしました。

深層学習RNN / LSTM分類画像
用途
スパイクニューラルネットワークアクセラレータの実装
難易度
Hard
コスト
Low