31 articles

Category

生成AI

Diffusion、画像生成、動画生成など、生成モデルの実装可否と推論コストを重視して整理します。

拡散モデルGANVAE画像生成動画生成音声・音楽生成

人気記事

新着記事

未読 31
arxivPaper only2026-07-23

GraphVid: Interactive Graph-Controllable Video Generation

GraphVidは、グラフと文本から生成することができ、オブジェクトの複数の移動を正確に制御することができる。グラフではオブジェクトの動きを表す情報を保存し、文から生成の制約を指定することができる。

品質予測/異常検知生成AI動画生成生成画像テキスト
用途
コントロール可能なビデオ生成
難易度
Hard
コスト
High
arxivPaper only2026-07-23

ElasticTTT: Prior-Preserving Test-Time Tuning for Video Editing

ElasticTTTは、プログラムがテストのときに動作を調整できるようにした。方法は、テストのときにモデルが前のサンプルの情報と現在の情報を組み合わせて、ビデオを編集する際に正しく動作するようにした。

生成AI拡散モデル生成テキスト動画
用途
ビデオ編集時のテスト タイムチューニング
難易度
Hard
コスト
High
arxivPaper only2026-07-23

GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning

視覚モータリティポリシーを学習する際、人間が視覚アタッチメントを理解し、修正できるようにするため、視覚アタッチメントを明示的にしたフレームワークを提案します。

説明可能生成AI拡散モデル異常検知画像
用途
ロボットマニュピュレーションの視覺アタッチメント
難易度
Hard
コスト
High
arxivPaper only2026-07-21

End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation

この文書では、閉回路交通シナリオ生成のための変分ベースのアプローチ「E2E-CDiff」を提案しました。これを使用すると、実世界に近い交通ルールを生成したり、交通ルールを操作することができるようになります。

生成AI拡散モデル生成画像
用途
自動運転データの生成
難易度
Hard
コスト
High
githubGitHubあり2026-07-08

VoxCPM — VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning

マルチラギングスピーチ生成やクリエイティブボイスデザイン、ルートライフクライミングなど、テクスチャファリーTTSの最新技術を実現するためのフレームワークです。

生成AI音声・音楽生成生成テキスト音声
用途
マルチラギングスピーチ生成
難易度
Easy
コスト
Medium