generation」の検索結果

332
githubGitHubあり2026-07-24

Medical_Image_Analysis — Foundation models based medical image analysis

医学画像分析は、医療の診断や治療を支援するために画像に記載されたデータから情報を抽出する研究分野です。この研究では、foundation modelsを用い、医療画像分析のための新しいアプローチを提案しました。found

自然言語処理大規模言語モデル生成画像テキスト
用途
医学画像分析
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

qdrant — Qdrant - High-performance, massive-scale Vector Database and Vector Search Engine for the next generation of AI. Also available in the cloud https://cloud.qdrant.io/

このリポジトリでは、データとAIアルゴリズムを製品化するためのプラットフォームであるTaipyを提供しています。

自然言語処理埋め込み・検索生成画像
用途
AIアプリケーションを製品化するためのプラットフォーム
難易度
Easy
コスト
Low
githubGitHubあり2026-07-24

kserve — Standardized Distributed Generative and Predictive AI Inference Platform for Scalable, Multi-Framework Deployment on Kubernetes

flyteは、高度に動的で堅牢なAIオーケストレーションプラットフォームであり、データ、モデル、コンピューティングを統合してAIワークフローを作成することができます。

自然言語処理大規模言語モデル生成
用途
エクスペリメントトラッカーを簡単にする
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

haystack — Open-source AI orchestration framework for building context-engineered, production-ready LLM applications. Design modular pipelines and agent workflows with explicit control over retrieval, routing, memory, and generation. Built for scalable agents, RAG, multimodal applications, semantic search, and conversational systems.

オープンソースのAIオーケストレーションフレームワークです。LLMアプリケーションの構築に必要なパイプラインやエージェントワークフローの設計ができるようになっています。

深層学習Transformer生成要約テキスト
用途
LLMアプリケーションの構築
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

RAG_Techniques — This repository showcases various advanced techniques for Retrieval-Augmented Generation (RAG) systems. Each technique has a detailed notebook tutorial.

医学画像に対する疾患検出モデルを開発し、臨床現場で早期検出と迅速な介入を容易にすることを目的としたフレームワークを提案します。

自然言語処理大規模言語モデル生成
用途
医学画像の疾患検出
難易度
Easy
コスト
High
arxivPaper only2026-07-23

Synthetic data generation framework for quality control automation in gravure printing

印刷品質管理技術のための新しいアプローチであるシンセティック データ生成フレームワークを提案しました。このフレームワークは、ロトグラビューグラビング技術における品質管理のためのシンセティック データを生成することで、印刷

品質予測/異常検知画像検査深層学習Transformer検出生成画像
用途
印刷品質管理技術の開発
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Token Budget Saturation and Mechanistic Early Detection of Reasoning Non-Convergence in Chain-of-Thought Models

チェーン・オブ・サウト reasoning モデルの収束不明確さを解決する研究。このモデルの不完全収束は、生成するトークンの数に依存し、モデルには収束しない限り問題を解決する能力がない。これを解決するための予測を終了する

自然言語処理プロンプトエンジニアリング検出生成
用途
チェーン・オブ・サウト reasoning モデルに適切に予測を終了する方法を検討する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Context-weighted Discrete Flow Matching

ディスクリートフロー・マッチングにおけるコンテキストの正しい有用性の利用を検討した。この研究では、ディスクリートフロー・マッチングのモデルの正確さを高めるためにコンテキストの有用性を適切に利用する方法を提案した。

品質予測/異常検知コンピュータビジョンセグメンテーション生成テキスト
用途
ディスクリートフロー・マッチングにおけるコンテキストの有用性
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Emergent Misalignment Recruits a Pre-existing Persona Subspace

アライメントした言語モデルの偏った表現の理解を進めた。この研究では、アライメントした言語モデルの表現を分析して、偏った表現を理解することができ、これを用いて、偏った表現を正すことができると主張した。

自然言語処理ファインチューニング生成テキスト
用途
アライメントした言語モデルの偏った表現の理解
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Best-of-Evidence: Best-of-N Selection under Partial Verification

モデル出力の選択のためのBoN(ベストオブナ)を、部分検証が含まれるビジョン言語タスクに適用する。この方法により、モデル出力を効率化できる。

品質予測/異常検知コンピュータビジョンセグメンテーション生成マルチモーダル
用途
部分検証を含むビジョン言語タスクを効率化する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Position Bias is Hidden Behind Ceiling Effects: A Permutation Diagnostic for LLM Benchmarks

LLM(言語モデル)の評価における位置バイアスを分析するための方法を提案した研究で、この方法により、位置バイアスが評価結果にどのような影響を与えるかが明らかにできる。

自然言語処理大規模言語モデル検出生成
用途
LLMの評価における位置バイアスを分析する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

GraphVid: Interactive Graph-Controllable Video Generation

GraphVidは、グラフと文本から生成することができ、オブジェクトの複数の移動を正確に制御することができる。グラフではオブジェクトの動きを表す情報を保存し、文から生成の制約を指定することができる。

品質予測/異常検知生成AI動画生成生成画像テキスト
用途
コントロール可能なビデオ生成
難易度
Hard
コスト
High
arxivPaper only2026-07-23

From Resource Flow to Executable Tests: Petri-Net-Guided LLM Test Generation for Concurrent Stateful Rust APIs

この研究は、リソースフローの動作を表すPetriネットと、APIを操作するためのテストを自動生成する方法を提案した。方法は、APIの機能をテストするためのシナリオを生成し、テストが正しく実行されるようにした。

自然言語処理大規模言語モデル生成テキスト
用途
共時進行のコンカURRENCYAPIのテスト
難易度
Hard
コスト
High
arxivPaper only2026-07-23

ElasticTTT: Prior-Preserving Test-Time Tuning for Video Editing

ElasticTTTは、プログラムがテストのときに動作を調整できるようにした。方法は、テストのときにモデルが前のサンプルの情報と現在の情報を組み合わせて、ビデオを編集する際に正しく動作するようにした。

生成AI拡散モデル生成テキスト動画
用途
ビデオ編集時のテスト タイムチューニング
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Artificial Epanorthosis: Why large language models overuse a classical rhetorical figure, and how to mitigate it

Artificial Epanorthosisは、大規模言語モデルが古典的なルレチックの表現を使用する傾向に注目した。結果は、モデルのトレーニングデータの形状がこの傾向に影響していることができた。

深層学習軽量化・量子化分類生成テキスト
用途
大規模言語モデル上のエパノルシス
難易度
Hard
コスト
High
arxivPaper only2026-07-23

An LLM-Driven Workflow for Automated Process Control Strategy Generation and Tuning from Dynamic Process Models

このプロセスでは、大規模言語モデルを使用して、ダイナミックプロセスモデルに基づいて自動化された制御戦略を生成します。

少数データ向きCPUで試しやすい条件最適化自然言語処理大規模言語モデル生成
用途
オートメーションされた制御戦略の生成
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Search Hardness-Aware LLM-Based Problem Formulation for Expensive Simulation-Driven Design

シミュレーション駆動設計では、高精度なシミュレーションを少なくすることで設計を実現しています。既存の手法では、その問題に取り組むために最適化アルゴリズムが改善されてきましたが、問題の定義自体は検討されていません。この論文

深層学習軽量化・量子化生成
用途
コスト削減的なシミュレーション駆動設計
難易度
Hard
コスト
High
arxivPaper only2026-07-23

MedGame: Storytelling Gamification Empowered by Large Language Models for Medical Education

Large Language Models (LLMs) は医学教育に大きな可能性を持っていますが、現在のシステムでは、質問に答えるか一時的なフィードバックしか行なわれていません。一方、臨床病例を決定センターへの学習トレ

自然言語処理大規模言語モデル生成QAテキスト
用途
医学教育への Large Language ModeL の適用
難易度
Hard
コスト
High
arxivPaper only2026-07-23

An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

この論文では、音声字幕の評価手法が提案され、音声字幕の評価において既存の手法の制約を克服することを目指しました。提案されたフレームワークは音声字幕の各側面を評価し、質問回答型の評価手法ではなく字幕の中立性を評価することが

センサ/時系列自然言語処理大規模言語モデル生成テキスト音声
用途
音声字幕の評価フレームワークの構築
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning

長形推論のための言語モデルが、提供されたコンテキストから乖離した論理を生成する可能性があることを指摘し、コンテキストと推論論理をより適切に融合するため、 REFACT (REstating Facts in Adapti

自然言語処理大規模言語モデル生成テキスト
用途
Chain-Of-Thought (CoT) の改善
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

Inference-Time Scaling of Diffusion Models via Progressive Seed Pruning

ディフュージョンモデルにおける初期的なNoise Seed の影響が、モデルが生成する高質のイメージに大きく影響していることを提示し、Seed Search 時の時間的負荷を削減するための方法を提案した。

品質予測/異常検知深層学習軽量化・量子化生成画像テキスト
用途
ディフュージョンモデルのサケリング
難易度
Hard
コスト
High
arxivPaper only2026-07-23

GrainGS: Gradient-Decoupled Gaussian Splatting for Efficient Dynamic Novel View Synthesis

3Dガウシアンスプレイティングによる動的なシーン再構成は、動的なモーションモデリング、構造的安定性とコンパクトな表現のバランスをとることが求められる。実際、既存のprimitive毎に実際に実装されている方法はローカルの

品質予測/異常検知深層学習軽量化・量子化生成3D
用途
3D Gaussian Splatting動的シーン再構成
難易度
Hard
コスト
High
arxivPaper only2026-07-23

HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models

大規模言語モデルはさまざまな画像をテキストに変換する上で優れた性能を示しているが、発生するホログラフィックな診断にはまだ解決策が必要です。この研究では、主流の粗い検出方法の欠点を補うため、細部の診断方法を提案しています。

説明可能自然言語処理大規模言語モデル分類検出生成
用途
ホログラフィックハロウィーンの診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

空間理解は、物理世界と静的のセマンティック理解の間でつながるために不可欠です。多くの空間タスクは、場所、領域、パスの自然な表現は、ポインティングやマーキングなど、連続的な視覚的シーンで行われることが多いが、現行の空間推論

自然言語処理大規模言語モデル生成画像テキスト
用途
空間理解
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Unsupervised Metal Artifact Reduction in Dental CBCT using Fine-tuned Cycle-Consistent Adversarial Networks

この研究では、歯科CBCT画像中のメタルアーティファクトを除去するための循環互換的アドバーサリアルネットワーク(CycleGAN)を提案します。CycleGANを使用すると、メタルアーティファクトを除去した後、CBCT画

品質予測/異常検知自然言語処理RAG生成画像教師なし
用途
メタルアーティファクトの除去
難易度
Hard
コスト
Low
arxivPaper only2026-07-23

TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation

オートメーションされたマニピュレーションを目的とした、大規模なテーブルトップのデータセットであるTableVerse を提案します。このデータセットには、物理的に可能な実世界のレイアウトを生成する実用的な方法が含まれてお

品質予測/異常検知自然言語処理RAG生成画像テキスト
用途
オートメーションされたマニピュレーションのためのテーブル環境の生成
難易度
Hard
コスト
Low
arxivPaper only2026-07-23

Distributed Model-Based Diffusion For Scalable Multi-Robot Trajectory Optimization

多ロボットのトラッジオプティマイズを目的とした、分散型のモデリングベースの浸透を提案します。このフレームワークは、非凸の非線形の非可微分な環境を考慮しながら、効率的なトラッジ作成を支援します。

自然言語処理RAG生成
用途
多ロボットのトラッジオプティマイズ
難易度
Hard
コスト
High
githubGitHubあり2026-07-23

Causal-Forcing — [ICML 2026] Official codebase for "Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation" & Causal Forcing++

この論文では、Causal-Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive

品質予測/異常検知深層学習軽量化・量子化生成テキスト動画
用途
高品質のビデオ生成を実現する。
難易度
Easy
コスト
High
arxivGitHubあり2026-07-22

Antigen-specific Antibody Multi-modal Foundation Model for Functional Antibody Design

この研究では、抗原特異性抗体を設計するために、抗原および抗体の間でエピトープレベルでのペアリングが必要であることを考慮した、抗原特異性の抗体多モーダルファンデーションモデル(AAMFM)を提案しました。

自然言語処理RAG分類生成テキスト
用途
抗原特異性抗体設計
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Hypothesis-and-Refinement Learning of Organic Structures from Multimodal Spectroscopic Data

分子構造を決定するために、スペクトルデータから自動的な構造解析を実施するための方法を提案している。この方法は、スペクトルデータに基づいてヒントと改良を繰り返すことで、分子構造を決定するもので、分子の可能性の広範な構造スペ

MI向き自然言語処理ファインチューニング生成テキストマルチモーダル
用途
分子構造の解析
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Multi-Mask Diffusion Language Models for Few-Step Generation

この研究では、多マスク分散言語モデルを提案します。このモデルには、複数のマスクがあり、それぞれが異なる生成タスクを実行することになります。このモデルは、生成タスクの多様性を高めることができ、生成された文がより多様性の高い

品質予測/異常検知深層学習軽量化・量子化生成テキスト
用途
リトルバイトの生成
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Nuclear Quantum Effects as a Denoising Problem

この研究では、核量子効果をシミュレートするために、画像時刻パス積分を利用した分散機械学習アルゴリズムを提案します。このアルゴリズムは、分散機械学習を利用して核量子効果をシミュレートすることに成功し、核量子効果に関連する問

MI向きコンピュータビジョンセグメンテーション生成テキスト
用途
核量子効果のシミュレーション
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PoTRE: Test-Time Reasoning inspired by Cognitive Heterogeneity

モデルの脆弱性を解決するために、四つのエージェントに分割される多様なフレームワークPoTREを導入した。モデルの推論能力を強化し、単一のストリーミングアプローチよりも複雑な理論的制約とアブストラクションに抵抗できるように

表形式向き自然言語処理大規模言語モデル生成テキスト
用途
複雑な推論力のあるタスクの解決
難易度
Hard
コスト
High
arxivPaper only2026-07-22

The Maskability Index: Predicting Task-Objective Alignment in Pretrained Language Models

ある知識関係がマスクスタイルのパラミトリックパラメータ化方法で適切かどうかを計算したメトリックとしてMaskability Index (MI)を導入した。DepthRankの違いを用いて、与えられたパラメータ化方法で知

少数データ向き深層学習Transformer生成テキスト
用途
強い知識獲得タスクでのパフォーマンスの向上
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

3つのタスクをサポートする音曲生成フレームワークを提示した。これらのタスクには、歌詞、テキストの説明、音楽的特性を利用して、歌詞の生成、バンドの音楽の生成、カバー曲の生成などが含まれる。

品質予測/異常検知深層学習軽量化・量子化生成テキスト音声
用途
音楽の生成
難易度
Hard
コスト
High
arxivPaper only2026-07-22

DQAOA-GPT: AI-Accelerated Distributed Quantum Optimization for Combinatorial Problems

組み合わせ方程式の最適化を解くための新しいフレームワークを提示した。分布される量子アルゴリズムの局所的な制限に直面する際、最適化の解を導けるために、分布される量子近似最適化アプローチと深層学習アルゴリズムを組み合わせた。

品質予測/異常検知自然言語処理大規模言語モデル生成
用途
方程式組み合わせの最適化
難易度
Hard
コスト
High
arxivPaper only2026-07-22

StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation

オフラインでの短時間の視覚生成が一般的な人間の行動の分析では、人間の行動の長期的な視覚生成は、実践的な長時間の視覚生成では実行不能である。StreamHOI は、人間間の視覚的な行動の生成を生成したいくつの画像を使用して

MI向き品質予測/異常検知深層学習Transformer生成画像動画
用途
人物間の相互作用による視覚生成
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

危険な問題に対する正しい答えを提供する大きな言語モデルと費用の効率が良い、小さな言語モデルを協力させる技術が開発されました。

深層学習軽量化・量子化生成テキスト
用途
小さな言語モデルを大きい言語モデルと協力させる手法が効率的かつ安全に実装される
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

3D オキュピエンシー予測には、物体の配置と密度を解釈するための視覚的手法が必要です。従来の方法では、計算コストが高くなりすぎていたが、新しく提案されたGaussianSeedアルゴリズムは、層を階層化することで、計算コ

品質予測/異常検知自然言語処理大規模言語モデル生成テキスト
用途
3次元空間における物体の配置と密度の予測
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

ビデオキャプション生成には、空間と時刻の理解が重要です。PercepCapアルゴリズムは、ビデオ入力を空間時刻認識に分解することで、生成されたキャプションの理解度が向上するとともに、空間時刻の誤差をより正確に検出でき、キ

品質予測/異常検知自然言語処理大規模言語モデル生成動画強化学習
用途
ビデオキャプション生成のための構造化された空間時刻の理解
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Self Gradient Forcing: Native Long Video Extrapolation

長時間ビデオエクストラポレーションには、高度な視覚的知能が必要です。Self Gradient Forcingアルゴリズムは、学生モデルを教師モデルから生成される歴史の下で学習させることで、長時間ビデオエクストラポレーシ

コンピュータビジョンセグメンテーション生成テキスト動画
用途
長時間ビデオエクストラポレーションのための自力勾配強制
難易度
Hard
コスト
High
arxivGitHubあり2026-07-22

Evolving Cache Schedules for Fast Diffusion Policy Inference

分散式推論には、高解像度ビデオ生成のためにコストが高いという問題があります。Evolving Cache Schedulesアルゴリズムは、コストと効率性のトレードオフを最適化することで、キャッシュで推論コストを削減しま

深層学習Transformer生成
用途
分散式推論のためのキャッシュスケジュールの進化
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Importance-Aware OBS Pruning for Diffusion Models

セグメンテーションのパフォーマンスの向上と計算的リソースの削減を目的として、Lean-SAM2は対象領域をアサインする対象アンバウンダリーセグメンテーション(SAM2)にターゲットアンチャイニングされたメモリとエンコーダ

深層学習軽量化・量子化生成画像
用途
画像のセグメンテーションに効率を実現
難易度
Hard
コスト
High
arxivPaper only2026-07-22

STEREOFLOW: Progressive Stereo Matching with StereoDiT and Transition Flow Matching

ステレオマッチングは3次元再構成において重要なタスクです。この研究では、ステレオマッチングを確率的生成タスクと組み合わせ、オブジェクト検出の向上を目的として、ステレオマッチングフレームワークと潜在分配を統合する方法を提案

深層学習Transformer生成回帰画像
用途
オブジェクト検出の向上
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PRISM-DR: Per-lesion Retinal Inference with Specialist Models for Diabetic Retinopathy

この研究では、糖尿病性黄斑病変の検出を目的としたPRISM-DRシステムを開発しました。このシステムは、医師が見逃す可能性がある小さな低コントラストな病変を見つけるのに役立ちます。

少数データ向きCPUで試しやすい条件最適化自然言語処理ファインチューニング検出生成画像
用途
糖尿病性黄斑病変を検出する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation

自律ロボットには、障害物や事故の回避能力が必要です。これは、障害物や事故の回避能力が強化されていれば、障害物や事故に対しての対策がより効果的になります。障害物や事故の回避能力が強まることで、ロボットが障害物や事故から安全

品質予測/異常検知自然言語処理ファインチューニング生成セグメンテーション画像
用途
自動ロボットが障害物や事故を回避できるようにする
難易度
Hard
コスト
High
arxivPaper only2026-07-22

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

Language-Guided Grasping は、複雑なシーンで物体の把持を行うために、視覚言語モデル(VLM)を用いる。このアプローチでは、VLM は直接把持を予測するのではなく、3 次元空間における把持の位置を指

深層学習軽量化・量子化生成テキスト3D
用途
複雑なシーンで物体の把持を実現
難易度
Hard
コスト
High
githubGitHubあり2026-07-22

Awesome-CVPR2026-CVPR2025-ICCV2025-CVPR2024-ECCV2026-ECCV2024-AIGC — A Collection of Papers and Codes for CVPR2026/CVPR2025/ICCV2025/CVPR2024/ECCV2026/ECCV2024 AIGC

CVPRに基づくAIを取り入れるための資料集を提供します。CVPR 2026、2025、2024、およびECCV 2024に基づくAIGCに関する研究論文とソフトウェアコードを含みます。

コンピュータビジョン3D・点群生成画像動画
用途
AIをCVPRに応用する
難易度
Easy
コスト
High
arxivPaper only2026-07-21

Supra Cognitive Modes: A Routed Architecture for Agent Memory

この研究では、エージェントメモリーのワークロードは直接的事実検索、関係連鎖や現在の状態の推論、長時間の履歴上に関係がある合成を組み合わせて、Supra Cognitive Modes を開発しました。このアーキテクチャで

品質予測/異常検知自然言語処理埋め込み・検索分類生成
用途
メモリアーキテクチャの設計
難易度
Hard
コスト
Low
arxivPaper only2026-07-21

HindsightBench: A Black-Box Behavioral Audit Protocol for Parametric Hindsight in Time-Indexed LLM Decision Tasks

大規模言語モデルは、決定タスクを遂行する過程で、実行された事実を含むパラメトリックな知識を漏らす傾向にある。大規模言語モデルが実際にどのような意思決定タスクを遂行したかを検証するのは困難であるものの、これが確かに事実であ

深層学習軽量化・量子化生成テキスト
用途
LLMによる金融意思決定タスクの検証
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning

離散RLは、長所と短所を含む複雑なランク付けゴールの最適化に効果があります。しかし、その計算コストは通常高く、自動微分化などの複雑なグラadientsの計算アラウンドを必要とします。この文書では、長所と短所を含むランク付

説明可能深層学習Transformer生成強化学習
用途
離散RLアルゴリズムの性能アップデート
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor Fusion

この研究では、高空飛行の無信号位置指示のNGPS (Next-Generation Positioning System)というフレームワークを提案しました。NGPSは、GPSの信号を利用せずに位置推定を可能にします。N

センサ/時系列コンピュータビジョン動画認識検出生成画像
用途
高空飛行の無信号位置指示
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Correct-by-Construction Behavior Tree Synthesis from Signal Temporal Logic Specifications with Application to Robotic Missions

行動木はロボットの複雑なタスクの実行に広く採用されており、モジュラーで反応的な制御を提供します。しかし、既存の合法的な生成方法は、線形時間論理(LTL)のみに制限されるため、量的タイミング制約を表現できません。この論文で

自然言語処理RAG生成
用途
行動木の合法的な生成を解決する
難易度
Hard
コスト
Low
arxivPaper only2026-07-21

End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation

この文書では、閉回路交通シナリオ生成のための変分ベースのアプローチ「E2E-CDiff」を提案しました。これを使用すると、実世界に近い交通ルールを生成したり、交通ルールを操作することができるようになります。

生成AI拡散モデル生成画像
用途
自動運転データの生成
難易度
Hard
コスト
High
githubGitHubあり2026-07-21

agent-starter-pack — Ship AI Agents to Google Cloud in minutes, not months. Production-ready templates with built-in CI/CD, evaluation, and observability.

AIエージェントをGoogle Cloudに展開することが可能で、CI/CD、評価、観察など、プロダクションリードテンプレートが事前に用意されています。

自然言語処理大規模言語モデル生成
用途
AIエージェントをGoogle Cloudに展開
難易度
Easy
コスト
High
arxivPaper only2026-07-20

FinSAgent: Corpus-Aligned Multi-Agent RAG Framework for Evidence-Grounded SEC Filing Question Answering

金融質問回答を実行するには、長い標準化されて高度に冗長な説明書に分散する証券取引委員会(SEC)の証拠を取得する必要がある。既存の取得を拡張するおよび多要素システムの多くの選択肢は、モデルの先行事項と目的のファイルリング

深層学習軽量化・量子化生成QAテキスト
用途
金融質問回答問題を解決
難易度
Hard
コスト
Low
arxivPaper only2026-07-20

From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation

この論文では、ラインダブルロボットのための自発的アクション生成を実現することを目標とし、vision-language 指向性の指令によりロボットが自発的に動作することができることを示します。

コンピュータビジョン3D・点群生成画像3D
用途
ラインダブルロボットのための自発的アクション生成
難易度
Hard
コスト
High
arxivPaper only2026-07-16

Diffusion models recover accurate mixture weights despite score function insensitivity

スコアベース生成モデルにおけるモード分解能の向上を目的とした研究で、モード分解能がスコア関数に依存しておらず、生成サンプルから混合重みを推測できることを明らかにした。

深層学習Transformer生成マルチモーダル
用途
スコアベース生成モデルにおけるモード分解能の向上
難易度
Hard
コスト
High
arxivPaper only2026-07-16

NeuronSoup: Evolving Asynchronous, Shared-Neuron Temporal Graphs without Backpropagation

この研究では、共有ニューロンを使用して時系列グラフを学習する方法、NeuronSoup を開発しました。NeuronSoup では、各パスの信号は、変数数の間のニューロンを通過する途中で、共有ニューロンを使用して伝票され

深層学習Transformer分類生成
用途
神経ネットワークの共有ニューロンによる時系列グラフの学習
難易度
Hard
コスト
Low
githubGitHubあり2026-07-14

memvid — Memory layer for AI Agents. Replace complex RAG pipelines with a serverless, single-file memory layer. Give your agents instant retrieval and long-term memory.

MemVidは、サーバーレスで単一ファイルの記憶層を提案し、AIエージェントが即時検索と長期的な記憶を持つようにする記憶層です。

自然言語処理大規模言語モデル生成テキスト動画
用途
AIエージェントの記憶を管理する
難易度
Easy
コスト
High
githubGitHubあり2026-07-11

LLMs-from-scratch — Implement a ChatGPT-like LLM in PyTorch from scratch, step by step

この研究では、COVID-19臨床パスウェイズの予測監視を支援するために、パイプラインを構築しました。このパイプラインには、データリフティング、時間的再構成、イベントログの構築、プリフィックスベースの表現、予測モデルの整

深層学習Transformer生成
用途
医療機器へのアクセスを予測する
難易度
Easy
コスト
High
githubGitHubあり2026-07-09

Awesome-Item-ID-Gen-RecSys — Updating curated list of research advancements on item identification and item tokenization in generative recommender systems. The survey is titled "A Survey of Item Identifiers in Generative Recommendation: Construction, Alignment, and Generation"

本研究では、生成推奨システムにおけるアイテムIDの構築、調整、生成の手法について、アイテムIDの構築方法を分析しています。

自然言語処理大規模言語モデル生成
用途
生成推奨システムのアイテムIDの問題解決
難易度
Easy
コスト
High
arxivPaper only2026-07-08

Intrinsic-Noise Consolidation: A Doob-Barrier-Conditioned Diffusion Turns Analog Device Noise into a Continual-Learning Resource

計算機による学習記憶を安定化させることができる、新しい方程式を開発した。新しい方程式により、計算機による学習記憶を正確にコンソリデーションさせることができる。

自然言語処理RAG生成
用途
計算機による学習記憶のコンソリデーション
難易度
Hard
コスト
High
githubGitHubあり2026-07-08

VoxCPM — VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning

マルチラギングスピーチ生成やクリエイティブボイスデザイン、ルートライフクライミングなど、テクスチャファリーTTSの最新技術を実現するためのフレームワークです。

生成AI音声・音楽生成生成テキスト音声
用途
マルチラギングスピーチ生成
難易度
Easy
コスト
Medium
arxivPaper only2026-07-07

6G Sensing Security: Distributed Game-Theoretic RL for Urban Beamforming and Attacker Detection

Next-generation wireless networksにおける分散型ゲーム理論を用いた6Gのセキュリティを研究します。分散型ゲーム理論は、6Gの通信システムが環境の認識とデータの伝送両方を実現するために必要な

センサ/時系列深層学習軽量化・量子化検出生成強化学習
用途
6Gにおける分散型ゲーム理論
難易度
Hard
コスト
Medium
arxivPaper only2026-07-06

A Large-Scale Sparse Multiobjective Optimization Algorithm Based on Optimal Performance Scores

この論文では、大規模スパース多目標最適化の問題に取り組むために、新しく提唱された適応可能な初期値生成アルゴリズムを提案し、アルゴリズムの効率とパフォーマンスを評価する。

品質予測/異常検知コンピュータビジョンセグメンテーション生成
用途
大規模スパース多目標最適化
難易度
Hard
コスト
Medium
githubGitHubあり2026-07-05

llm-app — Ready-to-run cloud templates for RAG, AI pipelines, and enterprise search with live data. 🐳Docker-friendly.⚡Always in sync with Sharepoint, Google Drive, S3, Kafka, PostgreSQL, real-time data APIs, and more.

この論文では、RAG、AIパイプライン、企業検索を含むクラウド テンプレートを提供するアプリケーション「llm-app」を紹介します。 llm-app は Docker で動作し、Sharepoint、Google Dr

自然言語処理大規模言語モデル生成
用途
AIパイプラインを構築する
難易度
Easy
コスト
High
arxivPaper only2026-07-02

Hybridizing a Grouping Metaheuristic with Reinforcement Learning for the One-Dimensional Bin Packing Problem

1D バイナリング パッキング問題(1D-BPP)とは、さまざまな用途に多く応用される、分配不可能なNP困難な組合せ最適化問題である。この研究では、Falkenauerのハイブリッドグループゲンエイリアスアリファメント(

表形式向き品質予測/異常検知自然言語処理RAG生成表形式強化学習
用途
1D バイナリング パッキング
難易度
Hard
コスト
Low
arxivPaper only2026-07-02

Evolutionary Wave Function Collapse

波形機能崩壊 (WFC) は、プロセス内容生成のために普及している一種メソッドで、ローカルな隣接制約を学習しながら、例の入力からより大きな出力を生成する。WFCに進化的検索を組み合わせることで生成されたレベルの評価が可能

品質予測/異常検知深層学習Transformer生成
用途
プロセス内容生成における進化的波形機能崩壊
難易度
Hard
コスト
Medium
arxivPaper only2026-07-02

Mechanism and Stability Analysis of Metabolic Closed-Loop Metaheuristics

この論文は、メタ解析システムのフレームワークレベルでの解釈を研究する。メタ解析システムのリソースループの解釈は、ナラティブのための象徴的表現だけではなく、フレームワークレベルにおいても存在するのではないかという質問を中心

深層学習Transformer生成
用途
メタ解析システムの安定性の分析
難易度
Hard
コスト
Medium
arxivPaper only2026-07-01

From Consistency to Collaborative Discovery: MFEA-CoD for Multitask Novelty Search

この研究では、多タスクの奇抜さを促進するために、エボリューション性の多タスク (EMT) を導入しました。EMT は、目標指向の最適化に焦点を当ててきましたが、共通性の構造を利用して、同時に複数の最適化問題を解決する能力

自然言語処理RAG生成
用途
多タスクの奇抜さ検索
難易度
Hard
コスト
Low
arxivPaper only2026-06-30

Distributed Hierarchical Temporal Memory with Shared Associative Memory for Cross-Entity Preemptive Warning

分散型時間関数記憶体を用いた異常検知システムを開発しました。このシステムは、関連のあるエンティティの予兆行動を共有メモリ空間に保存し、異常検知に役立ちます。このシステムは、異常検知に役立つ新しい方法を提供します。

センサ/時系列品質予測/異常検知自然言語処理RAG検出生成異常検知
用途
分散型時間関数記憶体を用いた異常検知
難易度
Hard
コスト
Low
arxivPaper only2026-06-30

Data Sharing and Competition in Learning-by-Deploying Industries: Insights from Robotics and Beyond

データ共有と競争を経済学的にもうつることの影響を分析する。この研究では、企業がデータを共有することで、競争が減るか増すかを考察し、データ共有と競争の関係を分析する。

深層学習Transformer生成
用途
データ共有と競争を経済学的にもうつることの影響を分析する
難易度
Hard
コスト
Low
arxivPaper only2026-06-12

MeEvo: Metacognitive Evolution Combined with Natural Evolution for Automatic Heuristic Design

この研究では、自動補助関数設計(AHD)についての研究を行った。AHDは、マシン学習が可能になる以前から研究されていたトピックであり、マシン学習によって、AHDがさらに活用可能になった。この研究では、AHDにおけるメタ認

品質予測/異常検知自然言語処理大規模言語モデル生成テキスト
用途
自動補助関数設計
難易度
Hard
コスト
High