generation」の検索結果

332
githubGitHubあり2026-07-25

Medical_Image_Analysis — Foundation models based medical image analysis

医学画像分析は、医療の診断や治療を支援するために画像に記載されたデータから情報を抽出する研究分野です。この研究では、foundation modelsを用い、医療画像分析のための新しいアプローチを提案しました。found

自然言語処理大規模言語モデル生成画像テキスト
用途
医学画像分析
難易度
Easy
コスト
High
githubGitHubあり2026-07-25

qdrant — Qdrant - High-performance, massive-scale Vector Database and Vector Search Engine for the next generation of AI. Also available in the cloud https://cloud.qdrant.io/

このリポジトリでは、データとAIアルゴリズムを製品化するためのプラットフォームであるTaipyを提供しています。

自然言語処理埋め込み・検索生成画像
用途
AIアプリケーションを製品化するためのプラットフォーム
難易度
Easy
コスト
Low
githubGitHubあり2026-07-25

kserve — Standardized Distributed Generative and Predictive AI Inference Platform for Scalable, Multi-Framework Deployment on Kubernetes

flyteは、高度に動的で堅牢なAIオーケストレーションプラットフォームであり、データ、モデル、コンピューティングを統合してAIワークフローを作成することができます。

自然言語処理大規模言語モデル生成
用途
エクスペリメントトラッカーを簡単にする
難易度
Easy
コスト
High
githubGitHubあり2026-07-25

haystack — Open-source AI orchestration framework for building context-engineered, production-ready LLM applications. Design modular pipelines and agent workflows with explicit control over retrieval, routing, memory, and generation. Built for scalable agents, RAG, multimodal applications, semantic search, and conversational systems.

オープンソースのAIオーケストレーションフレームワークです。LLMアプリケーションの構築に必要なパイプラインやエージェントワークフローの設計ができるようになっています。

深層学習Transformer生成要約テキスト
用途
LLMアプリケーションの構築
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

RAG_Techniques — This repository showcases various advanced techniques for Retrieval-Augmented Generation (RAG) systems. Each technique has a detailed notebook tutorial.

医学画像に対する疾患検出モデルを開発し、臨床現場で早期検出と迅速な介入を容易にすることを目的としたフレームワークを提案します。

自然言語処理大規模言語モデル生成
用途
医学画像の疾患検出
難易度
Easy
コスト
High
arxivPaper only2026-07-23

Synthetic data generation framework for quality control automation in gravure printing

印刷品質管理技術のための新しいアプローチであるシンセティック データ生成フレームワークを提案しました。このフレームワークは、ロトグラビューグラビング技術における品質管理のためのシンセティック データを生成することで、印刷

品質予測/異常検知画像検査深層学習Transformer検出生成画像
用途
印刷品質管理技術の開発
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context

この研究では、autoregressive生成のためにspeculative decodingを高速化する方法を提案している。このアプローチでは、draftキーの多くのトークンを事前に予測して、一貫性の高いオプションを提

品質予測/異常検知自然言語処理大規模言語モデル生成テキスト
用途
autoregressive生成のためのspeculative decodingの高速化
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Finite-Sample Coverage Audits for High-Recall Candidate Generation: Certification and Learning-Theoretic Design

Candidate生成は、後続のステージで重要なトークンを決定し、それらのトークンを特定するための検証ラベルを生成するステージです。この研究では、Candidate生成のための検証ラベルが必要であるが、ラベルを使用したり

自然言語処理RAG生成テキスト
用途
Candidate生成のための高収率の高確率的な検証
難易度
Hard
コスト
Low
arxivPaper only2026-07-23

Token Budget Saturation and Mechanistic Early Detection of Reasoning Non-Convergence in Chain-of-Thought Models

チェーン・オブ・サウト reasoning モデルの収束不明確さを解決する研究。このモデルの不完全収束は、生成するトークンの数に依存し、モデルには収束しない限り問題を解決する能力がない。これを解決するための予測を終了する

自然言語処理プロンプトエンジニアリング検出生成
用途
チェーン・オブ・サウト reasoning モデルに適切に予測を終了する方法を検討する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Context-weighted Discrete Flow Matching

ディスクリートフロー・マッチングにおけるコンテキストの正しい有用性の利用を検討した。この研究では、ディスクリートフロー・マッチングのモデルの正確さを高めるためにコンテキストの有用性を適切に利用する方法を提案した。

品質予測/異常検知コンピュータビジョンセグメンテーション生成テキスト
用途
ディスクリートフロー・マッチングにおけるコンテキストの有用性
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Emergent Misalignment Recruits a Pre-existing Persona Subspace

アライメントした言語モデルの偏った表現の理解を進めた。この研究では、アライメントした言語モデルの表現を分析して、偏った表現を理解することができ、これを用いて、偏った表現を正すことができると主張した。

自然言語処理ファインチューニング生成テキスト
用途
アライメントした言語モデルの偏った表現の理解
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Best-of-Evidence: Best-of-N Selection under Partial Verification

モデル出力の選択のためのBoN(ベストオブナ)を、部分検証が含まれるビジョン言語タスクに適用する。この方法により、モデル出力を効率化できる。

品質予測/異常検知コンピュータビジョンセグメンテーション生成マルチモーダル
用途
部分検証を含むビジョン言語タスクを効率化する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Position Bias is Hidden Behind Ceiling Effects: A Permutation Diagnostic for LLM Benchmarks

LLM(言語モデル)の評価における位置バイアスを分析するための方法を提案した研究で、この方法により、位置バイアスが評価結果にどのような影響を与えるかが明らかにできる。

自然言語処理大規模言語モデル検出生成
用途
LLMの評価における位置バイアスを分析する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

GraphVid: Interactive Graph-Controllable Video Generation

GraphVidは、グラフと文本から生成することができ、オブジェクトの複数の移動を正確に制御することができる。グラフではオブジェクトの動きを表す情報を保存し、文から生成の制約を指定することができる。

品質予測/異常検知生成AI動画生成生成画像テキスト
用途
コントロール可能なビデオ生成
難易度
Hard
コスト
High
arxivPaper only2026-07-23

From Resource Flow to Executable Tests: Petri-Net-Guided LLM Test Generation for Concurrent Stateful Rust APIs

この研究は、リソースフローの動作を表すPetriネットと、APIを操作するためのテストを自動生成する方法を提案した。方法は、APIの機能をテストするためのシナリオを生成し、テストが正しく実行されるようにした。

自然言語処理大規模言語モデル生成テキスト
用途
共時進行のコンカURRENCYAPIのテスト
難易度
Hard
コスト
High
arxivPaper only2026-07-23

ElasticTTT: Prior-Preserving Test-Time Tuning for Video Editing

ElasticTTTは、プログラムがテストのときに動作を調整できるようにした。方法は、テストのときにモデルが前のサンプルの情報と現在の情報を組み合わせて、ビデオを編集する際に正しく動作するようにした。

生成AI拡散モデル生成テキスト動画
用途
ビデオ編集時のテスト タイムチューニング
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Artificial Epanorthosis: Why large language models overuse a classical rhetorical figure, and how to mitigate it

Artificial Epanorthosisは、大規模言語モデルが古典的なルレチックの表現を使用する傾向に注目した。結果は、モデルのトレーニングデータの形状がこの傾向に影響していることができた。

深層学習軽量化・量子化分類生成テキスト
用途
大規模言語モデル上のエパノルシス
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Euclid-MCP: A Model Context Protocol Server for Deterministic Logical Reasoning via Prolog

大規模言語モデルの長所である自然言語理解と生成を引き出しつつ、確実性のある論理的推論を実現したい。そのための最近の対話型アプローチもあるが、そのような統合は通常ユーザー定義のものに留まっている。そのため、安全性を確保でき

表形式向き自然言語処理大規模言語モデル生成テキスト
用途
安全性を確保した論理的推論
難易度
Hard
コスト
High
arxivPaper only2026-07-23

An LLM-Driven Workflow for Automated Process Control Strategy Generation and Tuning from Dynamic Process Models

このプロセスでは、大規模言語モデルを使用して、ダイナミックプロセスモデルに基づいて自動化された制御戦略を生成します。

少数データ向きCPUで試しやすい条件最適化自然言語処理大規模言語モデル生成
用途
オートメーションされた制御戦略の生成
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Traceable Scholarship: Page Anchors and Ariadne's Thread for Humanistic Inquiry in the Age of Generative AI

生成型のAIにより、論文を数秒で生成することができるが、フリーランスではありません。論文のフリーランスに基づく説明や証拠を提供するには、源の追跡が必要です。Traceable Scholarshipでは、ページアンカーの

自然言語処理大規模言語モデル生成テキスト
用途
学術論文の信頼性と透明性
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Source-Prior-Driven Selective Adaptation for Efficient Diffusion Model Finetuning

大きな拡散モデルを新しいドメインまたはスタイルでフィニチューニングする際には、ターゲット特異的生成を向上させると、事前にトレーニングされたモデルを拡散する能力が低下することがある。この問題を解決するために、この研究では、

深層学習軽量化・量子化生成
用途
分化モデルを効率的にフィニチューニングする
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions

Deep Researchエージェントは、LLMベースのアシスタントを長方形ワークフローに拡張するが、信頼性についてはまだ十分に研究されていない。特に、ある情報環境で信憑性な情報を得ることができるが、事実上の間違っている

品質予測/異常検知自然言語処理大規模言語モデル生成テキスト
用途
深い研究を信頼できるかどうかを確認する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Search Hardness-Aware LLM-Based Problem Formulation for Expensive Simulation-Driven Design

シミュレーション駆動設計では、高精度なシミュレーションを少なくすることで設計を実現しています。既存の手法では、その問題に取り組むために最適化アルゴリズムが改善されてきましたが、問題の定義自体は検討されていません。この論文

深層学習軽量化・量子化生成
用途
コスト削減的なシミュレーション駆動設計
難易度
Hard
コスト
High
arxivPaper only2026-07-23

MedGame: Storytelling Gamification Empowered by Large Language Models for Medical Education

Large Language Models (LLMs) は医学教育に大きな可能性を持っていますが、現在のシステムでは、質問に答えるか一時的なフィードバックしか行なわれていません。一方、臨床病例を決定センターへの学習トレ

自然言語処理大規模言語モデル生成QAテキスト
用途
医学教育への Large Language ModeL の適用
難易度
Hard
コスト
High
arxivPaper only2026-07-23

An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

この論文では、音声字幕の評価手法が提案され、音声字幕の評価において既存の手法の制約を克服することを目指しました。提案されたフレームワークは音声字幕の各側面を評価し、質問回答型の評価手法ではなく字幕の中立性を評価することが

センサ/時系列自然言語処理大規模言語モデル生成テキスト音声
用途
音声字幕の評価フレームワークの構築
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning

長形推論のための言語モデルが、提供されたコンテキストから乖離した論理を生成する可能性があることを指摘し、コンテキストと推論論理をより適切に融合するため、 REFACT (REstating Facts in Adapti

自然言語処理大規模言語モデル生成テキスト
用途
Chain-Of-Thought (CoT) の改善
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

Inference-Time Scaling of Diffusion Models via Progressive Seed Pruning

ディフュージョンモデルにおける初期的なNoise Seed の影響が、モデルが生成する高質のイメージに大きく影響していることを提示し、Seed Search 時の時間的負荷を削減するための方法を提案した。

品質予測/異常検知深層学習軽量化・量子化生成画像テキスト
用途
ディフュージョンモデルのサケリング
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

Future Rendering $\neq$ Future Surface: A Benchmark and Dataset for Dynamic Surface Reconstruction Beyond the Observed Window

この研究では、従来では評価対象外にされている未来の表面再構築の定式化と評価を提案しました。この研究では、将来の表面の再構築を目的とした診断的なベンチマークおよびデータセット、FutureSurfを開発しました。

品質予測/異常検知コンピュータビジョン3D・点群生成3D
用途
時間軸を超えた表面再構築
難易度
Hard
コスト
High
arxivPaper only2026-07-23

GrainGS: Gradient-Decoupled Gaussian Splatting for Efficient Dynamic Novel View Synthesis

3Dガウシアンスプレイティングによる動的なシーン再構成は、動的なモーションモデリング、構造的安定性とコンパクトな表現のバランスをとることが求められる。実際、既存のprimitive毎に実際に実装されている方法はローカルの

品質予測/異常検知深層学習軽量化・量子化生成3D
用途
3D Gaussian Splatting動的シーン再構成
難易度
Hard
コスト
High
arxivPaper only2026-07-23

HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models

大規模言語モデルはさまざまな画像をテキストに変換する上で優れた性能を示しているが、発生するホログラフィックな診断にはまだ解決策が必要です。この研究では、主流の粗い検出方法の欠点を補うため、細部の診断方法を提案しています。

説明可能自然言語処理大規模言語モデル分類検出生成
用途
ホログラフィックハロウィーンの診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

空間理解は、物理世界と静的のセマンティック理解の間でつながるために不可欠です。多くの空間タスクは、場所、領域、パスの自然な表現は、ポインティングやマーキングなど、連続的な視覚的シーンで行われることが多いが、現行の空間推論

自然言語処理大規模言語モデル生成画像テキスト
用途
空間理解
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Unsupervised Metal Artifact Reduction in Dental CBCT using Fine-tuned Cycle-Consistent Adversarial Networks

この研究では、歯科CBCT画像中のメタルアーティファクトを除去するための循環互換的アドバーサリアルネットワーク(CycleGAN)を提案します。CycleGANを使用すると、メタルアーティファクトを除去した後、CBCT画

品質予測/異常検知自然言語処理RAG生成画像教師なし
用途
メタルアーティファクトの除去
難易度
Hard
コスト
Low
arxivPaper only2026-07-23

TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation

オートメーションされたマニピュレーションを目的とした、大規模なテーブルトップのデータセットであるTableVerse を提案します。このデータセットには、物理的に可能な実世界のレイアウトを生成する実用的な方法が含まれてお

品質予測/異常検知自然言語処理RAG生成画像テキスト
用途
オートメーションされたマニピュレーションのためのテーブル環境の生成
難易度
Hard
コスト
Low
arxivPaper only2026-07-23

Distributed Model-Based Diffusion For Scalable Multi-Robot Trajectory Optimization

多ロボットのトラッジオプティマイズを目的とした、分散型のモデリングベースの浸透を提案します。このフレームワークは、非凸の非線形の非可微分な環境を考慮しながら、効率的なトラッジ作成を支援します。

自然言語処理RAG生成
用途
多ロボットのトラッジオプティマイズ
難易度
Hard
コスト
High
githubGitHubあり2026-07-23

Causal-Forcing — [ICML 2026] Official codebase for "Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation" & Causal Forcing++

この論文では、Causal-Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive

品質予測/異常検知深層学習軽量化・量子化生成テキスト動画
用途
高品質のビデオ生成を実現する。
難易度
Easy
コスト
High
arxivPaper only2026-07-22

Machine-Learned Compact Subspace Generation for Quantum Selected Configuration Interaction within Density Matrix Embedding Framework

分子構造に関する情報を直接復元することができるQuantum Diagonalization (QD)を改良し、配置復元を効率的に実現するために機械学習ベースのモデリングを提案した。

自然言語処理RAG生成テキスト
用途
電子構成インタラクションの機械学習ベースモデリング
難易度
Hard
コスト
Low
arxivGitHubあり2026-07-22

Antigen-specific Antibody Multi-modal Foundation Model for Functional Antibody Design

この研究では、抗原特異性抗体を設計するために、抗原および抗体の間でエピトープレベルでのペアリングが必要であることを考慮した、抗原特異性の抗体多モーダルファンデーションモデル(AAMFM)を提案しました。

自然言語処理RAG分類生成テキスト
用途
抗原特異性抗体設計
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Hypothesis-and-Refinement Learning of Organic Structures from Multimodal Spectroscopic Data

分子構造を決定するために、スペクトルデータから自動的な構造解析を実施するための方法を提案している。この方法は、スペクトルデータに基づいてヒントと改良を繰り返すことで、分子構造を決定するもので、分子の可能性の広範な構造スペ

MI向き自然言語処理ファインチューニング生成テキストマルチモーダル
用途
分子構造の解析
難易度
Hard
コスト
High
arxivPaper only2026-07-22

How Fast Can Reward Models Score? A Systems Study of C++ and PyTorch Inference Runtimes for RLHF

RLHFのバックボーンとしてのスコアリングを高速化する技術が提唱される。この技術は、PythonとC++のインフェランスパフォーマンスを比較検討し、C++がPyTorchより高速であることを示し、ロールアウト生成とスコア

CPUで試しやすいコンピュータビジョンセグメンテーション生成
用途
スコアリングの高速化
難易度
Hard
コスト
Medium
arxivPaper only2026-07-22

Multi-Mask Diffusion Language Models for Few-Step Generation

この研究では、多マスク分散言語モデルを提案します。このモデルには、複数のマスクがあり、それぞれが異なる生成タスクを実行することになります。このモデルは、生成タスクの多様性を高めることができ、生成された文がより多様性の高い

品質予測/異常検知深層学習軽量化・量子化生成テキスト
用途
リトルバイトの生成
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Nuclear Quantum Effects as a Denoising Problem

この研究では、核量子効果をシミュレートするために、画像時刻パス積分を利用した分散機械学習アルゴリズムを提案します。このアルゴリズムは、分散機械学習を利用して核量子効果をシミュレートすることに成功し、核量子効果に関連する問

MI向きコンピュータビジョンセグメンテーション生成テキスト
用途
核量子効果のシミュレーション
難易度
Hard
コスト
High
arxivPaper only2026-07-22

DS@GT ARC at ImageCLEFmed GANs 2026: Geometric Filtering for Privacy-Preserving CT Slice Generation

この研究では、画像CLEFmed GANs 2026のイベントで利用可能なプライバシープリザーブCTスラ이스生成にフォーカス。開発されたアプローチは最適な輸送条件フローマッチングとプライバシーの考慮を含むトレーニング、お

自然言語処理埋め込み・検索生成画像
用途
医学画像処理
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Demonstrating GenDB: Instance-Optimized and Customized Query Processing Code Generation via LLM Agents

この研究では、分析的データ処理システムを作成するための自動生成手法を開発した。この研究では、GenDBを開発し、分析的データ処理システムを作成するために使用されるSQLクエリを生成した。これにより、データ分析を迅速かつ効

品質予測/異常検知画像検査深層学習軽量化・量子化生成画像テキスト
用途
分析的データ処理システムの自動生成
難易度
Hard
コスト
High
arxivPaper only2026-07-22

RealVDeblur: One-Step Diffusion for Generalizable Real-World Video Deblurring

この研究では、映像の不鮮明度を除去するためのAI技術を開発した。 RealVDeblurは、映像の不鮮明度を除去するためのAIフレームワークで、複雑な運動パターンと複雑な損傷を考慮して、映像の不鮮明度を除去できます。

品質予測/異常検知深層学習軽量化・量子化生成テキスト動画
用途
映像の不鮮明度の除去
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Persian Pixel: A large-scale synthetic OCR dataset for Persian language

この研究では、ペルシャ文字の用途に適したデータセットを構築した。Persian Pixelは、ペルシャ文字の用途に適した、大規模な合成OCRデータセットです。これにより、ペルシャ文字を読み取ることの精度が向上します。

品質予測/異常検知深層学習Transformer分類生成画像
用途
OCRのためのペルシャ文字のデータセット
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PoTRE: Test-Time Reasoning inspired by Cognitive Heterogeneity

モデルの脆弱性を解決するために、四つのエージェントに分割される多様なフレームワークPoTREを導入した。モデルの推論能力を強化し、単一のストリーミングアプローチよりも複雑な理論的制約とアブストラクションに抵抗できるように

表形式向き自然言語処理大規模言語モデル生成テキスト
用途
複雑な推論力のあるタスクの解決
難易度
Hard
コスト
High
arxivPaper only2026-07-22

The Maskability Index: Predicting Task-Objective Alignment in Pretrained Language Models

ある知識関係がマスクスタイルのパラミトリックパラメータ化方法で適切かどうかを計算したメトリックとしてMaskability Index (MI)を導入した。DepthRankの違いを用いて、与えられたパラメータ化方法で知

少数データ向き深層学習Transformer生成テキスト
用途
強い知識獲得タスクでのパフォーマンスの向上
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

3つのタスクをサポートする音曲生成フレームワークを提示した。これらのタスクには、歌詞、テキストの説明、音楽的特性を利用して、歌詞の生成、バンドの音楽の生成、カバー曲の生成などが含まれる。

品質予測/異常検知深層学習軽量化・量子化生成テキスト音声
用途
音楽の生成
難易度
Hard
コスト
High
arxivPaper only2026-07-22

DQAOA-GPT: AI-Accelerated Distributed Quantum Optimization for Combinatorial Problems

組み合わせ方程式の最適化を解くための新しいフレームワークを提示した。分布される量子アルゴリズムの局所的な制限に直面する際、最適化の解を導けるために、分布される量子近似最適化アプローチと深層学習アルゴリズムを組み合わせた。

品質予測/異常検知自然言語処理大規模言語モデル生成
用途
方程式組み合わせの最適化
難易度
Hard
コスト
High
arxivPaper only2026-07-22

StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation

オフラインでの短時間の視覚生成が一般的な人間の行動の分析では、人間の行動の長期的な視覚生成は、実践的な長時間の視覚生成では実行不能である。StreamHOI は、人間間の視覚的な行動の生成を生成したいくつの画像を使用して

MI向き品質予測/異常検知深層学習Transformer生成画像動画
用途
人物間の相互作用による視覚生成
難易度
Hard
コスト
High
arxivPaper only2026-07-22

CUSUM-Shaped Inference-Time Monitoring and Targeted Re-Decoding for Quantized Small Language Model Reasoning

量子化された小規模な自律的推論モデルは長く繰り返される思考回路や無駄な回路に入る可能性があります。この問題に対処するために、以前開発されたtokenレベルのe-CUSUMコントローラの基板の上に、MGT-B (Monit

自然言語処理RAG検出生成回帰
用途
不要な長い思考回路の抑制
難易度
Hard
コスト
Low
arxivPaper only2026-07-22

Language-Specific versus Cross-Lingual Knowledge Graphs for Implicit Aspect Identification in Arabic: A Comparative Study of Reasoning and Adaptation Strategies

アラビアsentiment分析には、文章中で明示的に述べられていないアスペクトを抽出する機能が必要です。これは、オプションの言語モデルにアッセメントグラフを使用して実現できますが、低リソース言語であるアラビア語では、この

自然言語処理大規模言語モデル生成テキスト
用途
Arabiasentiment分析
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

危険な問題に対する正しい答えを提供する大きな言語モデルと費用の効率が良い、小さな言語モデルを協力させる技術が開発されました。

深層学習軽量化・量子化生成テキスト
用途
小さな言語モデルを大きい言語モデルと協力させる手法が効率的かつ安全に実装される
難易度
Hard
コスト
High
arxivPaper only2026-07-22

VizRAG: Enhancing Retrieval-Augmented Generation with Hypergraph Visualization

グラフやハイパーグラフを用いたリテラル・アンダラインは、複雑なn-アライアブル原子事実をエンティティ間の単一の関係を頼らない、エンティティ間の関係を明示することで、従来のグラフベースのアプローチを上回る精度を実現している

自然言語処理大規模言語モデル生成画像テキスト
用途
リテラル・アンダラインの精度評価
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

3D オキュピエンシー予測には、物体の配置と密度を解釈するための視覚的手法が必要です。従来の方法では、計算コストが高くなりすぎていたが、新しく提案されたGaussianSeedアルゴリズムは、層を階層化することで、計算コ

品質予測/異常検知自然言語処理大規模言語モデル生成テキスト
用途
3次元空間における物体の配置と密度の予測
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Ocular Verification for Virtual Reality

VRヘッドセットのユーザー認証を実現する上で、目の虹彩認証が重要な要素となる。しかし、VR環境では、無制限な受理やVR環境の特殊性など、従来の眼瞼認証では対処が難しい点がある。そのため、VR環境でeye瞳認証を実現するた

品質予測/異常検知コンピュータビジョンマルチモーダル分類生成画像
用途
iris認証
難易度
Hard
コスト
High
arxivPaper only2026-07-22

3D-GIMP: When 3D Gaussian Inpainting Meets PatchMatch

3Dシーンの編集を実現するための新しいフレームワークを提唱した。提案されたフレームワークは、まず補間モデルの更新処理に使用できる3D Gaussian Inpaintingを利用して、3Dオブジェクトが破損した部分を削除

品質予測/異常検知自然言語処理RAG生成テキスト3D
用途
3Dオブジェクトの削除と再構成
難易度
Hard
コスト
High
arxivPaper only2026-07-22

A real-time RGB-D perception pipeline for autonomous impact hammers in mining: self-filtering, rock segmentation and rock-breaking poses generation

下層掘削工事で使用されるハイドラルックブレーカーは重要な機械の一つである。しかし、運用効率の向上を実現するには機械の操作の自動化が必須である。そのため、地上掘削工事用

コンピュータビジョンセグメンテーション生成画像3D
用途
機械の操作の自動化
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

ビデオキャプション生成には、空間と時刻の理解が重要です。PercepCapアルゴリズムは、ビデオ入力を空間時刻認識に分解することで、生成されたキャプションの理解度が向上するとともに、空間時刻の誤差をより正確に検出でき、キ

品質予測/異常検知自然言語処理大規模言語モデル生成動画強化学習
用途
ビデオキャプション生成のための構造化された空間時刻の理解
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Self Gradient Forcing: Native Long Video Extrapolation

長時間ビデオエクストラポレーションには、高度な視覚的知能が必要です。Self Gradient Forcingアルゴリズムは、学生モデルを教師モデルから生成される歴史の下で学習させることで、長時間ビデオエクストラポレーシ

コンピュータビジョンセグメンテーション生成テキスト動画
用途
長時間ビデオエクストラポレーションのための自力勾配強制
難易度
Hard
コスト
High
arxivGitHubあり2026-07-22

Evolving Cache Schedules for Fast Diffusion Policy Inference

分散式推論には、高解像度ビデオ生成のためにコストが高いという問題があります。Evolving Cache Schedulesアルゴリズムは、コストと効率性のトレードオフを最適化することで、キャッシュで推論コストを削減しま

深層学習Transformer生成
用途
分散式推論のためのキャッシュスケジュールの進化
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Importance-Aware OBS Pruning for Diffusion Models

セグメンテーションのパフォーマンスの向上と計算的リソースの削減を目的として、Lean-SAM2は対象領域をアサインする対象アンバウンダリーセグメンテーション(SAM2)にターゲットアンチャイニングされたメモリとエンコーダ

深層学習軽量化・量子化生成画像
用途
画像のセグメンテーションに効率を実現
難易度
Hard
コスト
High
arxivPaper only2026-07-22

STEREOFLOW: Progressive Stereo Matching with StereoDiT and Transition Flow Matching

ステレオマッチングは3次元再構成において重要なタスクです。この研究では、ステレオマッチングを確率的生成タスクと組み合わせ、オブジェクト検出の向上を目的として、ステレオマッチングフレームワークと潜在分配を統合する方法を提案

深層学習Transformer生成回帰画像
用途
オブジェクト検出の向上
難易度
Hard
コスト
High
arxivPaper only2026-07-22

WearWow: Native 2K Multi-Garment Virtual Try-On via Adaptive Token Packing and Preference Alignment

この研究では、WearWowを提案します。これは、1人目が着る服の試着画像を生成するフレームワークです。記憶量の爆発を防ぐために、Adaptive 2D Token Packing (ATP) を使用しています。

品質予測/異常検知自然言語処理RAG生成テキスト
用途
1人目が着る服の試着画像生成
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PRISM-DR: Per-lesion Retinal Inference with Specialist Models for Diabetic Retinopathy

この研究では、糖尿病性黄斑病変の検出を目的としたPRISM-DRシステムを開発しました。このシステムは、医師が見逃す可能性がある小さな低コントラストな病変を見つけるのに役立ちます。

少数データ向きCPUで試しやすい条件最適化自然言語処理ファインチューニング検出生成画像
用途
糖尿病性黄斑病変を検出する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation

自律ロボットには、障害物や事故の回避能力が必要です。これは、障害物や事故の回避能力が強化されていれば、障害物や事故に対しての対策がより効果的になります。障害物や事故の回避能力が強まることで、ロボットが障害物や事故から安全

品質予測/異常検知自然言語処理ファインチューニング生成セグメンテーション画像
用途
自動ロボットが障害物や事故を回避できるようにする
難易度
Hard
コスト
High
arxivPaper only2026-07-22

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

Language-Guided Grasping は、複雑なシーンで物体の把持を行うために、視覚言語モデル(VLM)を用いる。このアプローチでは、VLM は直接把持を予測するのではなく、3 次元空間における把持の位置を指

深層学習軽量化・量子化生成テキスト3D
用途
複雑なシーンで物体の把持を実現
難易度
Hard
コスト
High
githubGitHubあり2026-07-22

Awesome-CVPR2026-CVPR2025-ICCV2025-CVPR2024-ECCV2026-ECCV2024-AIGC — A Collection of Papers and Codes for CVPR2026/CVPR2025/ICCV2025/CVPR2024/ECCV2026/ECCV2024 AIGC

CVPRに基づくAIを取り入れるための資料集を提供します。CVPR 2026、2025、2024、およびECCV 2024に基づくAIGCに関する研究論文とソフトウェアコードを含みます。

コンピュータビジョン3D・点群生成画像動画
用途
AIをCVPRに応用する
難易度
Easy
コスト
High
arxivPaper only2026-07-21

Supra Cognitive Modes: A Routed Architecture for Agent Memory

この研究では、エージェントメモリーのワークロードは直接的事実検索、関係連鎖や現在の状態の推論、長時間の履歴上に関係がある合成を組み合わせて、Supra Cognitive Modes を開発しました。このアーキテクチャで

品質予測/異常検知自然言語処理埋め込み・検索分類生成
用途
メモリアーキテクチャの設計
難易度
Hard
コスト
Low
arxivPaper only2026-07-21

HindsightBench: A Black-Box Behavioral Audit Protocol for Parametric Hindsight in Time-Indexed LLM Decision Tasks

大規模言語モデルは、決定タスクを遂行する過程で、実行された事実を含むパラメトリックな知識を漏らす傾向にある。大規模言語モデルが実際にどのような意思決定タスクを遂行したかを検証するのは困難であるものの、これが確かに事実であ

深層学習軽量化・量子化生成テキスト
用途
LLMによる金融意思決定タスクの検証
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning

離散RLは、長所と短所を含む複雑なランク付けゴールの最適化に効果があります。しかし、その計算コストは通常高く、自動微分化などの複雑なグラadientsの計算アラウンドを必要とします。この文書では、長所と短所を含むランク付

説明可能深層学習Transformer生成強化学習
用途
離散RLアルゴリズムの性能アップデート
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor Fusion

この研究では、高空飛行の無信号位置指示のNGPS (Next-Generation Positioning System)というフレームワークを提案しました。NGPSは、GPSの信号を利用せずに位置推定を可能にします。N

センサ/時系列コンピュータビジョン動画認識検出生成画像
用途
高空飛行の無信号位置指示
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Correct-by-Construction Behavior Tree Synthesis from Signal Temporal Logic Specifications with Application to Robotic Missions

行動木はロボットの複雑なタスクの実行に広く採用されており、モジュラーで反応的な制御を提供します。しかし、既存の合法的な生成方法は、線形時間論理(LTL)のみに制限されるため、量的タイミング制約を表現できません。この論文で

自然言語処理RAG生成
用途
行動木の合法的な生成を解決する
難易度
Hard
コスト
Low
arxivPaper only2026-07-21

End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation

この文書では、閉回路交通シナリオ生成のための変分ベースのアプローチ「E2E-CDiff」を提案しました。これを使用すると、実世界に近い交通ルールを生成したり、交通ルールを操作することができるようになります。

生成AI拡散モデル生成画像
用途
自動運転データの生成
難易度
Hard
コスト
High
githubGitHubあり2026-07-21

agent-starter-pack — Ship AI Agents to Google Cloud in minutes, not months. Production-ready templates with built-in CI/CD, evaluation, and observability.

AIエージェントをGoogle Cloudに展開することが可能で、CI/CD、評価、観察など、プロダクションリードテンプレートが事前に用意されています。

自然言語処理大規模言語モデル生成
用途
AIエージェントをGoogle Cloudに展開
難易度
Easy
コスト
High
arxivPaper only2026-07-20

FinSAgent: Corpus-Aligned Multi-Agent RAG Framework for Evidence-Grounded SEC Filing Question Answering

金融質問回答を実行するには、長い標準化されて高度に冗長な説明書に分散する証券取引委員会(SEC)の証拠を取得する必要がある。既存の取得を拡張するおよび多要素システムの多くの選択肢は、モデルの先行事項と目的のファイルリング

深層学習軽量化・量子化生成QAテキスト
用途
金融質問回答問題を解決
難易度
Hard
コスト
Low
arxivPaper only2026-07-20

From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation

この論文では、ラインダブルロボットのための自発的アクション生成を実現することを目標とし、vision-language 指向性の指令によりロボットが自発的に動作することができることを示します。

コンピュータビジョン3D・点群生成画像3D
用途
ラインダブルロボットのための自発的アクション生成
難易度
Hard
コスト
High
arxivPaper only2026-07-16

Diffusion models recover accurate mixture weights despite score function insensitivity

スコアベース生成モデルにおけるモード分解能の向上を目的とした研究で、モード分解能がスコア関数に依存しておらず、生成サンプルから混合重みを推測できることを明らかにした。

深層学習Transformer生成マルチモーダル
用途
スコアベース生成モデルにおけるモード分解能の向上
難易度
Hard
コスト
High
arxivPaper only2026-07-16

NeuronSoup: Evolving Asynchronous, Shared-Neuron Temporal Graphs without Backpropagation

この研究では、共有ニューロンを使用して時系列グラフを学習する方法、NeuronSoup を開発しました。NeuronSoup では、各パスの信号は、変数数の間のニューロンを通過する途中で、共有ニューロンを使用して伝票され

深層学習Transformer分類生成
用途
神経ネットワークの共有ニューロンによる時系列グラフの学習
難易度
Hard
コスト
Low
githubGitHubあり2026-07-14

memvid — Memory layer for AI Agents. Replace complex RAG pipelines with a serverless, single-file memory layer. Give your agents instant retrieval and long-term memory.

MemVidは、サーバーレスで単一ファイルの記憶層を提案し、AIエージェントが即時検索と長期的な記憶を持つようにする記憶層です。

自然言語処理大規模言語モデル生成テキスト動画
用途
AIエージェントの記憶を管理する
難易度
Easy
コスト
High
githubGitHubあり2026-07-11

LLMs-from-scratch — Implement a ChatGPT-like LLM in PyTorch from scratch, step by step

この研究では、COVID-19臨床パスウェイズの予測監視を支援するために、パイプラインを構築しました。このパイプラインには、データリフティング、時間的再構成、イベントログの構築、プリフィックスベースの表現、予測モデルの整

深層学習Transformer生成
用途
医療機器へのアクセスを予測する
難易度
Easy
コスト
High
githubGitHubあり2026-07-09

Awesome-Item-ID-Gen-RecSys — Updating curated list of research advancements on item identification and item tokenization in generative recommender systems. The survey is titled "A Survey of Item Identifiers in Generative Recommendation: Construction, Alignment, and Generation"

本研究では、生成推奨システムにおけるアイテムIDの構築、調整、生成の手法について、アイテムIDの構築方法を分析しています。

自然言語処理大規模言語モデル生成
用途
生成推奨システムのアイテムIDの問題解決
難易度
Easy
コスト
High
arxivPaper only2026-07-08

Intrinsic-Noise Consolidation: A Doob-Barrier-Conditioned Diffusion Turns Analog Device Noise into a Continual-Learning Resource

計算機による学習記憶を安定化させることができる、新しい方程式を開発した。新しい方程式により、計算機による学習記憶を正確にコンソリデーションさせることができる。

自然言語処理RAG生成
用途
計算機による学習記憶のコンソリデーション
難易度
Hard
コスト
High
githubGitHubあり2026-07-08

VoxCPM — VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning

マルチラギングスピーチ生成やクリエイティブボイスデザイン、ルートライフクライミングなど、テクスチャファリーTTSの最新技術を実現するためのフレームワークです。

生成AI音声・音楽生成生成テキスト音声
用途
マルチラギングスピーチ生成
難易度
Easy
コスト
Medium
arxivPaper only2026-07-07

6G Sensing Security: Distributed Game-Theoretic RL for Urban Beamforming and Attacker Detection

Next-generation wireless networksにおける分散型ゲーム理論を用いた6Gのセキュリティを研究します。分散型ゲーム理論は、6Gの通信システムが環境の認識とデータの伝送両方を実現するために必要な

センサ/時系列深層学習軽量化・量子化検出生成強化学習
用途
6Gにおける分散型ゲーム理論
難易度
Hard
コスト
Medium
arxivPaper only2026-07-06

A Large-Scale Sparse Multiobjective Optimization Algorithm Based on Optimal Performance Scores

この論文では、大規模スパース多目標最適化の問題に取り組むために、新しく提唱された適応可能な初期値生成アルゴリズムを提案し、アルゴリズムの効率とパフォーマンスを評価する。

品質予測/異常検知コンピュータビジョンセグメンテーション生成
用途
大規模スパース多目標最適化
難易度
Hard
コスト
Medium
githubGitHubあり2026-07-05

llm-app — Ready-to-run cloud templates for RAG, AI pipelines, and enterprise search with live data. 🐳Docker-friendly.⚡Always in sync with Sharepoint, Google Drive, S3, Kafka, PostgreSQL, real-time data APIs, and more.

この論文では、RAG、AIパイプライン、企業検索を含むクラウド テンプレートを提供するアプリケーション「llm-app」を紹介します。 llm-app は Docker で動作し、Sharepoint、Google Dr

自然言語処理大規模言語モデル生成
用途
AIパイプラインを構築する
難易度
Easy
コスト
High
arxivPaper only2026-07-02

Hybridizing a Grouping Metaheuristic with Reinforcement Learning for the One-Dimensional Bin Packing Problem

1D バイナリング パッキング問題(1D-BPP)とは、さまざまな用途に多く応用される、分配不可能なNP困難な組合せ最適化問題である。この研究では、Falkenauerのハイブリッドグループゲンエイリアスアリファメント(

表形式向き品質予測/異常検知自然言語処理RAG生成表形式強化学習
用途
1D バイナリング パッキング
難易度
Hard
コスト
Low
arxivPaper only2026-07-02

Evolutionary Wave Function Collapse

波形機能崩壊 (WFC) は、プロセス内容生成のために普及している一種メソッドで、ローカルな隣接制約を学習しながら、例の入力からより大きな出力を生成する。WFCに進化的検索を組み合わせることで生成されたレベルの評価が可能

品質予測/異常検知深層学習Transformer生成
用途
プロセス内容生成における進化的波形機能崩壊
難易度
Hard
コスト
Medium
arxivPaper only2026-07-02

Mechanism and Stability Analysis of Metabolic Closed-Loop Metaheuristics

この論文は、メタ解析システムのフレームワークレベルでの解釈を研究する。メタ解析システムのリソースループの解釈は、ナラティブのための象徴的表現だけではなく、フレームワークレベルにおいても存在するのではないかという質問を中心

深層学習Transformer生成
用途
メタ解析システムの安定性の分析
難易度
Hard
コスト
Medium
arxivPaper only2026-07-01

From Consistency to Collaborative Discovery: MFEA-CoD for Multitask Novelty Search

この研究では、多タスクの奇抜さを促進するために、エボリューション性の多タスク (EMT) を導入しました。EMT は、目標指向の最適化に焦点を当ててきましたが、共通性の構造を利用して、同時に複数の最適化問題を解決する能力

自然言語処理RAG生成
用途
多タスクの奇抜さ検索
難易度
Hard
コスト
Low
arxivPaper only2026-06-30

Distributed Hierarchical Temporal Memory with Shared Associative Memory for Cross-Entity Preemptive Warning

分散型時間関数記憶体を用いた異常検知システムを開発しました。このシステムは、関連のあるエンティティの予兆行動を共有メモリ空間に保存し、異常検知に役立ちます。このシステムは、異常検知に役立つ新しい方法を提供します。

センサ/時系列品質予測/異常検知自然言語処理RAG検出生成異常検知
用途
分散型時間関数記憶体を用いた異常検知
難易度
Hard
コスト
Low
arxivPaper only2026-06-30

Data Sharing and Competition in Learning-by-Deploying Industries: Insights from Robotics and Beyond

データ共有と競争を経済学的にもうつることの影響を分析する。この研究では、企業がデータを共有することで、競争が減るか増すかを考察し、データ共有と競争の関係を分析する。

深層学習Transformer生成
用途
データ共有と競争を経済学的にもうつることの影響を分析する
難易度
Hard
コスト
Low
arxivPaper only2026-06-12

MeEvo: Metacognitive Evolution Combined with Natural Evolution for Automatic Heuristic Design

この研究では、自動補助関数設計(AHD)についての研究を行った。AHDは、マシン学習が可能になる以前から研究されていたトピックであり、マシン学習によって、AHDがさらに活用可能になった。この研究では、AHDにおけるメタ認

品質予測/異常検知自然言語処理大規模言語モデル生成テキスト
用途
自動補助関数設計
難易度
Hard
コスト
High