embedding」の検索結果

86
arxivPaper only2026-07-24

DCS: A Unified Conditional Sensitivity Framework for Cross-Modal Copyright Infringement Detection

画像コピーライト侵害検-outのために、新しい統合された検出フレームワークを開発した。このフレームワークは、侵害の有力性を特性の変化として視覚化し、侵害判定のためにコピーライトの保護されたターゲットの条件付き分布シフトを

説明可能深層学習Transformer検出回帰画像
用途
コピーライト侵害検-out のための特性識別
難易度
Hard
コスト
High
arxivPaper only2026-07-24

PRIMS: Physics-guided Representation for Fluid Identification in Multimodal Sensing

液体の識別は、ミクロ流動の応用に不可欠であり、しかし、流況、圧力、温度を取り巻く条件が変化することで、信頼性が失われるのである。この研究では、物質の物理的関係を考慮し、視覚的シグナルを結合することで、物質を識別するための

説明可能センサ/時系列深層学習Transformer分類異常検知埋め込み
用途
物質の識別
難易度
Hard
コスト
High
arxivPaper only2026-07-24

TextSLIP: Text Self-Supervised CLIP for Medical Report Generation

ラジオリジー報告の自動化は、報告の連続性と臨床ワークフローを改善するために重要です。 CLIPは、医学分野の視覚言語モデリングを進歩させましたが、既存のCLIPスタイルアプローチでは、複雑な報告生成において十分なfine

自然言語処理ファインチューニング生成埋め込み画像
用途
medical Report Generation
難易度
Hard
コスト
High
arxivPaper only2026-07-24

Three-Body Alignment: Aligning Chess Agent with Human Reasoning through Reranked Rationale

人間の推論とマシン・リーザーの推論を一致させることがAIセキュリティーやセーフティーにおける課題です。人間の推論とマシンの推論を対称化することで、AIシステムを安全かつ予測可能なものとすることができます。

説明可能深層学習軽量化・量子化検索画像テキスト
用途
人間の推論とマシン・リーザーの推論の対称化
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models

認知機能障害(CI)は重大な公衆衛生上の懸念となっている。早期発見と精度の高い診断は、適切な介入と患者結果の向上に不可欠である。この研究では、スピーチベースのCI検出が有望な非侵襲的アプローチであることを示唆している。最

センサ/時系列自然言語処理大規模言語モデル分類検出埋め込み
用途
認知機能障害の早期発見のためのスピーチベースのマルチモーダル大規模言語モデル
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Compact Latent Coordination for Autonomous Vehicles at Unsignalized Intersections

自律車は人間の協調を必要としますが、交通信号機のない交差点では協調が困難です。この研究では、複数の自律車を操作するための新しいアプローチが提案されていて、Master-AgentProto-planSystem(MAPS

自然言語処理RAG強化学習
用途
交通信号機のない交差点のコミュニティでの自律車の協調
難易度
Hard
コスト
Low
arxivPaper only2026-07-23

M$^3$-Gen: Interpretable Multimodal Generation of Gene Expression Profiles Using Clinical and Imaging Data

この研究では、臨床データと画像データを用い、臓器の遺伝子発現プロファイルを予測することができます。提唱されるM^3-Genフレームワークは、生成的アジバーサリアルネットワークを用い、臨床データと画像データを組み合わせた方

説明可能自然言語処理RAG生成画像マルチモーダル
用途
臓器の遺伝子発現プロファイルの予測問題
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Counterfactual Explainability Framework With CycleGAN And Counterfactual-Classifier Alignnment Score for Retinal Disease Classification

ロシア語で構築されたベンチマーク、RUMBAは、LLMの長期的なメモリをテストするために開発されました。このベンチマークでは、長期的なメモリを使用する質問のタイプや、ロシア語のテキスト内のメモリと時間に関する情報を考慮し

説明可能深層学習CNN分類検出画像
用途
ロシア語のロングメモリをテストする
難易度
Hard
コスト
High
arxivPaper only2026-07-23

MSBraM: A Multi-scale Self-supervised Brain Foundation Model for Hierarchical EEG Dynamics Learning

脳波データを用いたアプリケーションに必要な自律性を持たせた新しいEEGバックボーンモデルの提案であり、そのようなモデルは、EEG特性を理解する上で大きな助けとなるように期待されている。

コンピュータビジョンセグメンテーション埋め込みテキスト自己教師
用途
EEGデータの理解
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation

オープン語彙セマンティックセグメンテーションは、前もって定義されたカテゴリ以外のオブジェクトを分類する手法の一種である。本研究では、大規모言語モデルでこの手法を実現するために、連続的な視覚テキストのアライメントを実現する

自然言語処理RAGセグメンテーション画像テキスト
用途
オープン語彙セマンティックセグメンテーションのための視覚テキストの連続的なアライメントを実現する。
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Learning-based Seam Correspondence Reconstruction in Sewing Patterns

この研究では、現状では手動で行われている衣類制作パターンのデータから3Dモデルを自動生成することを目的として、グラフベースの学習フレームワークを提案している。このフレームワークは、衣類パターンを表すグラフを学習によって構

深層学習Transformerテキスト3D
用途
衣服デザインの革新
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Out of Sight, Still in Mind: Token Compression for Omni-LLMs

この研究では、大規模なオムニモダル言語モデル(Omni-LLMs)へのデータコンプレッションを目的として、オムニ-LLMsのトークンコストの増大を緩和するフレームワーク、ReMoの提案している。ReMoは、オムニ-LLM

自然言語処理大規模言語モデル画像テキスト音声
用途
大規模な言語モデルへのデータコンプレッション
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Sidewalk Moments: Are Richer Representations Always More Human-Aligned? Evidence from City-Walk Videos

この研究では、都市ウォークビデオを分析するために、4つのモダリティの表現(スペース時領域情報、時間平均画像、オーディオ符号化、テキストベースの表現)を使用しました。

MI向き品質予測/異常検知深層学習Transformer分類画像テキスト
用途
都市ウォークビデオの分析
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Efficient Clustering with Provable Guardrails for LLM Inference at Scale

LLMのインフェランス効率化を目的としたクラスタリングアルゴリズムが提唱される。このアルゴリズムは、各サンプルにクォリティコントロールを実行する能力を備えていると主張し、プローブメトリクスとパフォーマンスメトリクスを組み

品質予測/異常検知深層学習軽量化・量子化
用途
LLMのインフェランス効率化
難易度
Hard
コスト
High
arxivGitHubあり2026-07-22

LKValues: Aligning Large Language Models with Sri Lankan Societal Values

スリランカの文化的価値観が反映された言語モデルの開発により、同国で言語モデルを使用する際の精度を向上させることができると予想され、このような言語モデルを開発するためのリソースを提供します。

自然言語処理大規模言語モデルテキスト
用途
スリランカの文化的価値を対象とする言語モデルの精度向上
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

危険な問題に対する正しい答えを提供する大きな言語モデルと費用の効率が良い、小さな言語モデルを協力させる技術が開発されました。

深層学習軽量化・量子化生成テキスト
用途
小さな言語モデルを大きい言語モデルと協力させる手法が効率的かつ安全に実装される
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Language-Specific versus Cross-Lingual Knowledge Graphs for Implicit Aspect Identification in Arabic: A Comparative Study of Reasoning and Adaptation Strategies

アラビアsentiment分析には、文章中で明示的に述べられていないアスペクトを抽出する機能が必要です。これは、オプションの言語モデルにアッセメントグラフを使用して実現できますが、低リソース言語であるアラビア語では、この

自然言語処理大規模言語モデル生成テキスト
用途
Arabiasentiment分析
難易度
Hard
コスト
High
arxivGitHubあり2026-07-22

emb-diversity: A Tool for Embedding-Based Measurement of Data Diversity

データ多様性はフェアかつ頑健なNLPモデルを構築する上で重要な要素である。しかし、データ多様性を測定する現存のアプローチは不合理で一貫性が欠けている。そのため、エンドポイントベースの多様性測定ツールを提案した。

自然言語処理RAGテキスト
用途
データの多様性の測定
難易度
Easy
コスト
Low
arxivPaper only2026-07-22

DS@GT ARC at ImageCLEFmed GANs 2026: Geometric Filtering for Privacy-Preserving CT Slice Generation

この研究では、画像CLEFmed GANs 2026のイベントで利用可能なプライバシープリザーブCTスラ이스生成にフォーカス。開発されたアプローチは最適な輸送条件フローマッチングとプライバシーの考慮を含むトレーニング、お

自然言語処理埋め込み・検索生成画像
用途
医学画像処理
難易度
Hard
コスト
High
arxivGitHubあり2026-07-22

Not All Patches are Equal: Sampling Matters for Visible-Infrared Pre-Training

可視光と非可視光のデータを連携するためのアプローチを提案し、可視光と非可視光のデータを連携するための精度と効率を向上させることを目指しています。

センサ/時系列深層学習軽量化・量子化検出セグメンテーション埋め込み
用途
可視光と非可視光のデータを連携するためのアプローチ
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Supra Cognitive Modes: A Routed Architecture for Agent Memory

この研究では、エージェントメモリーのワークロードは直接的事実検索、関係連鎖や現在の状態の推論、長時間の履歴上に関係がある合成を組み合わせて、Supra Cognitive Modes を開発しました。このアーキテクチャで

品質予測/異常検知自然言語処理埋め込み・検索分類生成
用途
メモリアーキテクチャの設計
難易度
Hard
コスト
Low
arxivPaper only2026-07-20

Scalable and Efficient Joint Spiking Embedding Predictive Architecture for Large-Scale Dynamic Graphs

動的グラフの構造と意味のパターンを捉えるため、最新の研究では、ラベル付けされたデータの欠如に対応するために、生成的または対比的のパラダイムを導入する。ただし、これらの方法は複雑なエッジレベルからの再構築の目標に依存し、グ

深層学習軽量化・量子化分類検出生成
用途
多階層グラフに対する埋め込み予測アーキテクチャ
難易度
Hard
コスト
High