supervised」の検索結果

164
arxivGitHubあり2026-07-24

Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs

この研究では、遥宙イメージングモデルの特化を支援するための能力ギャップドリブン訓練法を提案し、遥宙イメージングモデルの特化において、従来のfine-tuning法に比べて性能が向上することを示しました。

センサ/時系列品質予測/異常検知自然言語処理大規模言語モデル生成画像テキスト
用途
遥宙イメージングの特化を支援する能力ギャップドリブン訓練
難易度
Hard
コスト
High
arxivPaper only2026-07-24

TextSLIP: Text Self-Supervised CLIP for Medical Report Generation

ラジオリジー報告の自動化は、報告の連続性と臨床ワークフローを改善するために重要です。 CLIPは、医学分野の視覚言語モデリングを進歩させましたが、既存のCLIPスタイルアプローチでは、複雑な報告生成において十分なfine

自然言語処理ファインチューニング生成埋め込み画像
用途
medical Report Generation
難易度
Hard
コスト
High
arxivPaper only2026-07-23

From Evaluation to Optimisation: Hierarchy-Aware Training Signals for CWE Prediction in Python

混合データの文脈で、LLM生成されたコンテンツが人間との共著を検出する方法を説明します。この方法は、トークン単位で異常を検出し、LLMが生成した可能性の高いコンテンツを特定するため、混合データを分析する際に有効です。

自然言語処理ファインチューニング分類強化学習
用途
異常度チェックを効率化する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Beyond Heavy Log Curation: Perplexity-Based APT Detection via Unsupervised, Context-Augmented Language Models

ログ解析は大量のログが存在し、攻撃関連のログは少ないため、攻撃を検出することは困難です。従来の機械学習アプローチでは、訓練データが詳細にカレキュレーションされ、特徴工程が複雑で、ドキュメントの知識が必要です。

センサ/時系列深層学習Transformer検出テキスト時系列
用途
APT検出問題の解決
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Unsupervised Consensus-Based Anomaly Detection for Spatiotemporal Malaria Incidence in Ghana

このアプローチは、モザイクコンセンサスアノマリーディテクションを用いて、Ghanaのマラリア発生情報を分析することにより、地域で発生する異常なマラリア発生パターンを特定することを目的としている。

品質予測/異常検知深層学習RNN / LSTM検出異常検知教師なし
用途
マラリア発生予測問題の解決
難易度
Hard
コスト
Medium
arxivPaper only2026-07-23

Artificial Epanorthosis: Why large language models overuse a classical rhetorical figure, and how to mitigate it

Artificial Epanorthosisは、大規模言語モデルが古典的なルレチックの表現を使用する傾向に注目した。結果は、モデルのトレーニングデータの形状がこの傾向に影響していることができた。

深層学習軽量化・量子化分類生成テキスト
用途
大規模言語モデル上のエパノルシス
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Logical Regression for Planning with Axioms

自動プランニングでは、ロジカル・レガッションは一定の式を達成するために何らかの方法で実行できる可能性があるかを決定する演算である。そのような手法は、より包括的なプランの実行や非決定性プランニングのコパクトなポリシー提示な

機械学習教師あり学習回帰テキスト
用途
自動プランニングの論理的推論
難易度
Hard
コスト
Medium
arxivPaper only2026-07-23

Cycle-Consistent and Uncertainty-Aware Neural Surrogates for Tokamak Edge Plasmas

トカマクのエッジプラズマは、装置で放出されるエネルギーの量に関係しており、これを正確に予測することは装置の安全性を向上させることができる。しかし、従来の方法ではこの計算が実行時間が長いため、パラメータスキャンやオプティマ

説明可能品質予測/異常検知自然言語処理RAG自己教師
用途
エッジプラズマの予測と検査
難易度
Hard
コスト
Low
arxivPaper only2026-07-23

MSBraM: A Multi-scale Self-supervised Brain Foundation Model for Hierarchical EEG Dynamics Learning

脳波データを用いたアプリケーションに必要な自律性を持たせた新しいEEGバックボーンモデルの提案であり、そのようなモデルは、EEG特性を理解する上で大きな助けとなるように期待されている。

コンピュータビジョンセグメンテーション埋め込みテキスト自己教師
用途
EEGデータの理解
難易度
Hard
コスト
High
arxivPaper only2026-07-23

VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

Embodied Agentが自然言語の指示に従い、視覚と言語を組み合わせたナビゲーションを達成したい。このようなアプリケーションでは、ルートレベルを含む指示によって、視覚的なナビゲーションを達成し、GPSの無いオープン

センサ/時系列自然言語処理大規模言語モデル画像テキスト3D
用途
開放的なヴィジョンナビゲーション
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation

オープン語彙セマンティックセグメンテーションは、前もって定義されたカテゴリ以外のオブジェクトを分類する手法の一種である。本研究では、大規모言語モデルでこの手法を実現するために、連続的な視覚テキストのアライメントを実現する

自然言語処理RAGセグメンテーション画像テキスト
用途
オープン語彙セマンティックセグメンテーションのための視覚テキストの連続的なアライメントを実現する。
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Surprisal Theory is Tautological (without Rational Grounding)

ある単位の人間の認知的難易度は、その単位のスルーパイズアル (Surprisal) と特定の言語モデルによれば線形関数に等しいという理論が存在します。しかし、この理論は実態を反映していないという批判があります。この論文で

自然言語処理テキスト
用途
認知的難易度と言語モデルとの関係
難易度
Hard
コスト
High
arxivPaper only2026-07-23

DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages

この論文では、DONDO と呼ばれるアフリカ諸国向けの音声認識ベースモデル (ASR)が構築されました。これらのモデルは、自律学習型スピーチエンコーダーであるw2v-BERT 2.0を使用して構築されています。このエンコ

センサ/時系列深層学習Transformer分類テキスト音声
用途
アフリカ諸国への音声認識技術の適用
難易度
Hard
コスト
Low
arxivPaper only2026-07-23

Sample-Efficient Learning from Agent Experience

この論文では、エージェントが自分の経験から学ぶことができ、その経験が取り除かれると学習成果が消えることを示しました。これには、コンテキスト内包のメカニズムを使用して、コンテキスト情報をモデルウェイトに保存することが重要で

深層学習軽量化・量子化テキスト
用途
エージェントの学習を高速化する方法の検討
難易度
Hard
コスト
Medium
arxivPaper only2026-07-23

What Happens to Accuracy When Photo Lineups Contain Non-Mated Rank-One Images From Large Galleries?

この論文では、一対多の顔識別技術の安全性を評価しました。特に、画像のランク付けの正確性と目撃者が正しい人物を選択する可能性について、重要な問題を議論し解決策を提案しました。

コンピュータビジョン画像動画
用途
一対多の顔識別方法の安全性を評価
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

この研究では、オキシジェン-キノーを提案しました。これは、仮想きもの試着に関しては、ファッションが専用データエンジンや特定のトレーニングを持つもので構成されていることを認識することで、高精度の仮想きもの試着を実現すること

MI向き品質予測/異常検知自然言語処理大規模言語モデル生成画像強化学習
用途
仮想きもの试着を高速化するモデル
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

Boosting Robustness for All-Weather Self-Supervised Depth Estimation in Autonomous Driving

この研究では、夜間や雪などの悪天候での自動運転におけるディープラーニングを利用した自律的なデプス推定の問題を解くことを目的とし、センサーの感度低下を考慮して、強い耐性と推定精度の高さを達成しました。

センサ/時系列深層学習軽量化・量子化画像3D自己教師
用途
自動運転でのデプス推定
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Quality-Aware Multimodal Fusion Reveals Implicit Identity in Valence-Arousal Features

この研究では、感情と気分の表現を分析し、顔の感情とアウトルの視聴動作とアウトルの視聴動作の結びつきを用いて、多モーダル表現を取得しました。提案された方法は、不完全な視聴動作、遮断、不良照明などの変動に対して、高い

品質予測/異常検知深層学習正規化・最適化手法分類画像テキスト
用途
感情と気分の识別
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Stokes-Informed Diffusion for Robust Linear Polarization Estimation

この研究では、赤外線画像のスーパーレゾリューション技術を開発することを目的として、赤外線と可視光の特性を組み合わせた新しいモデルを提案している。提案モデルは、可視光から学習された分布と、赤外光によって取得された情報とを同

深層学習軽量化・量子化検出画像
用途
可視化されていない物体の表面特性を推定
難易度
Hard
コスト
High
arxivPaper only2026-07-23

The Second LoViF 2026 Challenge on Real-World All-in-One Image Restoration: Methods and Results

LoViF の 2 回目のチャレンジでは、画像修復に新たなアプローチを提案しています。実世界の画像を修復するための包括的な評価基準を提供しており、低光照度、ハッジ、雨、雪などのさまざまな障害に対する解決策を研究者に求めて

コンピュータビジョン画像
用途
画像修復
難易度
Hard
コスト
Medium
arxivPaper only2026-07-23

The RealDefocus Benchmark for Defocus Deblurring

ドリフス脱失は画像を再構築するために不可欠ですが、再構築画像とドリフス画像のペアリングや標準化されたプロトコルなどの要件を満たすデータセットが不足しているため、評価が難しいです。この研究では、レアルワールドに基づくドリフ

品質予測/異常検知コンピュータビジョン画像
用途
ドリフス脱失の解除
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Unsupervised Metal Artifact Reduction in Dental CBCT using Fine-tuned Cycle-Consistent Adversarial Networks

この研究では、歯科CBCT画像中のメタルアーティファクトを除去するための循環互換的アドバーサリアルネットワーク(CycleGAN)を提案します。CycleGANを使用すると、メタルアーティファクトを除去した後、CBCT画

品質予測/異常検知自然言語処理RAG生成画像教師なし
用途
メタルアーティファクトの除去
難易度
Hard
コスト
Low
arxivPaper only2026-07-23

Discrete Truthful Heterogeneous Two-Facility Location: The Line and Beyond

この研究では、複数の工学システム間の関係を推測するための方法をproposedした。方法は、それぞれのシステムの出力と入力がどのように関係しているかを観察するというものであり、これらの関係をグラフ構造を用いて表現すること

強化学習
用途
複数の工学システム間の関係を推測する
難易度
Hard
コスト
Medium
arxivPaper only2026-07-22

Emergent Compositional Skills in Mixture-of-Experts VLAs

この研究では、ロボットのコンプオーシャナルスキルを取得するためのアプローチを提案した。コンプオーシャナルスキルは、タスクを構成された基本的な行動に分解する能力であり、これはロボットの柔軟性と適応性を向上させる。提案したア

説明可能機械学習教師あり学習
用途
ロボットのコンプオーシャナルスキル
難易度
Hard
コスト
Medium
arxivPaper only2026-07-22

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

危険な問題に対する正しい答えを提供する大きな言語モデルと費用の効率が良い、小さな言語モデルを協力させる技術が開発されました。

深層学習軽量化・量子化生成テキスト
用途
小さな言語モデルを大きい言語モデルと協力させる手法が効率的かつ安全に実装される
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Self-supervision drives representational convergence in medical foundation models more than clinical supervision

医療画像エンコーダを比較検討し、オープンウェイト、ローカル実行で18枚の画像エンコーダと7枚のテキストエンコーダを評価した。研究では、自律学習が医学画像エンコーダが共通表現を持つ最大の要因であることが確認されました。

自然言語処理RAG分類画像テキスト
用途
医療画像エンコーダの共通表現取得
難易度
Hard
コスト
High
arxivPaper only2026-07-22

SLPO: Scaling Latent Reasoning via a Surrogate Policy

この研究では、ラベラーの品質が悪い場合の対策として、ラベラーの評価を自動化します。特に、ラベラーの評価はオブジェクト検出のタスクでは困難です。したがって、ラベラーの評価を自動化するために、画像認識のデータを分析してラベラ

説明可能自然言語処理プロンプトエンジニアリング強化学習
用途
ラベル付けの品質を確保し、品質管理が必要な画像認識
難易度
Hard
コスト
Medium
arxivPaper only2026-07-22

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

ビデオキャプション生成には、空間と時刻の理解が重要です。PercepCapアルゴリズムは、ビデオ入力を空間時刻認識に分解することで、生成されたキャプションの理解度が向上するとともに、空間時刻の誤差をより正確に検出でき、キ

品質予測/異常検知自然言語処理大規模言語モデル生成動画強化学習
用途
ビデオキャプション生成のための構造化された空間時刻の理解
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Self-Supervised Bio-Inspired Robotic Trajectory Planning with Obstacle Avoidance

この論文では、障害回避のためのロボット Trajectory プランニングに焦点が当てられています。ロボットが障害を回避できる Trajectory の作成には、Collision-free で効率的な Trajecto

深層学習軽量化・量子化生成教師あり自己教師
用途
実行可能な障害回避のためのロボットTrajectory プランニング
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Digital Twin Modeling of a Highly Automated Agricultural Tractor

このプロジェクトでは、農林業用自動化トラクターのデジタルツインモデリングが行われた。デジタルツインはCAN通信を使用することでトラクターの動きを模倣し、実際のトラクターの動作をシミュレートする。

強化学習画像
用途
農林業用自動化トラクターのデジタルツインモデリング
難易度
Hard
コスト
Medium
arxivPaper only2026-07-22

SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation

SOPD-SocialNav は、学習モデルを小さなロボットに伝える技術であり、ロボットが環境と人間の行動を理解し、ナビゲーションが行えるようにする。

深層学習軽量化・量子化テキストマルチモーダル
用途
ソーシャルなナビゲーションのための学習モデルを小さなロボットに伝える技術
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards

この研究では、大規模言語モデルを使用しての評価とフィードバックを同時に行う方法が提案され、評価とフィードバックの両方の品質を同時に改善することが可能になる。

説明可能品質予測/異常検知自然言語処理大規模言語モデル生成テキスト強化学習
用途
大規模言語モデルが評価とフィードバックを同時に行う方法
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

Reasoning Before Translation: Enhancing Legal Machine Translation with Structured Reasoning

この研究では、平衡方程式を満たすPINNs(物理基準付きニューラルネットワーク)を使用して、平均脱出時間の計算を目的とした椭球型境界条件付きPINNsを提案し、PINNsを使用した計算と実験室データを比較します。

品質予測/異常検知自然言語処理ファインチューニング翻訳テキスト強化学習
用途
平均脱出時間計算を目的とした椭円型境界条件付きPINNs
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Automated Extraction of Techno-Economic Data from 76,000 Energy System Studies

エネルギー系モデリングの信頼性は数量的仮定に依存するが、この仮定の情報源が乏しい。データベースの更新が遅いなどの問題は、研究者の重複した努力につながる。ここではエネルギー系研究の76,000件以上のデータを対象に行った自

自然言語処理
用途
エネルギー系研究データの自動抽出
難易度
Hard
コスト
Medium
arxivPaper only2026-07-21

Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results

人間の耳は最高の聴覚能力をもつものであると考えられており、音声認識では人間の聴覚機能を上回るようなシステムが作りだされるのを待っている。しかし、このようなシステムは実現しておらず、人間は音声認識システムの基準作成の参考と

センサ/時系列自然言語処理分類音声
用途
多様な発音の音声認識の基準作成
難易度
Hard
コスト
Low
arxivPaper only2026-07-21

Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

ある単語を複数のスピーカーや環境の異なる条件下で言語モデルが使用できるようにしたい場合は、単語の抽出を実現する必要がある。しかし、現在の言語モデルでは、スピーカーの特性や環境の特性が単語に含まれていることが多い。ここでは

センサ/時系列深層学習Transformerテキスト音声教師あり
用途
可変な条件における単語の抽出
難易度
Hard
コスト
Medium
arxivPaper only2026-07-21

Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing

記号化の種類 (verbatim vs. intended) は、現在の音声認識モデルの評価に影響を与えるが、このような制約はモデルのトレーニングに影響しないことが多い。しかし、ここでは、制約はモデルのトレーニングに影響

品質予測/異常検知深層学習Attention機構検出音声
用途
記号化の制約付き復元
難易度
Hard
コスト
High
arxivPaper only2026-07-20

Scalable and Efficient Joint Spiking Embedding Predictive Architecture for Large-Scale Dynamic Graphs

動的グラフの構造と意味のパターンを捉えるため、最新の研究では、ラベル付けされたデータの欠如に対応するために、生成的または対比的のパラダイムを導入する。ただし、これらの方法は複雑なエッジレベルからの再構築の目標に依存し、グ

深層学習軽量化・量子化分類検出生成
用途
多階層グラフに対する埋め込み予測アーキテクチャ
難易度
Hard
コスト
High
arxivPaper only2026-07-14

Cycles in Liquid Democracy: A Game-Theoretic Justification

代表権という概念は、政治や経済のシステムで重要である。デリゲーション、または代表権の授与、はさまざまなシステムに現れる。デリゲーションを安全かつ効率的かつ有効に運用するために、意思決定者はデリゲーションを設計する際に考慮

品質予測/異常検知強化学習
用途
代表権の確保
難易度
Hard
コスト
Medium
arxivPaper only2026-07-02

Electronic Bursting Neuron: design, equations and hardware implementation

SNNは、脳の行動を模倣するためのニューラルネットワークである。SNNの構築には、電子ニューロンを設計することが必要であり、その構築には、多くの方法が考えられていて、その構築は複雑で困難であり、実装も容易ではない。この研

深層学習
用途
spiking-neuralネットワーク(SNN)
難易度
Hard
コスト
Medium
arxivPaper only2026-06-26

GTI-mSEMP Framework : A Proposed Framework to Simulate Malware Propagation with Inclusion of Attacker-Defender Strategy

マルウェアの感染は、ネットワーク全体に広がる可能性があります。既存のモデルの場合、脅威に対する防御戦略は静的なパラメータとして扱われますが、実際には攻撃方策と防御方策の間の競合関係に依存します。このため、ゲーム理論を用い

センサ/時系列強化学習
用途
マルウェアの感染をシミュレーションし、防御戦略を提案する
難易度
Hard
コスト
Medium
arxivPaper only2026-06-16

An Optimization Framework for Automated Assessment of Biological Plausibility of Spiking Neurons

この論文では、スパイクニューロンの生物学的合理性を評価するためのオプティマイズフレームワークを提案します。このフレームワークは、Izhikevichの生物学的合理性の定義に基づいており、スパイクニューロンをモデル化するた

機械学習教師あり学習分類テキスト
用途
スパイクニューロンの生物学的合理性を評価するためのオプティマイズフレームワークの開発
難易度
Hard
コスト
Low