Fine-tuning」の検索結果

102
arxivPaper only2026-07-23

A Diffusion-Model Subpopulation Digital Twin for Mobile Health Deployment: A Case Study on the HeartSteps Intervention

人間に合わせたモバイルヘルスインストリュメントの開発を進めた。この研究では、現実的なシミュレートされたユーザーを用いて、アルゴリズムをテストすることによって、人間に合わせたモバイルヘルスインストリュメントを開発するための

センサ/時系列深層学習Transformer時系列
用途
人間に合わせたモバイルヘルスインストリュメントの開発
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Hilbert Operator for Progressive Encoding (HOPE): A Mathematical Framework for Deconstructing Learned Representations in Deep Networks

学習された表現の分解構造を理解するための枠組みを提案した。この研究では、ネットワークをコンプレッションすることで、学習された表現を分解することで、学習された表現の理解を進めた。

深層学習Transformer
用途
学習された表現の分解構造を理解するための枠組み
難易度
Hard
コスト
Medium
arxivPaper only2026-07-23

Emergent Misalignment Recruits a Pre-existing Persona Subspace

アライメントした言語モデルの偏った表現の理解を進めた。この研究では、アライメントした言語モデルの表現を分析して、偏った表現を理解することができ、これを用いて、偏った表現を正すことができると主張した。

自然言語処理ファインチューニング生成テキスト
用途
アライメントした言語モデルの偏った表現の理解
難易度
Hard
コスト
High
arxivPaper only2026-07-23

The Weight of Silence: A Causal Case for Weights Over the Scratchpad in Latent Chess Reasoning

ラテン言語モデルを使用すると、言語モデルの内部の計算結果を分析できる。計算結果は、連続ベクトル空間として実行される中間計算であり、これを分析すると、モデルがどのように結果を得ているかを明らかにできる。

MI向き自然言語処理ファインチューニングテキスト強化学習
用途
ラテン言語モデルの中間計算を分析する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Artificial Epanorthosis: Why large language models overuse a classical rhetorical figure, and how to mitigate it

Artificial Epanorthosisは、大規模言語モデルが古典的なルレチックの表現を使用する傾向に注目した。結果は、モデルのトレーニングデータの形状がこの傾向に影響していることができた。

深層学習軽量化・量子化分類生成テキスト
用途
大規模言語モデル上のエパノルシス
難易度
Hard
コスト
High
arxivPaper only2026-07-23

V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure

ビデオLMMの安全性を確認するために、新しい診断フレームワークを提案します。これらのフレームワークは、モデルの挙動、理解、セマンティクスを同時に考慮します。

自然言語処理大規模言語モデル画像テキスト動画
用途
ビデオ安全性デ-カリブレーションの診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Hardware-Software Co-Design for Float16 On-Device Training on RISC-V Single-Core

RISC-V単コア上の16ビット浮動小数演算 (FP16) を高速化するために、新しいフレームワークを提案します。これらのフレームワークは、メモリ フットプリントを約50%削減しながらモデルのパフォーマンスを維持します。

自然言語処理RAG
用途
RISC-V単コア上の16ビット浮動小数演算の高速化
難易度
Hard
コスト
High
arxivPaper only2026-07-23

MedGame: Storytelling Gamification Empowered by Large Language Models for Medical Education

Large Language Models (LLMs) は医学教育に大きな可能性を持っていますが、現在のシステムでは、質問に答えるか一時的なフィードバックしか行なわれていません。一方、臨床病例を決定センターへの学習トレ

自然言語処理大規模言語モデル生成QAテキスト
用途
医学教育への Large Language ModeL の適用
難易度
Hard
コスト
High
arxivPaper only2026-07-23

DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages

この論文では、DONDO と呼ばれるアフリカ諸国向けの音声認識ベースモデル (ASR)が構築されました。これらのモデルは、自律学習型スピーチエンコーダーであるw2v-BERT 2.0を使用して構築されています。このエンコ

センサ/時系列深層学習Transformer分類テキスト音声
用途
アフリカ諸国への音声認識技術の適用
難易度
Hard
コスト
Low
arxivPaper only2026-07-23

ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments

オブジェクト目標のナビゲーションにおける、動的な避け方とマルチフロア環境を考慮した、ゼロショットオブジェクトナビゲーションのフレームワークを提案します。このフレームワークでは、動的な人々とマルチフロア環境を考慮しながら、

自然言語処理ファインチューニングテキスト3Dマルチモーダル
用途
マルチフロアにおけるオブジェクト目標のナビゲーション
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Hypothesis-and-Refinement Learning of Organic Structures from Multimodal Spectroscopic Data

分子構造を決定するために、スペクトルデータから自動的な構造解析を実施するための方法を提案している。この方法は、スペクトルデータに基づいてヒントと改良を繰り返すことで、分子構造を決定するもので、分子の可能性の広範な構造スペ

MI向き自然言語処理ファインチューニング生成テキストマルチモーダル
用途
分子構造の解析
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

危険な問題に対する正しい答えを提供する大きな言語モデルと費用の効率が良い、小さな言語モデルを協力させる技術が開発されました。

深層学習軽量化・量子化生成テキスト
用途
小さな言語モデルを大きい言語モデルと協力させる手法が効率的かつ安全に実装される
難易度
Hard
コスト
High
arxivPaper only2026-07-22

TINY_SCHILLER: A Drop-In German Drama Corpus for Small Language Models

小さな言語モデルに対するドロップインコーパス、tiny_schillerを導入し、単一ファイルで利用できるようにし、言語モデルを簡単にprototyping、fine-tuning、教育、研究に利用できるようにする。

自然言語処理大規模言語モデルテキスト
用途
ナイーブな言語モデルに対するドロップインコーパスの提供
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

ビデオキャプション生成には、空間と時刻の理解が重要です。PercepCapアルゴリズムは、ビデオ入力を空間時刻認識に分解することで、生成されたキャプションの理解度が向上するとともに、空間時刻の誤差をより正確に検出でき、キ

品質予測/異常検知自然言語処理大規模言語モデル生成動画強化学習
用途
ビデオキャプション生成のための構造化された空間時刻の理解
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?

画像理解のための多モーダルラージランゲージモデルは、強力ですが、まだ能力と限界については明確な理解が不足しています。この論文では、多モーダルラージランゲージモデルが画像理解においてどの程度の能力と限界を持つか、を分析し、

センサ/時系列深層学習軽量化・量子化QA画像テキスト
用途
画像理解における多モーダルラージランゲージモデルの能力と限界
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Toward Seasonal Guidelines for Robust Deep-Learning Sentinel-2 Building Detection in Different Area Types

OffNadirLocは地学化におけるオフナジアムの視点を考慮するための基準セットを提案します。これにより、ドローンと衛星画像の交差視点地学化プロセスでは重要な構造的シーン理解と内部ドメイン間の関係的制約に重点を置くこと

深層学習CNN分類検出セグメンテーション
用途
ドローンから衛星画像への地学化の改善
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PRISM-DR: Per-lesion Retinal Inference with Specialist Models for Diabetic Retinopathy

この研究では、糖尿病性黄斑病変の検出を目的としたPRISM-DRシステムを開発しました。このシステムは、医師が見逃す可能性がある小さな低コントラストな病変を見つけるのに役立ちます。

少数データ向きCPUで試しやすい条件最適化自然言語処理ファインチューニング検出生成画像
用途
糖尿病性黄斑病変を検出する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Look Before You Edit: Attention-Guided Camera Placement and Multi-View Alignment for 3D Gaussian Splatting Editing

DRGBTトラッキングの分野では、目標物を変動するセンシングモデリティと観測プラットフォームの条件下で追跡することが求められます。ドリフト、視線、時間の条件変化に関しても検討が必要です。ただし、現在のバenchmarkで

深層学習Transformerテキスト3D
用途
DRGBTトラッキングを改善
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation

自律ロボットには、障害物や事故の回避能力が必要です。これは、障害物や事故の回避能力が強化されていれば、障害物や事故に対しての対策がより効果的になります。障害物や事故の回避能力が強まることで、ロボットが障害物や事故から安全

品質予測/異常検知自然言語処理ファインチューニング生成セグメンテーション画像
用途
自動ロボットが障害物や事故を回避できるようにする
難易度
Hard
コスト
High
arxivPaper only2026-07-22

SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation

SOPD-SocialNav は、学習モデルを小さなロボットに伝える技術であり、ロボットが環境と人間の行動を理解し、ナビゲーションが行えるようにする。

深層学習軽量化・量子化テキストマルチモーダル
用途
ソーシャルなナビゲーションのための学習モデルを小さなロボットに伝える技術
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

Reasoning Before Translation: Enhancing Legal Machine Translation with Structured Reasoning

この研究では、平衡方程式を満たすPINNs(物理基準付きニューラルネットワーク)を使用して、平均脱出時間の計算を目的とした椭球型境界条件付きPINNsを提案し、PINNsを使用した計算と実験室データを比較します。

品質予測/異常検知自然言語処理ファインチューニング翻訳テキスト強化学習
用途
平均脱出時間計算を目的とした椭円型境界条件付きPINNs
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing

記号化の種類 (verbatim vs. intended) は、現在の音声認識モデルの評価に影響を与えるが、このような制約はモデルのトレーニングに影響しないことが多い。しかし、ここでは、制約はモデルのトレーニングに影響

品質予測/異常検知深層学習Attention機構検出音声
用途
記号化の制約付き復元
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

オリジナルのデータとZoom-Inのツールを組み合わせた方法、OmniReasonerを提案する。これにより、オリンモードルLLMsの長いオーディオビデオの論理的推論を改善できる。

MI向き品質予測/異常検知自然言語処理大規模言語モデル画像音声動画
用途
長いオーディオビデオの論理的推論を改善する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Beyond Transformers: Linear Attention Policy for Open-Vocabulary Object Goal Navigation

オープン・バグナビゲーションには、エージェントへの部分観測が含まれます。パフォーマンスの向上のために、内部状態更新が重要です。これを実現するには、ポリシーネットワークの更新が必要です。最近のアプローチでは、トランスフォー

深層学習Transformerテキスト3D
用途
オープン・バグナビゲーション問題を解決する
難易度
Hard
コスト
High
arxivPaper only2026-07-20

O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

工場の中の異常が検出されるように設計された機械学習モデルを提案しています。通常の方法では、モデルはビデオ内のすべての内容を考慮し、複雑な問題を解決することは困難です。提案されたモデルのアプローチは、オブジェクトを検出して

説明可能品質予測/異常検知自然言語処理ファインチューニング検出異常検知テキスト
用途
産業ビデオの異常発生検出
難易度
Hard
コスト
High
arxivPaper only2026-07-20

Predictive Training with Latent Imagination for Visual Quadruped Navigation

四足ロボットのナビゲーションのための予測的推論方法が提案されます。ロボットは、現在の観察と短期的な記憶によってアクションを選択しますが、障害物の発展を予測することができないため、このアプローチには課題があります。この課題

深層学習Transformer画像
用途
ロボットのナビゲーション
難易度
Hard
コスト
High
arxivPaper only2026-07-15

Price of Fairness in Bandits: A Tight Minimax Characterization

最小限マージン定理を仮想環境における公平性と利益のトレードオフの分析に導入します。この定理により、公平性と利益のトレードオフを最小限の公平性確保することで解決することができます。

自然言語処理ファインチューニングテキスト
用途
仮想環境における公平性と利益のトレードオフを分析するための最小限マージン定理の導入
難易度
Hard
コスト
Medium
arxivPaper only2026-07-13

Markov Chain Monte Carlo with Diffusion Paths

この研究では、マルコフ連鎖モンテカルロ法を改良し、多モーダル分布からサンプリングする能力を高めるための新しいアプローチを提案した。このアプローチでは、微分のノイズパスを使用することで、モデルの収束を高速化し、多モーダル分

自然言語処理ファインチューニングマルチモーダル
用途
マルコフ連鎖モンテカルロ
難易度
Hard
コスト
High
arxivPaper only2026-07-10

Evolutionary Intelligence for Scientific Discovery: From Evolutionary Computation to Cumulative Discovery Systems

人工知能は、タスク固有のワークフローから、人工知能を組成して、実験とヒューマンフィードバックを組み込み、無尽蔵な候補空間内で自動的に調査を行うようにした。進化的計算は、実験的および人間のフィードバックに基づいて探索を導き

自然言語処理ファインチューニング
用途
感覚的探索に基づく科学研究
難易度
Hard
コスト
Medium