audio」の検索結果

52
arxivPaper only2026-07-23

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

大規模な言語モデルを用いた推論技術のための新しいアプローチであるX$^3$-OPD(Distilling Reasoning into Large Audio-Language Models via On-Policy

センサ/時系列品質予測/異常検知深層学習軽量化・量子化テキスト音声マルチモーダル
用途
大規模な言語モデルを用いた推論技術の開発
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Differentiable Logic Programming to Mitigate Reasoning Shortcuts in Neurosymbolic Systems

ニューロ記号学的スキットがミットゲーション(制約を満たさずにタスクを達成する)を持っていることを指摘し、制約サティスファクションミットゲーション削減手法を提案します。この手法では、制約の制約を満たす代わりに、モデルが制約

説明可能MLOpsモデルデプロイ音声
用途
ニュロシンボリックシステムのミットゲーション削減
難易度
Hard
コスト
Medium
arxivPaper only2026-07-23

Safeguards for Speech2Speech LLM-Assistants: A Case Study in Automotive Applications

S2S (Speech-to-Speech) LLMアシスタントを利用して、人間のような話し方をすることができますが、安全対策の実装が困難です。この研究では、S2S LLMアシスタントの安全対策を2つのアプローチで実現し

自然言語処理大規模言語モデルテキスト音声
用途
S2S LLMアシスタントの安全対策
難易度
Hard
コスト
High
arxivPaper only2026-07-23

DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages

この論文では、DONDO と呼ばれるアフリカ諸国向けの音声認識ベースモデル (ASR)が構築されました。これらのモデルは、自律学習型スピーチエンコーダーであるw2v-BERT 2.0を使用して構築されています。このエンコ

センサ/時系列深層学習Transformer分類テキスト音声
用途
アフリカ諸国への音声認識技術の適用
難易度
Hard
コスト
Low
arxivPaper only2026-07-23

An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

この論文では、音声字幕の評価手法が提案され、音声字幕の評価において既存の手法の制約を克服することを目指しました。提案されたフレームワークは音声字幕の各側面を評価し、質問回答型の評価手法ではなく字幕の中立性を評価することが

センサ/時系列自然言語処理大規模言語モデル生成テキスト音声
用途
音声字幕の評価フレームワークの構築
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Sidewalk Moments: Are Richer Representations Always More Human-Aligned? Evidence from City-Walk Videos

この研究では、都市ウォークビデオを分析するために、4つのモダリティの表現(スペース時領域情報、時間平均画像、オーディオ符号化、テキストベースの表現)を使用しました。

MI向き品質予測/異常検知深層学習Transformer分類画像テキスト
用途
都市ウォークビデオの分析
難易度
Hard
コスト
High
arxivPaper only2026-07-23

RL-MACRO: A Cybernetic Closed-Loop Intelligence Framework for Multimodal Adaptive Robotic Craniotomy

クロアニオトミーの手術を自動化するために、複数のモジュールから形成されるサイバネティックなクローゼッドループのフレームワークを提案します。このフレームワークは、ツールと組織との対話を通じて、ツールと組織の相互作用に対して

センサ/時系列深層学習CNN音声マルチモーダル
用途
クロアニオトミー手術の自動化
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory Adjustment

人間の知能を模倣するクロアニオトミー手術のフレームワークを提案します。このフレームワークは、前方計画と後方実行を組み合わせて、手術中に手術台の位置を自動的に調整することで、人間と同様の安全で効率的な手順を実現します。

センサ/時系列深層学習Transformer検出画像音声
用途
クロアニオトミー手術の自動化
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

3つのタスクをサポートする音曲生成フレームワークを提示した。これらのタスクには、歌詞、テキストの説明、音楽的特性を利用して、歌詞の生成、バンドの音楽の生成、カバー曲の生成などが含まれる。

品質予測/異常検知深層学習軽量化・量子化生成テキスト音声
用途
音楽の生成
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Lightweight Person-Place Relation Extraction from Historical Newspapers with Dependency Graphs and Proximity Features

人名と場所の関係を抽出するタスクは、歴史的ニュース記事の解釈において重要です。従来の方法では、言語モデルの前処理が必要でしたが、Lightweightアルゴリズムは、依存グラフと近接特性を使って、歴史的ニュース記事から人

説明可能CPUで試しやすい深層学習軽量化・量子化分類テキスト音声
用途
歴史新聞から人名と場所の関係の抽出
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results

人間の耳は最高の聴覚能力をもつものであると考えられており、音声認識では人間の聴覚機能を上回るようなシステムが作りだされるのを待っている。しかし、このようなシステムは実現しておらず、人間は音声認識システムの基準作成の参考と

センサ/時系列自然言語処理分類音声
用途
多様な発音の音声認識の基準作成
難易度
Hard
コスト
Low
arxivPaper only2026-07-21

Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

ある単語を複数のスピーカーや環境の異なる条件下で言語モデルが使用できるようにしたい場合は、単語の抽出を実現する必要がある。しかし、現在の言語モデルでは、スピーカーの特性や環境の特性が単語に含まれていることが多い。ここでは

センサ/時系列深層学習Transformerテキスト音声教師あり
用途
可変な条件における単語の抽出
難易度
Hard
コスト
Medium
arxivPaper only2026-07-21

Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing

記号化の種類 (verbatim vs. intended) は、現在の音声認識モデルの評価に影響を与えるが、このような制約はモデルのトレーニングに影響しないことが多い。しかし、ここでは、制約はモデルのトレーニングに影響

品質予測/異常検知深層学習Attention機構検出音声
用途
記号化の制約付き復元
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

オリジナルのデータとZoom-Inのツールを組み合わせた方法、OmniReasonerを提案する。これにより、オリンモードルLLMsの長いオーディオビデオの論理的推論を改善できる。

MI向き品質予測/異常検知自然言語処理大規模言語モデル画像音声動画
用途
長いオーディオビデオの論理的推論を改善する
難易度
Hard
コスト
High
arxivPaper only2026-07-13

Difference-Driven Gating: Adaptive Feature Fusion for U-Net Decoder

この研究では、新しい特徴融合手法を提案した。この手法は、上からの特徴と下からの特徴の関係性を考慮することで、特徴を効率的に融合し、三次元データを2次元サムライグラフにコンパクトに表現する機能をもたらせる。

センサ/時系列コンピュータビジョンセグメンテーション画像音声
用途
特徴融合
難易度
Hard
コスト
Medium