X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment
大規模な言語モデルを用いた推論技術のための新しいアプローチであるX$^3$-OPD(Distilling Reasoning into Large Audio-Language Models via On-Policy
- 用途
- 大規模な言語モデルを用いた推論技術の開発
- 難易度
- Hard
- コスト
- High
「audio」の検索結果
52 件大規模な言語モデルを用いた推論技術のための新しいアプローチであるX$^3$-OPD(Distilling Reasoning into Large Audio-Language Models via On-Policy
Cognitive impairment (CI) is a growing public health concern. Early and accurate diagnosis is critical for ena
Phonetic forced alignment is a key technique in phonetic research, yet existing alignment systems lack special
Autonomous AI agents increasingly execute actions, invoke tools, and operate on protected resources with limit
ニューロ記号学的スキットがミットゲーション(制約を満たさずにタスクを達成する)を持っていることを指摘し、制約サティスファクションミットゲーション削減手法を提案します。この手法では、制約の制約を満たす代わりに、モデルが制約
S2S (Speech-to-Speech) LLMアシスタントを利用して、人間のような話し方をすることができますが、安全対策の実装が困難です。この研究では、S2S LLMアシスタントの安全対策を2つのアプローチで実現し
Autoregressive text-to-speech models achieve strong naturalness but suffer from slow inference due to sequenti
Omni-modal models can handle text, images, and audio in one system, but improving all of these abilities toget
この論文では、DONDO と呼ばれるアフリカ諸国向けの音声認識ベースモデル (ASR)が構築されました。これらのモデルは、自律学習型スピーチエンコーダーであるw2v-BERT 2.0を使用して構築されています。このエンコ
この論文では、音声字幕の評価手法が提案され、音声字幕の評価において既存の手法の制約を克服することを目指しました。提案されたフレームワークは音声字幕の各側面を評価し、質問回答型の評価手法ではなく字幕の中立性を評価することが
この論文では、会話マンダリンにおける単語の意味と子音の特性の関係を調べました。その結果、単語の
We present VibeVoice-ASR-BitNet, a compressed variant of VibeVoice-ASR optimized for real-time inference on ed
Conventional face recognition relies on static appearance cues and degrades in unconstrained settings with exp
The goal of this paper is to reduce the input token cost of Omni-modal large language models (Omni-LLMs) at in
Acoustic impedance imaging is a fundamental yet severely ill-posed problem in subsurface analysis: the seismic
この研究では、都市ウォークビデオを分析するために、4つのモダリティの表現(スペース時領域情報、時間平均画像、オーディオ符号化、テキストベースの表現)を使用しました。
クロアニオトミーの手術を自動化するために、複数のモジュールから形成されるサイバネティックなクローゼッドループのフレームワークを提案します。このフレームワークは、ツールと組織との対話を通じて、ツールと組織の相互作用に対して
人間の知能を模倣するクロアニオトミー手術のフレームワークを提案します。このフレームワークは、前方計画と後方実行を組み合わせて、手術中に手術台の位置を自動的に調整することで、人間と同様の安全で効率的な手順を実現します。
Machine learning (ML) models are increasingly integrated into optical network automation frameworks to support
ストリーミングキーワードスポットイントを扱う研究、Cumsum-Composable Phase Transport を用いてストリーミングキーワードスポットイントを提案する。
この研究では、人工知能の研究者と神経科学者の間の分野を結びつけるために、脳のシステム構造を研究し、その研究から導かれた新しいアプローチを提案しました。
Discovering the direct causes and effects of a target variable from observational data is a fundamental proble
Federated learning (FL) over wireless networks suffers from significant training latency and degraded converge
Concept Bottleneck Models provide interpretable-by-design predictions by mediating diagnosis through human-und
最新言語モデル(LLM)が危険な生成を防ぐための確信的な安全な限界を計算するための新しいフレームワークを提案した。Clopper-Pearsonの信頼区間の新しい応用として、PAC(可能性が最も近い)の境界を得るためのア
3つのタスクをサポートする音曲生成フレームワークを提示した。これらのタスクには、歌詞、テキストの説明、音楽的特性を利用して、歌詞の生成、バンドの音楽の生成、カバー曲の生成などが含まれる。
Large Audio Language models (LALMs) have made rapid progress on acoustic understanding, yet they still struggl
Spoken language models (SLMs) enable natural human-computer interaction, but their reasoning ability still lag
人名と場所の関係を抽出するタスクは、歴史的ニュース記事の解釈において重要です。従来の方法では、言語モデルの前処理が必要でしたが、Lightweightアルゴリズムは、依存グラフと近接特性を使って、歴史的ニュース記事から人
ETPデザイナはマルチモーダルな電子シアターのデザインを自動化するフレームワークを提案します。
Cross-dataset generalisation remains a major barrier to clinical deployment of echocardiographic left ventricu
Soft robot exteroception is increasingly being explored for a variety of field applications. In this work, we
Theory of Mind (ToM), the ability to infer other's beliefs, intentions, and states of knowledge, is central to
人間の耳は最高の聴覚能力をもつものであると考えられており、音声認識では人間の聴覚機能を上回るようなシステムが作りだされるのを待っている。しかし、このようなシステムは実現しておらず、人間は音声認識システムの基準作成の参考と
ある単語を複数のスピーカーや環境の異なる条件下で言語モデルが使用できるようにしたい場合は、単語の抽出を実現する必要がある。しかし、現在の言語モデルでは、スピーカーの特性や環境の特性が単語に含まれていることが多い。ここでは
アラビア語の発音記号化は重要な問題だが、データが不足していることが難点の一つである。この問題を解決するために、ここでは「Connectionist Temporal Classification (CTC)」を使った制約
記号化の種類 (verbatim vs. intended) は、現在の音声認識モデルの評価に影響を与えるが、このような制約はモデルのトレーニングに影響しないことが多い。しかし、ここでは、制約はモデルのトレーニングに影響
Automatic speech recognition (ASR) for African languages is constrained by orthographic inconsistency, annotat
A single embedding space that covers text, images, video, and audio lets one index serve every query a user ca
オリジナルのデータとZoom-Inのツールを組み合わせた方法、OmniReasonerを提案する。これにより、オリンモードルLLMsの長いオーディオビデオの論理的推論を改善できる。
existing AUV development methodの制約を解決するためのrobustなオートニモティクス基盤と機械学習アライアンスを開発する。
This paper proposes a causal independence principle for value -- the value Causal Markov Condition (v-CMC) --
脳のニューロン同士のつながりを分析する方法を提案する。この方法では、神経伝達の構造を考慮しながら、ニューロン間のつながりを分析できる。
For a second time, the android robot Andrea was set up at a public museum in Germany for six consecutive days
指定された観察的式が特定の介入分布を特定することを検証することができることを提案、識別と異なる概念であることが確認。
オーディオ信号を分析するために、complex-valuedのBoltzmann マシンの開発を発表。
この研究では、新しい特徴融合手法を提案した。この手法は、上からの特徴と下からの特徴の関係性を考慮することで、特徴を効率的に融合し、三次元データを2次元サムライグラフにコンパクトに表現する機能をもたらせる。
Neuromorphic and edge computing research has focused on reducing the inference cost of neural network controll
この研究では、パーソナライズされた話し言葉アシスタンスシステムを提案します。
Language models turn a worded situation into a numeric plan, and the dominant pipelines (NL4Opt, OptiMUS, ORLM
この研究では、音声認識のパターン認識を分析するためのスパイクニューラルネットワークを使用します。モデルは音声認識のパターン認識に役立ちます。
Efficient processing of continuous audio streams remains a key challenge for real-time and resource-constraine