self-supervised」の検索結果

24
arxivPaper only2026-07-23

DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages

この論文では、DONDO と呼ばれるアフリカ諸国向けの音声認識ベースモデル (ASR)が構築されました。これらのモデルは、自律学習型スピーチエンコーダーであるw2v-BERT 2.0を使用して構築されています。このエンコ

センサ/時系列深層学習Transformer分類テキスト音声
用途
アフリカ諸国への音声認識技術の適用
難易度
Hard
コスト
Low
arxivPaper only2026-07-21

Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

ある単語を複数のスピーカーや環境の異なる条件下で言語モデルが使用できるようにしたい場合は、単語の抽出を実現する必要がある。しかし、現在の言語モデルでは、スピーカーの特性や環境の特性が単語に含まれていることが多い。ここでは

センサ/時系列深層学習Transformerテキスト音声教師あり
用途
可変な条件における単語の抽出
難易度
Hard
コスト
Medium