話者クラス音響モデル及び単語グラフ統合を用いた音声認識(音声,聴覚)
スポンサーリンク
概要
- 論文の詳細を見る
音声認識における話者性の問題に関し,話者クラスモデルに基づく新たな手法を提案する.提案する話者クラスモデル音声認識手法と話者適応の組み合わせによる性能向上を目的とする.本研究では認識対象音声と学習話者間の類似度を定義し,認識対象音声に音響的に類似する学習話者を選択し,話者クラスモデルを作成し認識する方法を基本とする.この方法の更なる性能向上を目指し,複数話者クラスモデルの利用と単語単位の話者クラスモデル選択手法を提案する.提案法を実現するために単語グラフ統合法を利用する.認識処理においてはまず複数の話者クラスモデルから得られた複数の単語グラフを統合し一つの単語グラフを得る.次に複数の話者クラスモデルを用いて単語グラフに含まれる単語ごとに複数の音響スコアを付与する.この中からゆう度基準でスコア選択し,選択したスコアの統合を行う.以上の処理により単語ごと入力音声に音響的特徴の類似した話者クラスモデルを使用することが実現できる.以上の手法の有効性を講演音声認識実験で示す.教師なし話者適応法と組み合わせることにより,従来法と比較し性能向上が得られることを示す.
- 2013-11-01
著者
-
加藤 正治
山形大学大学院理工学研究科
-
小坂 哲夫
山形大学大学院理工学研究科
-
伊藤 貴
山形大学大学院理工学研究科
-
好田 正紀
山形大学大学院理工学研究科
-
好田 正紀
山形大学
-
好田 正紀
山形大学大学院理工学研究科:(現)山形大学
関連論文
- 単語グラフ統合を用いた種々の雑音環境下での音声認識 (音声)
- PLSA言語モデル適応におけるアニーリングスケジュールの評価(言語モデル・システム,第10回音声言語シンポジウム)
- SP2000-25 N-gramに基づくエルゴディックHMMによる言語モデル
- Quinphone HM-Netを用いた単語グラフ統合に基づく講演音声認識(音声・言語・音響教育,一般)
- 単語グラフ統合を用いた種々の雑音環境下での音声認識(認識,理解,対話,一般)
- 音声雑音環境下における音声区間検出の検討
- 話者クラス音響モデルを用いた講演音声認識の性能向上(音響モデル,認識,理解,対話,一般)
- 英語発音評定における各種正規化の検討 (音声)
- 英語発音評定における各種正規化の検討 (言語理解とコミュニケーション)
- PLSA言語モデル適応におけるアニーリングスケジュールの評価(言語モデル・システム,第10回音声言語シンポジウム)
- PLSA言語モデル適応におけるアニーリングスケジュールの評価(言語モデル・システム,第10回音声言語シンポジウム)
- 話者ベクトルに基づく話者照合の検討(認識,理解,対話,一般)
- 音素クラスHMMを使用した話者ベクトルに基づく話者識別法の検討(特徴量・音響モデル,第9回音声言語シンポジウム)
- 音素クラスHMMを使用した話者ベクトルに基づく話者識別法の検討(特徴量・音響モデル,第9回音声言語シンポジウム)
- 音素クラスHMMを使用した話者ベクトルに基づく話者識別法の検討(特徴量・音響モデル,第9回音声言語シンポジウム)
- 音素モデルを用いた話者ベクトルに基づく話者識別(音声,聴覚)
- 講演音声認識における教師なし適応の改善(認識,理解,対話,一般)
- 話者ベクトルによる雑音下話者識別の検討(認識,理解,対話,一般)
- 音素モデルを用いた話者ベクトルに基づく話者識別の検討(第8回音声言語シンポジウム)
- 音素モデルを用いた話者ベクトルに基づく話者識別の検討(Session-4 一般(ポスターセッション),第8回音声言語シンポジウム)
- 音素モデルを用いた話者ベクトルに基づく話者識別の検討(Session-4 一般(ポスターセッション),第8回音声言語シンポジウム)
- コードブック適応を用いた離散混合分布型HMMによる講演音声認識(音声認識)
- 音声認識のための確率文脈自由文法に基づく言語モデルの構築と評価(音声情報処理 : 現状と将来技術論文特集)
- 英語発音評定における各種正規化の検討(一般(ポスターセッション),第11回音声言語シンポジウム)
- 英語発音評定における各種正規化の検討
- 日本語話し言葉コーパスを用いた発音変形依存モデルによる講演音声認識の性能評価(Session-1 音響モデル・特徴量・学習, 第7回音声言語シンポジウム)
- 日本語話し言葉コーパスを用いた発音変形依存モデルによる講演音声認識の性能評価(Session-1 音響モデル・特徴量・学習, 第7回音声言語シンポジウム)
- 日本語話し言葉コーパスを用いた発音変形依存モデルによる講演音声認識の性能評価(Session-1 音響モデル・特徴量・学習, 第7回音声言語シンポジウム)
- 離散混合分布HMMのヒストグラム同等化を用いたコードブック正規化(認識・理解・対話・一般)
- 発音変形依存モデルを用いた講演音声認識(音声,聴覚)
- 離散混合分布型HMMによる講演音声認識の検討(多言語, CSJ, 認識・理解・対話・一般)
- 離散混合出力分布型HMMによる雑音下音声認識のMFCCでの評価
- ETSI標準フロントエンドを用いた雑音下音声認識の検討(認識・理解・対話)
- ETSI標準フロントエンドを用いた雑音下音声認識の検討(認識・理解・対話)
- 離散混合出力分布型HMMを用いた非定常雑音下の音声認識(ポスターセッション)(第5回音声言語シンポジウム)
- 離散混合出力分布型HMMを用いた非定常雑音下の音声認識(第5回音声言語シンポジウム : ポスターセッション)
- 離散混合出力分布型HMMを用いた非定常雑音下の音声認識(第5回音声言語シンポジウム : ポスターセッション)
- 講演音声認識における音響・言語モデルの話者適応の検討(認識・理解・対話)
- MAP推定を用いた離散混合出力分布型HMMの雑音重畳音声での評価(認識・理解・対話)
- 講演音声認識における話者適応の検討
- 離散混合出力分布型HMMのMAP推定による雑音適応の検討
- かな・漢字文字列を単位とした言語モデルの検討
- 講演音声認識のための音響・言語モデルの検討
- かな・漢字文字列を単位とした言語モデルの検討
- かな・漢字文字列を単位とした言語モデルの検討
- かな・漢字文字列を単位とした音声認識の検討
- 単語グラフ生成の言語重み・挿入ペナルティ最適化の検討
- 音素グラフに基づく仮説制限法を用いた大語彙連続音声認識の検討
- 音素グラフに基づく仮説制限法を用いた大語彙連続音声認識の検討
- Trigramに基づくErgodic HMMによる言語モデルの検討
- 話者クラス音響モデルおよび話者適応を用いた話し言葉音声認識の検討(認識,理解,対話,一般)
- 声道長正規化による大語彙連続音声認識の性能改善の検討
- 講演音声認識のための音響・言語モデルの検討
- 講演音声認識のための音響・言語モデルの検討
- 最大エントロピー法によるトリガー言語モデルの評価
- 対話音声認識におけるMLLR適応の評価
- 単語グラフ生成におけるパラメータ最適化の検討
- 単語グラフ生成におけるパラメータ最適化の検討
- 単語グラフ生成におけるパラメータ最適化の検討
- 単語グラフ生成におけるパラメータ最適化の検討
- SP2000-26 単語グラフ生成の言語重み・挿入ペナルティ最適化の検討
- SP2000-19 話者照合におけるMLLRベースの話者モデル作成の検討
- MLLR適応におけるMDL基準に基づく回帰クラスタ設定の検討
- 品詞と高頻度単語のN-gramを使用したタスク適応の検討
- 確率文脈自由文法を用いた言語モデルにおける初期値の検討
- 識別学習を用いた離散混合分布HMMによる音声認識
- 話者クラス音響モデル及び単語グラフ統合を用いた音声認識(音声,聴覚)
- 話者クラス音響モデルを用いた講演音声認識におけるクラスタリング手法の各種検討(ポスターセッション)