辞書選択型非負値行列因子分解による構音障害者の声質変換

概要

論文の詳細を見る
本研究では,アテトーゼ型脳性麻痒による構音障害者を対象とし,筋肉の不随意運動を原因とする障害者の不安定な発話を聞き取りやすく変換することを目指す.従来の声質変換手法で最も一般的なのは,混合正規分布モデル (GMM) を用いた統計的手法であった.この手法は主に話者変換を目的として研究されてきたため,GMM 声質変換を構音障害者の発話音声に適用し健常者の音声に変換した場合,障害者の話者性は別人のものに置き換わってしまう.「自分らしい声で話したい」という障害者のニーズに答えるため,本研究では従来の統計的モデルによる声質変換とは異なる,非負値行列因子分解 (NMF) を用いた Exemlpar-based 声質変換を用いて,話者性を維持しつつ聞き取りやすい音声に変換する.これまで NMF 声質変換では,入力音声フレームと,辞書から選ばれる基底の音素が必ずしも一致しないという問題があった.本研究では,この問題を解決するため,NMF を用いて音素カテゴリ認識を行い音素カテゴリに分割した副辞書上でマッピングを行うことで声質変換を行う.提案手法の有効性を評価するため,従来の GMM 声質変換,NMF 声質変換との比較実験を行った.
2013-12-12