Sparse Codingを用いた唇情報からの音声変換(ポスターセッション)

スポンサーリンク

概要

論文の詳細を見る
唇の動きから発話内容を読み取る技術はリップリーディング(読唇)と呼ばれ,聴覚・言語障害者のコミュニケーション手段の一つとして用いられている.本研究では,Sparse Coding を用いて,唇動画像から対応する発話音声へテキスト情報なしで変換を行う.事前に音声を含んだ発話映像から唇情報と音声情報を抽出し,それぞれを基底の集合である辞書として学習する.このとき,二つの辞書行列は同一時系列であり,パラレルなデータである.入力された無音声の映像から抽出された唇情報は,Sparse Coding により少数の基底の線形和で表される.唇辞書行列から選ばれた基底を対応する音声辞書の基底と取り換えることで,音声の基底の線形和として音声が出力される.本稿では,唇情報から識別可能と考えられる母音について変換を行った.
2012-12-13

著者

関連論文

もっと見る

スポンサーリンク