討論音声を対象とした話者モデル選択による話者インデキシングと自動書き起こし

スポンサーリンク

概要

論文の詳細を見る
討論音声を対象とした教師なし話者インデキシングとそれを用いた音声認識について報告する.討論音声では,話者の交替が頻繁に発生し,継続時間の短い発話が多く,発話時間のばらつきが大きいため,画一的なモデルで話者インデキシングを行うのが困難である.そこで,BICに基づいて最適な話者モデル(GMMまたはVQ)を選択する方式を提案する.本方式では,発話時間の短い音声に対してVQモデル,長い音声に対してはGMMモデルが選択される枠組みを実現する.実際の討論音声に対して,従来法に比べて高いインデキシング精度を得ることができた.次に,討論音声認識のための音響・言語モデルについて検討を行う.話者インデキシング結果に基づいて音響モデルを適応することにより,音声認識精度の改善を得ることができた.
社団法人電子情報通信学会の論文
2002-12-13

著者

関連論文

もっと見る

スポンサーリンク