線形予測残差の尖度に基づく近端/遠端話者判別の提案(一般,時系列パターン認識,一般)
スポンサーリンク
概要
- 論文の詳細を見る
マイクロホンで受音した信号から所望の音声のみを判別することは,有用な音声インタフェースやテレビ会議システムを実現する上で重要になる.従来の発話区間検出(VAD)では,複数のマイクロホンで受音した信号から推定した音源の方向を基に所望音声と不要音声との判別を行っている.そのため,話者の方向を推定するために複数のマイクロホンが必要となる.そこで本研究では,単一のマイクロホンのみを用いて所望音声と不要音声とを判別する方法について検討した.本研究では,所望の話者はマイクロホンから一定の距離より近くに存在すると仮定する.提案法では単一のマイクロホンで受音した音声の線形予測残差の尖度に基づいて,受音した音声が近端話者によって発話されたのかどうかを判別することで,所望音声と不要音声とを判別する.実環境における評価実験の結果から,提案法は一般的な残響環境において判別の境界を1000mmとした場合に,10%以下の等誤り率で近端話者と遠端話者とを判別可能であることを確認した.また,提案法は実時間で処理が可能であることを確認した.
- 一般社団法人電子情報通信学会の論文
- 2014-02-21
著者
-
加藤 恒夫
株式会社KDDI研究所
-
堀内 俊治
株式会社KDDI研究所ユーザインタフェースグループ
-
山下 洋一
立命館大学
-
西浦 敬信
立命館大学
-
林田 亘平
立命館大学大学院 情報理工学研究科
-
中山 雅人
立命館大学
関連論文
- SLP音声ドキュメント処理ワーキンググループ活動報告(ドキュメント処理・翻訳・言語獲得,第10回音声言語シンポジウム)
- 基本周波数モデルとその応用(言語獲得・学習,合成,生成,韻律,一般)
- 多数の携帯電話とデジタルサイネージ間のインタラクションを可能にするクライアントサーバー型Bluetooth通信方式 (ディペンダブルコンピューティング)
- 多数の携帯電話とデジタルサイネージ間のインタラクションを可能にするクライアントサーバー型Bluetooth通信方式 (コンピュータシステム)
- CRFと統計的F0モデルに基づく連続音声のアクセント型自動推定(合成,生成,韻律,一般)
- 音楽情報検索向け類似テキスト検索システムの試作(音楽情報検索)
- 母音/子音特徴量に基づく適応形マイクロホンアレーを用いた雑音下音声認識(音声,聴覚)
- 話者方位推定を利用した動的時間領域処理に基づく遠隔発話区間検出(音声,聴覚)
- 話者方位情報とゼロ交差情報に基づくハンズフリー発話区間検出の評価(セッション5 : 音声認識+音声合成)
- マイクロホンアレーを用いた時間/空間情報に基づくハンズフリー発話区間検出の検討(認識・検出)
- 櫛形フィルタと確率モデルに基づいた音高認識
- 音声対話技術コンソーシアム(ISTC)の活動成果報告(SIG-SLP内組織の活動報告)
- 携帯電話音声に対する主観評価の精度及び客観評価尺度PESQの有効性の検証(一般)
- LE-006 音響信頼度に基づく動的特徴量統合を用いた全方位マルチモーダル話者方位推定の検討(自然言語・音声・音楽)
- 正三角形型マイクロホンアレーと全方位カメラを用いた全方位マルチモーダル話者方位推定の検討(福祉と知能・情動・認知障害,福祉と音声処理,一般)
- 正三角形型マイクロホンアレーと全方位カメラを用いた全方位マルチモーダル話者方位推定の検討
- 背景雑音を含む携帯電話音声に対するMOS評価の精度推定とPESQの有効性検証
- 携帯インターネットサービスのための音声認証システムの試作と評価
- B-20-60 パッシブ型超音波ポインティングシステムにおける追従性能の評価(B-20.ユビキタス・センサネットワーク,一般セッション)
- 音声ドキュメント検索評価のためのテストコレクションの試作(第8回音声言語シンポジウム)
- 音声ドキュメント検索評価のためのテストコレクションの試作(Session-4 一般(ポスターセッション),第8回音声言語シンポジウム)
- 2 携帯電話における分散型音声認識システムの実用化(音声認識技術の実用化への取り組み)
- 分散型音声認識の商用システム構築(特別企画「音声認識デベロッパーズフォーラム」)
- B-15-16 統合PDA端末の開発(6) : 分散型音声認証システムの実装(B-15. モバイルマルチメディア通信, 通信1)
- キーワードと音響的に類似したアンチキーワードを用いたキーワードスポッティングのリジェクション性能の改善
- 連続数字のパタン指定方式による時期差データに対する話者照合精度の改善
- 携帯インターネットサービスのための音声認証システムの試作と評価
- 携帯電話音声に含まれる雑音のモデル化による音声区間検出誤りの削減
- 混合分布HMMにおけるTree-basedクラスタリング(音声情報処理 : 現状と将来技術論文特集)
- D-14-9 電話音声認識を用いた株価情報案内システム
- SP2000-10 多数話者電話音声データベースを用いた話者クラスタリング
- 大語彙汎用音声認識エンジンの評価
- 大語彙汎用音声認識エンジンの開発
- 多数話者電話音声データベースを用いた話者クラスタリングの検討
- 不特定話者混合分布HMMにおけるTree-Basedクラスタリングの検討
- 不特定話者混合分布HMMにおけるTree-Basedクラスタリングの検討
- 不特定話者混合分布HMMにおけるTree-Basedクラスタリングの検討
- 音声信号の途切れ・オーバーフローへのMissing Feature Theoryの適用
- マルチモーダルコミュニケーションのための音声合成プラットホーム
- マルチモーダルコミュニケーションのための音声合成プラットホーム
- アクセント結合規則を利用した統計的手法に基づく連続音声のアクセント型自動ラベリング
- 多数の携帯電話とデジタルサイネージ間のインタラクションを可能にするクライアントサーバー型Bluetooth通信方式
- 多数の携帯電話とデジタルサイネージ間のインタラクションを可能にするクライアントサーバー型Bluetooth通信方式
- 多数の携帯電話とデジタルサイネージ間のインタラクションを可能にするクライアントサーバー型Bluetooth通信方式
- 多数の携帯電話とデジタルサイネージ間のインタラクションを可能にするクライアントサーバー型Bluetooth通信方式
- NTCIR-9 SpokenDoc: 音声検索語検出と音声ドキュメント検索の評価枠組の設計
- 英語学習者発話の自動評定における正規化の検討(一般(ポスターセッション),第9回音声言語シンポジウム)
- 英語学習者発話の自動評定における正規化の検討(一般(ポスターセッション),第9回音声言語シンポジウム)
- 英語学習者発話の自動評定における正規化の検討(一般(ポスターセッション),第9回音声言語シンポジウム)
- 4Q-5 音声対話システムにおける韻律修正合成音声の利用(音声対話・音声要約,学生セッション,人工知能と認知科学)
- SLP音声ドキュメント処理ワーキンググループ活動報告(ドキュメント処理・翻訳・言語獲得,第10回音声言語シンポジウム)
- SLP音声ドキュメント処理ワーキンググループ活動報告(ドキュメント処理・翻訳・言語獲得,第10回音声言語シンポジウム)
- 韻律を手作業で変更した合成音声の作成と対話システムでの利用(マルチモーダル)
- 話者方位情報とゼロ交差情報に基づくハンズフリー発話区間検出の評価(セッション5 : 音声認識+音声合成)
- 正三角形型マイクロホンアレーと全方位カメラを用いた全方位マルチモーダル話者方位推定の検討(福祉と知能・情動・認知障害,福祉と音声処理,一般)
- 分散マイクロホンシステムを用いた音源位置同定(福祉と知能・情動・認知障害,福祉と音声処理,一般)
- A-10-1 3次元位置推定に基づくパッシブ型超音波ポインティングシステムの構築(A-10. 応用音響,一般セッション)
- Spoken Term Detectionのためのテストコレクション構築とベースライン評価
- Spoken Term Detectionのためのテストコレクション構築とベースライン評価
- 不特定話者混合分布HMMにおけるTree-Basedクラスタリングの検討
- 最ゆう状態系列を用いた実時間ケプストラム平均値正規化の検討
- リジェクションを用いた音声始端検出法の改良
- 電話音声認識におけるケプストラム平均値算出法の改良
- 最尤状態系列を用いた実時間ケプストラム平均値正規化の検討
- 時差・エリアコード案内システムの試作
- 発声内容を考慮した実時間ケプストラム平均値正規化の検討
- カスタマイズ性を考慮した擬人化音声対話ソフトウェアツールキットの設計(音声言語情報処理とその応用)
- 分散マイクロホンシステムを用いた音源位置同定(福祉と知能・情動・認知障害,福祉と音声処理,一般)
- 分散マイクロホンシステムを用いた音源位置同定(福祉と知能・情動・認知障害,福祉と音声処理,一般)
- 少数マイクロホンを用いた音声入力手法の検討(立体音響・トランスデューサ/一般)
- 音声ドキュメント検索評価のためのテストコレクションの試作(Session-4 一般(ポスターセッション),第8回音声言語シンポジウム)
- 音声中の検索語検出のためのテストコレクション構築 -中間報告-
- 音素間の相関を用いた音声認識
- N-best音声認識における認識スコアを利用した候補提示数の決定(音声, 聴覚)
- 話者空間モデルに基づいた音素間相関を用いた音声認識(音声,聴覚)
- N-best音声認識における認識スコアを利用した候補提示数の決定
- 話者空間のモデルに基づいた音声認識
- 連続音声認識による言語情報と韻律情報を利用した講演音声の重要文抽出(言語モデル・要約)(第5回音声言語シンポジウム)
- 連続音声認識による言語情報と韻律情報を利用した講演音声の重要文抽出(第5回音声言語シンポジウム : 言語モデル・要約)
- 連続音声認識による言語情報と韻律情報を利用した講演音声の重要文抽出(第5回音声言語シンポジウム : 言語モデル・要約)
- 連続音声認識による言語情報と韻律情報を利用した講演音声の重要文抽出
- 講演音声の自動要約のための韻律情報の利用
- 要約のための重要文検出におけるF0モデルの利用
- F0モデルを利用した重要文検出の検討
- 音声対話に対する談話セグメントのタグ方式の検討
- 第5回ヨーロッパ音声通信技術会議(EuroSpeech'97)
- RJ-006 注視行動の予測に向けた動画像コンテンツの視覚的特徴と実測した注視点の正準相関分析(J分野:ヒューマンコミュニケーション&インタラクション,査読付き論文)
- 2010年度喜安記念業績賞紹介 : 第3世代携帯電話向けの分散型音声認識システムの実用化
- 4-1 CGM動画像検索のための動き特徴の分散に基づいたハイライト区間抽出手法に関する考察(第4部門 メディア処理1)
- 5-7 ライトの反射光を利用した携帯電話向けユーザインタフェース(第5部門 メディア処理2)
- 18-1 テレビ番組の探しやすさと選局の操作しやすさを特徴とする簡単リモコンGUIの試作と評価(第18部門[テーマ講演]人にやさしい情報メディア技術)
- J-056 加速度およびタッチパネルへの入力情報を用いた携帯端末の持ち手・打ち手判別(HCI(4),J分野:ヒューマンコミュニケーション&インタラクション)
- J-039 HMMに基づくフリックキーボード入力方式(インタフェース,J分野:ヒューマンコミュニケーション&インタラクション)
- Robust and Fast Search Algorithm for Lyric Search Covering Erroneous Queries due to Mishearing
- 音声合成のためのサブバンド符号化技術を用いた高速な波形生成(音声合成・音声再生,電気音響,信号処理,音声一般)
- 音声合成のためのサブバンド符号化技術を用いた高速な波形生成(音声合成・音声再生,電気音響,信号処理,音声一般)
- 音声合成のためのサブバンド符号化技術を用いた高速な波形生成(音声合成・音声再生,電気音響,信号処理,音声一般)
- タブレットデバイスにおける音声対話エージェントを用いたインタラクティブなレシピ検索インターフェイス(コミュニケーション支援及びヒューマン情報処理一般)
- タブレットデバイスにおける音声対話エージェントを用いたインタラクティブなレシピ検索インターフェイス(コミュニケーション支援及びヒューマン情報処理一般)
- 線形予測残差の尖度に基づく近端/遠端話者判別の提案(一般,時系列パターン認識,一般)