画像と音声情報の併用による雑音に頑強な発話検出
スポンサーリンク
概要
- 論文の詳細を見る
In this paper, we propose a method to detect speech by audio and visual modalities. It is well known that the accuracy of speech detection affects speech recognition accuracy. Because the detection by audio modality is intrinsically disturbed by audio noise, we have researched on the video modality speech detection. The method is not only robust to the audio noise, but also robust to the speaker's motion and other video modality disturbances. However, the accuracy of detection is less accurate because the duration of speech motion is intrinsically longer than the duration of speech. Thus, we propose a bimodal speech detection method. Proposed method is able to eliminate the false detection caused by audio noise. The experiment confirms that the proposed method improves the word accuracy not only in clean condition, but also in the noisy condition(SNR 10dB).
- 一般社団法人情報処理学会の論文
- 2001-07-13
著者
関連論文
- A-16-18 Blendshapesによるリップシンクアニメーションのためのキーフレーム削除法(A-16.マルチメディア・仮想環境基礎,一般講演)
- 京都観光案内対話コーパスにおける対話行為タグの設計と分析(理解)
- 同調的対話システム構築のための音声対話コーパスの構築(「ユニバーサルコミュニケーションを実現するための言語処理技術」シンポジウム)
- 携帯型端末を用いた音声自動翻訳システムとフィールド実験(モバイルと放送の融合時代を迎えて(1セグ放送, モバイル放送, 携帯放送融合サービス, 1セグ対応携帯端末, モバイルコンテンツと放送コンテンツの融合, マルチメディア配信, ディジタル放送受信機, および一般))
- NICT知識創成コミュニケーション研究センターの研究と高度言語情報融合フォーラム(ALAGIN)の活動について(Web情報処理,Webとデータベースに関する技術報告)
- 雑音下音声認識評価ワーキンググループ活動報告 : 認識に影響する要因の個別評価環境(3)(SIG-SLP内組織の活動報告)
- 雑音下音声認識評価ワーキンググループ活動報告 : 認識に影響する要因の個別評価環境(2)(雑音・VAD,第9回音声言語シンポジウム)
- 雑音下音声認識評価ワーキンググループ活動報告 : 認識に影響する要因の個別評価環境 (2)(雑音・VAD,第9回音声言語シンポジウム)
- 雑音下音声認識評価ワーキンググループ活動報告 : 認識に影響する要因の個別評価環境(第8回音声言語シンポジウム)
- 雑音下音声認識評価ワーキンググループ活動報告 : 認識に影響する要因の個別評価環境(Session-1 検出,第8回音声言語シンポジウム)
- バイモーダル音声認識における音素境界を越えた同期性のモデル
- 音声認識における頑健性 : 音響分析・音響モデル,なにが課題か(企画)
- NICTにおける音声・言語研究拠点MASTARプロジェクトについて(「ユニバーサルコミュニケーションを実現するための言語処理技術」シンポジウム)
- 多チャンネル三次元音場再現システムの再生方式の違いによる再現性能評価
- マルチモーダル音声言語処理とその応用(マルチモーダル)
- ストーリへの没入感を実現するダイブイントゥザムービープロジェクト(テーマ関連/オーガナイズドセッション)
- 5.効率的アニメ制作支援のための3次元CG技術(情報技術が支えるアートとコンテンツの世界)
- CENSREC-1-C : 雑音下音声区間検出評価基盤の構築
- 連続音声認識候補受理/リジェクションのためのワードスポッティング仮説検証手法(第5回音声言語シンポジウム : システム・信頼度)
- 統計的対話モデルを用いたWFSTに基づく音声対話システム
- SLP雑音下音声認識評価WG活動報告 : 評価用データと評価手法について(Session-6 スペシャルセッション: 共通コーパスを利用した耐雑音技術評価, 第7回音声言語シンポジウム)
- ATR実環境雑音DB-ATRANS-を用いた雑音重畳音声認識実験(耐雑音)
- 実走行車内単語音声データベースCENSREC-3と共通評価環境の構築
- CENSREC-3 : 実走行車内単語音声データベースと評価環境の構築(ポスターセッション)(第6回音声言語シンポジウム)
- 実環境下音声認識の評価の標準化とその動向(音声・言語における標準化動向)(第6回音声言語シンポジウム)
- 分散型認識システムでのデータ補完に関する一検討
- 歩行者支援GISにおける音声入力インタフェースの検討(福祉と言語処理/一般)
- 音声翻訳研究の展開(機械翻訳)
- D-14-6 次世代情報家電への音声インタフェースの導入に関する検討(D-14.音声・聴覚,一般講演)
- 連続音声認識候補受理/リジェクションのためのワードスポッティング仮説検証手法(第5回音声言語シンポジウム : システム・信頼度)
- 来場者の声の特徴を反映する映像エンタテインメントシステムのための台詞音声生成システム
- iFACe:デジタルアニメ声優体験システム
- 携帯型端末を用いた音声自動翻訳システムとフィールド実験
- 実環境における発話区間検出のための音響情報と画像情報の統合(音響と音声処理,音声強調,ロバスト音声認識)
- 実環境における発話区間検出のための音響情報と画像情報の統合(音響と音声処理,音声強調,ロバスト音声認識)
- 個人の音声を反映する映像エンタテインメントシステム
- QAシステムのための音声入力インターフェース
- 音声認識の信頼度・複数候補を利用したWFST対話システムの評価
- 雑音下マルチモーダル音声認識評価基盤CENSREC-1-AVの構築
- 相談型対話のモデル化と対話戦略の最適化
- 利得適応型AR-HMM分解法を用いた音響モデルの雑音適応化の検討(音響と音声処理,音声強調,ロバスト音声認識)
- 利得適応型AR-HMM分解法を用いた音響モデルの雑音適応化の検討(音響と音声処理,音声強調,ロバスト音声認識)
- 雑音下音声認識評価ワーキンググループ活動報告 : 認識に影響する要因の個別評価環境(Session-1 検出,第8回音声言語シンポジウム)
- CENSREC-2 : 実走行車内における連続数字音声データベースと評価環境の構築
- 自動車内における連続数字音声コーパスCENSREC-2の設計と評価(Session-7 スペシャルセッション(ポスター): 共通コーパスを利用した耐雑音技術評価, 第7回音声言語シンポジウム)
- Switching dynamical systemとパーティクルフィルタを用いた非定常雑音の逐次推定(Session-1 音響モデル・特徴量・学習, 第7回音声言語シンポジウム)
- 自動車内における連続数字音声コーパスCENSREC-2の設計と評価(Session-7 スペシャルセッション(ポスター): 共通コーパスを利用した耐雑音技術評価, 第7回音声言語シンポジウム)
- SLP雑音下音声認識評価WG活動報告 : 評価用データと評価手法について(Session-6 スペシャルセッション: 共通コーパスを利用した耐雑音技術評価, 第7回音声言語シンポジウム)
- 自動車内における連続数字音声コーパスCENSREC-2の設計と評価(Session-7 スペシャルセッション(ポスター): 共通コーパスを利用した耐雑音技術評価, 第7回音声言語シンポジウム)
- SLP雑音下音声認識評価WG活動報告 : 評価用データと評価手法について(Session-6 スペシャルセッション: 共通コーパスを利用した耐雑音技術評価, 第7回音声言語シンポジウム)
- Switching dynamical systemとパーティクルフィルタを用いた非定常雑音の逐次推定(Session-1 音響モデル・特徴量・学習, 第7回音声言語シンポジウム)
- Switching dynamical systemとパーティクルフィルタを用いた非定常雑音の逐次推定(Session-1 音響モデル・特徴量・学習, 第7回音声言語シンポジウム)
- 歩行者支援地理情報システムにおける音声入力インタフェースと高齢者に対するその評価
- 歩行者支援GISにおける音声入力インタフェースの検討(福祉と言語処理/一般)
- HMM/BN音響モデルの設計と実装
- HMM/BN音響モデルの設計と実装(国際ワークショップ"Beyond HMM")
- HMM/BN音響モデルの設計と実装(国際ワークショップ"Beyond HMM")
- 雑音や発話スタイルの変動に頑健な日本語大語彙連続音声認識
- ハイブリッドHMM/BNモデルに基づいた調音特徴とスペクトル特徴の統合
- ハイブリッドHMM/BNモデルに基いた大語彙音声認識システム
- ハイブリッドHMM/BNモデルに基いた大語彙音声認識システム
- 多様な雑音環境下での頑健な音声認識
- GMMを用いた音声区間の検出
- インドネシア語の音声コーパス作成および音声認識システムの開発
- インドネシア語の音声コーパス作成および音声認識システムの開発
- インドネシア語の音声コーパス作成および音声認識システムの開発
- インドネシア語の音声コーパス作成および音声認識システムの開発(ポスターセッション)(第6回音声言語シンポジウム)
- インドネシア語の音声コーパス作成および音声認識システムの開発(ポスターセッション)(第6回音声言語シンポジウム)
- インドネシア語の音声コーパス作成および音声認識システムの開発(ポスターセッション)(第6回音声言語シンポジウム)
- マルチモーダル音声認識のための顔検出
- マルチモーダル音声認識のための顔検出
- 話者の顔画像を併用した発話検出
- 画像と音声情報の併用による雑音に頑強な発話検出
- 講演音声の音響的特徴分析と音響モデル構築方法の検討
- 3次元個人顔モデルを用いたビデオ映像中の顔の自動トラッキング及びモデルマッチムーブ処理
- D-12-126 3次元顔モデルを用いたビデオ映像中の自動顔トラッキングとモデルマッチムーブ
- モーションキャプチャシステムを用いたマルチモーダル音声コーパスの構築(セッション2)(インタラクション・メディア)
- 一般化事後確率を用いた異なるレベルの大語彙連続音声認識出力の検証
- 一般化事後確率を用いた異なるレベルの大語彙連続音声認識出力の検証
- 連続音声認識候補受理/リジェクションのためのワードスポッティング仮説検証手法
- 一般化事後確率を用いた異なるレベルの大語彙連続音声認識出力の検証(大語彙音声認識)(第6回音声言語シンポジウム)
- 一般化事後確率を用いた異なるレベルの大語彙連続音声認識出力の検証(大語彙音声認識)(第6回音声言語シンポジウム)
- F0パターンの自動推定と目標点の抽出(第8回音声言語シンポジウム)
- 一般化事後確率を用いた異なるレベルの大語彙連続音声認識出力の検証(大語彙音声認識)(第6回音声言語シンポジウム)
- 音場の局所化技術を応用した指向性スピーカシステムの試作と評価
- 音声認識と音声翻訳の国際的共通評価基盤構築に向けて
- 動的な音素ラティス処理による非母国語話者のための音声認識
- CENSREC-3 : 実走行車内単語音声データベースと評価環境の構築(ポスターセッション)(第6回音声言語シンポジウム)
- 実環境下音声認識の評価の標準化とその動向(音声・言語における標準化動向)(第6回音声言語シンポジウム)
- CENSREC-3 : 実走行車内単語音声データベースと評価環境の構築(ポスターセッション)(第6回音声言語シンポジウム)
- 実環境下音声認識の評価の標準化とその動向(音声・言語における標準化動向)(第6回音声言語シンポジウム)
- 複数マイクロホン受音信号の逐次時間差推定アルゴリズム
- マイクロホンアレー座標系の逐次補正アルゴリズムの提案
- 変分ベイズ法を用いた逐次状態分割法(音響モデル)(第5回音声言語シンポジウム)
- 変分ベイズ法を用いた逐次状態分割法(第5回音声言語シンポジウム : 音響モデル)
- 変分ベイズ法を用いた逐次状態分割法(第5回音声言語シンポジウム : 音響モデル)
- AURORA-2J/AURORA-3Jデータベースとその評価ベースライン
- 雑音下音声認識のための複数の前処理手法の統合とそのAURORA-2Jによる評価
- マイクロホン対を用いた雑音除去法の最適化に関する検討 : スペクトルの滑らかさに基づいた場合
- SPINE2プロジェクトのための単語間ポーズモデルによる耐雑音性に優れた音声認識