モーダル間の共起関係を考慮した階層的トピック軌跡モデルによる映像認識検索(IBIS2010(情報論的学習理論ワークショップ))
スポンサーリンク
概要
- 論文の詳細を見る
本稿では,与えられた映像に適合するメタ情報を提示する映像認識(automatic video annotation)と,与えられたメタ情報に適合する映像を提示する映像検索(video retrieval)とを,統一的な枠組で取り扱う映像認識検索問題を取り上げ,そのための統計モデルである階層的トピック軌跡モデルHTTMを提案する.提案モデルは,各モダリティ及びクロスモーダルの共起関係を考慮したトピックモデルと,その時空間的ダイナミクスを表現する状態空間モデルとによって構成され,映像におけるインスタンス・シーン・コンセプトを階層的に表現する.このモデルに基づき,モデル推定・映像認識・映像検索それぞれを簡易に実現することが可能である.それと共に,音響信号や地理情報など他の要素を新規に導入する拡張も容易である.本稿では,人手によりラベル付けきれた映像データセットに対してこのモデルを用いた認識実験を行い,精度向上の結果とともに報告する.
- 2010-10-28
著者
-
木村 昭悟
日本電信電話(株)NTTコミュニケーション科学基礎研究所
-
柏野 邦夫
日本電信電話株式会社NTTコミュニケーション科学基礎研究所
-
西本 卓也
東京大学情報理工学系研究科システム情報学専攻
-
小野 順貴
東京大学情報理工学系研究科システム情報学専攻
-
嵯峨山 茂樹
東京大学情報理工学系研究科システム情報学専攻
-
亀岡 弘和
NTTコミュニケーション科学基礎研究所
-
柏野 邦夫
NTTコミュニケーション科学基礎研究所
-
西本 卓也
東京大学大学院情報理工学系研究科
-
嵯峨山 茂樹
東京大学大学院情報理工学系研究科
-
木村 昭悟
日本電信電話株式会社nttコミュニケーション科学基礎研究所
-
木村 昭悟
東京工業大学工学部電気電子工学科
-
小野 順貴
東京大学大学院情報理工学系研究科
-
柏野 邦夫
日本電信電話(株)基礎研究所 情報科学研究部
-
亀岡 弘和
日本電信電話株式会社
-
嵯峨山 茂樹
北陸先端科学技術大学院大学情報科学研究科情報処理学専攻
-
西本 卓也
東京大学大学院情報理工学系研究科システム情報学専攻
-
宮部 滋樹
東京大学大学院情報理工学系研究科システム情報学専攻
-
西本 卓也
東京大学
-
中野 拓帆
東京大学
-
宮部 滋樹
奈良先端科学技術大学院大学
-
亀岡 弘和
日本電信電話株式会社nttコミュニケーション科学基礎研究所
-
小野 順貴
東京大学
-
嵯峨山 茂樹
東京大学情報理工学系研究科
-
中野 拓帆
東京大学大学院情報理工学系研究科
-
柏野 邦夫
Ntt コミュニケーション科学基礎研
-
木村 昭悟
日本電信電話(株)コミュニケーション科学基礎研究所
-
亀岡 弘和
東京大学大学院情報理工学系研究科|nttコミュニケーション科学基礎研究所
-
柏野 邦夫
日本電信電話(株)NTTコミュニケーション科学基礎研究所
関連論文
- メディアコンテンツ特定技術の最新動向(学生/教養のページ)
- グラフコストの逐次更新を用いた映像顕著領域の自動抽出(テーマセッション,映像ハンドリング技術とその応用)
- グラフコストの逐次更新を用いた映像顕著領域の自動抽出(テーマセッション,映像ハンドリング技術とその応用)
- グラフコストの逐次更新を用いた映像顕著領域の自動抽出(テーマセッション,映像ハンドリング技術とその応用)
- 視覚的注意の確率的モデル化のための動的マルコフ確率場(テーマセッション2,アンビエント環境知能)
- グラフコストの逐次更新を用いた映像顕著領域の自動抽出(画像映像解析,画像の認識・理解論文)
- MCMC-based particle filterを用いた人間の映像注視行動の実時間推定(テーマセッション,映像ハンドリング技術とその応用)
- MCMC-based particle filterを用いた人間の映像注視行動の実時間推定(テーマセッション,映像ハンドリング技術とその応用)
- MCMC-based particle filterを用いた人間の映像注視行動の実時間推定(テーマセッション,映像ハンドリング技術とその応用)
- 畳み込みHMMに基づく歌声の基本周波数制御モデルの提案とそのパラメータ学習方法(音響分析一般(1))
- 2値多重音響特徴ベクトルを用いた類似音楽探索法の頑健性評価
- 音や映像から「部品」を取り出すメディアシーン学習技術 (特集 「見る・見せる」技術の最先端)
- 音響指紋技術とその応用
- 視覚的注意の確率的モデル化のための動的マルコフ確率場(テーマ関連セッション2)
- 動的ベイジアンネットワークを用いた視覚的注意の確率モデル(一般,膨大なデータから学ぶもの)
- 適応型混合テンプレートを用いた音源同定 : 音楽演奏への適用
- アンサンブル実演奏の自動アンミキサ
- 適応型混合テンプレートを用いた音源同定 : 複数楽器演奏への適用
- 音声分離と楽音分離の統合のための音オントロジーの提案
- メディアコンテンツ特定技術の最新動向
- 認識理解への認知発達的アプローチ (パターン認識・メディア理解)
- 視覚的注意の確率的モデル化のための動的マルコフ確率場(テーマセッション2,アンビエント環境知能)
- 動的ベイジアンネットワークを用いた視覚的注意の確率モデル(一般,膨大なデータから学ぶもの)
- AS-5-5 複合ソースフィルタモデルによる音響信号の三要素テンソル分解(AS-5. 音響信号のモデリングと表現,シンポジウムセッション)
- 実環境で収録された映像断片をキーとする一致映像探索(マルチメディア応用,画像の認識・理解論文)
- 高速メディア探索 (特集 コミュニケーション環境の未来に向けた研究最前線)
- 幾何変換パラメータを特定する縮退生成探索法(テーマセッション(4),パターン認識・メディア理解のための学習理論とその応用)
- 音楽や映像の高速探索(工学と芸術を融合する若い息吹)
- ベイジアンネットワークの音響認識への応用
- SPIRE : スパースなインデキシングによる画像中の同一部分領域の検出(画像検索, 画像の認識・理解論文)
- サブテンプレート間距離を用いた適応的ウィンドウスキップによる高速テンプレートマッチング法(画像処理・解析, 画像の認識・理解論文)
- Vocal Dynamics Controller: 歌声のF0動特性をノート単位で編集し,合成できるインタフェース
- Music Factorizer: 音楽音響信号をノート単位で編集できるインタフェース
- 相平面に描かれるF0の動的変動成分を利用した歌唱様式の自動分類
- 映像認識理解への認知発達的アプローチ(テーマセッション,パターン認識とメディア理解のフロンティアとグランドチャレンジ)
- 局所的・大域的クラスタリングに基づく音・映像の高速時系列探索法(テーマセッション: 時系列・大規模メディア処理, データ工学とメディア理解との融合)
- 局所的・大域的クラスタリングに基づく音・映像の高速時系列探索法(テーマセッション: 時系列・大規模メディア処理, データ工学とメディア理解との融合)
- 実環境で受音した楽音をキーとする楽曲探索法(パターン認識)
- グローバルな枝刈りを導入した音や映像の高速探索
- 同じ音や映像を高速に探す技術--学習アクティブ探索法 (特集論文1 高度検索技術)
- 音や映像の高速探索のための動的分割に基づく特徴次元削減法
- 携帯カメラで収録した映像をキーとする一致映像探索
- グローバルな枝刈りを導入した音や映像の高速探索
- LI-18 携帯電話で受音した音をキーとする音響信号探索(I. 画像認識・メディア理解)
- 区分線形写像に基づく音響信号の高速探索
- 区分線形写像に基づく映像信号の高速探索
- 解説 確率ディザボーティング--低品質な映像も瞬時に探すためのコア技術
- R&Dホットコーナー 楽曲やCMの高速検索を実現する学習アクティブ探索ライブラリ--NTTコミュニケーション科学基礎研究所
- 音や影像を素早く探すメディア探索技術の未来 (特集 人間情報科学が切り拓くコミュニケーションの未来)
- 時系列アクティブ探索法のための特徴ひずみに頑健な確率デイザボーテイング (画像の認識・理解論文特集)
- 特徴歪みに頑健な部分空間を用いた携帯端末による音響信号探索
- 保有知識の確信度に基づく対話型映像認識理解システムの質問生成戦略(テーマセッション,コンピュータビジョンとパターン認識のための機械学習と最適化,一般)
- 保有知識の確信度に基づく対話型映像認識理解システムの質問生成戦略(テーマセッション,コンピュータビジョンとパターン認識のための機械学習と最適化,一般)
- 重み付き特徴点照合に基づく高速画像検索(テーマセッション: 時系列・大規模メディア処理, データ工学とメディア理解との融合)
- 重み付き特徴点照合に基づく高速画像検索(テーマセッション: 時系列・大規模メディア処理, データ工学とメディア理解との融合)
- 線形2次系を利用した歌声のF0ダイナミクスの統計的モデル化と分析(オーガナイズドセッション:「Advances in soeech decomposition」,合成,生成,韻律,音声一般)
- TRECVID 2010 Instance Searchタスク参加報告 (パターン認識・メディア理解)
- 多数の小領域スペクトログラムの探索に基づく背景音楽の高速探索法(音楽情報処理)
- 2値多重音響特徴ベクトルを用いた類似音楽探索とその高速化(マルチメディアパターン処理)
- モーダル間の共起関係を考慮した階層的トピック軌跡モデルによる映像認識検索(IBIS2010(情報論的学習理論ワークショップ))
- インデックス検索の情報理論的解析
- 特徴歪みに頑健な部分空間を用いた携帯端末による音響信号探索
- 時系列アクティブ探索法に基づく音や映像の高速AND/OR探索
- ヒストグラム特徴系列に基づく長時間音響信号の高速探索
- 音の流れを認識して楽器を聞き分けるコンピュータ (特集論文 ヒューマノイド・テクノロジー&サイエンス研究)
- 音や映像を瞬時に探す時系列アクティブ探索法
- ヒストグラム特徴を用いた音響信号の高速探索法 : 時系列アクティブ探索法
- オーバースキッピングによる時系列アクティブ探索法の高速化
- 時系列アクティブ探索法における音響信号の高速AND/OR探索
- 複数の音響信号の高速探索 -参照信号のOR探索における照合回数削減-
- 単音連繋確率ネットワークに基づく音楽演奏の音源同定
- マルチモーダルアクティブ探索を用いた画像・音響時系列の高速探索
- ヒストグラム特徴系列に基づく長時間音響信号の高速探索
- パート譜を用いたボーカル音 分離システム
- アンサンブル実演奏の自動アンミキサ
- 適応型混合テンプレートを用いた音源同定 : 複数楽器演奏への適用
- 多数の小区間信号の探索に基づく背景音楽の探索
- 多数の小区間信号の探索に基づく背景音楽の探索
- D-12-22 メディア探索のための曖昧文字列照合の高速計算法
- TRECVID 2010 Instance Searchタスク参加報告(テーマセッション,映像処理とTRECVID)
- 対話型映像認識理解における動的学習戦略に関する取り組み(テーマセッション,PRMUのフロンティア・グランドチャレンジ)
- 半教師付き正準密度推定法に基づく音響信号の自動タグ付けと検索(一般セッション,PRMUのフロンティア・グランドチャレンジ)
- シーンの色情報と深度情報の統合による自動物体セグメンテーション(実世界センシングとその応用)
- シーンの色情報と深度情報の統合による自動物体セグメンテーション(実世界センシングとその応用)
- 人間の視覚的注意の計算モデル(サーベイセッション,人の視聴覚情報処理とPRMUの接点)
- 非負制約下における複合行列分解
- 人間の視覚的注意の計算モデル(サーベイセッション,人の視聴覚情報処理とPRMUの接点)
- 動的ベイジアンネットワークを用いた視覚的注意の確率モデル
- 動的ベイジアンネットワークを用いた視覚的注意の確率モデル
- 画像検索でのユーザ行動を利用した大規模画像アノテーション(一般物体認識,文字・文書,映像,医用画像,画像の認識・理解論文)
- sNMF:非負値制約下における複数行列の同時分解法 : ソーシャルメディア解析を応用例として(第15回情報論的学習理論ワークショップ)
- シーンの色情報と深度情報の統合による自動物体セグメンテーション
- ACM Multimedia 2013参加報告と関連研究動向
- 関係データ解析のための長方形分割過程 (情報論的学習理論と機械学習)
- 大規模マルチメディア解析コーパスとしてのsocial curationの可能性(特別講演,大規模データベースとパターン認識)
- 非負制約下における複合行列分解とそのソーシャルメディア解析への応用
- 画像検索でのユーザ行動解析に基づく大規模画像アノテーション
- SNSを利用したトピックモデルによる画像へのユーザ嗜好性の解析(テーマセッション,大規模データベースとパターン認識)
- 人間の視覚的注意の計算モデル
- 人間の視覚的注意の計算モデル