連続動画ストリームで自己教師あり学習が難しくなる理由
はじめに
視覚の自己教師あり学習は、画像を独立にサンプリングし、データを全体的にシャッフルしながら複数エポック学習する設定を前提にしていることが多い。しかし、カメラやロボットが現実世界から情報を受け取る方法は、それとは異なる。フレームは時間順に到着し、隣接する観測はよく似ており、過去のデータを自由に並べ替えたり、何度も再生したりできるとは限らない。
論文「I Have a Stream」は、自己教師あり事前学習をこの連続ストリーム条件に置いたとき、どのような問題が生じるのかを調べている。
主なポイント
- ストリーミング用データセットを構築。 WT++は95時間の都市ウォーキングツアー動画からなる。フレームは厳密なスライディングウィンドウのバッチで時間順に処理され、全体シャッフルや複数エポックの再利用は行わない。
- 手法によって影響が異なる。 対照学習と蒸留ベースの手法はこの設定で苦戦した。一方、マスク付きオートエンコーダ(MAE)は比較的安定していたが、標準的なi.i.d.学習には及ばなかった。
- 問題はバッチ間だけではない。 連続するバッチが似ていることは自然な原因に見えるが、実験ではそれだけでは性能差を説明できなかった。より重要なのはバッチ内の類似性であり、同じバッチのフレームがほとんど重複する場合、学習に使える視覚的変化が不足する。
- StreamMAEが入力処理を調整。 MAEの再構成目的は維持したまま、ストリームを考慮した正則化を加え、動きのある領域を選びやすいクロップ戦略を導入した。
- 長いストリームでも効果が続く。 StreamMAEはストリーミング用のベースラインを上回り、同じ動画をi.i.d.に学習したMAEに近い性能を示した。また、事前学習ストリームを12時間から95時間へ拡大すると、性能も引き続き向上した。
意義と影響
この研究は、動画の長さと学習情報の量を同一視できないことを示している。大量のフレームがあっても、バッチ内にほぼ同じ画像が並んでいれば、モデルが新たに得られる情報は限られる。バッチ間の相関とバッチ内の冗長性を分けて分析した点は、連続データで自己教師あり学習が弱くなる理由を理解するうえで重要だ。
ロボット、モバイルカメラ、長時間の動画理解など、データの再配置や再生が難しい用途では、目的関数だけでなく入力パイプラインも設計し直す必要がある。StreamMAEは、通常の学習バッチを時系列順に流すだけでは不十分であり、各バッチにどれだけ有用な変化を含めるかが重要だと示唆する。
WT++と評価環境は、今後のストリーミング学習研究の基盤にもなる。今後の手法には、シャッフルされた大規模データセットで学習できるだけでなく、冗長で再配置できない連続観測からも情報を持続的に抽出する能力が求められるだろう。
コメント
ログイン状態を確認中…
コメントを読み込み中…