記事一覧へ戻る
マルチモーダル

PrismML、1ビット小型モデルをQualcomm製スマートグラス向けに展開

読了目安 3 分

スマートグラスが日常的なコンピューターになるには、カメラやディスプレー、音声操作だけでなく、限られた電力と計算資源で周囲を理解するAIモデルが必要になる。PrismMLは、その課題に対してモデルを小型化するアプローチを提示している。Caltechの研究者が設立し、UC BerkeleyのIon Stoica氏がアドバイザーを務める同社は、端末上で動くオープンウェイトAIを大きな目標に掲げる。

今回示されたもの

QualcommのSnapdragon Summitで、同社はSnapdragon AR1 Gen 1 Platformを使うAIスマートグラス向けに、PrismMLの1ビットBonsai大規模言語モデルを紹介した。グラス向けのモデルは約20億パラメータで、視覚と言語の処理に合わせて調整されている。利用者が目の前にあるものについて質問し、端末側のモデルが答えるという使い方が想定される。

PrismMLの技術的な主張は、モデルの圧縮と性能維持だ。同社によれば、より大きなモデルを約4分の1の規模に縮小しながら、標準ベンチマークでは性能のほぼすべてを保てるという。今回のモデルは、その考え方をメモリー、発熱、電池、遅延に厳しいウェアラブル環境へ持ち込む試みである。

要点

  • 端末内処理:画像を毎回クラウドへ送らず、関連する処理をグラス上で行うことを目指す。
  • 1ビット設計:保存容量と推論負荷を抑え、バッテリー駆動の機器に適応しやすくする狙いがある。
  • 視覚言語モデル:約20億パラメータで映像入力と言語応答を組み合わせる。
  • オープンウェイト志向:独自AI研究所のクラウドや大量の計算資源への依存を減らし、既存端末の計算能力を活用する。
  • 製品は未発表:PrismMLのモデルを搭載した具体的なスマートグラスは、現時点で発表されていない。

意義と課題

視覚言語処理を端末上で行えれば、スマートグラスは通信状況に左右されにくくなり、場面によっては応答速度も高められる。周囲の映像を扱う用途では、クラウド中心とは異なるプライバシーの選択肢にもなる。ただし、端末処理だから自動的に安全になるわけではない。実際の製品では、画像やログの保存、権限管理、モデル更新の方法が重要になる。

今回の発表は、AI開発の評価軸がパラメータ数だけではなくなっていることも示す。ウェアラブルでは、圧縮効率、チップとの互換性、消費電力、応答遅延が実用性を左右する。Qualcommがハードウェア基盤を提供し、PrismMLが小型モデルによってその計算資源を活用しようとしている構図だ。

一方、実環境での認識精度、騒音や複雑な視界への対応、バッテリーへの影響はまだ分からない。具体的な搭載製品が発表されていない以上、今回の内容は商用製品の発売ではなく、端末向けAI基盤のデモンストレーションとして捉えるのが妥当だ。

出典:TechCrunch AI

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Ovis-Embedding、テキスト・画像・動画・音声を一つの意味空間へ
マルチモーダル
cctest.ai
マルチモーダル

Ovis-Embedding、テキスト・画像・動画・音声を一つの意味空間へ

Ovis-Embeddingは、共有マルチモーダル・バックボーンでテキスト、画像、動画、音声を処理するオムニモーダル埋め込み方式を提案する。データ構成、難例学習、類似度蒸留、推論時の次元調整までを一体で設計している。

続きを読む
CCTest · Blog
Realtime-Venus、非同期委任に対応する全二重インタラクションを提案
マルチモーダル
cctest.ai
マルチモーダル

Realtime-Venus、非同期委任に対応する全二重インタラクションを提案

Realtime-Venus は、会話を継続しながらバックグラウンドで推論やツール実行を進めるリアルタイム対話システムです。音声・映像向けと音声対話向けに、個別に学習した 9B モデルをそれぞれ備えています。

続きを読む