記事一覧へ戻る
推論・デプロイ

HybridInfer、スマホの熱余裕を使ってLLMの実行先を選択

読了目安 3 分

導入

端末内で言語モデルを動かせば、ユーザーデータを外部に送らず、オフラインでも利用でき、クエリごとのクラウド料金も避けられます。一方、HybridInferの研究は、モバイル推論の制約が必ずしも単純な速度低下ではないことを示します。骁龍8 Elite搭載のフラッグシップ端末では、端末内生成を続けるとGPU推論ランタイムが不安定になり、クラッシュや実質的な停止が発生しました。

そのため、端末・エッジ・クラウドを使い分けるルーターには、品質、遅延、料金だけでなく、端末に残された熱的な余裕も必要になります。

3層構成と学習方針

HybridInferは、端末側にLlama 3.2 3B、エッジ側に検索機能付きのLlama 3.1 8B、クラウド側にGPT-4oを配置します。ルーターは端末の熱余裕とクエリの複雑度推定を状態として受け取り、オフラインで学習したQ-learningポリシーによって実行先を決定します。

報酬関数は、回答品質、遅延、コスト、熱的リスクをまとめて評価します。さらに、端末内で処理した場合にローカル性のボーナスを与えます。これは重要な設計要素です。このボーナスを外すと、ポリシーは端末の負荷を避けるため、すべてのリクエストを外部へオフロードするようになります。それでは、プライバシー、オフライン利用、低コストという端末内推論の利点が失われます。

実機での評価

評価はSamsung Galaxy S25+上のAndroid測定環境で行われ、210件のプロンプトと固定された参照回答が使われました。2種類の手作業によるヒューリスティックと比較すると、HybridInferは有意に高い品質を示し、対応のあるWilcoxon検定でp < 0.02となりました。また、適応型の条件の中で最も低いコストでした。

ただし、端末内モデルが常に優れているという結論ではありません。端末で処理可能なクエリに限れば、常時端末内で動かす方式は1クエリあたりの品質で同等でした。しかし、処理速度は3〜6倍遅く、長いクエリでは失敗します。HybridInferの利点は、小型モデルの能力を高めることではなく、遅延、信頼性、対応範囲を改善する点にあります。

意義と限界

この研究は、熱状態を単なるハードウェア監視ではなく、推論方策の一部として扱います。モバイルAIでは、モデル能力に加えて、端末状態、実行環境の安定性、プライバシー、コストを同時に考える必要があるでしょう。

評価対象は1機種、210件のプロンプト、特定の3層構成に限られます。チップ、温度制御、ランタイム、負荷が変われば結果も変わる可能性があります。それでも、Android測定ハーネスとルーティング・評価パイプラインの公開は、他端末での検証に役立ちます。

端末内AIの現実的な解は、すべてをローカルに固定することではなく、ローカル処理を続けるべき時と、エッジやクラウドに一時的に任せるべき時を判断することなのかもしれません。

arXiv

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Mentored Decoding:推測デコーディングとブースティングをつなぐ
推論・デプロイ
cctest.ai
推論・デプロイ

Mentored Decoding:推測デコーディングとブースティングをつなぐ

新しいarXiv論文は、損失を許容する推測デコーディングを形式化し、ターゲットモデルとの分布差を適切に管理すれば、速度向上だけでなく品質改善も起こり得る理由を分析した。解析にはブースティングとfダイバージェンスが用いられている。

続きを読む
CCTest · Blog
SSDを「メモリ階層」に使うColibrì、巨大MoEモデルを一般PCで推論
推論・デプロイ
cctest.ai
推論・デプロイ

SSDを「メモリ階層」に使うColibrì、巨大MoEモデルを一般PCで推論

オープンソースのColibrìは、MoEモデルの専門家重みをNVMe SSDに置き、必要なものだけをRAMやVRAMへ読み込む推論フレームワークです。必要メモリは下げられますが、SSDの速度が推論性能を大きく左右します。

続きを読む