HybridInfer、スマホの熱余裕を使ってLLMの実行先を選択
導入
端末内で言語モデルを動かせば、ユーザーデータを外部に送らず、オフラインでも利用でき、クエリごとのクラウド料金も避けられます。一方、HybridInferの研究は、モバイル推論の制約が必ずしも単純な速度低下ではないことを示します。骁龍8 Elite搭載のフラッグシップ端末では、端末内生成を続けるとGPU推論ランタイムが不安定になり、クラッシュや実質的な停止が発生しました。
そのため、端末・エッジ・クラウドを使い分けるルーターには、品質、遅延、料金だけでなく、端末に残された熱的な余裕も必要になります。
3層構成と学習方針
HybridInferは、端末側にLlama 3.2 3B、エッジ側に検索機能付きのLlama 3.1 8B、クラウド側にGPT-4oを配置します。ルーターは端末の熱余裕とクエリの複雑度推定を状態として受け取り、オフラインで学習したQ-learningポリシーによって実行先を決定します。
報酬関数は、回答品質、遅延、コスト、熱的リスクをまとめて評価します。さらに、端末内で処理した場合にローカル性のボーナスを与えます。これは重要な設計要素です。このボーナスを外すと、ポリシーは端末の負荷を避けるため、すべてのリクエストを外部へオフロードするようになります。それでは、プライバシー、オフライン利用、低コストという端末内推論の利点が失われます。
実機での評価
評価はSamsung Galaxy S25+上のAndroid測定環境で行われ、210件のプロンプトと固定された参照回答が使われました。2種類の手作業によるヒューリスティックと比較すると、HybridInferは有意に高い品質を示し、対応のあるWilcoxon検定でp < 0.02となりました。また、適応型の条件の中で最も低いコストでした。
ただし、端末内モデルが常に優れているという結論ではありません。端末で処理可能なクエリに限れば、常時端末内で動かす方式は1クエリあたりの品質で同等でした。しかし、処理速度は3〜6倍遅く、長いクエリでは失敗します。HybridInferの利点は、小型モデルの能力を高めることではなく、遅延、信頼性、対応範囲を改善する点にあります。
意義と限界
この研究は、熱状態を単なるハードウェア監視ではなく、推論方策の一部として扱います。モバイルAIでは、モデル能力に加えて、端末状態、実行環境の安定性、プライバシー、コストを同時に考える必要があるでしょう。
評価対象は1機種、210件のプロンプト、特定の3層構成に限られます。チップ、温度制御、ランタイム、負荷が変われば結果も変わる可能性があります。それでも、Android測定ハーネスとルーティング・評価パイプラインの公開は、他端末での検証に役立ちます。
端末内AIの現実的な解は、すべてをローカルに固定することではなく、ローカル処理を続けるべき時と、エッジやクラウドに一時的に任せるべき時を判断することなのかもしれません。
コメント
ログイン状態を確認中…
コメントを読み込み中…