記事一覧へ戻る
モデルリリース

Tencent Hunyuan、推論時に13Bを活性化する80B MoEモデルを公開

読了目安 3 分

概要

Tencent Hunyuanは、Mixture-of-Experts(MoE)アーキテクチャを採用したオープンソース大規模言語モデル、Hunyuan-A13Bのテクニカルレポートを公開しました。モデル全体のパラメータ数は800億ですが、推論時に活性化されるのは約130億です。すべてのパラメータを毎回使うのではなく、タスクごとに一部の専門家を選択することで、モデルの容量と実行時の計算負荷を切り分けています。

主なポイント

  • MoEによる疎な計算:Hunyuan-A13Bは、各トークンの処理でネットワーク全体を利用しません。専門家の選択によって一部のパラメータだけを動かし、モデル能力、計算効率、導入コストのバランスを取る設計です。
  • 20兆トークン規模の学習データ:事前学習には、厳格にフィルタリングされた約20兆トークンのコーパスを使用しました。特にSTEM分野のデータキュレーションを強化し、事実性と推論能力の向上を狙っています。ただし、提供された要約だけでは、フィルタリング基準やデータの内訳、比較実験までは分かりません。
  • 複数段階のポストトレーニング:事前学習後には、高品質な教師ありファインチューニングと大規模強化学習を実施しました。全体性能を高めることが目的ですが、強化学習の具体的な設定や計算資源は素材に記載されていません。
  • 推論深度を切り替える二モード設計:日常的な質問には「速い思考」、複雑な多段階問題には「遅い思考」を使い分けます。すべての質問に同じ深さの推論を適用せず、課題の複雑さに応じて計算量を調整する考え方です。
  • 幅広い評価領域:数学、科学、プログラミング、一般言語理解、エージェントタスクで競争力のある結果を示し、一部ではより大規模なモデルに近づいたと報告されています。ただし、ベンチマーク名、スコア、比較対象、試験条件は提示されていないため、具体的な順位を断定することはできません。

意義と影響

Hunyuan-A13Bの重要点は、単純にパラメータ数を増やしたことではありません。総容量を大きく保ちながら、1回の推論で使うパラメータを抑えることで、実運用に必要な計算量を減らそうとしています。さらに二モード推論によって、難しい問題には多くの思考時間を割き、定型的な質問では応答遅延を抑える構想を示しています。

この仕組みが実際のサービス環境でも安定して機能すれば、スループットやレイテンシが重視される用途に適したモデルになる可能性があります。一方、必要なメモリや実際の速度は、実装、ハードウェア、推論基盤、ワークロードによって変わります。活性化パラメータ数だけで導入コスト全体を判断することはできません。

オープンモデルの観点では、データ整理、教師あり学習、強化学習、疎な活性化、適応的推論を組み合わせた点が注目されます。ただし、現時点の素材だけでは、他の公開モデルに対する具体的な優位性は検証できません。今後は、完全な論文、モデルの公開状況、ライセンス、推論手順、再現可能な評価結果を確認する必要があります。

Hunyuan-A13Bは、大規模モデルの能力を維持しながら、より効率的な推論を実現できるかを試すリリースです。その価値は、報告された性能とスループットが異なる環境や実際のタスクで再現できるかによって決まるでしょう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
元OpenAI研究者がJevを発表、ソフトウェア向け構造化意思決定を目指す
モデルリリース
cctest.ai
モデルリリース

元OpenAI研究者がJevを発表、ソフトウェア向け構造化意思決定を目指す

TypeSafe AIは、最初の「System One Model」と位置付けるJevを発表し、早期アクセスを開始した。会話そのものではなく、非構造化された状態をソフトウェアが扱える構造化された判断へ変換することを狙う。

続きを読む