記事一覧へ戻る
大規模言語モデル

ByteDance、10兆パラメータ級モデルでAnthropicに挑む

読了目安 2 分

ByteDance が、フロンティア級AIモデルの競争で大きく踏み込んでいる。報道によれば、同社は最大10兆パラメータに達する可能性のあるモデルを訓練中で、これは米国トップ研究所の最先端システムに匹敵する規模だ。

要点

  • モデルはまだ事前学習段階にあり、通常は3〜6か月ほどかかる。
  • 業界推定では、Anthropic の Mythos 5 は約8兆パラメータ、Fable 5 は約5兆パラメータとされる。
  • パラメータ数は能力を直接決めるものではないが、記憶容量や基礎的な表現力の上限を左右する。
  • ByteDance の Seed チームは、他社モデルの蒸留に頼らない独立路線を採っている。
  • AIインフラ、クラウド、自社チップへの投資も並行して進めている。

何を意味するのか

この動きは、中国の大手テック企業が「米国を追いかける」段階から、「同じ土俵で最上位を争う」段階へ入りつつあることを示している。ベンチマークの差を縮めるだけでなく、モデルの規模そのものを引き上げることで、将来的な競争力を確保しようとしている。

ByteDance にとっては、Doubao や企業向けAIサービスの基盤を強化する意味も大きい。さらに、独立したモデル開発を通じて、長期的な技術主導権を握りたい狙いもある。

もっとも、巨大化だけで勝てるわけではない。データ品質、学習手法、推論効率が揃って初めて強いモデルになる。10兆パラメータという数字は、野心の大きさを示すものだが、最終的な成果はその先の実装力で決まる。

Ars Technica AI

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
NCP-ArchPreview:次のトークンから次の概念を予測する言語モデルへ
大規模言語モデル
cctest.ai
大規模言語モデル

NCP-ArchPreview:次のトークンから次の概念を予測する言語モデルへ

NCP-ArchPreviewは、従来の次トークン予測に、複数トークンをまたぐ離散的な「次の概念」予測を組み合わせる。自動回帰生成を維持しながら、潜在空間でより高い抽象度の学習を試みる構成だ。

続きを読む
CCTest · Blog
正解をまねるのではなく、誤った推論を避けてLLMを学習させる
大規模言語モデル
cctest.ai
大規模言語モデル

正解をまねるのではなく、誤った推論を避けてLLMを学習させる

Negative Self-Distillationは、特権情報を使った正解軌跡をそのまま模倣させるのではなく、モデル自身が生成した不完全な推論から離れるように学習する枠組みです。外部ラベルなしで探索と自己修正を保つことを目指します。

続きを読む
CCTest · Blog
多言語データの混合で、モデルは入力言語のまま推論できるか
大規模言語モデル
cctest.ai
大規模言語モデル

多言語データの混合で、モデルは入力言語のまま推論できるか

Cohere Labs は、推論モデルが英語に戻らず、ユーザーの入力言語で考えるための学習方法を検証した。3.35B パラメータの Tiny Aya L2-Thinker は、60言語で93%以上の言語内推論率を報告している。

続きを読む