記事とガイド

大規模言語モデル

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 15 件の記事

CCTest · Blog
外部監督なしのオンポリシー自己蒸留:モデル自身の合意から学ぶ U-OPSD
大規模言語モデル
cctest.ai
大規模言語モデル

外部監督なしのオンポリシー自己蒸留:モデル自身の合意から学ぶ U-OPSD

本論文は、モデル自身の複数生成結果から擬似解を作り、それとの不一致を学習信号にする U-OPSD を提案する。真値ラベルや強い教師モデルを使わずに、数学推論ベンチマークで基盤モデルを安定して上回った点が特徴だ。

続きを読む
CCTest · Blog
SPOT:推論モデル蒸留を「結果で校正」する新手法
大規模言語モデル
cctest.ai
大規模言語モデル

SPOT:推論モデル蒸留を「結果で校正」する新手法

SPOT は、On-Policy Distillation において、どの位置を詳しく調べ、どの候補を学習目標にすべきかを同時に扱う手法です。教師モデルの局所確率だけでなく、検証器が評価した後続結果を使って蒸留ターゲットを調整します。

続きを読む
CCTest · Blog
解釈可能性は性能の代償ではない?Steerling-8B が示す透明な言語モデルの設計
大規模言語モデル
cctest.ai
大規模言語モデル

解釈可能性は性能の代償ではない?Steerling-8B が示す透明な言語モデルの設計

この技術レポートは、言語モデルの解釈可能性を学習後に付け足すのではなく、学習プロセスそのものに組み込むべきだと主張している。Steerling-8B は生成結果を入力、概念、学習データへ結び付ける試みとして紹介されている。

続きを読む
CCTest · Blog
Skaling Law:モデル規模とデータ量を再び結び直す新しいスケーリング則
大規模言語モデル
cctest.ai
大規模言語モデル

Skaling Law:モデル規模とデータ量を再び結び直す新しいスケーリング則

Skaling law は、モデル容量と学習データの相互作用を単一の指数で表し、従来のニューラルスケーリング則が極端な条件で外しやすい問題を補正しようとする研究です。

続きを読む
CCTest · Blog
GradCuit:LLMの推論をテスト時に内部状態から最適化する
大規模言語モデル
cctest.ai

GradCuit:LLMの推論をテスト時に内部状態から最適化する

GradCuit は、Transformer の中間層に最適化可能な連続状態を挿入し、生成結果からの勾配を内部推論へ直接戻す手法です。モデル重みを更新せずに、推論精度と頑健性を高めることを狙います。

続きを読む
CCTest · Blog
Multi-Head Attention Residuals:Transformer の残差経路を多頭化する新提案
大規模言語モデル
cctest.ai
大規模言語モデル

Multi-Head Attention Residuals:Transformer の残差経路を多頭化する新提案

Multi-Head Attention Residuals(MHAR)は、Transformer が深さ方向の履歴を読む方法を見直す手法です。全特徴幅で 1 つのルーティング分布を共有するのではなく、特徴サブスペースごとに別々の softmax を持たせます。

続きを読む
CCTest · Blog
TOPLはオフポリシー後学習を「トークンごとの判定」に変える
大規模言語モデル
cctest.ai
大規模言語モデル

TOPLはオフポリシー後学習を「トークンごとの判定」に変える

本論文は、オフポリシー生成をそのまま模倣するのではなく、各トークンが正しいかどうかを学習するTOPLを提案する。要約と翻訳の両方で、分布ずれに対する頑健性が示された。

続きを読む
CCTest · Blog
Loopie:ループ型 Transformer は再び有力な選択肢になるか
大規模言語モデル
cctest.ai
大規模言語モデル

Loopie:ループ型 Transformer は再び有力な選択肢になるか

Hugging Face Daily Papers に掲載された論文は、MoE 構成のループ型 Transformer「Loopie」を紹介している。著者らは、同じ事前学習計算量の下で通常の Transformer ベースラインを上回り、後処理学習によって強い推論能力を得たと主張する。

続きを読む
CCTest · Blog
DeepLoop:ループ型 Transformer の深さ拡張を安定化する手法
大規模言語モデル
cctest.ai
大規模言語モデル

DeepLoop:ループ型 Transformer の深さ拡張を安定化する手法

DeepLoop は、同じ Transformer ブロックを繰り返し使うと残差スケーリングの前提が変わる点に注目した研究です。名目上の層数だけでなく、パラメータが何度訪問されるかを考慮した設計を提案しています。

続きを読む
CCTest · Blog
GigaWorld-Policy-0.5:世界行動モデルをリアルタイム制御へ近づける試み
大規模言語モデル
cctest.ai
大規模言語モデル

GigaWorld-Policy-0.5:世界行動モデルをリアルタイム制御へ近づける試み

GigaWorld-Policy-0.5 は、推論時に未来動画を生成する World Action Models の重さに焦点を当てている。訓練では未来の視覚変化を活用し、実行時には行動のみを出力する設計が特徴だ。

続きを読む
CCTest · Blog
Transformer の深さを「ランク保存」から読み解く
大規模言語モデル
cctest.ai
大規模言語モデル

Transformer の深さを「ランク保存」から読み解く

arXiv の新論文は、Transformer のフィードフォワードブロックを、深さ方向にどれだけ勾配のランクを保てるかという観点から再解釈している。残差接続、正規化の位置、幅の拡張は、単なるスケール制御ではなくランク崩壊を避ける仕組みとして整理される。

続きを読む
CCTest · Blog
DeltaMerge-LowRes:言語適応とタスク適応を分けて学習し、重み空間で合成する
大規模言語モデル
cctest.ai
大規模言語モデル

DeltaMerge-LowRes:言語適応とタスク適応を分けて学習し、重み空間で合成する

DeltaMerge-LowRes は、低リソース言語で新しいタスクに対応する際の高コストな共同微調整を避けるための手法だ。言語 delta とタスク delta を別々に学習し、推論時に合成する。

続きを読む