記事一覧へ戻る
モデル評価

モデルが自分の出力から学ぶと、なぜ不安定になるのか

読了目安 3 分

概要

テスト時学習(Test-Time Training、TTT)は、推論中にモデルの重みを更新し、現在の入力から得た情報をモデル内部に一時的に蓄積する考え方だ。長いコンテキストへの適応や継続的な推論には有望だが、学習データをモデル自身が生成する場合には注意が必要になる。更新によって学習器が変わるだけでなく、次の学習例を作る生成器も同時に変化するからだ。

「Self-Generated Feedback Destabilizes Test-Time Training」は、この自己参照的なループを最長 128K token のストリームで調べた。複数の TTT-E2E 構成に加え、Qwen3-4B の既存重みに Adam で更新を加える条件も評価している。

主な発見

  • 生成文を使うこと自体が失敗の原因ではない。 人間が書いた実データを使った同種の更新では、予測性能が改善する場合がある。一方、自己生成文から得た更新を保持すると、独立した実データへの予測が悪化した。
  • 変化する生成器がフィードバックを生む。 生成担当を凍結したモデルに固定し、別のモデルだけを更新すると、125M と 760M の設定では損害の 98%超が取り除かれた。問題の中心は生成文の形式ではなく、生成器と学習器が同時に変化する閉ループだと考えられる。
  • 出典への適合と転移は一致しない。 1 回の更新を比較すると、更新後のモデルは学習元の文章をより正確に予測できる一方、新しい実データの予測は悪化することがあった。元データの損失低下だけでは、適応の成功を判断できない。
  • 深刻な失敗は一部の軌跡に集中する。 閉ループ適応を続けるとコストは増えるが、大きな性能低下の多くは少数の軌跡が占めた。平均値だけでは、まれだが深刻な不安定化を見落とす可能性がある。

更新を確定する前に検証

研究では「Settlement」と呼ばれる仕組みを評価した。候補となる更新をすぐに採用せず、独立した実データで予測を確認し、外部評価を満たす場合だけ状態を確定する方法だ。125M と 760M の設定では、最終的な平均差をそれぞれ 0.07 と -0.02 nats に抑えつつ、実データからの適応効果を維持した。

意義

この結果は、オンライン適応の更新を、その更新を生んだデータだけで評価してはいけないという原則を示している。長コンテキストモデル、ストリーミング学習器、自律エージェントが推論中に重みを書き換えるなら、更新の検証、拒否、ロールバックを設計に組み込む必要がある。

本研究は、自己生成データが常に有害だと主張しているわけではない。示されたのは、局所的には有効な更新でも、生成器と学習器の閉ループが長期化すると外部データとのずれを拡大し得るという点だ。今後は、低コストで独立検証を行い、不安定な軌跡を早期に検出しながら適応速度を保つ方法が課題になる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
SWE-Game、コーディングエージェントのゲーム開発力を検証
モデル評価
cctest.ai
モデル評価

SWE-Game、コーディングエージェントのゲーム開発力を検証

SWE-Gameは、ゲームの実装、修正、エンジン間移植までを含む247のタスクでコーディングエージェントを評価するベンチマークです。結果からは、動くプロトタイプの生成は進んだ一方、要件の網羅とゲームロジックには依然として課題があることが分かります。

続きを読む
CCTest · Blog
読めるだけでは不十分:UltraText Benchが画像生成の文字精度を検証
モデル評価
cctest.ai
モデル評価

読めるだけでは不十分:UltraText Benchが画像生成の文字精度を検証

UltraText Benchは、英語と中国語の密集した視覚テキストを対象に、画像生成モデルを複数領域・難易度別に評価するベンチマークです。文字の鮮明さと、指定内容を正確に再現する能力は一致しないことが示されています。

続きを読む