GoogleのTabFM、表形式データにゼロショット推論を導入
導入
表形式データの機械学習は、アルゴリズム自体が成熟している一方で、実務では依然としてデータセットごとの作業が必要になる。カテゴリ変数や欠損値の処理、モデルの選択、ハイパーパラメータ探索を新しいデータのたびにやり直すためだ。Google ResearchのTabFMは、この前提を変えようとするモデルである。表と予測対象を文脈として受け取り、教師あり表形式予測を文脈内学習として処理する。
主なポイント
- 表形式向け基盤モデル:TabFMは4億パラメータを持ち、特定のデータセット専用ではなく、複数のタスクに移転できる表形式の表現学習を目指す。
- ゼロショット推論:新しいタスクに合わせた微調整を行わず、1回のフォワード計算で予測を出力する。概要では予測が校正されていると説明されており、結果だけでなく信頼度の扱いも重視している。
- 合成データによる学習:構造的因果モデルから生成した合成テーブルのみで学習する。多様なデータ生成関係を人工的に用意できる一方、合成分布が各業界の実データをどこまで再現するかは、導入時に確認すべき点となる。
- ベンチマーク結果:TabArenaの51データセット、内訳は分類38件と回帰13件で、ゼロショットTabFMはデフォルトの表形式基盤モデル中で首位となり、調整済みAutoMLパイプラインも上回ったと報告されている。提供された素材には具体的なスコアや差分はない。
- 2つの拡張:TabFM+は重みを固定したまま、多視点の特徴拡張、アンサンブル、事後校正を行う。TabFM-AutoはLLMを使い、データセットごとの前処理と特徴量エンジニアリングを支援する。概要では、両者とも分類・回帰の双方で性能を改善したとされる。
意義と影響
TabFMの重要性は、単にパラメータ数が大きいことではない。従来はデータセットごとにモデル選択や探索を始めていたのに対し、基盤モデルがまず即時に予測を出せれば、分析の初期段階を短縮できる可能性がある。異なる表を大量に扱うチームや、迅速にベースラインを作りたい現場にとっては有用な方向性だ。
ただし、ゼロショットは評価不要を意味しない。学習は合成データに基づき、示された結果もTabArenaというベンチマークに関するものだ。実運用では、時間的な分布変化、独特な欠損パターン、情報漏えい、プライバシー制約、業界固有の符号化などが精度や校正に影響する可能性がある。信頼度の校正も、利用する環境で個別に検証する必要がある。
TabFM+とTabFM-Autoは、汎用モデルとデータセット固有の処理を対立させない道筋を示している。TabFMで初期予測を得て、LLMや自動化ツールで適応を行う構成だ。決定木アンサンブルやAutoMLを常に置き換えられるかは今後の検証を要するが、表形式学習をタスク単位の再構築から横断的な推論へ近づける提案といえる。
コメント
ログイン状態を確認中…
コメントを読み込み中…