LimiX-2、表形式データを「予測」から「機構の学習」へ
概要
表形式データの機械学習では、入力された特徴量から目的変数を予測する設定が一般的です。しかし、現実のデータに含まれる変数は、単なる入力列と正解列の集合ではありません。複数の変数が、共通するデータ生成過程や依存関係を反映している場合があります。LimiX-2は、この関係性そのものを事前学習の中心に置こうとするモデルです。
目的変数中心から機構中心へ
LimiX-2は、Contextual Mechanism Networks(CMNs)という考え方を採用し、Context-Conditional Masked Modeling(CCMM)で事前学習されます。従来の表形式PFNに近い方法は、文脈データを使って p(y | x, D_context)、つまり入力xから指定された目的変数yを予測する問題として整理できます。
これに対しCMNsは、p(x, y | D_context)のように、文脈に依存した変数全体の同時構造を学ぶことを目指します。どの列が観測され、どの列がマスクされるかに応じて、異なる未知量を推定できるという発想です。この設計は、分類や回帰だけでなく、欠損値補完にもつながります。さらに、プロジェクトは因果骨格の復元を能力の一つとして挙げています。
学習データと評価
事前学習には、構造的因果モデル(SCM)から生成した合成データを利用します。グラフ構造、関数メカニズム、観測過程を多様化することで、モデルが特定のデータセットだけに適応するのではなく、さまざまな構造化データの生成パターンに触れることを狙っています。
提供された資料によると、LimiX-2のスコアはTabArenaで1935 Elo、TALENTで1506 Elo、BCCOで1432 Eloです。3つの総合ベンチマークすべてで首位になったと報告されており、既存の表形式基盤モデルやデータセット専用モデルを上回ったとされています。また、パラメータ数を1250万から4億620万へ拡大すると、5つのスケーリング系列で性能が一貫して向上し、測定範囲では明確な飽和が見られなかったと説明されています。
意義と注意点
LimiX-2の重要性は、数値上の順位だけでなく、表形式知能の定義を広げようとしている点にあります。一つの目的変数に特化した予測器ではなく、変数間の構造を学ぶモデルになれば、同じ事前学習モデルを複数の推論タスクに利用できる可能性があります。
一方、因果能力については慎重な検証が必要です。資料では、特徴量の注意機構が直接的な因果関係を表し、因果骨格を復元できるとされていますが、ここで示された情報だけでは、交絡、分布変化、欠測がある現実データでの頑健性までは判断できません。SCM由来の合成データと実データの差も、今後の重要な評価点です。
LimiX-2は、表を「答えを予測するための入力」ではなく、「生成メカニズムを推定する構造」として扱う方向性を示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…