記事一覧へ戻る
モデル評価

Hindcast:予測市場を巻き戻し、LLMの本当の予測力を測る

読了目安 3 分

導入

大規模言語モデルが不確実な未来をどこまで予測できるのかは、推論能力や意思決定能力を測るうえで重要なテーマになっています。しかし、通常のバックテストをそのまま LLM に適用すると、評価が「予測」ではなく「答えを知っているか」の確認になりかねません。論文「Hindcast: Replaying Prediction Markets to Evaluate LLM Forecasters」は、この問題を避けるため、モデルを過去のある時点に戻して評価する Hindcast を提案しています。

重要なポイント

  • 従来のバックテストには落とし穴がある。 予測モデルの評価では、すでに結果が分かっている問いを再生し、結果が出る前ならどの確率を付けたかを見ることが一般的です。しかし LLM の場合、出来事の後に書かれた記事や投稿を検索できたり、後発モデルの学習データに結果が含まれていたりする可能性があります。

  • 二つの漏えい経路が問題になる。 一つは検索による漏えいです。検索や RAG を使うモデルは、事後に公開された情報を見つけてしまうかもしれません。もう一つは学習データです。ある時点では未来だった出来事が、後に訓練されたモデルにとっては既知の情報になっている可能性があります。

  • Hindcast は過去の締め切りを固定する。 各 Polymarket 市場について、結果がまだ存在しない過去の時点 t0 を設定します。モデルが読めるのは、凍結された公開 Reddit スナップショットのうち、t0 より前に投稿された内容だけです。

  • 市場価格も比較対象にする。 モデルの予測は、最終的な結果だけでなく、t0 時点の Polymarket 価格とも比較されます。この価格は、当時の人間参加者が同じような過去情報から作った集合的な予測と見なせるため、公平な参照基準になります。

意義と影響

Hindcast の意義は、単に新しいベンチマークを作ることではありません。LLM 評価では、情報が「いつ存在したか」を厳密に管理しなければ、モデルの先見性を測っているつもりで記憶や検索能力を測ってしまう、という点を明確に示しています。

論文はまた、検索の効果についても慎重な見方を示します。漏えいを防いだ後でも、検索は多くのモデルに役立つことがあります。ただし、それは Reddit 上に事前の関連議論がある場合に限られます。アーカイブに憶測ばかりが含まれている場合、検索はむしろ予測を悪化させる可能性があります。

これは RAG や検索拡張型 AI にとって重要な示唆です。情報量が多いこと自体は価値ではなく、時間的に正しく、内容が十分に濃い情報であることが必要です。Hindcast は、過去の限られた公開情報だけを使って確率判断を行わせ、人間の市場予測と比べることで、LLM の予測能力をより現実に近い形で測る道筋を示しています。

出典:arXiv

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
UrbanGround:実スケール都市でマルチモーダルエージェントの空間能力を検証
モデル評価
cctest.ai
モデル評価

UrbanGround:実スケール都市でマルチモーダルエージェントの空間能力を検証

UrbanGroundは、香港全域の3D地理空間データからインタラクティブな都市サンドボックスを構築し、局所的な視覚理解が長距離ナビゲーションに結び付くかを検証する。現在のMLLMは近距離の認識には強い一方、探索が長くなると方向維持や修正に課題を残す。

続きを読む
CCTest · Blog
評価結果は実際に何を証明できるのか
モデル評価
cctest.ai
モデル評価

評価結果は実際に何を証明できるのか

Inspect Evalsを特定コミットに固定して調査した結果、実行可能な評価コードだけでは、指標に結び付いた過去の主張まで再現できないことが示された。機械的に対象となった124ユニットのうち110件は、証拠または意味づけの不足により、決定的な推論へ進む前に停止した。

続きを読む
CCTest · Blog
Video-IFBench、動画マルチモーダルモデルの指示追従を検証
モデル評価
cctest.ai
モデル評価

Video-IFBench、動画マルチモーダルモデルの指示追従を検証

Video-IFBenchは、動画を正しく理解できるかだけでなく、視覚・音声・意味・形式・条件分岐を含む複雑な指示を守れるかを評価する。20以上の近年のMLLMを対象にした評価では、動画における指示追従の難しさが示された。

続きを読む