記事一覧へ戻る
モデル評価

ブラックボックスを開く:最先端モデルの隠れた推論を引き出す

読了目安 3 分

導入

最先端の大規模言語モデルが急速に高性能化した理由として、推論能力の向上がよく挙げられる。しかしクローズドモデルでは、元の思考連鎖を外部から確認できない。観測できるのは最終回答やベンチマークの結果であり、モデルが実際にどのような手順を踏んだのかは推測にとどまる。論文「Capable yet Parsimonious」は、この問題に対し、標準APIで登録したカスタムツールを使って中間推論の一部を外部化する方法を検討した。

対象にはオープンソースモデルに加え、GPT-6 Astra、GPT-5.6 Sol、Claude Opus 4.8、Claude Sonnet 5などのクローズドな最先端モデルが含まれる。研究者は、出力された説明を最初から真の思考だとは扱わなかった。まずオープンモデルで、抽出した推論をネイティブな思考連鎖と比較した。これは重要な慎重さである。モデルは答えを得た後に、もっともらしい説明を作ることもできるからだ。

主なポイント

  • 抽出推論には行動上の妥当性がある。 競技数学、科学、コード生成で、ネイティブ推論に近い性能を示し、推論なしの基準を大きく上回った。
  • モデルごとに推論の構造が異なる。 トークン効率、推論ステップの種類、誘導された推論木を分析し、推論の展開と圧縮の仕方を比較した。
  • Astraは方向性の強い推論を行う。 より早く正しい経路を選び、後戻りを減らす一方、初歩的な計算は暗黙に処理し、重要な部分だけを外部化する。
  • 短い記録は能力の証明ではない。 本当の熟練、学習データの記憶、事後的な合理化は、外部から見るといずれも「すぐ正答した」ように見える。

意義と限界

この研究は、モデルが何問正解したかだけでなく、観測可能な推論をどのように組み立てるかへ評価の焦点を移す。ツールによる推論記録を安定して取得できれば、モデルがどこで経路を変え、どのように誤りから戻り、精度とトークンコストをどう両立するかを調べられる。評価、監視、安全監査に新たな手がかりを与える可能性がある。

一方、外部化された文章はモデルが生成した行動結果であり、完全で忠実な内部計算記録とは限らない。今後は多様な課題や敵対的な条件で、失敗原因を本当に示すのか、それらしい説明を作るだけなのかを検証する必要がある。著者らは、この手法をOpenAIとAnthropicに開示したとしている。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
ExplorationBench、未知の「異星世界」でAIの探索能力を測定
モデル評価
cctest.ai
モデル評価

ExplorationBench、未知の「異星世界」でAIの探索能力を測定

ExplorationBenchは、AIが未知の規則を実験によって発見したのか、それとも事前学習の記憶を呼び出しただけなのかを検証するためのベンチマークだ。実行可能で常識に反する仮想世界を用い、回答を厳密に確認する。

続きを読む
CCTest · Blog
正答率だけでは足りない:LLM評価で校正を重視すべき理由
モデル評価
cctest.ai
モデル評価

正答率だけでは足りない:LLM評価で校正を重視すべき理由

大規模言語モデルは、どれだけ正解できるかだけでなく、自分の回答がどの程度確かなのかを適切に示せるかでも評価すべきだとする立場論文が発表された。校正手法はすでに存在しており、課題は評価現場での普及にある。

続きを読む