ブラックボックスを開く:最先端モデルの隠れた推論を引き出す
導入
最先端の大規模言語モデルが急速に高性能化した理由として、推論能力の向上がよく挙げられる。しかしクローズドモデルでは、元の思考連鎖を外部から確認できない。観測できるのは最終回答やベンチマークの結果であり、モデルが実際にどのような手順を踏んだのかは推測にとどまる。論文「Capable yet Parsimonious」は、この問題に対し、標準APIで登録したカスタムツールを使って中間推論の一部を外部化する方法を検討した。
対象にはオープンソースモデルに加え、GPT-6 Astra、GPT-5.6 Sol、Claude Opus 4.8、Claude Sonnet 5などのクローズドな最先端モデルが含まれる。研究者は、出力された説明を最初から真の思考だとは扱わなかった。まずオープンモデルで、抽出した推論をネイティブな思考連鎖と比較した。これは重要な慎重さである。モデルは答えを得た後に、もっともらしい説明を作ることもできるからだ。
主なポイント
- 抽出推論には行動上の妥当性がある。 競技数学、科学、コード生成で、ネイティブ推論に近い性能を示し、推論なしの基準を大きく上回った。
- モデルごとに推論の構造が異なる。 トークン効率、推論ステップの種類、誘導された推論木を分析し、推論の展開と圧縮の仕方を比較した。
- Astraは方向性の強い推論を行う。 より早く正しい経路を選び、後戻りを減らす一方、初歩的な計算は暗黙に処理し、重要な部分だけを外部化する。
- 短い記録は能力の証明ではない。 本当の熟練、学習データの記憶、事後的な合理化は、外部から見るといずれも「すぐ正答した」ように見える。
意義と限界
この研究は、モデルが何問正解したかだけでなく、観測可能な推論をどのように組み立てるかへ評価の焦点を移す。ツールによる推論記録を安定して取得できれば、モデルがどこで経路を変え、どのように誤りから戻り、精度とトークンコストをどう両立するかを調べられる。評価、監視、安全監査に新たな手がかりを与える可能性がある。
一方、外部化された文章はモデルが生成した行動結果であり、完全で忠実な内部計算記録とは限らない。今後は多様な課題や敵対的な条件で、失敗原因を本当に示すのか、それらしい説明を作るだけなのかを検証する必要がある。著者らは、この手法をOpenAIとAnthropicに開示したとしている。
コメント
ログイン状態を確認中…
コメントを読み込み中…