EvoDuet、ウェブ検索と問題解決を共進化させる科学探索手法
導入
大規模言語モデルを科学的な探索に使う方法の一つが、候補を生成し、評価し、その結果をもとに次の候補を作る進化的探索である。しかし、改善にモデルの内部知識だけでは足りない場合、探索は似た発想の周辺で停滞しやすい。ウェブ検索を追加すれば情報不足を補えるが、候補解が変化しても同じページを返し続けるなら、検索は探索の進歩に結び付かない。
EvoDuetはこの問題に対し、解決プロセスと検索プロセスを共進化させる。モデルの重みは固定したまま、候補解、検索クエリ、文書、評価結果の関係を反復的に更新する。
仕組みの要点
- 検索ゲート:各反復でモデルが知識の不足を判断し、新しい文書を探すか、保存済み文書を再利用するか、検索せずに進むかを選択する。毎回の機械的な検索を避ける設計だ。
- 内側のループ:検索クエリを改善し、どの文書が高いスコアの解候補につながりそうかを予測して順位付けする。文書の価値を単なる文章上の関連性だけで判断しない。
- 外側のループ:選ばれた文書を使って候補を並列生成し、タスクの評価値を記録する。その実測結果が、後続の検索や文書選択に戻される。
- 他の枠組みへの適用:Top-KやEvoXなどの進化的探索用スキャフォールドと組み合わせても、Sums/DiffsやDenoisingで改善が報告されている。
結果と限界
21の最適化タスクで、各反復に1候補だけを生成する条件では、GPT-5.6-Lunaを使った場合、OpenEvolveの正規化された発見ゲインが74.1%から78.0%に上昇した。Gemini-3.8-Flashでは61.3%から82.3%への改善だった。最良の実験では、8タスクで従来報告された最高スコアを上回り、3タスクで同等に達した。Q20とRosettaのSwap Reductionもその例に含まれる。
ただし、すべてのモデルが恩恵を受けたわけではない。Qwen3.5-9Bでは改善が確認されず、検索ツールの有無だけで性能が決まるわけではないことが分かる。知識不足を認識し、検索語を作り、文書を読み、より良い候補へ変換する能力が必要になる。
意義
EvoDuetの重要な点は、検索履歴を単なるコンテキストの保存場所にせず、解の評価と結び付けたことだ。科学最適化では、関連する情報を取得するだけでは不十分で、それが評価可能な解の改善につながらなければならない。この設計は、静的な検索拡張よりも探索の目的に適合しやすい。
一方で、検索コスト、質の低い文書が後続探索へ広がるリスク、モデル間の効果差は今後の課題である。より広い科学問題で、効率と安定性を検証する必要がある。
コメント
ログイン状態を確認中…
コメントを読み込み中…