医療のオープンエンド回答で検索ベースの事実検証が失敗する理由
導入
医療回答の事実性を評価する方法として、検索拡張型の検証が広く使われている。モデルの記憶だけで回答を判定するのではなく、医学文献や権威ある資料から関連文章を検索し、その証拠に基づいて主張の正しさを判断する仕組みだ。説明可能性と拡張性を期待できる一方で、今回の研究は、ベンチマークで高得点を取ることが、正しい証拠に基づいて判断できていることを意味しないと指摘する。
研究で分かったこと
研究は、オープンエンド形式のMedExpertを中心に、3つのクローズド形式データセットと比較した。4種類の検索手法、6種類の検証モデル、3種類のコーパス設定を評価したところ、形式による大きな性能差が確認された。クローズドな生物医学ベンチマークではF1が0.78に達した一方、臨床専門家が注釈したMedExpertでは、Qwen3検索器とGPT-5.4検証器の組み合わせでもF1は0.06にとどまった。
最初の問題は、検索結果がそのまま証拠になるわけではないことだ。4種類の検索器が返した文章のうち、対象となる主張を直接支持または反証できるものは18.5〜42%だった。残りは話題としては関連していても、患者集団や臨床条件が異なる場合がある。また、情報源のエビデンスレベルが不十分な文章も含まれる。関連語が多いというだけで文章を証拠として扱えば、検証段階に入る前から誤判定の原因が生まれる。
研究は検証過程も細分化した。検索された証拠の選択、内容の解釈、臨床的推論、推論と証拠の対応付け、確信度の調整、最終ラベルの一貫性という6段階である。モデルは、関連する文章を見つけても対象集団の違いを見落としたり、文献が明示していない結論を一般的な医学知識から補ったりする可能性がある。
大型モデルだけでは解決しない
LLMを用いたパターン誘導手法により、800件の主張・証拠ペアと576件の推論トレースを分析し、人手および臨床家の判定で確認した。テストされた条件では、推論量を増やすとトークン消費は大幅に増えたものの、再現率の改善にはつながらなかった。モデルを大型化すること、医学データで微調整すること、権威あるウェブ情報を広げることでも、主要な失敗パターンは消えなかった。
これは、問題が単なるモデル規模の不足ではなく、検索してから検証する流れ自体にある可能性を示す。オープンエンドの医療回答には、適用条件や対象集団、証拠の強さが異なる細かな主張が複数含まれる。1つのF1スコアだけでは、証拠を見つけられなかったのか、誤読したのか、推論を誤ったのか、過度に自信を持ったのか分からない。
意義
医療RAGやLLM評価器を開発する場合、総合指標だけでなく、証拠が主張を本当に支持しているか、対象集団が一致しているか、情報源が適切かを個別に診断する必要がある。今後は、主張の細かな分解、臨床条件を考慮した証拠照合、不確実性の明示が重要になるだろう。
コメント
ログイン状態を確認中…
コメントを読み込み中…