記事一覧へ戻る
モデル評価

EmbeddingをLLMに置き換えるべきか?性能差よりコスト差が大きい

読了目安 3 分

導入

大規模言語モデル(LLM)が文章からベクトル表現を生成できるようになり、従来のテキストEmbedding基盤を置き換えられるのではないかという議論が強まっています。LLMは検索意図や文脈を柔軟に解釈できるため魅力的ですが、柔軟性がそのまま運用上の優位性になるとは限りません。今回の研究は、精度だけでなくコストと処理速度も含めて比較しました。

幅広いタスクでの比較

評価対象は、6ファミリーに属する10種類のLLMと、1億1,800万から140億パラメーターまでの26種類のEmbeddingモデルです。分類、意味的テキスト類似度(STS)、クラスタリング、ペア分類、検索を含む37タスクで、異なるタイプのモデルを同じ枠組みで調べました。

総合結果は、LLMの圧勝ではありません。最も高いLLMであるGemini 3.1 Proは77.6点、最良のEmbeddingモデルは77.2点で、差はわずか0.4ポイントでした。標準的な意味処理の多くでは、モデルが生成型であることだけでは大きな追加効果にならないことを示しています。

タスク別に見ると、役割分担は明確です。

  • 推論を伴う検索:クエリの意図や複雑な関係を判断する場面ではLLMが優位です。
  • 分類:専用Embeddingモデルが上回り、反復的かつ大量の処理に向きます。
  • クラスタリング、STS、ペア分類:両者の性能はおおむね同等です。
  • コストと速度:ベンチマーク1回あたりの費用は、LLMが最大154ドル、同程度のEmbeddingモデルが約0.11ドルで、最大差は1,431倍でした。同じGPUで測ったオープンLLMのtoken処理速度も、2.5倍から736倍遅くなっています。

推論には明確な価格がある

LLMの推論コストに占めるreasoning tokenの割合は28%から81%でした。さらに推論予算を減らす実験では、多くのモデルで検索品質が維持され、一部では改善しました。常に最大限の推論を有効にするのではなく、実際のタスクが必要とする推論量を測ることが重要です。

品質とコストのPareto前線には、主要なEmbeddingモデルとGemini 3.1 Proだけが含まれました。つまりLLMは複雑な検索には有力ですが、すべてのベクトル化処理を置き換える存在ではありません。

RAGへの示唆

現実的なRAG構成は、役割分担です。類似度計算、分類、クラスタリングには、安定して高速かつ低コストなEmbeddingモデルを使います。検索に意図理解や複数段階の判断が必要な場合だけ、LLMを投入します。

この研究が示すのはEmbeddingの終わりではなく、導入判断の見直しです。どの処理に本当に推論が必要なのかを、精度、遅延、スループット、費用の実測で判断する必要があります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
ディープフェイク検出が破綻するとき、画像の再構成性で真正性を認証する
モデル評価
cctest.ai
モデル評価

ディープフェイク検出が破綻するとき、画像の再構成性で真正性を認証する

新しい生成モデルや敵対的摂動によって、従来のディープフェイク検出器の信頼性は大きく低下します。研究チームは、既知の生成器が画像を忠実に再構成できるかを調べ、誤認証のリスクを校正する方法を提案しました。

続きを読む
CCTest · Blog
OSWorld-Pro、コンピュータ操作エージェントを「結果」から「過程」で評価
モデル評価
cctest.ai
モデル評価

OSWorld-Pro、コンピュータ操作エージェントを「結果」から「過程」で評価

OSWorld-Pro は、最終状態だけでなく、連続するサブゴールごとにコンピュータ操作エージェントを評価する。クリックミスやキーボード入力の誤り、目的と無関係な操作を可視化できる。

続きを読む
CCTest · Blog
医療のオープンエンド回答で検索ベースの事実検証が失敗する理由
モデル評価
cctest.ai
モデル評価

医療のオープンエンド回答で検索ベースの事実検証が失敗する理由

長文の医療回答を対象にした研究は、検索してから検証するシステムがクローズドなベンチマークでは高い性能を示しても、臨床的なオープンエンド回答では大きく崩れることを示した。失敗の原因は、検索された証拠の質と検証モデルの推論過程に分けて分析できる。

続きを読む