記事一覧へ戻る
モデル評価

CADWorld、AIエージェントの長期CAD作業能力を検証

読了目安 4 分

導入

コンピューター操作エージェントは、検索や入力フォームの処理だけでなく、実際のデスクトップ環境でソフトウェアを扱う能力を試されるようになっています。しかし、専門的な設計ソフトでは、画面上でそれらしい結果を表示するだけでは不十分です。設計データがネイティブ形式で保存され、後から編集でき、寸法、拘束、構造、さらに下流工程の状態まで正しく保たれていなければなりません。

CADWorldは、この条件を長期的なコンピューター利用の評価に組み込んだベンチマークです。対象となる環境はオープンソースのCADソフトウェアFreeCADで、単発のクリックではなく、複数段階にわたる機械CAD作業を評価します。

主なポイント

  • 11種類のワークフローを収録。 全200タスクには、スケッチ、部品モデリング、組立、CAM、有限要素解析、測定、メッシュ処理、技術製図などが含まれます。
  • スクリーンショットとGUI操作で実行。 エージェントは画面を見ながら操作し、前の判断によって変化したアプリケーション状態を理解し続ける必要があります。
  • 保存された成果物を実行形式で検査。 FreeCADプロジェクトと補助出力を対象に、形状、パラメトリック構造、拘束、製造状態、シミュレーション結果などをタスクごとに確認します。
  • 専門家との開きが大きい。 7つの既存エージェントをベンチマーク全体で評価したところ、最も高い成功率は17.5%でした。一方、専門家の参考合格率は87.0%です。

なぜCADは難しいのか

機械CADでは、各工程が強く依存しています。スケッチの拘束が不完全なら、後続の押し出しやフィーチャーに影響します。最終形状が似ていても、寸法が違ったり、フィーチャーツリーの構成や作成順が要件と合わなかったりすれば、設計データとしては失敗です。組立関係、製造設定、測定値、解析結果も、画面の見た目だけでは判断しにくい状態情報です。

この点でCADWorldは、スクリーンショットの類似度だけを比べる評価とは異なります。エージェントはインターフェース、操作履歴、パラメータ、ファイル構造を一貫して管理しなければなりません。誤りからの回復も、単純な取り消しでは済まず、依存関係を調べ、フィーチャーを作り直し、拘束を再設定する必要が生じます。

研究結果では、弱いエージェントは有効な成果物を作る前に失敗する傾向がありました。より強いエージェントはプロジェクトを残せるようになる一方、構造、形状、作成プロセスに関する条件で失敗します。つまり、GUIを扱う能力が伸びても、工学的に正しい成果物を安定して作れるとは限りません。

意義と影響

CADWorldは、一般的なコンピューター操作と専門的な自動化の差を測るための、現実に近い評価軸を示しています。今後のエージェントには、ボタンやメニューを正確に選ぶ能力だけでなく、パラメトリック設計の理解、長期計画、状態追跡、節目ごとの検証が求められます。

研究者にとっては、操作途中での失敗と、ファイルを作った後に構造や形状を壊す失敗を区別できる点が重要です。実務で利用するには、成果物がネイティブで検査可能であり、正しい構造を持ち、次の編集や解析に引き渡せなければなりません。CADWorldの低い成功率は、GUIエージェントの進歩を否定するものではなく、ソフトウェア操作から信頼できる設計実行へ進む距離を可視化しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
BI-AgentとBI-Benchが目指すエンドツーエンドBIの自動化
モデル評価
cctest.ai
モデル評価

BI-AgentとBI-Benchが目指すエンドツーエンドBIの自動化

新たな研究によると、最先端の大規模言語モデルでさえ、現実に近いBIタスクの正解率は50%未満です。研究チームは、データ検索から結合、変換、回答までを評価するBI-Benchと、ツール拡張型のBI-Agentを提案しました。

続きを読む
CCTest · Blog
APort Vault、AIエージェントの決済認可境界を検証
モデル評価
cctest.ai
モデル評価

APort Vault、AIエージェントの決済認可境界を検証

APort Vaultは、ツールを使うAIエージェントが決済要求と認可済みの決済を区別できるかを評価するベンチマークだ。Open Agent Passportの決定的な事前チェックを加えると、未許可の受取人への送金は比較条件で140件から0件になった。

続きを読む
CCTest · Blog
AIがAI査読者を訓練するとき、科学的判断はどう縮小するのか
モデル評価
cctest.ai
モデル評価

AIがAI査読者を訓練するとき、科学的判断はどう縮小するのか

モデルが生成した査読文を次世代のAI査読者が学習すると、評価の分布と意味的多様性が縮小する可能性がある。研究チームはこの現象を「科学的判断の崩壊」と呼び、TrustReviewerによる緩和策を提案した。

続きを読む