記事一覧へ戻る
AIエージェント

AstraとOpus、チューリングのもう一つの試練に挑む

読了目安 3 分

導入

アラン・チューリングといえば、機械の知能を人間と区別できるかを問う「チューリングテスト」が知られている。しかし、彼の生涯でより直接的かつ歴史的な影響が大きかった課題は、第二次世界大戦中にナチス・ドイツが使ったエニグマ暗号の解読だった。戦時中の解読作業が終わった後も、記録の誤記や通信担当者の入力ミスなどが原因で、少数のメッセージが未解読のまま残っている。

その一部に、現代の大規模言語モデルが取り組んだ。暗号研究者によると、OpenAIのAstraとAnthropicのClaude Opusは、長年解読されていなかった別々のエニグマ通信2通の平文を復元するのに役立ったという。

主なポイント

  • 開発者のCarter Leffenは、エニグマ通信のデータベースから未解読の記録を探し、解読するようAstraに指示した。
  • Astraは史料を調べ、文脈上の手掛かりを見つけ、エニグマ機のシミュレーターを構築しながら解読を進めたとされる。
  • その結果、2005年から研究者を悩ませていたメッセージの平文が得られた。資料サイト「Crypto Cellar」を管理するFrode Weierudが解答を確認した。
  • Astraのログには、非公開コレクションに関する記述もあった。ただし、モデルが実際にその資料へアクセスしたのか、別の研究者が公開した情報を見つけたのか、公開アーカイブを参照したのかは明らかでない。
  • Jack Willisは後にClaude Opusを使い、別のメッセージを解読した。この作業では、特定の将校名を含む、より具体的な手掛かりが与えられていた。
  • Weierudによると、現在も7通のエニグマ通信が未解読で、平文は判明しているものの暗号設定が解けていないケースも1件ある。

意味と影響

今回の価値は、AIが単純に大量の組み合わせを試したことだけではない。エニグマの研究では、不完全な暗号文、歴史資料、当時の通信習慣、軍事的な状況、転記ミスの可能性を結び付ける必要がある。Astraの事例が興味深いのは、資料検索、仮説形成、プログラミング、候補の検証を一つの作業の流れにまとめた点だ。

これは、単発の質問に答えるモデルではなく、複数の段階からなる調査目標を追うAIエージェントの能力に近い。Weierudは、Astraが2日間で行ったことは人間なら数週間から数か月かかる可能性があると述べた。ただし、これは比較実験の結果ではなく、個人的な評価である。

また、これを暗号研究者の代替と受け止めるべきではない。Claude Opusには重要な人間の手掛かりが与えられ、Astraについても情報源の経路が完全には分かっていない。モデルが公開情報を再構成しただけなのか、どの資料が決定的だったのかも確認が必要だ。歴史研究でAIを使うなら、再現可能な手順、情報源の監査、独立した検証が欠かせない。

エニグマは、実用的な知能を測る難しい課題でもある。答えが整ったデータセットに用意されているわけではなく、証拠は不完全で、記録には誤りがあり、必要ならモデル自身が調査用の道具を作らなければならないからだ。残るメッセージの研究が進めば、問うべきなのはAIが「第二のチューリングテスト」に合格したかどうかだけではない。人間とAIがどの作業を分担し、結果をどれだけ確実に検証できるかが、より重要になる。

出典:TechCrunch AI

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Google、インドでGeminiからFlipkart商品を購入する機能を試験
AIエージェント
cctest.ai
AIエージェント

Google、インドでGeminiからFlipkart商品を購入する機能を試験

Googleはインドで、GeminiとGoogle AI Modeに表示された一部のFlipkart商品を、AI画面から購入できる機能を試験している。購入ボタンを押すとFlipkartのブランド付き決済フローに移動し、10月後半の提供拡大が予定されている。

続きを読む
CCTest · Blog
DeepSeek DSec、大規模エージェント訓練向けの弾力的なサンドボックス基盤
AIエージェント
cctest.ai
AIエージェント

DeepSeek DSec、大規模エージェント訓練向けの弾力的なサンドボックス基盤

DeepSeekのD​​Secは、エージェントの訓練と評価を対象にした本番向けサンドボックス基盤です。関数呼び出し、コンテナ、microVM、完全なVMを共通SDKで統合し、状態保持やイメージ配布、資源管理をまとめて扱います。

続きを読む
CCTest · Blog
DoorDash、マルチエージェントLLMで6万件のFeature Flagを整理
AIエージェント
cctest.ai
AIエージェント

DoorDash、マルチエージェントLLMで6万件のFeature Flagを整理

DoorDashは、古くなったFeature Flagをコードベースから削除するため、マルチエージェントLLMのワークフローを構築した。実験データ、人による承認、隔離されたGit Worktree、自動検証を組み合わせ、複雑な呼び出し経路ではエンジニアの介入を残している。

続きを読む