記事一覧へ戻る
AIエージェント

AIがAIを作り始めた:RSIをめぐる各社の異なる進路

読了目安 3 分

はじめに

AIが次世代のAI開発に参加する動きは、単なる将来予測から測定可能なエンジニアリングへ移りつつある。Anthropicが公開した内部データによれば、2026年8月時点でClaudeはAIの研究開発タスクの約26%で「主導」レベルに達したという。また、90%を超えるタスクが少なくともAI協働の段階に入り、社内のAgent基盤では約3万のAgentが研究や開発作業を同時に実行している。

ただし、「主導」は完全自律を意味しない。Anthropicは研究自動化を6段階で評価しており、AL3は人間の密接な指示のもとでAIが大きな作業を担う状態、AL4は人間が高レベルの目標を示せば、AIがタスクの大部分を端から端まで実行し、人間が監督と最終判断を行う状態を指す。完全自律に近いのはAL5である。

要点

  • 自動化の進展は速い。 Anthropicによると、AL4相当のモデル開発タスクは半年間で1%未満から26%へ増えた。評価対象は約1万5000件の細分化されたタスクで、事前学習、強化学習、評価基盤の障害対応、推論サービスの事故分析などを含む。
  • 指標には主観性がある。 最初の判定にはClaude自身が使われ、社内の担当者が検証した。人間との一致度は一定の水準に達したものの、「協働」と「主導」の境界を完全に客観化することは難しい。
  • Agent基盤が重要になる。 各Agentに固有のIDを与え、共有メッセージ基盤で通信させることで、担当者や資料、実行履歴を追跡できる。多数のAgentを動かすには、モデル能力だけでなく監査と責任追跡の設計が欠かせない。
  • 各社の重点は異なる。 OpenAIは自動化されたAI研究者の規模拡大を進め、Googleは答えだけでなく探索方法そのものの改善を目指す。Recursiveは、過去の実験結果を次の研究に活用する長期的なループを重視する。

意義と限界

各社に共通するのは、AIがコード作成、実験実行、分析、インフラ運用を担い、並列Agentによって探索できる範囲を広げる方向である。しかし、これは厳密な意味でのRSI、つまりAIが自分の後継モデルを自律的に構築する状態とは異なる。

完全なRSIには、モデル能力の向上が次のモデル改善へ安定してつながるフィードバックが必要になる。研究テーマの価値を決め、結果の信頼性を判断し、失敗した方針を止める作業を人間が担っている限り、システムは高度に自動化された研究所と見るべきだろう。候補を大量に生成する能力よりも、結果を正しく検証し、評価指標の抜け道を利用する行動を防ぐことが、今後の大きな課題になる。

Anthropic、OpenAI、Google、Recursiveの違いは、RSIへの入り口が一つではないことを示している。注目すべきなのはRSIという言葉の宣言ではなく、どの研究工程が安定して自動化され、人間の判断がどこまで残るのかである。

出典:InfoQ 中文

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
SoL-Pi、長時間動くコーディングエージェントのトークン消費を削減
AIエージェント
cctest.ai
AIエージェント

SoL-Pi、長時間動くコーディングエージェントのトークン消費を削減

SoL-Piは、コーディングエージェントの基盤モデルではなく、その周囲で動くharnessを自動研究ループで改善する手法です。EdgeBenchではPiに近い性能を保ちながら、トークン通信量とAPIコストを大きく削減したと報告しています。

続きを読む
CCTest · Blog
EvoSkill-GUI、GUIエージェントの技能を実行中に進化させる
AIエージェント
cctest.ai
AIエージェント

EvoSkill-GUI、GUIエージェントの技能を実行中に進化させる

ポップアップや読み込み遅延、移動するウィジェットは、事前に固定したGUI操作計画を簡単に崩してしまう。EvoSkill-GUIは追加学習なしで、実行結果を技能の更新につなげる「反省・修正・再利用」ループを提案する。

続きを読む
CCTest · Blog
GoogleのCC、家庭運営を支えるAIエージェントへ転換
AIエージェント
cctest.ai
AIエージェント

GoogleのCC、家庭運営を支えるAIエージェントへ転換

Googleは、家族で共有するメールや予定、タスクを整理する新しいCCをテストしている。学校行事の登録、買い物リスト、献立作成などを支援し、個人向け生産性ツールから家庭向け協働サービスへの転換を目指す。

続きを読む