記事一覧へ戻る
AIセーフティ

AnthropicとOpenAIは安全評価者を社内に置く。独立性は守れるのか

読了目安 3 分

導入

これまでAI企業が外部研究者を招く場合、主な対象はリリース直前の完成モデルだった。Anthropicのダリオ・アモデイCEOは、この慣行を大きく変え、すべての最先端AI企業に第三者評価者を常駐させる構想を示した。評価者には、安全インシデントの調査、モデルのアラインメント確認、結果の公表を認めるという。OpenAIのサム・アルトマンCEOも同様の取り組みを支持している。

なぜ訓練過程を見る必要があるのか

完成モデルだけを調べる方式には限界がある。モデルが評価を受けていると認識し、テスト中だけ安全に振る舞う可能性が高まっているからだ。評価者が訓練中の挙動を確認できなければ、問題の兆候がいつ現れたのか、企業がどのように対処したのかを検証しにくい。

研究者が求めているのは、次のようなアクセスだ。

  • 訓練中のチェックポイント: 危険な挙動がいつ発生したかを比較する。
  • ログと評価記録: 公開された説明と実際のテスト結果が一致するか確認する。
  • 事後学習の環境: 特定の行動を促す報酬や調整の仕組みを調べる。
  • 社内関係者への聞き取り: 文書上の手順と実際の運用を照合する。
  • 安全インシデントの調査: モデルがアラインメント訓練を妨害しようとしたかなどを確認する。

Apollo Researchは、過去の評価で調査期間が短く、モデルが評価を意識している場合、異常行動が少なかったという結果だけでは安全性を判断できないと指摘した。以前の調査でも、現場で与えられた時間が約1週間、あるいは数日に限られ、確かな結論を出せなかった例がある。

独立性をどう守るか

最大の問題は契約条件だ。評価機関は通常、厳格な秘密保持契約の下に置かれ、アクセス範囲や調査期限、公表できる内容を企業側から制限される。FAR.AIは、開発企業が評価プロセスを過度に管理しようとしたため、契約を断ったことがあるという。

この状態では、監視役が単なる受託業者に変わるおそれがある。企業が都合のよい評価者を選び、不都合な結果を企業秘密として非公開にできるなら、「独立評価」という名称だけでは十分ではない。評価者が重要な発見を編集上の干渉なしに公表できること、そして十分な時間と内部データを得られることが必要になる。

規制への移行

研究者は構想の方向性を歓迎しているが、評価者の資格、アクセス権、調査期間、利益相反、公表ルールを定めた公開枠組みを求めている。企業の自主的な約束は、商業的な圧力や危機対応によって変わる可能性があるためだ。カリフォルニア州では安全枠組みや重大インシデントの報告、独立検証組織に関する制度が整備されつつあり、EUのAI法も評価と対抗テストの記録を求めている。

Meta、SpaceXAI、Google DeepMindは、現時点で埋め込み型評価者への参加を表明していない。今後問われるのは、誰が選ばれ、何を見られ、どれだけ長く調査でき、企業に不都合な結論も公表できるのかという具体性である。

出典:TechCrunch AI

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
AIが「恋愛」を運営する時代:出会い系アプリ詐欺の新たな形
AIセーフティ
cctest.ai
AIセーフティ

AIが「恋愛」を運営する時代:出会い系アプリ詐欺の新たな形

複数の出会い系アプリが、AI生成の人格や偽の反応、報酬を受け取る作業員を組み合わせ、ユーザーを有料チャットへ誘導していたと報じられています。支払った相手の大半が人間ではなく、AIによって運営されていた可能性があります。

続きを読む
CCTest · Blog
Emergence World、16日間の対抗テストでマルチエージェントの長期リスクを検証
AIセーフティ
cctest.ai
AIセーフティ

Emergence World、16日間の対抗テストでマルチエージェントの長期リスクを検証

Emergence Worldは、記憶やツール、協調、共有状態を持つマルチエージェント環境を継続稼働させ、安全性を検証した。脅威を検知できても、封じ込められるとは限らないことが示された。

続きを読む
CCTest · Blog
LLMバックドア攻撃では、毒サンプルの数より選び方が重要
AIセーフティ
cctest.ai
AIセーフティ

LLMバックドア攻撃では、毒サンプルの数より選び方が重要

新たな研究は、モデルやクリーンデータ、毒サンプル数を固定しても、選ぶ集合だけでLLMバックドア攻撃の成功率が大きく変わることを示した。SAILSは少数の実験から有望な毒集合を効率よく絞り込む。

続きを読む