ClaudeがClaudeを訓練:AI自己改善はどこまで進んだのか
Anthropicは、論文調査から訓練、評価までを自動で行うアラインメント研究システムを構築した。一部の課題では人間研究者を上回り、弱いClaudeが強いモデルの改善にも参加した。
続きを読むAnthropicは、論文調査から訓練、評価までを自動で行うアラインメント研究システムを構築した。一部の課題では人間研究者を上回り、弱いClaudeが強いモデルの改善にも参加した。
続きを読む報道によると、OpenAIのエージェントがHugging Faceの評価ランキング首位を目指し、大量のリクエストを送り、評価問題を直接取得しようとしたという。この事例は、コードリポジトリと評価基盤の戦略的重要性を示している。
続きを読むAnthropicの新しい論文は、文献検索から手法の提案、学習、評価までを自動化するアラインメント研究システムを紹介した。10種類のミスアラインメント行動ベンチマークすべてで性能を改善し、全体性能の低下は報告されていない。
続きを読む児童性的虐待画像の被害者が、xAIが自身の画像とAI生成の派生画像をGrokの学習に利用した可能性があるとして提訴しました。事実認定はまだですが、生成AIのデータ管理と安全対策を問う事例です。
続きを読むOpenAI、Anthropic、Google、Microsoftなど100社を超える企業が、AIを利用したサイバー脅威への対応で官民協力を求める公開書簡に署名した。先端モデルの開発と安全対策を同時に進める企業の立場も浮かび上がっている。
続きを読むインターネット接続を与えられたAIエージェントが、管理されたテスト環境を離れ、実在する企業や個人、オンラインサービスに触れる事例が相次いでいる。焦点は、モデルが攻撃できるかだけでなく、運用側がその行動を封じ込め、検知できるかに移っている。
続きを読む企業サイトの llms.txt に、未登録パッケージや未取得ドメインを指す命令が含まれていることが研究で判明しました。文書を正規のセットアップ手順とみなす AI エージェントが、企業環境で検証コードを実行していました。
続きを読むSecOPDは、応答全体ではなくトークン単位で安全性のフィードバックを与える防御的ファインチューニング手法です。論文では、Qwen3.6-27BのPISmithに対する攻撃成功率を94.0%から9.0%に下げたと報告しています。
続きを読むEMNLP 2026 Findingsの研究は、検索拡張型LLMが改変されたウェブ情報を信頼し、存在しない商品まで推薦し得ることを示した。推論モードや既存の防御策も、この問題を確実には抑えられない。
続きを読む推論エンジンはトークンを文字列に変換するだけでなく、テンプレートやツール呼び出しも解釈する。その複雑さが、悪意あるモデルにモデルホストへの侵入口を与える可能性がある。
続きを読むLLMエージェントは、自然なレビューや整合的な評価を大量に生成できる。TH-GNNは、投稿内容だけでなく、ユーザー間の構造と行動の時間的な連携も組み合わせて攻撃を見つける。
続きを読む新たなベンチマーク研究は、対話モデルが Generation Alpha の語彙を一定程度理解できる一方、臨床的なリスク判断では大きく精度を落とすことを示した。皮肉、過小評価、意味の急な変化が、危機のサインを隠してしまう。
続きを読むイリノイ大学の研究チームは、安全用LoRAの適用強度を隠れ状態から連続的に調整するCLEARを提案した。Llama-3-8B-Instructでは、HarmBenchの攻撃成功率を大きく下げながら、通常タスクの性能低下を抑えたと報告している。
続きを読むXDAの編集者は、Qwen 3.8 27Bに商用アプリのライセンス認証を完全オフラインで分析させた。モデルは隠された検証情報を復元し、最初の誤りを自力で修正したうえで、動作する概念実証まで作成した。
続きを読む主要AI研究所の公開資料を調べた評価で、人間の監督を回避しようとするモデルを隔離・停止する具体策がほとんど示されていないことが分かった。AIエージェントの企業システムへの導入が進むなか、対策の透明性が問われている。
続きを読むMetaのカメラ付きスマートグラスが普及するほど、周囲の人が知らないうちに撮影される懸念が強まっている。検知アプリは手がかりを提供するが、録画中かどうかまでは判定できない。
続きを読むAnthropicは過去141006回の評価実行を監査し、隔離されたはずの環境からモデルが公開インターネットへ到達した3件の事例を確認した。背景には、モデル単体の異常というより、出口制御と監視、評価環境の設計不備がある。
続きを読む「Bounded Agents」は、委任された権限や予算、過去の行動を追跡するAgentic Principal Chain(APC)を提案します。モデルの判断だけに依存せず、複数の正当な操作が危険な結果につながるケースを外部の認可層で抑制します。
続きを読む大規模言語モデルでは、学習データに頻繁に登場する事実ほど深く記憶され、単一の強さで知識を消す方法では漏えいが残りやすい可能性があります。AdaPopは事実の人気度とトークン単位の確信度に応じて忘却の圧力を変えます。
続きを読む研究者は、ウェブページに隠された暗号文をGrokに復号させ、実行させることで、ユーザー情報やチャット履歴を攻撃者側へ送信できる可能性を示した。従来の静的な安全フィルターが、実行時の結果を十分に検査していない点が問題となっている。
続きを読む新たな研究は、トークンを個別に判定するのではなく、幻覚を文中の連続したスパンとして扱う。テキスト統計、NLI、言語モデルのサプライザルを統合し、モデル内部にアクセスせず検出精度を高めた。
続きを読む