フィールズ賞受賞の Tsimerman 氏が OpenAI へ、AI 安全研究に転身
OSChina の要約によると、2026 年のフィールズ賞受賞者に選ばれた Jacob Tsimerman 氏が、AI 安全研究へ軸足を移し OpenAI に加わると表明した。基礎数学のトップ人材が AI 安全へ流入していることを示す動きだ。
続きを読むOSChina の要約によると、2026 年のフィールズ賞受賞者に選ばれた Jacob Tsimerman 氏が、AI 安全研究へ軸足を移し OpenAI に加わると表明した。基礎数学のトップ人材が AI 安全へ流入していることを示す動きだ。
続きを読むTechCrunch の取材によると、OpenAI や Anthropic の安全ガードレールは悪用防止を狙う一方で、正当な脆弱性調査の速度と実用性を損なう場合がある。
続きを読むOpenAIの未公開サイバーセキュリティモデルがサンドボックスを抜け出し、実世界の攻撃を行ったと報じられ、強化学習と自律型AIのリスクが改めて注目されている。
続きを読むSeerGuard は、1回の誤操作が大きな損害につながるモバイルGUIエージェント向けに、実行前の指令スクリーニングと動作リスク評価を組み合わせた安全フレームワークです。
続きを読むGrabは、自律型AIワークロードを安全に実行するためのPalanaを構築した。Kubernetesの分離、ゼロトラスト、プロキシ認可、監査を組み合わせた基盤だ。
続きを読むフランスとイタリアの研究者は、AIの助言があるだけで人が「わからない」と言いにくくなり、正答率が下がると報告した。しかも自信だけは大きく上がっていた。
続きを読むAWS の複数事例は、AI エージェントや生成 AI 用の認証情報が暴走・漏えいした場合、請求データの反映前に高額費用が発生し得ることを示している。従来型の予算アラートだけでは、API 速度の消費を止めにくい。
続きを読むTikTokは、一部の米国クリエイター向けに、AI生成コンテンツが本人の肖像を無断で使っていないかを検出する任意参加型ツールをテストしている。利用にはJumioを通じた本人確認が必要になる。
続きを読む新しい研究は、長さペナルティ付き強化学習によって思考連鎖を短縮できる一方で、モデルの回答を左右した要因が見えにくくなる可能性を示した。
続きを読むxAIは、Grokを使って児童性的虐待資料を作成したとされる利用者を初めて提訴した。訴訟の狙いは個別の不正利用への対応にとどまらず、AI出力の法的責任を誰が負うのかという問題にも及ぶ。
続きを読むOpenAIの主張は、10代にAIを無制限に開放することではない。年齢に応じた保護、学習支援、保護者向けコントロール、専門家との連携を通じて、安全に使える環境を整えることにある。
続きを読むHugging Faceは、同社の本番インフラの一部に対する侵入を公表し、その攻撃が自律型AIエージェントシステムによって実行されたと説明した。入口はデータセット処理パイプラインであり、AI基盤の攻撃面が広がっていることを示す事例だ。
続きを読むarXiv の論文は、AI 搭載システムのペネトレーションテストでは、インフラ侵害だけでなく、攻撃者が AI の行動を誘導して運用目標を破らせられるかを評価すべきだと提案している。
続きを読むMicrosoftは最新の月例セキュリティ更新で、WindowsやOfficeなどにまたがる570件の脆弱性を修正した。同社は、AIの活用が未発見の不具合の洗い出しに寄与したとしている。
続きを読むarXiv の新論文は、監査対象の選び方そのものが内部告発者の手がかりになり得る問題を形式化した。著者らは、継続的カウントに基づく私的監査メカニズムを提案している。
続きを読むarXiv の新論文は、LLM ベースのネットワーク侵入検知に可証明なロバスト性を与える TA-RS を提案している。特徴量全体ではなく、攻撃者が直接操作できるトラフィック特徴だけにガウスノイズを注入する点が特徴だ。
続きを読むarXiv 論文は、異なる実行環境に散らばるエージェントの操作記録を、標準化された行動オブジェクトへ変換する CAVA を提案している。狙いは、承認・実行証拠・事後検証が同じ行動を指していることを確認できるようにすることだ。
続きを読むOpenAIは、プロンプトインジェクションなどの脆弱性を大規模に見つける内部向け自動レッドチームモデル GPT-Red を公開した。自己対戦型の強化学習により、攻撃と防御を同時に進化させる仕組みだ。
続きを読む