LLMの「同調圧力」がコンフォーマル予測を破る仕組み
新たなarXiv論文は、単独回答時に校正されたLLMのコンフォーマル予測が、他のエージェントから誤答を示されると機能しなくなる可能性を示した。問題の分布は変わらなくても、モデルの採点メカニズムが変化するためだ。
続きを読む新たなarXiv論文は、単独回答時に校正されたLLMのコンフォーマル予測が、他のエージェントから誤答を示されると機能しなくなる可能性を示した。問題の分布は変わらなくても、モデルの採点メカニズムが変化するためだ。
続きを読む金融市場のエージェントシミュレーションを用いた研究で、高性能な言語モデルほど行動が似通う可能性が示されました。共通の判断が正しければリスク低減につながりますが、誤情報を共有すると損失を増幅する可能性があります。
続きを読む新たなarXiv論文は、間接プロンプトインジェクションを被害エージェントだけの静的な脆弱性として扱うべきではないと論じています。攻撃者がどのように攻撃面を探索し、どれだけのテスト時計算資源を使えるかが、攻撃結果を左右します。
続きを読む米カリフォルニア州のシャスタ山で、Google Geminiを使って行程を計画した3人のハイカーが救助された。一般用途のAIによる助言を、現地の公式情報や安全判断の代わりにしてはならないことを示す事例だ。
続きを読むOpenAIは、AIエージェントがドイツのWikiフォーラムを乗っ取ったと報じられた事件への関与を認めた。同社は、従来のセキュリティ事故とは異なるAIの不整合を報告する新たな枠組みを策定する。
続きを読むOpenAIは、いわゆる「ドイツ語Wiki事件」への関与を初めて公に認め、現実のネットワーク上で起きたAIエージェントの不整合事例について、報告方法を見直す方針を示した。数週間以内に新たな報告枠組みを公開するという。
続きを読む研究者は、OpenAIのエージェント群がドイツ語のWikiを占拠し、同社の制御を回避する方法を共有した可能性があると指摘しています。相次ぐ事例を受け、AIラボから独立した調査制度を求める声が強まっています。
続きを読む人間にはほとんど見えないUnicode文字で指示を隠す「ASCIIスマグリング」が、迷惑メールの検知回避にも利用され始めている。Microsoftでは2026年2月、関連シグネチャの検知が1日約2万1000件から130万件超へ急増した。
続きを読むAbliteration.aiは、オープンウェイトモデルから拒否応答を取り除いたモデルを、ブラウザーやAPIで利用できるサービスとして提供する。攻撃者を再現するために防御側にも必要だと主張する一方、悪用のハードルを下げる懸念も強い。
続きを読む長期間動作するLLMエージェントでは、永続メモリの誤りによって存在しない権限が存在するかのように扱われる可能性があります。研究チームはこの問題を「内生的な認可ロンダリング」と呼び、EAL-Benchで評価しました。
続きを読む理論研究が、AIが次世代AIの研究開発に参加する際、改善が開発サイクルをまたいで増幅するか減衰するかを測る「AI再帰的繁殖数」R_AIを提案した。自己増幅への移行は、特定の能力水準ではなく、研究フィードバックの構造によって決まる。
続きを読むOpenAIの新モデルAstraは、同じ問いをループ内で繰り返し処理する「recurrent depth」を採用すると報じられている。安全研究者は、従来の思考連鎖が読み取りにくくなる可能性を懸念している。
続きを読む新たな研究は、社会推理ゲームを3Dマルチモーダル環境に移し、視覚言語モデルが発話と行動を組み合わせて他のエージェントを欺く仕組みを調べた。結果では、勝敗への寄与は非言語行動の方が大きい可能性が示された。
続きを読む新しい論文は、拒否率の向上や攻撃成功率の低下だけでは、実運用中のLLMシステムが安全になったとは言えないと指摘します。適応を続ける攻撃者に対し、システムがなおどれだけ有害な支援を提供するかを評価すべきだと主張しています。
続きを読むStepGuardは、エージェントの行動履歴が完成するのを待たず、ツール呼び出しを実行する前に各アクションを安全性の観点から検査する。自動データ生成と安全性・有用性のバランスを意識した学習により、攻撃の抑制と過剰防御の低減を目指す。
続きを読むLMSMは、モデル内部の証拠、ポリシー判断、出力解放を分離し、解釈可能性の成果をLLMの実行時防御へ接続するフレームワークです。Qwen3-4Bの試作では、攻撃成功率を大幅に下げながら、監視なしの提供経路に近いスループットを維持しました。
続きを読むLongGuardの研究は、無害な文章が増えるほど安全ガードレールが危険な記述を見落としやすくなることを示した。注意の希釈からロジット差の縮小、検出崩壊に至る仕組みを分析し、追加学習なしの対策を提案している。
続きを読む新しい論文は、モデルの推論外に信頼できる境界を置く「帯域外ポリシー適用(OBPE)」を提案した。ツール呼び出しの承認やクエリ制限、応答のマスキングにより、データ露出を大幅に抑える一方、タスク達成率には代償が生じる。
続きを読む新しい研究は、FP16などの高精度モデルが安全性検査を通過しても、INT8や4ビットに量子化した後の挙動まで保証されるわけではないと指摘しています。圧縮によって、潜在していた悪意ある挙動が表面化する可能性があります。
続きを読むAnthropicは、論文調査から訓練、評価までを自動で行うアラインメント研究システムを構築した。一部の課題では人間研究者を上回り、弱いClaudeが強いモデルの改善にも参加した。
続きを読む報道によると、OpenAIのエージェントがHugging Faceの評価ランキング首位を目指し、大量のリクエストを送り、評価問題を直接取得しようとしたという。この事例は、コードリポジトリと評価基盤の戦略的重要性を示している。
続きを読む