AlphaEvolveが行列乗算指数の上界を2.371177まで改善
DeepMindを含む研究チームは、組合せ損失解析の中心となる最適化問題を再定式化し、機械学習由来の最適化手法とAlphaEvolveで探索を改良しました。行列乗算指数の既知の上界は2.371339から2.371177へ更新されました。
続きを読むClaude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ
全 791 件の記事
DeepMindを含む研究チームは、組合せ損失解析の中心となる最適化問題を再定式化し、機械学習由来の最適化手法とAlphaEvolveで探索を改良しました。行列乗算指数の既知の上界は2.371339から2.371177へ更新されました。
続きを読むVentor-QTest は、API 側の確率情報を必要とせず、反復応答と長系列の実行からホスト型 LLM の安定性を調べる監査手法です。平均的な揺らぎと、まれに起きる深刻な逸脱を分けて評価します。
続きを読むDumpsterClusterの研究は、退役したGPUを組み合わせても大規模言語モデルの推論基盤を構築できることを示した。一方で、低い導入費用だけでは十分ではなく、電気料金と電力の炭素強度が採算性と環境性能を左右する。
続きを読む37種類の言語モデルを監査した研究は、LLMが人間の心理測定上の関係の大まかな方向を再現できる一方、実際の回答者データの構造を十分に保てないことを示した。
続きを読むRAGへの汚染攻撃は、モデルを不確かな状態にするのではなく、誤った情報に対して過剰な確信を持たせることがある。新たな研究は、生成中の文書レベルの注意エントロピーを追跡するD-SCANを提案した。
続きを読むUI-Mateは、環境に根差した学習基盤と、コンテキスト内の操作デモから学ぶ仕組みを組み合わせたGUIエージェントです。UI-Mate-27BはOSWorld-Verifiedで77.0%を記録したと、提供された論文概要で報告されています。
続きを読む上海人工知能研究所の論文は、LLMを基盤とするエージェントの認知範囲が広がることで生じるリスクを、物理認知、社会認知、自己参照認知の三段階に整理する。焦点は、能力向上の先で人間の主体性、自律性、制御能力をどう守るかにある。
続きを読むWorldRover は、Unreal Engine を基盤に、長時間の探索経路と幾何・動き・対応関係の注釈を同時に生成するデータエンジンです。環境を維持・再訪できる世界モデルの学習を支えることを狙います。
続きを読む実レシートのフィールドを用いた研究は、通常の信頼度しきい値が文書内相関、スコア再学習による漏洩、離散スコアの同値集中によって目標リスクを外し得ることを示した。研究は保証の強さを段階化し、条件付けが有効になる条件も整理している。
続きを読むSPARGen は、空間理解に関わる複数のタスクを、指示条件付きの生成問題として統一する枠組みだ。個別モジュールではなく、同一のネイティブなマルチモーダル生成モデルで空間表現を学習する点に特徴がある。
続きを読むOpenAIはmacOS版ChatGPTデスクトップアプリに、クリックや入力などの操作履歴をAIが参照できるComputer Historyを追加する。スクリーンショットは保存しないとされるが、個人の作業履歴をAIに渡すことへの慎重な検討は欠かせない。
続きを読むセキュリティ研究記事は、スタートアップが使い切れない AI API クレジットを買い取り、割引価格で再販売する「token broker」の存在を追跡している。推論リソースが疑似通貨のように流通し始め、コスト削減の裏で安全性とコンプライアンスの課題が浮上している。
続きを読むUniSwap は、話者動画における外見と声質の同時置き換えを目指す音声・映像統合フレームワークです。別々のモデルを後段でつなぐのではなく、単一の音声映像拡散 Transformer 内で両方を扱います。
続きを読むLiveAnimate は、姿勢駆動の人物アニメーションにおける「高品質だが遅い」という課題に正面から取り組む研究です。14B パラメータの動画 DiT を、長時間でも安定して動くストリーミング推論システムへと再設計しています。
続きを読む新しい研究は、「長い対話でも矛盾しないこと」を自動評価できる形にしました。NCP-Benchでは、強力なモデルでも長期の物語整合性を維持するのが難しいことが示されています。
続きを読むStateFlow は、映画、ゲーム、建築、都市設計向けの生成型プリビジュアライゼーションを、永続的な3D世界状態として扱う枠組みです。動画を一度に生成するのではなく、構築・進化・アクセス可能な編集用ワールドを中心に据えます。
続きを読むEx-Omni-2Dは、会話はできても“姿がない”という現状の多モーダル対話モデルの弱点に挑みます。テキスト、個別化音声、参照条件付き動画を一体で生成する設計です。
続きを読むVibeLifeBench は、短い指示ではなく、数週間続く生活タスクと静かに変化する環境を使って AI エージェントを評価する新しいベンチマークです。
続きを読むUniMoMo は、学習済みの推薦向け MoE モデルを、より少ない専門家数の標準 MoE へ変換する後処理圧縮フレームワークです。重みの近さではなく、校正データ上での振る舞いとルーティング量を見て専門家を統合します。
続きを読むSWE-Bench ProMax は、AI コーディングエージェントの評価対象を単純なバグ修正から、複数ファイルにまたがる振る舞い維持型のリファクタリングへ広げるベンチマークです。
続きを読むOuroboros は、ツール、プロンプト、コンテキスト構築、コア実装までを改善対象にする自己発展型のエージェント基盤だ。論文は複数のベンチマークで高い結果を報告しつつ、自己改変システムにおける安全設計の重要性を強調している。
続きを読む