GPUは商品になるのか:AIインフラの価格を変える計算資源先物
GPUが希少な機器から時間単位で貸し出される生産資産へ変わる中、計算資源の価格変動に対するヘッジ需要が生まれている。CME、Silicon Data、CFTCの動きは、GPU先物が市場インフラへ進みつつあることを示す。
続きを読むClaude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ
全 791 件の記事
GPUが希少な機器から時間単位で貸し出される生産資産へ変わる中、計算資源の価格変動に対するヘッジ需要が生まれている。CME、Silicon Data、CFTCの動きは、GPU先物が市場インフラへ進みつつあることを示す。
続きを読むPew Researchの調査によると、ChatGPTの公開後に作成された英語のウェブページの約35%に、AIによる執筆または大幅な編集の兆候が見られました。一方で、AI検出ツールには誤判定の可能性があります。
続きを読む企業向け経費管理プラットフォームのRampが、複数の大規模言語モデルを1つのAPIから利用・切り替えできるAIモデルルーティングサービス「Router」を開始した。現時点では米国のみで提供され、2026年末まではルーティング料金が無料となる。
続きを読むMetaは、自然言語の指示から小規模なインタラクティブゲームを作れる実験的アプリ「Pocket」を米国で展開する。ブラジルでの試験に続く提供拡大となる。
続きを読む研究者は、ウェブページに隠された暗号文をGrokに復号させ、実行させることで、ユーザー情報やチャット履歴を攻撃者側へ送信できる可能性を示した。従来の静的な安全フィルターが、実行時の結果を十分に検査していない点が問題となっている。
続きを読むSlackが、開発タスクごとにAIコーディングエージェントとチームが協働できるSlack Codeを発表した。コード差分の確認やHTMLプレビュー、公開前のフィードバックと承認に対応する。
続きを読むBinanceは、ChatGPTやClaude Code、CursorなどのAIツールを取引・決済・ブロックチェーンサービスにつなぐAgent OSを発表した。エージェントはユーザーに代わって注文できるが、具体的なリスク管理は主にユーザーが担う。
続きを読むCo-RLは、パラメータを共有しない複数モデルが互いのフィードバックから報酬を得て学習する強化学習の枠組みです。正解ラベルなしでも、テキストとマルチモーダルの推論性能を高め、自己評価型RLの崩壊リスクを抑えます。
続きを読むFM-Benchは、言語モデルにサッカークラブを20年間運営させ、移籍、契約更新、投資、戦術の判断が長期的にどう作用するかを測定する。結果は、モデルの規模やトークン消費よりも、管理行動の違いが成績を左右することを示した。
続きを読む新たな研究は、トークンを個別に判定するのではなく、幻覚を文中の連続したスパンとして扱う。テキスト統計、NLI、言語モデルのサプライザルを統合し、モデル内部にアクセスせず検出精度を高めた。
続きを読むZetta は、基盤ポリシーを凍結したまま、実行時クリティックと復旧スキルをオンラインで進化させる具現知能向けハーネスです。行動時の介入、ロールアウト分析、検証を通過した更新を三つの時間スケールで組み合わせます。
続きを読むOmniScientistは、文章や事前計算済み特徴量だけでなく、異種の生データを直接扱うことを目指すエンドツーエンドのAI科学者です。知覚、研究着想、実験、論文執筆を一つのパイプラインに組み込みます。
続きを読むジェフリーズのアナリストが、主要なAIエージェント8製品を5種類の実務タスクで比較し、AlibabaのQwen Officeが総合1位となった。評価はモデル性能だけでなく、実行基盤であるHarnessとタスク単価の重要性も示している。
続きを読むFreeTokenは、異なる構成の個人向けハードウェアで大規模なMixture-of-Expertsモデルを動かすためのエッジネイティブな推論基盤です。PCを単なる小型GPUではなく、CPUやGPU、メモリを統合して使うプラットフォームとして捉え直します。
続きを読むAgent Lightning v1.0は、ツール呼び出しやコンテキスト管理を担う実運用のエージェント・ハーネスを、モデルの強化学習に直接参加させる手法を提案する。6,000件の学習例と比較的少ない計算資源で、Qwen3.5-9BのSWE-bench Verifiedスコアを41.8%から56.4%へ引き上げた。
続きを読む多様な記憶方式を同一条件で比較した研究は、最適な記憶基盤がタスク、履歴の長さ、運用コストによって変わることを示した。単一方式の採用より、状況に応じた記憶ルーティングが重要になる。
続きを読むHarnessRiskは、個別の攻撃手法だけでなく、エージェント・ハーネスの6つの運用段階を対象に安全性を測るベンチマークです。危険の検知や高いタスク達成度だけでは、安全な実行を保証できないことを示しました。
続きを読むAI-Infra-Guardを用いた研究が、DeepSeek Harnessに対して1万4,560回の制御実行を行い、間接プロンプトインジェクションへの耐性を調べた。隠れたUnicode文字や偽の完了通知などが、条件によってエージェントの挙動に影響し得ることが示された。
続きを読むFARは、専門家が一つの問題を指定する代わりに研究方向を示し、文献検索、モデルによる試行、自動トリアージを通じて有望な数学的課題を絞り込む。組合せ論の試験では、専門家の限られたレビュー時間を重点配分する可能性が示された。
続きを読む複数のベンチマーク、エージェント基盤、LLMを横断した研究は、Agent Skillsの主な効果が不足した知識の注入ではなく、ノイズの多い実行履歴を手順のアンカーへ変換することにあると示した。一方、スキル数の増加は検索精度を大きく低下させる。
続きを読むAgentic ESOptは、長期的で分岐の多いエージェントの微調整に進化戦略を用いる手法を提案する。推論時に近いメモリ使用量でパラメータを探索し、モデルとコンテキストの同時最適化を目指す。
続きを読む