記事一覧へ戻る
モデルリリース

Grok 4.7発表、長時間のコーディングと安全性を重視

読了目安 3 分

概要

xAIは、コーディングと知識労働向けの新モデルGrok 4.7を発表した。今回の説明で目立つのは、短い質問への応答速度よりも、数時間続く複雑な作業への対応である。長いコンテキストを維持し、出力を自分で確認しながら、コードや文書作成を進めるモデルとして位置付けられている。

ただし、発表元はxAI自身であり、以下のベンチマーク結果や競合比較は独立評価ではない。利用する際は、評価方法やプロンプト条件を確認する必要がある。

主なポイント

  • 長時間タスクを意識した学習。 xAIによれば、Grok 4.7はGrok 4.6より大きな基盤モデルを使い、より長い強化学習を行った。数時間かかる課題を重く扱うことで、計画、継続実行、結果の検証を改善したという。
  • コードと知識作業を一体化。 発表では、CursorBench 4.0、DeepSWE、電気工学、オフィス業務で前世代から改善したとされる。高い努力設定でのDeepSWEスコアは71%と記載されている。また、Grok Botの実行環境をネイティブに理解するよう訓練し、会話や一般的な知識作業への適応を狙う。
  • 比較的低いトークン価格。 APIは入力100万トークン2ドル、出力100万トークン6ドルから。出力速度を約2倍にした高速版は通常版の2倍の価格で提供される。Grok Build、Cursor、API、コーディング用ハーネス、ルーター、クラウド経由での利用が案内されている。
  • 安全対策を前面に。 新しい保護機構により、拒否性能、脱獄耐性、生物安全性、サイバーセキュリティで強い結果を得たとxAIは説明する。危険なプロンプトの通過率として3.3%という数値も示されるが、テストの分類や条件と合わせて見るべきだ。

意味と影響

Grok 4.7の狙いは、チャットボットやコード補完にとどまらず、計画、実行、確認、納品を繰り返すエージェントの基盤になることだ。トークン価格が抑えられていれば、開発者は複数回の試行やエージェント実行を比較的低コストで試せる。一方、実際の導入では、実コードベースでの成功率、ツール呼び出しの安定性、遅延、コンテキスト管理、過剰拒否の少なさが重要になる。

公表表では、Grok 4.7がすべての項目で首位というわけではない。端末操作や臨床推論などでは他モデルが上回る項目もあるため、発表だけで総合的な優位性を判断するのは早い。自社のデータと作業を使った小規模な検証、第三者による再現評価が必要だ。

このモデルは、長時間の処理能力と価格競争力を組み合わせたxAIの賭けといえる。その価値が本番環境での安定したエージェント運用につながるかは、今後の利用実績にかかっている。

出典:Hacker News

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
元OpenAI研究者がJevを発表、ソフトウェア向け構造化意思決定を目指す
モデルリリース
cctest.ai
モデルリリース

元OpenAI研究者がJevを発表、ソフトウェア向け構造化意思決定を目指す

TypeSafe AIは、最初の「System One Model」と位置付けるJevを発表し、早期アクセスを開始した。会話そのものではなく、非構造化された状態をソフトウェアが扱える構造化された判断へ変換することを狙う。

続きを読む
CCTest · Blog
文章を生成しないAIモデル「Jev」が開発者を引きつける理由
モデルリリース
cctest.ai
モデルリリース

文章を生成しないAIモデル「Jev」が開発者を引きつける理由

元OpenAI研究者のDiogo Almeida氏が立ち上げたTypeSafe AIが、文章ではなく確率付きの判断を返すモデル「Jev」を公開した。分類やモデル振り分け、ソフトウェアの安全確認で、低コストと低遅延を狙う。

続きを読む
CCTest · Blog
LimiX-2、表形式データを「予測」から「機構の学習」へ
モデルリリース
cctest.ai
モデルリリース

LimiX-2、表形式データを「予測」から「機構の学習」へ

LimiX-2は、特定の目的変数だけを予測するのではなく、表に含まれる変数の同時的な構造を学ぶContextual Mechanism Networksを導入します。TabArena、TALENT、BCCOでの上位性能に加え、因果骨格の復元も目指します。

続きを読む