StartupBench、実際の業務ワークフローで汎用エージェントを評価
StartupBenchは、研究者が想定した課題ではなく、市場で利用実績のあるAIスタートアップ製品のワークフローから端到端の評価課題を作成します。評価対象の最強モデルでも、完全に達成できたのは約30%にとどまりました。
続きを読むClaude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ
全 791 件の記事
StartupBenchは、研究者が想定した課題ではなく、市場で利用実績のあるAIスタートアップ製品のワークフローから端到端の評価課題を作成します。評価対象の最強モデルでも、完全に達成できたのは約30%にとどまりました。
続きを読む「Personalized Auto-Research」は、真のAI共同科学者には研究者の過去の研究、手法、協力関係、所属コミュニティの理解が必要だと論じる。
続きを読むPTXBenchは、コードが正しいかだけでなく、指定したPTX命令が実行されるか、そして先端ライブラリに対して実際に高速化できるかを評価する。結果は、アーキテクチャ固有命令の利用と性能向上の間に差があることを示した。
続きを読むLEGO-RLは、実際のコーディングエージェントが使うHarnessを大きく改変せず、方策勾配による強化学習へ接続する枠組みです。Qwen3.5-35B-A3Bを3種類のHarnessで学習し、SWE-bench Verifiedのスコアを向上させました。
続きを読むMathForm は Mathlib の知識検索、コンパイラ診断、意味的一貫性フィードバックを組み合わせ、数学的記述を段階的に修正する。約 367K 件の検証済み Lean 4 例から学習した 8B モデルは、複数の専用 32B モデルを上回ったと報告されている。
続きを読むEditBridgeは、超高解像度画像編集向けの拡散ブリッジを提案する。低解像度で編集した結果を独立した超解像モデルに任せるのではなく、元の高解像度画像を参照して細部を復元し、計算量も抑える。
続きを読むASI-Benchは、未知の課題を探索し、研究手法を選び、検証可能な成果に結び付けるAIの能力を評価する。人間による方法論の支援を減らすと、現在のシステムの性能は大きく低下した。
続きを読むStripeはAIゲートウェイ企業OpenRouterの買収を認めた。報道された買収額は75億ドルに達するが、創業者が語る「シンギュラリティ」よりも、AI利用料と開発者向け支出の管理が現実的な狙いとみられる。
続きを読むOpenAIは、一部顧客向けにPrivate Safety Processingのプレビューを開始した。顧客データを保持せず、複数の会話にまたがるAIの悪用を検知する仕組みで、Anthropicとの企業向けプライバシー競争を強める狙いだ。
続きを読むGoogleはSpirit Airlinesの大規模な企業データを1,000万ドルで落札した。第三者による匿名化が予定されている一方、客室乗務員側は、氏名を削除しても雇用上の機密性や推測による再特定のリスクは残ると主張している。
続きを読む検索やメール、テレビなどにAIが組み込まれる一方、利用の広がりは受容の拡大につながっていない。雇用、著作権、データセンターの負担、企業への不信が、AIを事業上の信頼問題へと変えている。
続きを読むGoogleはSearchとGeminiに、インタラクティブな図解、シミュレーション、練習問題、資料整理、調査機能を追加した。学生が理解から復習までを一つの流れで進められるようにする狙いだ。
続きを読む複数のセキュリティ研究者が、OpenAIのTrusted Access for Cyberプログラムへのアクセスを突然失ったと報告しました。OpenAIは一部ユーザーに影響した技術的な問題だと説明し、再申請と本人確認を求めています。
続きを読むデータセンターとGPUへの投資が膨らむなか、AI計算資源は企業にとって管理すべき大きなコストになりつつある。Silicon DataはGPUレンタルの基準価格と、計算資源先物の市場を目指している。
続きを読むMetaのプラットフォームで、同意のない性的ディープフェイクを促すようなAIサービス「Kromix」の広告が掲載されていた。広告の一つでは、米国の著名な女性政治家に酷似した顔がポルノ映像に使われていた。
続きを読むStateMはモデルの重みを変更せず、状態管理や手順の検証を行うランタイムによって長期タスクの信頼性を高める。Terminal-Bench 2.1ではGPT-5.6 Sol xhighで95.3%の生精度を報告した。
続きを読むLarge Discovery Modelは生成モデルとベイズ非パラメトリック報酬サロゲートを組み合わせ、候補生成だけでなく、不確実性を踏まえた次の探索方向の決定まで支援する。
続きを読むMOSS-VLは、視覚言語モデルに「話している間も見続ける」能力を組み込むことを目指したオープンモデル群です。ゲート付きクロスアテンション、対話行動を学ぶデータ、段階的な訓練によって、ストリーミング環境への対応を設計段階から行っています。
続きを読むHarmProfileは、有害生成を単なる脱獄攻撃の成功結果ではなく、分析すべき対象として扱う。調査は、フロンティアモデルごとに異なるリスク像があり、能力向上に伴って有害性と出力の多様性が高まる可能性を示した。
続きを読む新たな研究は、推論やツール利用、コード生成、ワークスペース操作を行うLLMエージェントに、データベースのACID原則を応用する「エージェントトランザクション」を提案した。関連ベンチマークでは既存エージェントを10.6%上回ったと報告している。
続きを読む100件の実際の先端研究タスクと800本の軌跡を調べたAutoResearchEvalは、研究エージェントの問題が単純な能力不足ではなく、自己検証と自己修正の欠如にあると示した。
続きを読む