DataPrep-Bench:LLMの「訓練データ準備能力」を下流性能で測る
DataPrep-Bench は、LLM、エージェント、データ中心ワークフローが訓練データをどれだけ有効に準備できるかを評価するベンチマークです。表面的な文章品質ではなく、下流の訓練効果を基準にしています。
続きを読むClaude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ
全 795 件の記事
DataPrep-Bench は、LLM、エージェント、データ中心ワークフローが訓練データをどれだけ有効に準備できるかを評価するベンチマークです。表面的な文章品質ではなく、下流の訓練効果を基準にしています。
続きを読むIDEAgent は、LLM による研究アイデア生成で品質と多様性が別々に最適化されがちな問題に取り組む。複数エージェント、アイデアの系譜管理、Yield 指標を組み合わせ、有用で重複の少ない候補群を目指す。
続きを読むソニーの研究チームは、拡散モデルとフローマッチングモデルの推論時誤差を周波数領域で補正する Spectral Alignment(SPA)を提案した。事前に学習したスペクトル先験を使い、中間予測のパワースペクトルを軽量に校正する。
続きを読むTBSMは、GANの識別器や拡散モデルの固定されたノイズ除去経路に頼らず、生成サンプルが実データ分布へどう動くべきかを直接学習する枠組みです。
続きを読むこの論文は Agentic Context Management(ACM)を提案し、本番環境のエージェント失敗の多くは推論能力ではなく、推論コンテキストの管理不全にあると論じている。
続きを読むNetflix 関連の研究 ID-V2V は、編集済みキーフレームからシーン、照明、スタイルの変更を動画全体へ伝播しつつ、人物の顔立ち、表情、視線、リップシンクを保つことを目指す。
続きを読むMicrosoftは、脆弱性の発見・評価・修正を支援するMAI-Cyber-1-FlashとProject Perceptionを発表した。ベンチマークとコスト面での優位性を掲げるが、AIエージェントの制御リスクは依然として重要な論点だ。
続きを読むMicrosoft CEOのサティア・ナデラ氏は、企業がデータ、プロンプト、文脈、記憶、エージェントツールを単一のAIモデル提供者に委ねることは、自社の思考を外部化することに近いと警告した。企業にはAIゲートウェイやマルチモデル構成による主導権の確保が求められる。
続きを読むClaudeの共有チャットやArtifactsの一部がGoogle検索で見つかる状態だったと報じられました。医療記録や社内文書、子どもの連絡先などの機微情報が含まれていた可能性があり、AIツールの共有機能に潜むリスクが改めて注目されています。
続きを読むGoogleは検索結果のスクレイピングを止めるためDMCAを持ち出したが、裁判所は早い段階でSerpApi側の却下申立てを認めた。AI時代のデータ取得をめぐり、公開ウェブの境界が改めて問われている。
続きを読むMicrosoftは、サイバーセキュリティ向けAIモデル「MAI-Cyber-1-Flash」と、複数のエージェントで防御業務を支援する「Perception」を発表した。
続きを読むArs Technica によると、ChatGPT は著名作家の「正確な文体」を指定して書かせる依頼を拒否し始めた。代わりに、雰囲気や広い特徴を取り入れた独自の文章を提案するという。
続きを読むTechCrunchが紹介したSimilarwebのデータによると、GoogleのAI Overviewsは検索の43%に表示されるようになった。1年前の15%から大きく伸び、AI回答が検索の中心になりつつある。
続きを読むIlya Sutskever氏が設立したSafe Superintelligenceが、Nvidiaとの長期提携を発表した。Vera Rubin GPUプラットフォームへのアクセスにより、同社の安全性重視の研究は次の拡張段階に入る。
続きを読むAMDはMI455XアクセラレータとHeliosラックシステムを発表し、単体GPUではなくAIインフラ全体で勝負する姿勢を明確にした。
続きを読むCursorは、835ページのSQLiteマニュアルだけを与えたエージェント群にRust製データベースエンジンを実装させた。注目点は成果物そのものより、計画役と実装役を分けたときのコストと品質の差にある。
続きを読むNVIDIA は、外科ロボット向けのアクション条件付き生成シミュレータ Cosmos-H-Dreams を公開した。Cosmos-H-Surgical-Simulator の能力を因果的な少ステップ学生モデルへ蒸留し、FlashDreams でストリーミング推論する構成だ。
続きを読むAWSは、企業規模でAIエージェントを構築・展開・管理するためのオープンソース参考プラットフォーム「Loom」をAWS Labsで公開した。焦点は、ID伝播、権限制御、登録管理、人間による承認フローにある。
続きを読むTencent Hunyuan の論文は、固定計算予算の下で原生マルチモーダル事前学習をどう拡張すべきかを検証している。言語目標とマルチモーダル目標では、最適な資源配分の振る舞いが異なるという点が重要だ。
続きを読むSkill Self-Play は、検証可能な agent スキルを軸に、LLM の自己進化をより安定させるための枠組みだ。提案者、解答者、動的スキル制御器が強化学習ループの中で共進化する。
続きを読むMolt は、エージェント型強化学習研究における実装変更の負担を下げるために設計された PyTorch ネイティブの訓練フレームワークです。軽量なコードベースを保ちながら、非同期訓練、多モーダル方策、MoE 方策を扱える点を特徴とします。
続きを読む