外部監督なしのオンポリシー自己蒸留:モデル自身の合意から学ぶ U-OPSD
本論文は、モデル自身の複数生成結果から擬似解を作り、それとの不一致を学習信号にする U-OPSD を提案する。真値ラベルや強い教師モデルを使わずに、数学推論ベンチマークで基盤モデルを安定して上回った点が特徴だ。
続きを読むClaude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ
全 791 件の記事
本論文は、モデル自身の複数生成結果から擬似解を作り、それとの不一致を学習信号にする U-OPSD を提案する。真値ラベルや強い教師モデルを使わずに、数学推論ベンチマークで基盤モデルを安定して上回った点が特徴だ。
続きを読むMotif 3 は、総パラメータ 3140 億、トークン当たりの有効化 132 億の decoder-only MoE 言語モデルです。GDLA や多段階の後学習を組み合わせ、推論・コード・長文脈の性能向上を狙っています。
続きを読む画像生成チャットにおける次の編集提案は、会話テキストだけでなく現在の画像に基づく必要がある。論文は、実利用データ、クリックフィードバック、視覚検証器を組み合わせた三段階フレームワークを提案している。
続きを読むこの技術レポートは、言語モデルの解釈可能性を学習後に付け足すのではなく、学習プロセスそのものに組み込むべきだと主張している。Steerling-8B は生成結果を入力、概念、学習データへ結び付ける試みとして紹介されている。
続きを読むAMD は、強い教師エージェントの成功軌跡を階層的な記憶として整理し、小型LLMに渡すことで道具利用タスクを改善する発想だ。再学習ではなく、再利用しやすい経験の圧縮に焦点を当てている。
続きを読むSPOT は、On-Policy Distillation において、どの位置を詳しく調べ、どの候補を学習目標にすべきかを同時に扱う手法です。教師モデルの局所確率だけでなく、検証器が評価した後続結果を使って蒸留ターゲットを調整します。
続きを読むEvidence-RL は、視覚言語モデルが正答していても、その根拠が本当に画像内の証拠にあるのかを問い直す研究です。CED により、局所的な視覚証拠と回答の因果的な依存関係を訓練時に監査します。
続きを読むYOLO-PEFT は、リアルタイム物体検出器における PEFT アダプタ配置を、監査可能な制約計画として扱うフレームワークです。どの層に置くべきかだけでなく、危険な場合に訓練前に拒否する点も特徴です。
続きを読むこの研究は、Test-Time Training を個別実装の寄せ集めではなく、組み立て可能な設計空間として捉え直しています。狙いは新しい TTT を作りやすくすることに加え、どの要素が効いているのかを切り分けやすくすることです。
続きを読むSkaling law は、モデル容量と学習データの相互作用を単一の指数で表し、従来のニューラルスケーリング則が極端な条件で外しやすい問題を補正しようとする研究です。
続きを読むAI特化型ヘッジファンドのSituational Awarenessは、公開市場で苦戦するなかでも半導体製造スタートアップへの大型投資を続けている。Source Foundryへの今回の投資額は4億ドルに上る。
続きを読むUs vs. Them は、バージョン履歴と diff を使い、テキストのどの範囲が人間由来で、どの範囲がエージェント由来かを推定するオープンソースツールです。エージェントが人間の意図を含む部分を不用意に上書きしないための手がかりになります。
続きを読むアマゾンがテキサス州 Pecos County で計画するデータセンター向けに、天然ガスを燃料とするオンサイト発電所を整備する計画が報じられた。年間3300万トンの二酸化炭素排出が認められているとされ、気候面で大きな議論を呼んでいる。
続きを読むOpenAIはプレゼンテーション生成に取り組むスタートアップNextSlideを買収した。取引は2026年初めに完了しており、同社のチームは現在ChatGPT関連の業務に加わっている。
続きを読むCUA の性能向上には、まず“判定する側”の信頼性が必要です。OSReward は、その判定モデルの弱点を体系的に測り、開放データと専用報酬モデルまでつなげた研究です。
続きを読むKandinsky Lab は、潜在拡散モデル向けの多モーダル tokenizer ファミリー「KVAE」を発表した。音声、画像、動画を対象に、テキスト条件付き生成で使いやすい潜在表現を目指している。
続きを読むOracleはOpenJDKへの貢献において、AIが生成したコードの提出を禁止した。一方で、LLMを個人的にデバッグやレビュー補助に使うことは認めている。
続きを読むCloudflare は、人間ではなく AI エージェントの利用を前提にしたクラウドホスト型ブラウザ Kitesurf を発表した。一般的な自動化タスクで Chromium より少ない計算資源を使える点を訴求している。
続きを読む心理的危機にある利用者へのAIチャットボットの応答をめぐり、訴訟や研究が相次いで注目を集めている。専門家は、共感的な文面だけでなく、リスク把握、専門家への誘導、安全データの透明化が必要だと指摘する。
続きを読むByteDanceが最大10兆パラメータ規模のAIモデルを訓練していると報じられた。中国勢が米トップ研究所に近づくだけでなく、最前線で競う段階に入っていることを示す動きだ。
続きを読むニューメキシコ州の裁判所は、児童安全とソーシャルメディア被害をめぐる訴訟で、Metaに追加で5億6700万ドルの支払いを命じた。3月の3億7500万ドルと合わせ、同件の制裁金は計9億4200万ドルに達する。
続きを読む