LiveAnimate:長尺の人物アニメーションをリアルタイム配信へ
LiveAnimate は、姿勢駆動の人物アニメーションにおける「高品質だが遅い」という課題に正面から取り組む研究です。14B パラメータの動画 DiT を、長時間でも安定して動くストリーミング推論システムへと再設計しています。
続きを読むClaude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ
全 548 件の記事
LiveAnimate は、姿勢駆動の人物アニメーションにおける「高品質だが遅い」という課題に正面から取り組む研究です。14B パラメータの動画 DiT を、長時間でも安定して動くストリーミング推論システムへと再設計しています。
続きを読むUniSwap は、話者動画における外見と声質の同時置き換えを目指す音声・映像統合フレームワークです。別々のモデルを後段でつなぐのではなく、単一の音声映像拡散 Transformer 内で両方を扱います。
続きを読むStateFlow は、映画、ゲーム、建築、都市設計向けの生成型プリビジュアライゼーションを、永続的な3D世界状態として扱う枠組みです。動画を一度に生成するのではなく、構築・進化・アクセス可能な編集用ワールドを中心に据えます。
続きを読む新しい研究は、「長い対話でも矛盾しないこと」を自動評価できる形にしました。NCP-Benchでは、強力なモデルでも長期の物語整合性を維持するのが難しいことが示されています。
続きを読むUniMoMo は、学習済みの推薦向け MoE モデルを、より少ない専門家数の標準 MoE へ変換する後処理圧縮フレームワークです。重みの近さではなく、校正データ上での振る舞いとルーティング量を見て専門家を統合します。
続きを読むVibeLifeBench は、短い指示ではなく、数週間続く生活タスクと静かに変化する環境を使って AI エージェントを評価する新しいベンチマークです。
続きを読むEx-Omni-2Dは、会話はできても“姿がない”という現状の多モーダル対話モデルの弱点に挑みます。テキスト、個別化音声、参照条件付き動画を一体で生成する設計です。
続きを読むEvidence-RL は、視覚言語モデルが正答していても、その根拠が本当に画像内の証拠にあるのかを問い直す研究です。CED により、局所的な視覚証拠と回答の因果的な依存関係を訓練時に監査します。
続きを読むSPOT は、On-Policy Distillation において、どの位置を詳しく調べ、どの候補を学習目標にすべきかを同時に扱う手法です。教師モデルの局所確率だけでなく、検証器が評価した後続結果を使って蒸留ターゲットを調整します。
続きを読むAMD は、強い教師エージェントの成功軌跡を階層的な記憶として整理し、小型LLMに渡すことで道具利用タスクを改善する発想だ。再学習ではなく、再利用しやすい経験の圧縮に焦点を当てている。
続きを読むこの技術レポートは、言語モデルの解釈可能性を学習後に付け足すのではなく、学習プロセスそのものに組み込むべきだと主張している。Steerling-8B は生成結果を入力、概念、学習データへ結び付ける試みとして紹介されている。
続きを読む画像生成チャットにおける次の編集提案は、会話テキストだけでなく現在の画像に基づく必要がある。論文は、実利用データ、クリックフィードバック、視覚検証器を組み合わせた三段階フレームワークを提案している。
続きを読むMotif 3 は、総パラメータ 3140 億、トークン当たりの有効化 132 億の decoder-only MoE 言語モデルです。GDLA や多段階の後学習を組み合わせ、推論・コード・長文脈の性能向上を狙っています。
続きを読む本論文は、モデル自身の複数生成結果から擬似解を作り、それとの不一致を学習信号にする U-OPSD を提案する。真値ラベルや強い教師モデルを使わずに、数学推論ベンチマークで基盤モデルを安定して上回った点が特徴だ。
続きを読むOuroboros は、ツール、プロンプト、コンテキスト構築、コア実装までを改善対象にする自己発展型のエージェント基盤だ。論文は複数のベンチマークで高い結果を報告しつつ、自己改変システムにおける安全設計の重要性を強調している。
続きを読むSWE-Bench ProMax は、AI コーディングエージェントの評価対象を単純なバグ修正から、複数ファイルにまたがる振る舞い維持型のリファクタリングへ広げるベンチマークです。
続きを読むYOLO-PEFT は、リアルタイム物体検出器における PEFT アダプタ配置を、監査可能な制約計画として扱うフレームワークです。どの層に置くべきかだけでなく、危険な場合に訓練前に拒否する点も特徴です。
続きを読むSkaling law は、モデル容量と学習データの相互作用を単一の指数で表し、従来のニューラルスケーリング則が極端な条件で外しやすい問題を補正しようとする研究です。
続きを読むこの研究は、Test-Time Training を個別実装の寄せ集めではなく、組み立て可能な設計空間として捉え直しています。狙いは新しい TTT を作りやすくすることに加え、どの要素が効いているのかを切り分けやすくすることです。
続きを読むAI特化型ヘッジファンドのSituational Awarenessは、公開市場で苦戦するなかでも半導体製造スタートアップへの大型投資を続けている。Source Foundryへの今回の投資額は4億ドルに上る。
続きを読むUs vs. Them は、バージョン履歴と diff を使い、テキストのどの範囲が人間由来で、どの範囲がエージェント由来かを推定するオープンソースツールです。エージェントが人間の意図を含む部分を不用意に上書きしないための手がかりになります。
続きを読む