AlayaRenderer-Flash、生成型ワールドレンダリングをプレイ可能な 30 FPS へ
AlayaRenderer-Flash は、生成型ワールドレンダリングの速度を 0.56 FPS から 31.54 FPS へ引き上げ、物理エンジンと連携するインタラクティブ環境を実時間に近づけた。テキストだけで動画を作るのではなく、構造化された世界状態から RGB フレームを合成する点が特徴だ。
続きを読むClaude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ
全 795 件の記事
AlayaRenderer-Flash は、生成型ワールドレンダリングの速度を 0.56 FPS から 31.54 FPS へ引き上げ、物理エンジンと連携するインタラクティブ環境を実時間に近づけた。テキストだけで動画を作るのではなく、構造化された世界状態から RGB フレームを合成する点が特徴だ。
続きを読むこの論文は、MoE 学習で大きな負担になりやすいオプティマイザ状態に注目する。SkewAdam はバックボーン、専門家、ルーターごとに状態の持ち方を変え、報告された実験では大幅なメモリ削減と良好な検証性能を両立した。
続きを読む新しい研究は、文生画像 Diffusion Transformer における構造的なテキストテンプレートトークンが、単なる飾りではないことを示した。生成中に物体の同一性を保つ暗黙的な意味レジスタとして働くという。
続きを読むこの論文は、RLVRによる能力向上が重みの特異値スペクトルの大幅な書き換えではなく、入力・出力側の特異フレームの変化に宿ると主張する。その観察をもとに、固定スペクトル型の最適化スタック ISO を提案している。
続きを読むこの論文は、拡散言語モデルが明示的な時間ステップなしに、内部でノイズ除去の進行度を表現しているかを検証している。残差ストリームから、時間に対応する潜在信号を読み取れることが示された。
続きを読むAlayaWorld は、テキスト、画像、動画から探索可能で変化し続ける仮想環境を生成することを目指す。焦点は短い動画の見栄えだけでなく、対話性、長期一貫性、応答効率にある。
続きを読むABot-World-0 は、映像生成をユーザー操作に反応する世界モデルとして再構成する研究です。データ収集、長時間ロールアウトの蒸留、低ビット推論を組み合わせ、単一の RTX 5090 上で 720P のストリーミング生成を目指します。
続きを読むSciForma は、科学論文で使われる手法図の生成を、見た目の自然さではなく構造の正しさから捉え直す研究です。構成要素、矢印、テキストという三つの軸で品質を分解し、同時に正しくすることを重視します。
続きを読むAutoIndex は、検索器やリランカーを変更するのではなく、索引化の前に文書をどう表現するかを学習する枠組みです。BM25 を固定したまま、CRUMB の 8 タスクすべてで Recall@100 の改善を報告しています。
続きを読むMage-Flow は、画像生成モデルの競争力を単純な巨大化ではなく、トークナイザー、バックボーン、学習システムの共同設計で高めようとする取り組みだ。4B規模でテキスト画像生成と指示ベース編集の両方を扱う。
続きを読むこの論文は、LLMの「採点者」役を「コーチ」役へと拡張し、単一スカラーではなく経験知を学習信号に使う方法を提案する。非検証型タスクでの学習を、より細かなフィードバックに基づいて進めようとしている。
続きを読むNexForge は、LLM Agent の後学習に必要な実行可能データの不足に取り組むフレームワークです。固定ツールやリポジトリではなく、高レベルな能力要件からタスクと専門家軌跡を合成します。
続きを読むFlowMimic は、動画編集データの収集コストとタスクの狭さという課題に向き合う研究です。画像編集サンプルをリアルタイムで動画編集サンプルへ変換し、画像と動画の能力を相互模倣で近づけます。
続きを読む多言語ASRは語数を増やすだけでは十分ではありません。GigaAM Multilingual は、資源の少ない中央アジア言語に焦点を当て、データの偏りを抑える設計で性能向上を狙った研究です。
続きを読むSeerGuard は、1回の誤操作が大きな損害につながるモバイルGUIエージェント向けに、実行前の指令スクリーニングと動作リスク評価を組み合わせた安全フレームワークです。
続きを読むこの研究は、検索エージェントが自分の軌跡から学び直せる訓練環境を作ることに主眼があります。鍵になるのは、正しさを確認できる再現可能な検索・閲覧環境です。
続きを読むGEPO は GRPO を軽量に拡張し、prompt グループごとの熵を使って advantage を非対称に調整する手法です。混合タスク学習で起きやすい探索と利用の不均衡に対応しようとしています。
続きを読む長い文脈を扱うとき、重要なのは量ではなく取捨選択です。SWE-Pruner Pro は、ツール出力の保持・削除を外部分類器ではなくモデル内部の表現に任せます。
続きを読むDiFA は、拡散モデルの推論時に得られる過去の予測を相関のある観測として扱う、再学習不要のフレームワークです。前向き拡散過程に沿った時間的コンセンサスにより、生成の安定性と細部表現の改善を狙います。
続きを読むRynnBrain 1.1 は、知覚・空間推論・位置推定・計画を一つの枠組みにまとめた具身基盤モデル群です。単なる認識ではなく、実際の操作に使いやすい表現を目指している点が特徴です。
続きを読むAPI を呼び出すエージェントの学習には、大量の高品質な軌跡が必要です。しかし本物の環境を整備するのは重い作業です。本論文は、API 仕様だけを使って LLM に状態付き環境を模擬させる方法を提案します。
続きを読む