Vivix A1発表:仮想キャラクターをリアルタイムに「聞いて動く」存在へ
Vivixはリアルタイム対話型マルチモーダルモデルA1を発表し、あわせて物語世界への介入を狙うW1にも言及した。焦点は動画生成の画質だけでなく、継続的に反応し行動する仮想キャラクターにある。
続きを読むVivixはリアルタイム対話型マルチモーダルモデルA1を発表し、あわせて物語世界への介入を狙うW1にも言及した。焦点は動画生成の画質だけでなく、継続的に反応し行動する仮想キャラクターにある。
続きを読むドイツのAIスタートアップBlack Forest Labsが、マルチモーダル基盤モデルFlux3を発表した。Self-Flowアーキテクチャを採用し、画像、動画、音声、アクションを統合的に扱うことを目指すモデルとされている。
続きを読むPaddleOCR チームの HPD-Parsing は、VLM ベース文書解析に残る「ページ全体を逐次生成する」ボトルネックに焦点を当てる。レイアウトの全体把握とブロック単位の並列解析を分けることで、高いスループットを示した。
続きを読むAV-Flamingo は、短いクリップではなく、長く複雑な実世界の音声・映像動画を対象にしたオープンな大規模モデルです。大規模データ、段階的学習、時刻に結びついた推論で、長期的な整合性と説明性を高めています。
続きを読むHallo4Dは、3Dおよび4D生成で起こる形状のずれ、重複、時間的なちらつきを抑えるための枠組みです。基盤となる生成モデルを再学習せず、マルチモーダルLLMを一貫性の判定役として使います。
続きを読むKnowAct-GUIClaw は、「Know Deeply, Act Perfectly」という考え方に基づき、OpenClaw のクロスプラットフォーム GUI 操作と自己進化機構の不足を補うことを目指す。経験に基づく記憶、自己進化するスキルライブラリ、反省プロセスを組み合わせ、実行能力を継続的に高める設計だ。
続きを読むBoogu-Image-0.1は、画像生成、編集、高速推論、中英バイリンガル文字描画を対象とするオープンソースの統合マルチモーダルモデル群です。論文は、限られた計算資源でもデータ、学習、推論時スケーリングの工夫で閉鎖型システムに近づけると主張しています。
続きを読むFM² は、医用画像基盤モデルに必要な多施設データと、患者データを集中集約できないプライバシー制約の間にあるギャップに取り組む研究だ。論文は、施設ごとに画像モダリティが異なる状況を中心課題として扱っている。
続きを読むarXiv に投稿された CF-Net は、映像内の ambivalence/hesitancy(葛藤やためらい)を認識するためのマルチモーダルモデルだ。典型的な表情ではなく、視覚・音声・テキストの微妙な不一致に注目する。
続きを読むarXiv に投稿された論文は、マルチモーダル大規模言語モデルを活用する AgentHOI を提案している。固定カテゴリの分類器を学習する代わりに、推論と視覚的グラウンディングを組み合わせて開かれた場面の HOI 検出を行う。
続きを読むarXivの新論文は、2D事前学習済みの医用マルチモーダル大規模言語モデルに3D体積画像の理解力を持たせるため、スライス単位のデータ合成手法を提案している。診断過程を構造化された推論データとして学習させる点が特徴だ。
続きを読むAspectCLIP は、画像には複数の意味的側面がある一方で、キャプションはその一部しか記述しないという問題に着目する。テキスト類似性に基づく属性クラスタを使い、一貫性正則化をより適切な範囲に限定する。
続きを読むThinking MachinesのInklingがHugging Faceで公開された。画像、テキスト、音声をネイティブに入力できる大規模マルチモーダルモデルで、1MコンテキストとMoE構成を特徴とする。
続きを読む