記事とガイド

マルチモーダル

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 34 件の記事

CCTest · Blog
Vivix A1発表:仮想キャラクターをリアルタイムに「聞いて動く」存在へ
マルチモーダル
cctest.ai
マルチモーダル

Vivix A1発表:仮想キャラクターをリアルタイムに「聞いて動く」存在へ

Vivixはリアルタイム対話型マルチモーダルモデルA1を発表し、あわせて物語世界への介入を狙うW1にも言及した。焦点は動画生成の画質だけでなく、継続的に反応し行動する仮想キャラクターにある。

続きを読む
CCTest · Blog
Black Forest LabsがFlux3を発表、音声と映像の同期生成を重視したマルチモーダルモデル
マルチモーダル
cctest.ai
マルチモーダル

Black Forest LabsがFlux3を発表、音声と映像の同期生成を重視したマルチモーダルモデル

ドイツのAIスタートアップBlack Forest Labsが、マルチモーダル基盤モデルFlux3を発表した。Self-Flowアーキテクチャを採用し、画像、動画、音声、アクションを統合的に扱うことを目指すモデルとされている。

続きを読む
CCTest · Blog
HPD-Parsing:文書解析を階層型並列デコードへ移す試み
マルチモーダル
cctest.ai
マルチモーダル

HPD-Parsing:文書解析を階層型並列デコードへ移す試み

PaddleOCR チームの HPD-Parsing は、VLM ベース文書解析に残る「ページ全体を逐次生成する」ボトルネックに焦点を当てる。レイアウトの全体把握とブロック単位の並列解析を分けることで、高いスループットを示した。

続きを読む
CCTest · Blog
AV-Flamingo:長尺で複雑な動画を理解するオープン音声・映像モデル
マルチモーダル
cctest.ai
マルチモーダル

AV-Flamingo:長尺で複雑な動画を理解するオープン音声・映像モデル

AV-Flamingo は、短いクリップではなく、長く複雑な実世界の音声・映像動画を対象にしたオープンな大規模モデルです。大規模データ、段階的学習、時刻に結びついた推論で、長期的な整合性と説明性を高めています。

続きを読む
CCTest · Blog
Hallo4D:マルチモーダルLLMで3D/4D生成の時空間幻覚を抑える
マルチモーダル
cctest.ai
マルチモーダル

Hallo4D:マルチモーダルLLMで3D/4D生成の時空間幻覚を抑える

Hallo4Dは、3Dおよび4D生成で起こる形状のずれ、重複、時間的なちらつきを抑えるための枠組みです。基盤となる生成モデルを再学習せず、マルチモーダルLLMを一貫性の判定役として使います。

続きを読む
CCTest · Blog
KnowAct-GUIClaw:記憶とスキルで自己進化する個人向け GUI アシスタント
マルチモーダル
cctest.ai
マルチモーダル

KnowAct-GUIClaw:記憶とスキルで自己進化する個人向け GUI アシスタント

KnowAct-GUIClaw は、「Know Deeply, Act Perfectly」という考え方に基づき、OpenClaw のクロスプラットフォーム GUI 操作と自己進化機構の不足を補うことを目指す。経験に基づく記憶、自己進化するスキルライブラリ、反省プロセスを組み合わせ、実行能力を継続的に高める設計だ。

続きを読む
CCTest · Blog
Boogu-Image-0.1公開:オープンな統合マルチモーダル画像モデルの挑戦
マルチモーダル
cctest.ai
マルチモーダル

Boogu-Image-0.1公開:オープンな統合マルチモーダル画像モデルの挑戦

Boogu-Image-0.1は、画像生成、編集、高速推論、中英バイリンガル文字描画を対象とするオープンソースの統合マルチモーダルモデル群です。論文は、限られた計算資源でもデータ、学習、推論時スケーリングの工夫で閉鎖型システムに近づけると主張しています。

続きを読む
CCTest · Blog
FM²:異種マルチモーダル医用画像に向けた連合型基盤モデル
マルチモーダル
cctest.ai
マルチモーダル

FM²:異種マルチモーダル医用画像に向けた連合型基盤モデル

FM² は、医用画像基盤モデルに必要な多施設データと、患者データを集中集約できないプライバシー制約の間にあるギャップに取り組む研究だ。論文は、施設ごとに画像モダリティが異なる状況を中心課題として扱っている。

続きを読む
CCTest · Blog
CF-Net:映像中のためらいを「モダリティ間の衝突」から読む
マルチモーダル
cctest.ai
マルチモーダル

CF-Net:映像中のためらいを「モダリティ間の衝突」から読む

arXiv に投稿された CF-Net は、映像内の ambivalence/hesitancy(葛藤やためらい)を認識するためのマルチモーダルモデルだ。典型的な表情ではなく、視覚・音声・テキストの微妙な不一致に注目する。

続きを読む
CCTest · Blog
AgentHOI:学習なしで人物と物体の相互作用を検出する新手法
マルチモーダル
cctest.ai
マルチモーダル

AgentHOI:学習なしで人物と物体の相互作用を検出する新手法

arXiv に投稿された論文は、マルチモーダル大規模言語モデルを活用する AgentHOI を提案している。固定カテゴリの分類器を学習する代わりに、推論と視覚的グラウンディングを組み合わせて開かれた場面の HOI 検出を行う。

続きを読む
CCTest · Blog
3D医用マルチモーダルLLMを強化するスライス単位推論
マルチモーダル
cctest.ai
マルチモーダル

3D医用マルチモーダルLLMを強化するスライス単位推論

arXivの新論文は、2D事前学習済みの医用マルチモーダル大規模言語モデルに3D体積画像の理解力を持たせるため、スライス単位のデータ合成手法を提案している。診断過程を構造化された推論データとして学習させる点が特徴だ。

続きを読む
CCTest · Blog
AspectCLIP:CLIP の表現空間を「意味の側面」から整える新手法
マルチモーダル
cctest.ai
マルチモーダル

AspectCLIP:CLIP の表現空間を「意味の側面」から整える新手法

AspectCLIP は、画像には複数の意味的側面がある一方で、キャプションはその一部しか記述しないという問題に着目する。テキスト類似性に基づく属性クラスタを使い、一貫性正則化をより適切な範囲に限定する。

続きを読む
CCTest · Blog
Thinking MachinesがInklingを公開:1兆規模に迫るオープンなマルチモーダルモデル
マルチモーダル
cctest.ai
マルチモーダル

Thinking MachinesがInklingを公開:1兆規模に迫るオープンなマルチモーダルモデル

Thinking MachinesのInklingがHugging Faceで公開された。画像、テキスト、音声をネイティブに入力できる大規模マルチモーダルモデルで、1MコンテキストとMoE構成を特徴とする。

続きを読む