記事とガイド

音声・オーディオ

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 24 件の記事

CCTest · Blog
X-AuT、段階的蒸留で音声LLMの音声エンコーダーを圧縮
音声・オーディオ
cctest.ai
音声・オーディオ

X-AuT、段階的蒸留で音声LLMの音声エンコーダーを圧縮

X-AuTは、音声大規模言語モデルの音声エンコーダーを段階的に圧縮するフレームワークです。行動プローブと表現アライメント、クロススケール蒸留を組み合わせ、剪定後に起きる文字欠落や早すぎる終了を抑えます。

続きを読む
CCTest · Blog
小米、聞きたい話者に絞る音声認識モデル「CocktailASR-1」を公開
音声・オーディオ
cctest.ai
音声・オーディオ

小米、聞きたい話者に絞る音声認識モデル「CocktailASR-1」を公開

小米が、複数人の発話が重なる環境を対象とした産業級のターゲット話者音声認識モデル、CocktailASR-1をオープンソース化しました。単純なノイズ除去ではなく、先に聞きたい話者を指定し、その人物の発話だけを認識するアプローチです。

続きを読む
CCTest · Blog
脳信号を意味経由で文字へ:非侵襲音声デコーディングの新しい設計
音声・オーディオ
cctest.ai
音声・オーディオ

脳信号を意味経由で文字へ:非侵襲音声デコーディングの新しい設計

Brain2Semantics2Textは、文レベルのMEG応答をまず意味埋め込み空間へ写像し、その後に自然言語へ変換する。音素や単語を逐一復元する代わりに、文全体の意味を優先するアプローチだ。

続きを読む
CCTest · Blog
Pocket FM、AIで音声コンテンツを拡大し年換算売上ランレート5億ドルへ
音声・オーディオ
cctest.ai
音声・オーディオ

Pocket FM、AIで音声コンテンツを拡大し年換算売上ランレート5億ドルへ

インドの音声ストーリープラットフォームPocket FMは、年換算売上ランレートが1年間で倍増し、5億ドルに達したと発表しました。全カタログの93%、新規コンテンツの99%でAIを活用していますが、物語の核となる創作は人間が担っています。

続きを読む
CCTest · Blog
AuK、音声生成と編集を統合するオープンソース基盤モデル
音声・オーディオ
cctest.ai

AuK、音声生成と編集を統合するオープンソース基盤モデル

AuKは、自然言語の指示と音声コンテキストを共通インターフェースとして、音声生成、内容編集、分離、表現編集、音響編集を扱う基盤モデルです。蒸留版のAuK-Flashは、少ない推論ステップで高速化を目指します。

続きを読む
CCTest · Blog
GPT-Liveの設計を読み解く:低遅延で状態を保つ音声対話基盤
音声・オーディオ
cctest.ai

GPT-Liveの設計を読み解く:低遅延で状態を保つ音声対話基盤

OpenAIのGPT-Liveは、遅延に敏感なメディア処理と推論を、ツール利用やタスク委任、永続化などのアプリケーション処理から分離する設計を採用しています。状態を持つセッションの移行、WebRTCの改良、実トラフィックを使ったサイレントテストによって、会話の連続性と拡張性の両立を目指します。

続きを読む
CCTest · Blog
ASR幻覚はどこで始まるのか:エンコーダー最終段が重要な境界に
音声・オーディオ
cctest.ai

ASR幻覚はどこで始まるのか:エンコーダー最終段が重要な境界に

音声入力と無関係なのに流暢な文章を生成するASRの「幻覚」について、新たな研究がその発生条件を分析した。エンコーダーの最終段は音声情報をテキストとして読める形に整える重要な位置だが、そこを壊すだけで自然な幻覚が生じるわけではない。

続きを読む
CCTest · Blog
VibeVoice-ASR-Streaming、リアルタイムに「誰が何を話したか」を認識
音声・オーディオ
cctest.ai

VibeVoice-ASR-Streaming、リアルタイムに「誰が何を話したか」を認識

Microsoftの研究チームは、音声認識と話者帰属を一つのストリーミングモデルに統合したVibeVoice-ASR-Streamingを発表した。音声が届くたびに、話者情報付きの文字起こしを継続的に生成する。

続きを読む
CCTest · Blog
AI音楽の拡大で、EDMミュージシャンが“鑑定人”になる理由
音声・オーディオ
cctest.ai
音声・オーディオ

AI音楽の拡大で、EDMミュージシャンが“鑑定人”になる理由

生成AIによる音楽制作が容易になる一方、電子ダンスミュージックの現場では、誰が曲を作ったのかをめぐる不信感が広がっている。音の違和感や映像の異常を手がかりに、ミュージシャンが疑わしい作品を調べ始めた。

続きを読む
CCTest · Blog
LibriBrain100、100時間超のMEGデータで神経音声デコーディングを拡張
音声・オーディオ
cctest.ai
音声・オーディオ

LibriBrain100、100時間超のMEGデータで神経音声デコーディングを拡張

LibriBrain100は、32人が自然な連続音声を聞いている間に収録した100時間超のMEGデータを提供する。1人からの深いデータと、多数の参加者による広いデータを組み合わせ、再現可能な神経音声デコーディング評価を目指す。

続きを読む
CCTest · Blog
AlibabaのCosyVoice Studio、AI音声を一体型の生産性基盤へ
音声・オーディオ
cctest.ai

AlibabaのCosyVoice Studio、AI音声を一体型の生産性基盤へ

Alibabaは、音声認識、音声合成、音声コンテンツ生成、リアルタイム音声エージェントを統合する CosyVoice Studio を発表した。注目点は、単なる文字起こしや読み上げではなく、音声ワークフローに意味理解を組み込んだことにある。

続きを読む
CCTest · Blog
SunoのAI音楽ウォーターマーク導入は「拡大」から「適法化」への転換点
音声・オーディオ
cctest.ai

SunoのAI音楽ウォーターマーク導入は「拡大」から「適法化」への転換点

AI生成楽曲の急増と著作権訴訟の圧力を受け、Sunoは生成音声への不可視ウォーターマーク付与とダウンロード制限を進める方針を示した。これはAI音楽サービスが、単なる生成能力ではなく出所管理と悪用対策を問われる段階に入ったことを示している。

続きを読む
CCTest · Blog
SwanTale:複数話者の音声と音響シーンを統合生成するモデル
音声・オーディオ
cctest.ai

SwanTale:複数話者の音声と音響シーンを統合生成するモデル

SwanTale は、単なるテキスト読み上げではなく、複数話者、話し方、環境音、効果音をまとめて扱う音声生成モデルを目指している。指示文による生成と、参照音声を使うゼロショット生成の両方を対象にしている点が特徴だ。

続きを読む
CCTest · Blog
Fender CEOの「バンド仲間はアナログAI」発言が反発を招いた理由
音声・オーディオ
cctest.ai

Fender CEOの「バンド仲間はアナログAI」発言が反発を招いた理由

Fender CEOのEdward “Bud” Cole氏が、カバー曲の学習やバンドでの共同制作を「アナログAI」にたとえた発言が再び注目を集めている。音楽家の間では、人間の経験や技能をAIの処理に置き換えるような見方だとして批判が広がっている。

続きを読む
CCTest · Blog
Billboard入りしたラップ曲はAI生成なのか――「Rubberz」論争の焦点
音声・オーディオ
cctest.ai

Billboard入りしたラップ曲はAI生成なのか――「Rubberz」論争の焦点

Fenix Flexinの「Rubberz」はBillboard Hot 100で順位を上げた一方、生成AIで作られたのではないかという疑念を集めている。疑問の根拠は音の不自然さ、歌詞、AI判定されたビジュアル、ライブでの再現性に及ぶ。

続きを読む
CCTest · Blog
マルチモーダル話者照合が音声匿名化の弱点を浮き彫りに
音声・オーディオ
cctest.ai
音声・オーディオ

マルチモーダル話者照合が音声匿名化の弱点を浮き彫りに

新しい研究は、声質を変えるだけの匿名化では、複数発話が集まる現実的な状況に十分対応できない可能性を示した。音響、韻律、言語的な手掛かりが蓄積されると、匿名化後でも話者を識別しやすくなる。

続きを読む
CCTest · Blog
逐語起こしを制御可能にするASR研究:転写ポリシーを潜在変数として扱う
音声・オーディオ
cctest.ai
音声・オーディオ

逐語起こしを制御可能にするASR研究:転写ポリシーを潜在変数として扱う

nyra labs の論文は、現代のASRが逐語転写と意図転写を混在したまま学習し、出力や評価、単語レベルの時刻情報を不安定にしていると指摘する。タスクトークンと cross-attention 微調整により、転写スタイルを明示的に制御する方法を提案している。

続きを読む
CCTest · Blog
GigaChat Audio:長時間音声を時間付きで理解するオープンLLM
音声・オーディオ
cctest.ai
音声・オーディオ

GigaChat Audio:長時間音声を時間付きで理解するオープンLLM

長い録音で「何が起きたか」だけでなく「いつ起きたか」まで答えることを目指した音声LLMです。最大120分の入力に対して、明示的なタイムスタンプ付きで応答できます。 周期的な時間マーカーを音声トークンと交互に入れ、合成データで学習させる設計が特徴です。

続きを読む
CCTest · Blog
Qwen-Music 技術報告:旋律を先に計画するフルソング生成モデル
音声・オーディオ
cctest.ai
音声・オーディオ

Qwen-Music 技術報告:旋律を先に計画するフルソング生成モデル

Qwen の技術報告は、歌声を含む高品質な楽曲生成モデル Qwen-Music を紹介している。特徴は、旋律トークンによる計画を先に行い、その後に楽曲全体を生成・レンダリングする点だ。

続きを読む
CCTest · Blog
Suno のソースコード流出疑惑、AI 音楽の学習データ問題が再燃
音声・オーディオ
cctest.ai
音声・オーディオ

Suno のソースコード流出疑惑、AI 音楽の学習データ問題が再燃

OSChina の要約によると、生成 AI 音楽プラットフォーム Suno で内部ソースコードとデータ収集関連情報が流出し、音楽・歌詞・音声素材を学習に使うため大規模に取得していた可能性が示された。

続きを読む