記事とガイド

音声・オーディオ

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 16 件の記事

CCTest · Blog
AI音楽の拡大で、EDMミュージシャンが“鑑定人”になる理由
音声・オーディオ
cctest.ai
音声・オーディオ

AI音楽の拡大で、EDMミュージシャンが“鑑定人”になる理由

生成AIによる音楽制作が容易になる一方、電子ダンスミュージックの現場では、誰が曲を作ったのかをめぐる不信感が広がっている。音の違和感や映像の異常を手がかりに、ミュージシャンが疑わしい作品を調べ始めた。

続きを読む
CCTest · Blog
LibriBrain100、100時間超のMEGデータで神経音声デコーディングを拡張
音声・オーディオ
cctest.ai
音声・オーディオ

LibriBrain100、100時間超のMEGデータで神経音声デコーディングを拡張

LibriBrain100は、32人が自然な連続音声を聞いている間に収録した100時間超のMEGデータを提供する。1人からの深いデータと、多数の参加者による広いデータを組み合わせ、再現可能な神経音声デコーディング評価を目指す。

続きを読む
CCTest · Blog
AlibabaのCosyVoice Studio、AI音声を一体型の生産性基盤へ
音声・オーディオ
cctest.ai

AlibabaのCosyVoice Studio、AI音声を一体型の生産性基盤へ

Alibabaは、音声認識、音声合成、音声コンテンツ生成、リアルタイム音声エージェントを統合する CosyVoice Studio を発表した。注目点は、単なる文字起こしや読み上げではなく、音声ワークフローに意味理解を組み込んだことにある。

続きを読む
CCTest · Blog
SunoのAI音楽ウォーターマーク導入は「拡大」から「適法化」への転換点
音声・オーディオ
cctest.ai

SunoのAI音楽ウォーターマーク導入は「拡大」から「適法化」への転換点

AI生成楽曲の急増と著作権訴訟の圧力を受け、Sunoは生成音声への不可視ウォーターマーク付与とダウンロード制限を進める方針を示した。これはAI音楽サービスが、単なる生成能力ではなく出所管理と悪用対策を問われる段階に入ったことを示している。

続きを読む
CCTest · Blog
SwanTale:複数話者の音声と音響シーンを統合生成するモデル
音声・オーディオ
cctest.ai

SwanTale:複数話者の音声と音響シーンを統合生成するモデル

SwanTale は、単なるテキスト読み上げではなく、複数話者、話し方、環境音、効果音をまとめて扱う音声生成モデルを目指している。指示文による生成と、参照音声を使うゼロショット生成の両方を対象にしている点が特徴だ。

続きを読む
CCTest · Blog
Fender CEOの「バンド仲間はアナログAI」発言が反発を招いた理由
音声・オーディオ
cctest.ai

Fender CEOの「バンド仲間はアナログAI」発言が反発を招いた理由

Fender CEOのEdward “Bud” Cole氏が、カバー曲の学習やバンドでの共同制作を「アナログAI」にたとえた発言が再び注目を集めている。音楽家の間では、人間の経験や技能をAIの処理に置き換えるような見方だとして批判が広がっている。

続きを読む
CCTest · Blog
Billboard入りしたラップ曲はAI生成なのか――「Rubberz」論争の焦点
音声・オーディオ
cctest.ai

Billboard入りしたラップ曲はAI生成なのか――「Rubberz」論争の焦点

Fenix Flexinの「Rubberz」はBillboard Hot 100で順位を上げた一方、生成AIで作られたのではないかという疑念を集めている。疑問の根拠は音の不自然さ、歌詞、AI判定されたビジュアル、ライブでの再現性に及ぶ。

続きを読む
CCTest · Blog
マルチモーダル話者照合が音声匿名化の弱点を浮き彫りに
音声・オーディオ
cctest.ai
音声・オーディオ

マルチモーダル話者照合が音声匿名化の弱点を浮き彫りに

新しい研究は、声質を変えるだけの匿名化では、複数発話が集まる現実的な状況に十分対応できない可能性を示した。音響、韻律、言語的な手掛かりが蓄積されると、匿名化後でも話者を識別しやすくなる。

続きを読む
CCTest · Blog
逐語起こしを制御可能にするASR研究:転写ポリシーを潜在変数として扱う
音声・オーディオ
cctest.ai
音声・オーディオ

逐語起こしを制御可能にするASR研究:転写ポリシーを潜在変数として扱う

nyra labs の論文は、現代のASRが逐語転写と意図転写を混在したまま学習し、出力や評価、単語レベルの時刻情報を不安定にしていると指摘する。タスクトークンと cross-attention 微調整により、転写スタイルを明示的に制御する方法を提案している。

続きを読む
CCTest · Blog
GigaChat Audio:長時間音声を時間付きで理解するオープンLLM
音声・オーディオ
cctest.ai
音声・オーディオ

GigaChat Audio:長時間音声を時間付きで理解するオープンLLM

長い録音で「何が起きたか」だけでなく「いつ起きたか」まで答えることを目指した音声LLMです。最大120分の入力に対して、明示的なタイムスタンプ付きで応答できます。 周期的な時間マーカーを音声トークンと交互に入れ、合成データで学習させる設計が特徴です。

続きを読む
CCTest · Blog
Qwen-Music 技術報告:旋律を先に計画するフルソング生成モデル
音声・オーディオ
cctest.ai
音声・オーディオ

Qwen-Music 技術報告:旋律を先に計画するフルソング生成モデル

Qwen の技術報告は、歌声を含む高品質な楽曲生成モデル Qwen-Music を紹介している。特徴は、旋律トークンによる計画を先に行い、その後に楽曲全体を生成・レンダリングする点だ。

続きを読む
CCTest · Blog
Suno のソースコード流出疑惑、AI 音楽の学習データ問題が再燃
音声・オーディオ
cctest.ai
音声・オーディオ

Suno のソースコード流出疑惑、AI 音楽の学習データ問題が再燃

OSChina の要約によると、生成 AI 音楽プラットフォーム Suno で内部ソースコードとデータ収集関連情報が流出し、音楽・歌詞・音声素材を学習に使うため大規模に取得していた可能性が示された。

続きを読む
CCTest · Blog
Suno流出資料が示すAI音楽学習の実態、問われるフェアユースの境界
音声・オーディオ
cctest.ai
音声・オーディオ

Suno流出資料が示すAI音楽学習の実態、問われるフェアユースの境界

404 Mediaの報道によると、ハッキングで取得されたSunoの資料には、YouTube Music、Deezer、Geniusなどから音源や歌詞を収集する指示が含まれていた。AI音楽モデルの学習データをめぐる著作権論争は、さらに具体的な局面に入った。

続きを読む
CCTest · Blog
MetaPerch:録音メタデータで生物音響基盤モデルを強化する
音声・オーディオ
cctest.ai
音声・オーディオ

MetaPerch:録音メタデータで生物音響基盤モデルを強化する

MetaPerch は、動物の鳴き声そのものだけでなく、録音に付随する場所や時刻などのメタデータを学習に使う生物音響向け基盤モデルだ。現実の受動的音響モニタリングで問題になる分布変化への対応を狙っている。

続きを読む
CCTest · Blog
自己教師あり音声表現で第二言語の発音・リズム・イントネーションを評価
音声・オーディオ
cctest.ai
音声・オーディオ

自己教師あり音声表現で第二言語の発音・リズム・イントネーションを評価

arXiv の新論文は、WavLM 表現と動的時間伸縮法を用いた、テキスト不要の第二言語音声評価を検証している。音素レベルの採点で高い性能を示し、リズムやイントネーション評価にも応用可能性を示した。

続きを読む