AI音楽の拡大で、EDMミュージシャンが“鑑定人”になる理由
生成AIによる音楽制作が容易になる一方、電子ダンスミュージックの現場では、誰が曲を作ったのかをめぐる不信感が広がっている。音の違和感や映像の異常を手がかりに、ミュージシャンが疑わしい作品を調べ始めた。
続きを読む生成AIによる音楽制作が容易になる一方、電子ダンスミュージックの現場では、誰が曲を作ったのかをめぐる不信感が広がっている。音の違和感や映像の異常を手がかりに、ミュージシャンが疑わしい作品を調べ始めた。
続きを読むLibriBrain100は、32人が自然な連続音声を聞いている間に収録した100時間超のMEGデータを提供する。1人からの深いデータと、多数の参加者による広いデータを組み合わせ、再現可能な神経音声デコーディング評価を目指す。
続きを読むAlibabaは、音声認識、音声合成、音声コンテンツ生成、リアルタイム音声エージェントを統合する CosyVoice Studio を発表した。注目点は、単なる文字起こしや読み上げではなく、音声ワークフローに意味理解を組み込んだことにある。
続きを読むAI生成楽曲の急増と著作権訴訟の圧力を受け、Sunoは生成音声への不可視ウォーターマーク付与とダウンロード制限を進める方針を示した。これはAI音楽サービスが、単なる生成能力ではなく出所管理と悪用対策を問われる段階に入ったことを示している。
続きを読むSwanTale は、単なるテキスト読み上げではなく、複数話者、話し方、環境音、効果音をまとめて扱う音声生成モデルを目指している。指示文による生成と、参照音声を使うゼロショット生成の両方を対象にしている点が特徴だ。
続きを読むFender CEOのEdward “Bud” Cole氏が、カバー曲の学習やバンドでの共同制作を「アナログAI」にたとえた発言が再び注目を集めている。音楽家の間では、人間の経験や技能をAIの処理に置き換えるような見方だとして批判が広がっている。
続きを読むFenix Flexinの「Rubberz」はBillboard Hot 100で順位を上げた一方、生成AIで作られたのではないかという疑念を集めている。疑問の根拠は音の不自然さ、歌詞、AI判定されたビジュアル、ライブでの再現性に及ぶ。
続きを読む新しい研究は、声質を変えるだけの匿名化では、複数発話が集まる現実的な状況に十分対応できない可能性を示した。音響、韻律、言語的な手掛かりが蓄積されると、匿名化後でも話者を識別しやすくなる。
続きを読むnyra labs の論文は、現代のASRが逐語転写と意図転写を混在したまま学習し、出力や評価、単語レベルの時刻情報を不安定にしていると指摘する。タスクトークンと cross-attention 微調整により、転写スタイルを明示的に制御する方法を提案している。
続きを読む多言語ASRは語数を増やすだけでは十分ではありません。GigaAM Multilingual は、資源の少ない中央アジア言語に焦点を当て、データの偏りを抑える設計で性能向上を狙った研究です。
続きを読む長い録音で「何が起きたか」だけでなく「いつ起きたか」まで答えることを目指した音声LLMです。最大120分の入力に対して、明示的なタイムスタンプ付きで応答できます。 周期的な時間マーカーを音声トークンと交互に入れ、合成データで学習させる設計が特徴です。
続きを読むQwen の技術報告は、歌声を含む高品質な楽曲生成モデル Qwen-Music を紹介している。特徴は、旋律トークンによる計画を先に行い、その後に楽曲全体を生成・レンダリングする点だ。
続きを読むOSChina の要約によると、生成 AI 音楽プラットフォーム Suno で内部ソースコードとデータ収集関連情報が流出し、音楽・歌詞・音声素材を学習に使うため大規模に取得していた可能性が示された。
続きを読む404 Mediaの報道によると、ハッキングで取得されたSunoの資料には、YouTube Music、Deezer、Geniusなどから音源や歌詞を収集する指示が含まれていた。AI音楽モデルの学習データをめぐる著作権論争は、さらに具体的な局面に入った。
続きを読むMetaPerch は、動物の鳴き声そのものだけでなく、録音に付随する場所や時刻などのメタデータを学習に使う生物音響向け基盤モデルだ。現実の受動的音響モニタリングで問題になる分布変化への対応を狙っている。
続きを読むarXiv の新論文は、WavLM 表現と動的時間伸縮法を用いた、テキスト不要の第二言語音声評価を検証している。音素レベルの採点で高い性能を示し、リズムやイントネーション評価にも応用可能性を示した。
続きを読む