X-AuT、段階的蒸留で音声LLMの音声エンコーダーを圧縮
X-AuTは、音声大規模言語モデルの音声エンコーダーを段階的に圧縮するフレームワークです。行動プローブと表現アライメント、クロススケール蒸留を組み合わせ、剪定後に起きる文字欠落や早すぎる終了を抑えます。
続きを読むX-AuTは、音声大規模言語モデルの音声エンコーダーを段階的に圧縮するフレームワークです。行動プローブと表現アライメント、クロススケール蒸留を組み合わせ、剪定後に起きる文字欠落や早すぎる終了を抑えます。
続きを読む小米が、複数人の発話が重なる環境を対象とした産業級のターゲット話者音声認識モデル、CocktailASR-1をオープンソース化しました。単純なノイズ除去ではなく、先に聞きたい話者を指定し、その人物の発話だけを認識するアプローチです。
続きを読むBrain2Semantics2Textは、文レベルのMEG応答をまず意味埋め込み空間へ写像し、その後に自然言語へ変換する。音素や単語を逐一復元する代わりに、文全体の意味を優先するアプローチだ。
続きを読むインドの音声ストーリープラットフォームPocket FMは、年換算売上ランレートが1年間で倍増し、5億ドルに達したと発表しました。全カタログの93%、新規コンテンツの99%でAIを活用していますが、物語の核となる創作は人間が担っています。
続きを読むAuKは、自然言語の指示と音声コンテキストを共通インターフェースとして、音声生成、内容編集、分離、表現編集、音響編集を扱う基盤モデルです。蒸留版のAuK-Flashは、少ない推論ステップで高速化を目指します。
続きを読むOpenAIのGPT-Liveは、遅延に敏感なメディア処理と推論を、ツール利用やタスク委任、永続化などのアプリケーション処理から分離する設計を採用しています。状態を持つセッションの移行、WebRTCの改良、実トラフィックを使ったサイレントテストによって、会話の連続性と拡張性の両立を目指します。
続きを読む音声入力と無関係なのに流暢な文章を生成するASRの「幻覚」について、新たな研究がその発生条件を分析した。エンコーダーの最終段は音声情報をテキストとして読める形に整える重要な位置だが、そこを壊すだけで自然な幻覚が生じるわけではない。
続きを読むMicrosoftの研究チームは、音声認識と話者帰属を一つのストリーミングモデルに統合したVibeVoice-ASR-Streamingを発表した。音声が届くたびに、話者情報付きの文字起こしを継続的に生成する。
続きを読む生成AIによる音楽制作が容易になる一方、電子ダンスミュージックの現場では、誰が曲を作ったのかをめぐる不信感が広がっている。音の違和感や映像の異常を手がかりに、ミュージシャンが疑わしい作品を調べ始めた。
続きを読むLibriBrain100は、32人が自然な連続音声を聞いている間に収録した100時間超のMEGデータを提供する。1人からの深いデータと、多数の参加者による広いデータを組み合わせ、再現可能な神経音声デコーディング評価を目指す。
続きを読むAlibabaは、音声認識、音声合成、音声コンテンツ生成、リアルタイム音声エージェントを統合する CosyVoice Studio を発表した。注目点は、単なる文字起こしや読み上げではなく、音声ワークフローに意味理解を組み込んだことにある。
続きを読むAI生成楽曲の急増と著作権訴訟の圧力を受け、Sunoは生成音声への不可視ウォーターマーク付与とダウンロード制限を進める方針を示した。これはAI音楽サービスが、単なる生成能力ではなく出所管理と悪用対策を問われる段階に入ったことを示している。
続きを読むSwanTale は、単なるテキスト読み上げではなく、複数話者、話し方、環境音、効果音をまとめて扱う音声生成モデルを目指している。指示文による生成と、参照音声を使うゼロショット生成の両方を対象にしている点が特徴だ。
続きを読むFender CEOのEdward “Bud” Cole氏が、カバー曲の学習やバンドでの共同制作を「アナログAI」にたとえた発言が再び注目を集めている。音楽家の間では、人間の経験や技能をAIの処理に置き換えるような見方だとして批判が広がっている。
続きを読むFenix Flexinの「Rubberz」はBillboard Hot 100で順位を上げた一方、生成AIで作られたのではないかという疑念を集めている。疑問の根拠は音の不自然さ、歌詞、AI判定されたビジュアル、ライブでの再現性に及ぶ。
続きを読む新しい研究は、声質を変えるだけの匿名化では、複数発話が集まる現実的な状況に十分対応できない可能性を示した。音響、韻律、言語的な手掛かりが蓄積されると、匿名化後でも話者を識別しやすくなる。
続きを読むnyra labs の論文は、現代のASRが逐語転写と意図転写を混在したまま学習し、出力や評価、単語レベルの時刻情報を不安定にしていると指摘する。タスクトークンと cross-attention 微調整により、転写スタイルを明示的に制御する方法を提案している。
続きを読む長い録音で「何が起きたか」だけでなく「いつ起きたか」まで答えることを目指した音声LLMです。最大120分の入力に対して、明示的なタイムスタンプ付きで応答できます。 周期的な時間マーカーを音声トークンと交互に入れ、合成データで学習させる設計が特徴です。
続きを読む多言語ASRは語数を増やすだけでは十分ではありません。GigaAM Multilingual は、資源の少ない中央アジア言語に焦点を当て、データの偏りを抑える設計で性能向上を狙った研究です。
続きを読むQwen の技術報告は、歌声を含む高品質な楽曲生成モデル Qwen-Music を紹介している。特徴は、旋律トークンによる計画を先に行い、その後に楽曲全体を生成・レンダリングする点だ。
続きを読むOSChina の要約によると、生成 AI 音楽プラットフォーム Suno で内部ソースコードとデータ収集関連情報が流出し、音楽・歌詞・音声素材を学習に使うため大規模に取得していた可能性が示された。
続きを読む