CCTest · Blog
GigaAM Multilingual:低資源言語向け音声基盤モデル
音声・オーディオ
cctest.ai
GigaAM Multilingual:低資源言語向け音声基盤モデル
多言語ASRは語数を増やすだけでは十分ではありません。GigaAM Multilingual は、資源の少ない中央アジア言語に焦点を当て、データの偏りを抑える設計で性能向上を狙った研究です。
続きを読む多言語ASRは語数を増やすだけでは十分ではありません。GigaAM Multilingual は、資源の少ない中央アジア言語に焦点を当て、データの偏りを抑える設計で性能向上を狙った研究です。
続きを読むQwen の技術報告は、歌声を含む高品質な楽曲生成モデル Qwen-Music を紹介している。特徴は、旋律トークンによる計画を先に行い、その後に楽曲全体を生成・レンダリングする点だ。
続きを読むOSChina の要約によると、生成 AI 音楽プラットフォーム Suno で内部ソースコードとデータ収集関連情報が流出し、音楽・歌詞・音声素材を学習に使うため大規模に取得していた可能性が示された。
続きを読む404 Mediaの報道によると、ハッキングで取得されたSunoの資料には、YouTube Music、Deezer、Geniusなどから音源や歌詞を収集する指示が含まれていた。AI音楽モデルの学習データをめぐる著作権論争は、さらに具体的な局面に入った。
続きを読むMetaPerch は、動物の鳴き声そのものだけでなく、録音に付随する場所や時刻などのメタデータを学習に使う生物音響向け基盤モデルだ。現実の受動的音響モニタリングで問題になる分布変化への対応を狙っている。
続きを読むarXiv の新論文は、WavLM 表現と動的時間伸縮法を用いた、テキスト不要の第二言語音声評価を検証している。音素レベルの採点で高い性能を示し、リズムやイントネーション評価にも応用可能性を示した。
続きを読む