当AI音乐涌入电子乐:音乐人为何开始充当“鉴伪侦探”
生成式音乐工具降低了创作门槛,也让电子乐场景陷入“哪些作品是真人创作”的信任危机。越来越多音乐人开始根据声音瑕疵、视觉异常和平台特征,公开质疑疑似AI作品。
阅读全文生成式音乐工具降低了创作门槛,也让电子乐场景陷入“哪些作品是真人创作”的信任危机。越来越多音乐人开始根据声音瑕疵、视觉异常和平台特征,公开质疑疑似AI作品。
阅读全文LibriBrain100提供超过100小时的自然语音MEG记录,并同时覆盖单个受试者的深度数据与多受试者的广度数据。研究结果显示,规模化的被试内采集和跨被试迁移都能为神经语音解码带来价值。
阅读全文阿里巴巴推出 CosyVoice Studio,试图把语音识别、语音合成、音频创作与实时语音智能体整合到同一平台。其核心看点不只是“听得清、说得像”,而是把语义理解嵌入语音工作流。
阅读全文面对流媒体平台上激增的AI音乐以及版权诉讼压力,Suno计划为模型生成的音频加入不可见水印,并限制部分下载行为。此举既是行业标签化趋势的一部分,也是一场关于AI音乐能否被平台、版权方和用户接受的合规实验。
阅读全文SwanTale 试图把多说话人语音、环境音效与零样本音色复用放进同一个生成框架。它的重点不只是“像谁说话”,而是让创作者用自然语言同时描述角色、情绪、场景与声音内容。
阅读全文Fender CEO Edward “Bud” Cole在一场采访中将翻唱学习和乐队协作类比为“模拟AI”,相关说法近日被重新传播,引发吉他社区不满。争议背后,是音乐人对AI训练、版权与创作价值被简化的长期焦虑。
阅读全文Fenix Flexin 的《Rubberz》登上 Billboard Hot 100 后,迅速陷入“是否由 AI 生成”的争议。问题不只在风格突变,更在声音瑕疵、歌词结构、封面素材和现场表现之间形成了一组相互指向的疑点。
阅读全文约翰斯·霍普金斯大学等作者的研究指出,说话人匿名化并不只会受到单条语音中的音色残留影响。多条匿名化语音被聚合后,声学、韵律和文本线索仍可能帮助系统重新区分说话人。
阅读全文nyra labs 的论文指出,现代 ASR 常把“逐字转写”和“整理后转写”混在一起学习,导致识别结果、WER 评估和词级时间戳都不稳定。研究尝试用任务 token 与交叉注意力微调,让模型按需输出可控的逐字稿或意图稿。
阅读全文这篇工作把焦点放在多语种自动语音识别中最难的一块:长期被忽视的中亚语言。作者用大规模自监督预训练加上更精细的数据均衡策略,试图缓解“头部语言”对模型的挤压。
阅读全文这篇工作聚焦长录音中的时间定位问题,提出一种面向音频的时间感知 LLM,能够在最长 120 分钟的输入中给出带明确时间戳的回答,并支持片段描述与摘要生成。 它的核心思路,是把周期性的时间标记与连续音频 token 交错输入,再借助大规模合成监督训练。
阅读全文Qwen 团队发布 Qwen-Music 技术报告,展示了一个面向文本生歌与翻唱生成的音乐模型。其核心亮点是将旋律规划引入自回归音乐建模,并通过渲染模块补足高保真立体声细节。
阅读全文据 OSChina 摘要信息,生成式 AI 音乐平台 Suno 遭遇源码与数据采集信息泄露,被指曾从 YouTube Music、Deezer、Genius 等平台抓取音乐、歌词和音频素材用于模型训练。
阅读全文据 404 Media 报道,黑客取得的 Suno 文件显示,这家 AI 音乐生成公司曾从 YouTube Music、Deezer、Genius 等平台抓取大量音频和歌词。事件让 Suno 训练数据来源、版权抗辩和用户数据安全问题同时暴露在聚光灯下。
阅读全文一篇 ICML 2026 录用论文提出 MetaPerch,探索把地点、时间等录音元数据作为辅助监督信号,用于训练生物声学基础模型。它的核心问题不是“多听更多声音”,而是让模型理解声音背后的生态与地理语境。
阅读全文一篇 arXiv 新论文探索了无需文本和大量标注数据的二语口语评分方法。研究显示,基于 WavLM 表示与动态时间规整的语音比较,能在音素评分上达到很强表现,并对节奏与语调评估提供新路径。
阅读全文