AI 음악 확산에 EDM 뮤지션들이 ‘감별사’가 된 이유
생성형 음악 도구가 전자댄스음악 제작의 문턱을 낮추는 동시에, 누가 실제로 곡을 만들었는지를 둘러싼 불신도 키우고 있다. 일부 뮤지션은 음향 결함과 영상의 이상 징후를 바탕으로 의심스러운 곡을 추적하기 시작했다.
더 보기생성형 음악 도구가 전자댄스음악 제작의 문턱을 낮추는 동시에, 누가 실제로 곡을 만들었는지를 둘러싼 불신도 키우고 있다. 일부 뮤지션은 음향 결함과 영상의 이상 징후를 바탕으로 의심스러운 곡을 추적하기 시작했다.
더 보기LibriBrain100은 32명이 자연스러운 연속 음성을 듣는 동안 수집한 100시간 이상의 MEG 데이터를 제공한다. 한 참가자의 깊은 데이터와 다수 참가자의 폭넓은 데이터를 함께 구성해 재현 가능한 신경 음성 디코딩 평가를 지원한다.
더 보기알리바바가 음성 인식, 음성 합성, 오디오 콘텐츠 제작, 실시간 음성 에이전트를 통합한 CosyVoice Studio를 공개했다. 핵심은 단순 전사나 합성이 아니라 음성 흐름 전반에 의미 이해를 결합했다는 점이다.
더 보기AI 생성 음악이 스트리밍 플랫폼에 대량 유입되고 저작권 소송이 이어지는 가운데, Suno가 생성 음원에 보이지 않는 워터마크를 넣고 다운로드 제한을 강화하겠다고 밝혔다. 이는 AI 음악 서비스가 출처 표시와 남용 방지라는 새로운 기준에 맞춰 재정비되는 흐름을 보여준다.
더 보기SwanTale은 단일 화자의 TTS를 넘어 여러 인물의 말투, 감정, 환경음, 효과음을 함께 생성하려는 연구다. 지시문 기반 생성과 참조 음성을 활용한 제로샷 생성을 하나의 프레임워크에서 다룬다.
더 보기Fender CEO Edward “Bud” Cole이 커버곡 학습과 밴드 협업을 ‘아날로그 AI’에 비유한 발언이 다시 확산되며 음악인들의 반발을 사고 있다. 논란은 AI 음악, 저작권, 인간 창작의 가치가 충돌하는 지점을 보여준다.
더 보기Fenix Flexin의 ‘Rubberz’가 Billboard Hot 100에 진입한 뒤 생성형 AI로 만든 곡이 아니냐는 의혹이 커지고 있다. 논란은 갑작스러운 장르 변화뿐 아니라 음원 아티팩트, 가사, 이미지 자료, 라이브 재현성까지 이어진다.
더 보기새 연구는 목소리 자체를 익명화하더라도 여러 발화가 모이면 화자 식별 단서가 다시 강해질 수 있음을 보여준다. 음향, 운율, 언어 정보가 결합되면 익명화된 음성의 프라이버시 위험은 더 커진다.
더 보기nyra labs 논문은 현대 ASR 모델이 축어 전사와 의도 전사를 혼합된 잠재 변수처럼 다루면서 출력 안정성, WER 평가, 단어 단위 시간 정보에 문제가 생긴다고 지적한다. 연구진은 태스크 토큰과 cross-attention 미세조정으로 전사 방식을 명시적으로 제어하는 접근을 제안했다.
더 보기다국어 ASR은 언어 수가 많다고 해서 자동으로 고르게 잘 동작하지 않습니다. GigaAM Multilingual은 중앙아시아 저자원 언어를 대상으로 데이터 편향을 줄이는 학습 전략을 제시합니다.
더 보기이 연구는 긴 녹음에서 무엇을 말했는지뿐 아니라 언제 발생했는지도 답하는 음성 LLM을 제안한다. 최대 120분 입력에 대해 명시적인 타임스탬프가 포함된 응답을 생성할 수 있다. 핵심은 주기적 시간 마커를 연속 음성 토큰과 교차 배치하고, 대규모 합성 감독으로 학습하는 방식이다.
더 보기Qwen이 공개한 Qwen-Music 기술 보고서는 보컬이 포함된 고음질 노래 생성을 목표로 한다. 핵심은 멜로디 토큰 기반 계획을 먼저 수행한 뒤 전체 곡과 스테레오 음향을 완성하는 구조다.
더 보기OSChina 요약에 따르면 생성형 AI 음악 플랫폼 Suno에서 내부 소스코드와 데이터 수집 관련 정보가 유출됐으며, 음악·가사·오디오 자료를 모델 학습에 활용하기 위해 대규모로 수집했다는 정황이 드러났다.
더 보기404 Media 보도에 따르면 해킹으로 확보된 Suno 자료에는 YouTube Music, Deezer, Genius 등에서 음악과 가사를 수집하는 지시가 포함돼 있었다. 이번 사안은 AI 음악 학습이 공정 이용인지, 무단 수집인지에 대한 논쟁을 더 구체화한다.
더 보기MetaPerch는 동물 소리 자체뿐 아니라 녹음 위치와 시간 같은 메타데이터를 보조 감독 신호로 활용하는 생물음향 파운데이션 모델이다. 실제 수동 음향 모니터링에서 중요한 분포 변화와 도메인 이동에 대응하는 데 초점을 맞춘다.
더 보기arXiv 논문은 WavLM 표현과 동적 시간 워핑을 활용해 텍스트 없이 제2언어 음성을 평가하는 방법을 탐구한다. 음소 평가에서는 강한 성능을 보였고, 리듬과 억양 평가로 확장할 가능성도 제시했다.
더 보기