文章与教程

语音与音频

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 16 篇文章

CCTest · Blog
Suno给AI音乐加水印:从“生成热潮”走向合规压力测试
语音与音频
cctest.ai
语音与音频

Suno给AI音乐加水印:从“生成热潮”走向合规压力测试

面对流媒体平台上激增的AI音乐以及版权诉讼压力,Suno计划为模型生成的音频加入不可见水印,并限制部分下载行为。此举既是行业标签化趋势的一部分,也是一场关于AI音乐能否被平台、版权方和用户接受的合规实验。

阅读全文
CCTest · Blog
把“逐字稿风格”变成可控开关:新研究改进 ASR 逐字转写与词级时间戳
语音与音频
cctest.ai
语音与音频

把“逐字稿风格”变成可控开关:新研究改进 ASR 逐字转写与词级时间戳

nyra labs 的论文指出,现代 ASR 常把“逐字转写”和“整理后转写”混在一起学习,导致识别结果、WER 评估和词级时间戳都不稳定。研究尝试用任务 token 与交叉注意力微调,让模型按需输出可控的逐字稿或意图稿。

阅读全文
CCTest · Blog
GigaChat Audio:把“时间”写进长音频理解的开源大模型
语音与音频
cctest.ai
语音与音频

GigaChat Audio:把“时间”写进长音频理解的开源大模型

这篇工作聚焦长录音中的时间定位问题,提出一种面向音频的时间感知 LLM,能够在最长 120 分钟的输入中给出带明确时间戳的回答,并支持片段描述与摘要生成。 它的核心思路,是把周期性的时间标记与连续音频 token 交错输入,再借助大规模合成监督训练。

阅读全文
CCTest · Blog
黑客泄露文件揭开 Suno 训练数据来源:音乐 AI 的“合理使用”边界再受拷问
语音与音频
cctest.ai
语音与音频

黑客泄露文件揭开 Suno 训练数据来源:音乐 AI 的“合理使用”边界再受拷问

据 404 Media 报道,黑客取得的 Suno 文件显示,这家 AI 音乐生成公司曾从 YouTube Music、Deezer、Genius 等平台抓取大量音频和歌词。事件让 Suno 训练数据来源、版权抗辩和用户数据安全问题同时暴露在聚光灯下。

阅读全文