音频模型
语音、音乐与音频理解模型 · 62 篇
站内搜索
搜索
2026年8月16日
音乐模型
11:06
ElevenLabs 上线 Sounds:免费 AI 音效与 Loop 库,文字描述即可生成新声音
3 次阅读
阅读全文
2026年8月15日
音乐模型
11:05
MiniMax Music 3.0 开源发布:8B+0.6B 双模型架构,最长5分钟完整歌曲生成,支持多语言人声
9 次阅读
阅读全文
2026年8月13日
语音模型
11:09
Deepgram 发布 Flux TTS:首个对话原生语音合成模型,80ms 延迟+跨轮次上下文,盲测击败 ElevenLabs
15 次阅读
阅读全文
2026年8月12日
语音模型
01:05
IndexTTS-2.5 开源发布:多语言零样本语音克隆,支持情感与语速精细控制
21 次阅读
阅读全文
2026年8月11日
语音模型
21:36
NVIDIA 开源全双工语音模型 VoiceChat 11B:一个模型替代 ASR+LLM+TTS 三件套,448ms 对话延迟还支持工具调用
8 次阅读
阅读全文
2026年8月8日
语音模型
11:22
阿里推出 CosyVoice Studio:国内首个 AI 语音生产力平台,Qwen-Audio-3.0 登顶全球
23 次阅读
阅读全文
2026年8月7日
音乐模型
11:11
Suno 宣布音频水印与透明性工具:AI 生成音乐将可被识别,下载政策同步收紧
14 次阅读
阅读全文
2026年8月6日
语音模型
11:39
字节 SeedRealtime 发布:首个音视频全双工大模型,AI 终于能「边看边听边说」
13 次阅读
阅读全文
2026年8月3日
语音模型
11:16
Irodori-TTS v4 Small 开源:766M 参数日语 TTS,用 Emoji 控制语气和拟声,零样本克隆最长 120 秒参考音频
20 次阅读
阅读全文
语音模型
01:11
Audio8 TTS 开源:0.6B 小模型实现 11 语言零样本语音克隆,RTF 仅 0.116
18 次阅读
阅读全文
2026年8月2日
语音模型
11:08
OpenAI 给 GPT-Live 语音加上隐形水印:SynthID 音频验证上线,EU AI Act 前一天踩点交付
12 次阅读
阅读全文
2026年8月1日
语音模型
11:14
Baseten 上线 Qwen3-TTS 语音克隆微调:三种克隆方式对比,SFT 模式 TTFA 快 16%
11 次阅读
阅读全文
已显示 12 / 62 篇文章
加载更多
加装
AI
助手
首页
大语言模型
生图模型
视频模型
音频模型
AI硬件
AI工具
本站经验分享
正在读取账户...