重拾音乐的温度:通过 AudioMuse-AI 构建真正直观的本地音乐库
死板的 ID3 流派标签正在扼杀你的本地音乐收藏。通过将 AudioMuse-AI 的先进音频分析技术与 Atlas Cloud 的可扩展 API 相结合,你可以将静态的媒体文件目录转化为深度直观的语义发现引擎,并将情感驱动的播放列表无缝导入你自托管的服务器中。
输入文稿挑个音色,或者描述一首曲子再填上词。来自 Google、xAI 和 MiniMax 的六个音频模型集中在一个工作台,每次生成都配一个播放器,听过再下载。
先给现成的文稿配音,再为这个场景配乐,全程不用换工具。
把文稿粘进来,AI 语音生成器就用你挑的音色读出来。xAI TTS v1 提供 80 多个音色、覆盖 20 种语言,还能自动识别语种。Gemini TTS 系列另有 30 个预置音色,用一句话说明语气和语速就能调。
开始渲染前可以先调整念法。xAI TTS v1 支持 0.7× 到 1.5× 的语速,还能做文本规范化,让数字和日期念得自然;导出支持 MP3、WAV、PCM、μ-law 和 A-law,最高 48 kHz。文稿最长 15,000 字符,大部分旁白一次就能出一个完整文件。
描述你要的曲子,想要人声就再填上歌词,AI 音乐生成器会返回一首编曲、混音都做好的完整歌曲,最长五分钟。MiniMax Music 3.0 和 2.6 能读 [Verse]、[Chorus] 这类结构标记,歌曲会照你写的段落走。
只需要给旁白垫一层底乐时,切到纯音乐模式;再按剪辑软件的要求选采样率和格式,从 16 kHz MP3 到 44.1 kHz WAV 都有。
四个语音合成模型加两个音乐模型。按音色范围、输出格式,或者你要配音的文稿长度来挑。
把要配音的文字粘进来,或者描述曲子风格,再填上带 [Verse]、[Chorus] 标记的歌词。
选好模型,语音就定音色、音乐就定要不要人声,再选导出格式。
用内置播放器听一遍,念得不对就重跑,满意了把文件下载下来接着剪。
挑一个最接近你工作的标签,看看生成的语音和音乐用在哪儿。
不用录音。把旁白粘进来,挑一个和画面搭的音色;剪辑改了就换稿子重跑。同一个模型能让视频的每个版本音色都一致。
一万字符的文稿一次跑完,有声书的一章或播客的一段直接出成一个文件,不用再把一堆小片段拼起来。念法想改,加一句风格说明再跑一次就行。
描述情绪,切到纯音乐模式,生成一段能垫在配音下面的底乐。brief 从欢快改成舒缓,换个描述就能在同一次会话里拿到新曲子。
把商品详情文案变成一段口述讲解,再配上一小段纯音乐。每个 SKU 都用同一个音色,整个商品库听起来就是一个品牌。
AI 音频生成器把写下来的内容变成声音。做语音就粘进文稿、挑一个音色;做音乐就描述曲子,需要的话再填歌词。模型渲染出文件,你按选好的格式下载。
Atlas Cloud 已接入六个音频模型:语音这边是 xAI TTS v1、Gemini 3.1 Flash TTS、Gemini 2.5 Flash TTS 和 Gemini 2.5 Pro TTS,音乐这边是 MiniMax Music 3.0 和 MiniMax Music 2.6。
看模型。xAI TTS v1 列出 80 多个音色,覆盖 20 种语言;Gemini TTS 系列提供 Kore、Puck、Charon 等 30 个预置音色,还能用一句自然语言指令调整语气。
Gemini TTS 系列每次请求最多 10,000 字符,xAI TTS v1 最多 15,000 字符,大部分旁白文稿一次就能跑完。
可以。当成 AI 歌曲生成器用时,MiniMax Music 3.0 和 2.6 接收一段风格描述加上带 [Verse]、[Chorus] 标记的歌词,返回一首约五分钟以内的完整人声歌曲。只要音乐不要人声,就切到纯音乐模式。
语音方面,Gemini 系列返回 24 kHz 的 WAV,xAI TTS v1 返回 MP3、WAV 或 PCM。音乐模型返回 MP3、WAV 或 PCM,采样率从 16 kHz 到 44.1 kHz。
可以。把语音文件下载下来,在数字人页签里传给数字人模型当音轨,它会让照片里的人物照着你的音频对口型。
语音合成按每 1,000 字符计费,音乐按次计费。你选中的模型具体多少钱,运行前就会在工作台里显示。
有。本页的每个语音和音乐模型都能通过 Atlas Cloud API 调用,鉴权方式和图片、视频接口完全一样。逛逛音频模型页面就能开始搭建。
音色横评、歌词写法和配音流程。