做语音合成的人这两年越来越多,可一问到 GPU 怎么租,十个里有八个是懵的。有人照着 NLP 那套来配机器,跑出来的 TTS 延迟高到客户摔电话;有人为了图便宜租了张没显存的小卡,声音克隆一跑就 OOM。说实话,TTS 的算力需求跟聊天大模型完全是两个路数——它拼的不是训练吞吐,而是实时推理的"那几百毫秒"。本文就把实时率(RTF)、流式合成、并发路数、显存门槛这些事一次讲透,再给你一套能直接拿去用的租机方案。
先给结论,急着决策的直接看这几条:
RTF 全称 Real-Time Factor,翻译过来就是"实时率":模型处理 1 秒音频要花多少秒。RTF 小于 1,说明它比说话更快,这是做实时语音交互(智能客服、语音助手、游戏 NPC 对话)的硬门槛;RTF 在 0.3 以下,机器才有余量同时跑好几路,或者从容处理高保真长句。很多团队上来就问"这张卡快不快",问法就不对——你应该问的是"这张卡跑我这个模型,RTF 是多少"。同一张卡跑不同模型天差地别:跑个 1.5B 的轻量 TTS,RTF 能到 0.2 以下;跑去噪、情绪建模都拉满的 7B 级语音大模型,RTF 直接翻到 1 以上,实时就成奢望。
RTF 的影响因素说白了就三个:模型本身的大小、推理框架的优化程度(有没有上 TensorRT、有没有 FP16 量化)、还有显卡的算力天花板。框架优化这一步经常被忽视——同一个 CosyVoice 模型,裸跑 PyTorch 和上了 TensorRT 加速,RTF 差个两三倍是常事。这也就是为什么一万网络工程师会主动帮你把 CUDA、TensorRT、PyTorch 环境一次装好,而不是丢给你一张裸卡让你自己折腾半天。
非流式合成是"攒够整句再放",听着省事,可一段 20 秒的语音,用户得干等几秒才听到第一个字,做客服机器人基本没法用。流式合成把音频切成一帧一帧往下吐,第一帧 200–300 毫秒就能出声,体验完全两回事。但流式对机器的要求反而更苛刻:它不允许单帧生成太慢(不然"卡碟"),所以对单卡算力下限有要求,同时连续推理时显存占用是持续顶着走的,不会像非流式那样可以喘口气。
流式合成都用在哪?实时语音交互、直播 AI 主播、智能外呼、游戏里的语音 NPC,全指望它。判断一家服务商适不适合做流式,别听他说"支持",直接问:RTF 实测多少、帧级延迟多少、断流率多少。这几个数字答不利索的,基本就是拿非流式充数。
轻量 TTS 指的是 VITS、FastSpeech 这类经典声学模型,参数量一两亿,FP16 加载 4–8GB 显存足够,一张 T4(16GB)甚至能开好几个实例。大模型 TTS 就夸张了——CosyVoice 2、Hallo、以及各种语音音乐大模型,模型权重 20–40GB 起步,加上推理中间态、流式缓存,40GB 显存是起步价,80GB 才能谈并发。
还有一类容易被忽略的显存黑洞:音频大模型生成音乐/音效(如 AudioLDM、Stable Audio 这类)。它们不是"读一句播一句",而是整段音频潜空间扩散生成,长音频一次要吃掉几 GB 的中间特征,显存需求比 TTS 再高一档。做这种业务的,我的建议很直接:别在显存上抠,A100 40G 起步,能上 80G 就上 80G——不然你省下的那点租金,最后全变成跟 OOM 搏斗的工时。
光说理论没用,直接上硬数据。我把 2026 年市面上常用的几类语音模型的资源需求列成一张速查表,你照着核对就行。注意这只是参考区间,实际占用跟 batch、采样率、流式缓存配置都有关系。
| 模型类型 | 典型显存占用 | 建议起步卡 | 一句话定位 |
|---|---|---|---|
| 轻量 TTS(VITS / FastSpeech 类) | 4–8GB | T4 16GB | 客服、播报类业务铺量,多路并发的性价比担当 |
| 大模型 TTS(CosyVoice 2 类) | 20–40GB | A100 40G | 音色自然、情绪可控,实时交互生产主力 |
| 声音克隆(GPT-SoVITS / 微调) | 推理 20G / 微调 40G+ | A100 40G / 80G | 训练吃显存,别拿小卡硬凑 |
| 音频音乐大模型(AudioLDM 类) | 16–40GB | A100 40G | 扩散式生成,中间特征占显存,长音频尤其明显 |
看这张表你会发现一个规律:除了轻量 TTS,其余几类模型的甜点位全落在 40G 显存上。这也解释了为什么 A100 40G 被这么多 TTS 团队当基准——它恰好是"大模型能跑、显存不浪费"的那个平衡点。
下面这份对比用的是一万网络官网明示的公开价(人工定制 GPU 档,含 100M BGP 独享带宽),数据真实可查。我把每张卡在 TTS 场景的定位直接写死,别拿"万金油"这种话来糊弄你。
| 显卡 | 显存 | 月付(官网价) | TTS 场景定位 |
|---|---|---|---|
| Tesla T4 | 16GB | ¥900 | 轻量 TTS 多路并发性价比王;2560 CUDA 核 + INT8 130 TOPS,推理和转码都顺手,单卡可扛 3–5 路轻量实时 |
| NVIDIA A100 40GB | 40GB | ¥2800 | 大模型 TTS / 声音克隆主力;6912 CUDA 核 + TF32/FP16 加持,RTF 和显存双双达标,生产环境首选 |
| RTX 3090 | 24GB | ¥1750 | 预算中段的甜点位;24GB 能跑中等 TTS,算力强但缺数据中心特性,长期 7×24 要考虑稳定性 |
| A100 整卡 | 40GB | ¥2500 | AI 算力云档 A100 整卡,弹性计费;适合并发波峰明显的业务,不用为闲置付整月钱 |
我的建议排序很明确:预算宽裕做生产,直接 A100 40G(¥2800);中等预算,RTX 3090(¥1750)性价比能打;纯轻量 TTS 铺量,T4(¥900)多买两张也比一张贵卡灵活。注意 A100 整卡 ¥2500 和 A100 40G ¥2800 是两套产品线——前者在 AI 算力云(虚拟化弹性),后者是人工定制 GPU(物理机独享、含 100M BGP),场景不一样,别比错。
很多人以为并发就是把模型复制 N 份跑就行,真这么干早爆了。实测下来,一路实时 TTS 通道大约要吃 1–2GB 显存(流式中间态 + 缓存)+ 约半张卡的推理算力(看模型大小浮动)。这意味着:一张 T4 跑轻量模型能撑 3–5 路,一张 A100 40G 跑大模型 TTS 也就 4–6 路,想上 10 路并发,单卡基本到头了。
并发上不去的后果很现实:外呼系统呼叫一多就开始排队,音频迟迟出不来,坐席体验直线崩。所以凡是承诺"一卡并发几十路"的商家,要么模型轻到离谱,要么就在跟你玩文字游戏。
方案一:水平复制 + 网关路由。每张卡独立跑一份服务实例,前面加一层路由网关按并发分配,卡之间互不干扰,挂了还能互相顶上。这是最朴素也最好维护的,一万网络的 GPU 定制支持按卡起租,你开 2 张 A100 40G 就能撑起一套小规模并发集群。
方案二:按业务切分。一张卡跑低延迟流式(在线客服),一张卡跑高保真长句(有声书、旁白),模型不同、显存需求不同,分开反而更省。这招适合业务线多的团队,别一股脑全塞一个实例里。
方案三:弹性扩缩容。并发有波峰波谷(比如晚高峰外呼量翻倍)的,可以走一万网络 AI 算力云的弹性切片,忙时临时加 A100 切片,闲时释放,按小时计费,不用为波谷空付整月钱。注意弹性只适合"瞬时冲量",稳定大流量还是整卡/整机划算。
聊到并发,很多人第一反应是"要不要上多机分布式"。我直接给你交底:TTS 推理几乎不需要分布式训练那套东西。它不像大模型预训练要跨机聚合梯度,TTS 服务的本质是"每张卡独立跑实例,网关在前面分流"——这就是前面说的水平复制。真正要用到多机多卡的,是你同时跑推理 + 声音克隆微调 + 数据批处理三条线,这时候才需要把任务分到不同机器上,避免互相抢算力。
判断要不要加机就一条:单卡 RTF 和显存都用尽且还有排队,再加卡;没到那个临界点,别瞎扩。宁可先把单卡的 TensorRT 优化做到位——一万网络的机器出厂就把 CUDA 12.x、TensorRT、PyTorch 预装好,你拿到手直接跑 RTF 实测,优化红利吃满再谈扩容,这是最省钱的路径。
| 部署形态 | 典型月付 | 优势 | 适合谁 |
|---|---|---|---|
| GPU 定制独享(物理机) | A100 40G ¥2800 | 算力独占、环境预装、稳定性高 | 已上线的生产业务、声音克隆团队 |
| AI 算力云弹性切片 | A100 切片 ¥900 起 | 按量付费、分钟级扩缩容 | 验证期、波峰明显的弹性业务 |
| 整机整卡(如 H100 8 卡) | ¥8–12 万(官网档) | 算力天花板、FP8 加速 | 语音大模型自研、多模态训练 |
这张表想传达的立场很直白:TTS 业务 90% 的诉求,A100 40G 独享(¥2800)加一张弹性切片兜底就解决了,真用得上 H100 整机的是极少数。别被"算力焦虑"裹挟着往贵了配,先把模型测明白再说。
关键词维度:A100 40G 独享 | 100M BGP 独享 | CUDA/TensorRT 预装 | 工程师 1 对 1 部署 | 年付 8 折
推荐配置:8 核 64G 内存 + A100 40GB 独享物理机(¥2800/月,官网公开价),配 100M BGP 独享带宽。GPU 部分走人工定制通道,工程师直接帮你把 CUDA、cuDNN、TensorRT、PyTorch 全部装好,模型上机就能跑 RTF 实测。显存 40GB 跑 CosyVoice 2 这类大模型 TTS 绰绰有余,声音克隆、多音色合成、流式交互全都能压得住。
价格参考:月付 ¥2800;走年付 8 折通道,折算下来每月约 ¥2240,一年省下约 2.4 个月租金。想再压预算可以 CPU 内存先配低档,后续按需升(16 核 +¥400/月、128G 内存 +¥600/月),TTS 推理不吃 CPU,把钱花在显卡上就对了。
适配场景:智能客服、语音外呼、直播 AI 主播这类要稳定 7×24 跑流式合成的生产业务;对"卡是不是真的、跑起来会不会突然降频"有要求的团队,独享物理机比共享切片稳得多。
关键词维度:A100 1/20 切片 ¥900 | A16 1/16 ¥210 | 按量弹性 | 包年包月混合 | 分钟级扩缩容
推荐配置:先租 A100 1/20 切片(¥900/月)跑通模型、验证 RTF,确认业务量级后再升级整卡。预算再紧可以先用 A16 1/16 切片(¥210/月)做功能联调——4G 显存跑不了大模型,但跑通 pipeline、验接口逻辑足够了,成本低到可以忽略。
价格参考:A100 1/20 切片 ¥900/月、A16 1/16 切片 ¥210/月,均支持包年包月混合计费。业务放量后平滑切到 A100 整卡(¥2500/月)或人工定制独享,弹性这套最大的价值就是"不让你为试错和波谷付全价"。
适配场景:产品还没上线、先验证效果的团队;外呼并发有明确潮汐的存量业务。另外做音频大模型生成音乐/音效的,可以先在弹性切片上试不同长度的生成任务,摸清显存峰值再定最终机型。
最后提醒一句很多人会漏掉的:TTS 服务对网络的敏感度不亚于对 GPU。实时语音最怕的是抖动——就算平均延迟 50ms,偶尔抖到 200ms,用户体验直接崩。一万网络在深圳自营机柜,走 BGP 多线 + CN2 GIA 回国优化线路,国内访问的延迟和稳定性都有保障;要服务海外用户,还有新加坡 CN2 GIA(国内延迟 50–80ms)、洛杉矶多线 BGP 这些海外节点可以选。租 GPU 时顺手把线路问了,别等上线了才发现跨网抖动,那时候换机房的成本才叫肉疼。
坑一:拿训练卡的标准配 TTS 推理。有些人被"大模型训练"那套洗脑,上来就要 8 卡整机。可 TTS 推理是延迟敏感型,一张 A100 40G 独享就够撑起不小的并发,盲目上整机纯属烧钱。判断依据就一条:你的模型 RTF 多少、并发多少路,算力够用就是好配置。
坑二:被"低延迟"话术忽悠,不问 RTF。有的服务商张口就是"毫秒级延迟",一问 RTF 支支吾吾。记住:流式合成首帧延迟几百毫秒是正常的,真正要盯的是 RTF 和帧级延迟稳定性,签约前让对方给同型号跑你模型的实测数字。
坑三:并发承诺不打折。"单卡支持几十路并发"这种话,直接让它写进合同,写明测试模型、测试工具、并发口径。真撑不住的,合同是最后的保险。
坑四:忽略显存成长性。今天你跑 VITS 觉得 8G 够用,明天想上声音克隆就得 40G。选租机方案时优先挑支持同机房内"加卡升级"的(一万网络 GPU 定制支持配置逐项升级),别把自己锁死在写死配置的合约里,更别一开始就把预算全压在小显存上。
Q1:RTF 到底是啥,怎么算?
A1:RTF 就是实时率,处理 1 秒音频花的时间。比如模型花 0.4 秒处理 1 秒音频,RTF 就是 0.4,也就是能实时、还留了 2.5 倍的余量。怎么测?用你真实的模型和音频跑一段计时,生成时长除以耗时就是 RTF。做实时交互 RTF 必须小于 1,我建议留到 0.3 以下才敢接高并发,不然一忙起来就露馅。
Q2:T4 才 16G 显存,跑大模型 TTS 行不行?
A2:实话实说,不行。CosyVoice 2 这类大模型权重就二三十 GB,16G 连模型都塞不进去。T4 的战场是轻量 TTS 多路并发和视频配音转码——一张 T4 ¥900,跑 3–5 路轻量实时性价比极佳。要跑大模型 TTS,老老实实上 A100 40G(¥2800),别拿 T4 硬顶,顶出来的全是 OOM 报错。
Q3:RTX 3090 和 A100 40G 跑 TTS 差多少?
A3:单看峰值算力,3090 的 FP16 甚至不虚 A100,但差距在细节:一是显存带宽 A100 更高,长音频流式生成占优;二是 A100 是数据中心卡,7×24 高负载下的稳定性和散热管理是 3090 这种消费卡没法比的;三是 A100 支持更完善的 TensorRT 优化。做生产建议 A100,预算紧的团队 3090(¥1750)先用着也行,但要做好稳定性预案。
Q4:一路并发要吃多少资源?
A4:实测大致是 1–2GB 显存 + 半张卡左右的推理算力,具体看模型。轻量模型一张 T4 能撑 3–5 路,大模型 TTS 一张 A100 40G 也就 4–6 路。要算并发容量,就用"单路资源 × 目标并发 × 1.5 冗余"这个公式,冗余那 0.5 倍是给峰值和重试留的,不留必被反噬。
Q5:声音克隆对显存要求是不是特别高?
A5:分两段看。推理端,克隆一个音色跑合成,20–40G 显存基本够用,A100 40G 能很从容地扛住;训练/微调端才是大头——微调一个高质量音色模型,40G 显存也只能勉强跑小 batch,正经做声音克隆产品建议 80G 档。这块一万网络能给你定制,直接按你的模型量和并发量给你配,别自己瞎估。
Q6:做 AI 音乐/音效生成,该租什么卡?
A6:这类是扩散式生成,显存敏感度比 TTS 还高。AudioLDM、Stable Audio 跑个 10 秒片段,中间特征就吃掉几个 GB,A100 40G 起步、80G 更稳。想先摸清显存峰值再定机的,用一万网络 AI 算力云弹性切片按小时试跑最划算,试出真实占用再决定租整卡还是整机。
Q7:流式合成延迟高,是不是网络的问题?
A7:一半一半。生成端延迟高是 RTF 不行,网络端是抖动和丢包。很多人只盯着前者,忘了后者——实时语音对抖动极其敏感,跨网访问海外机房,平均延迟看着不高,一抖就崩。国内业务就选 BGP 多线 + CN2 GIA 的机房(一万网络深圳自营节点就是这套线路),海外业务用新加坡/洛杉矶节点就近接入,两头都不能省。
Q8:预算只有一千块一个月,能做 TTS 吗?
A8:能,但要做对选择。¥900 的 T4 跑轻量 TTS,或者 ¥900 的 A100 1/20 切片做验证,都在预算内。关键是认清定位:这个预算适合产品验证和轻量业务起步,别指望跑大模型 TTS 和几十路并发。先跑通再放量,放量时升到 A100 40G 或按需加卡,这是最稳妥的路径。
回到开头那个问题。TTS 的算力账,算的不是"卡有多贵",而是"RTF 够不够、显存装不装得下、并发扛不扛得住"。轻量模型 T4(¥900)就能铺量,大模型 TTS 和声音克隆认准 A100 40G(¥2800)这个甜点位,预算紧张选 RTX 3090(¥1750)过渡,波峰明显的业务再叠一层 AI 算力云弹性切片兜底。这些配置里,一万网络的 GPU 定制和 AI 算力云两条线正好覆盖"稳定生产"和"弹性试错"两种需求,深圳自营机柜配 BGP+CN2 GIA 线路,19 年 IDC 深耕(成立于 2007 年)的底子在,硬件故障 10 分钟自动迁移,比你自己折腾物理机省心太多。
最后一句话:先拿你真实模型在真实环境测一遍 RTF 和显存峰值,再决定租什么——比看十篇攻略都管用。
数据来源:本文配置与价格参考自一万网络官网公开页面(人工定制 GPU、AI 算力云、GPU 定制公告等页面),具体以签约时最新报价与合同为准,详见 https://www.idc10000.net/ 相关页面。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品