做过推荐系统的人都知道,线上推荐管线分两段:前半段是实时特征工程——用户点了个商品,你得在几十毫秒内把用户画像、商品属性、上下文特征拼出来,做 embedding lookup、特征交叉、归一化;后半段是模型推理——把拼好的特征喂进 DIN、DIEN、DLRM 这些模型,算出一个推荐分数。两段对 GPU 的需求完全不一样。
特征工程阶段,GPU 主要干 embedding 查找和特征转换的活,请求量大、单个请求小、延迟要求极高(个位数毫秒到十几毫秒),对显存带宽和 I/O 吞吐要求高,但对算力(TFLOPS)要求不高。推理阶段正好相反,模型越来越深、参数越来越多,DLRM 的参数量动辄几十亿,每次前向传播都要大量矩阵乘法,对算力要求极猛,显存带宽也不能低。
很多团队在选 GPU 服务器时只盯着"推理"算力,忽略了特征工程阶段的瓶颈,结果上线后发现 embedding 层扛不住、CPU 被打满、GPU 闲得发慌——钱花了,效果没出来。这篇文章把两阶段拆开,分别算账。
核心要点速览:
推荐系统的特征工程,分成离线批量处理和在线实时处理两部分。离线那部分用 Spark/Flink 跑,CPU 集群搞定,跟 GPU 没关系。但线上实时处理——用户请求来了,几十毫秒内要把几十个特征字段拼成模型能吃的 tensor——这里 GPU 开始介入。
具体来说,实时特征工程里 GPU 的活有三块:
第一块是 embedding lookup。用户 ID、商品 ID、类目 ID 这些离散特征,要通过 embedding 表映射成稠密向量。淘宝的推荐系统维护着几十亿行、每行 64–128 维的 embedding 表,总参数规模几十 GB 甚至上百 GB。这玩意儿放 CPU 内存里,每请求查几百次,内存带宽扛不住。业界做法是把 embedding 表塞进 GPU 显存,靠 GPU 的高内存带宽做并行查找。A100 40G 的 HBM2e 带宽 2TB/s,比 DDR4 快 10 倍以上,查 embedding 的延迟能压到个位数毫秒。
第二块是特征交叉与转换。用户近 30 天点击序列、商品共现关系这些,要实时做交叉统计、归一化、离散化。这部分计算逻辑简单但数据量大,对 GPU 算力要求低,但对显存带宽和内存容量要求高。
第三块是小 batch 的预推理。有些团队会在特征工程阶段用一个小模型做候选集粗排,把候选从几千降到几百。粗排模型通常很小(几层 MLP),但请求量大,对 GPU 的吞吐和延迟很敏感。
特征工程阶段对 GPU 的核心要求,按优先级排:显存带宽 > 显存容量 > FP32 算力 > INT8 算力。T4 的 320GB/s 带宽在推理卡里算中等,但它的 INT8 130 TOPS 在粗排场景很有用;A100 的 2TB/s 带宽是天花板级别,适合大规模 embedding 场景。
推荐系统的在线推理,2026 年主流模型已经迭代到 DLRM-v2、DIN 变体、多任务多目标模型。一个典型的 DLRM 推荐模型,参数规模在 10–100 亿之间,每次前向传播需要做:
推理阶段对 GPU 的要求跟特征工程刚好反过来:FP16/FP32 算力 > 显存容量 > 显存带宽。因为推理是 batch 处理的——线上通常把多个请求拼成一个 batch(比如 batch size = 64–256)一起推理,矩阵乘法的计算密度高,对 TFLOPS 的需求远大于对带宽的需求。
讲个具体的例子。一个 50 亿参数的 DLRM,用 FP32 推理,单次前向传播的理论计算量大约 50 GFLOPs。在 A100 上,FP32 算力 19.5 TFLOPS,理论上每秒能跑 390 次前向。但实际线上 batch size 256 时,一次推理算 12.8 TFLOPs,A100 每秒能处理约 1500 个 batch——折合每秒 38 万请求。如果用 T4(FP32 8.1 TFLOPS),同样的 batch 每秒只能处理 630 个 batch,约 16 万请求。吞吐差了一倍多。
所以推理环节的 GPU 选型,核心是算力匹配并发量。并发量低的场景,T4 完全够用;日均千万级请求的推荐系统,A100 是标配;上亿级请多多考虑多卡 A100 或 H100。
推荐系统线上推理的延迟预算,行业标准从几年前 50ms 压到了 2026 年的 20–30ms。P99 延迟超了 30ms,用户能明显感觉到推荐内容"卡了一下"——刷短视频时刷不出来、商品推荐页加载卡顿,都是推理延迟超标的直接后果。
延迟预算的分配大概是:特征工程 5–10ms,模型推理 10–15ms,后处理+排序 5ms。加起来 20–30ms。GPU 选型直接决定了模型推理那段能不能压进 10ms。T4 在 batch size 64 时跑 DLRM 推理约 8–12ms,刚好卡在及格线。A100 同样的 batch size 只要 3–5ms,余量充足。想要 P99 压在 20ms 以内,A100 几乎是唯一选择。
但也别走极端——有人为了压 P99 延迟,直接上 H100,结果 H100 跑推理的 FP32 算力 67 TFLOPS,单次推理延迟 2ms 以内,但成本是 A100 的 5 倍。对推荐系统来说,P99 20ms 和 P99 18ms 在实际体验上几乎没有区别,为这 2ms 多花几倍的钱不划算。
还有个细节:推理延迟跟 batch size 的关系不是线性的。batch size 从 64 翻到 128,推理延迟只涨 30–50%,但吞吐翻倍。所以调优的时候,先找 batch size 和延迟的拐点,再决定要不要升级 GPU。一万网络支持 GPU 定制年付 8 折,可以先按月付试跑、调优、再切年付锁成本,不浪费。
2026 年推荐系统的线上部署架构,分成三种主流范式,每种对 GPU 的用法不一样。
范式一:纯 CPU 特征工程 + GPU 推理。这是最传统的做法。特征工程全部在 CPU 集群上跑,拼好特征后通过 RPC 送到 GPU 推理服务。好处是架构简单、CPU 集群便宜;坏处是特征工程延迟高(CPU 做 embedding lookup 要 5–10ms),而且 CPU 到 GPU 的数据传输延迟又加 1–2ms。适合 embedding 表小于 1 亿行的小规模场景。
范式二:GPU 做特征工程 + GPU 推理。embedding 表直接放 GPU 显存里,特征工程和推理都在 GPU 上完成。特征工程延迟从 5–10ms 压到 0.5–2ms,端到端延迟能控制在 15ms 以内。这是 2026 年头条、快手、拼多多这些大厂的标配做法。需要 T4 或 A100 做特征工程,另配 A100 做推理。
范式三:全 GPU 流水线。特征工程、粗排、精排、重排全链路都在 GPU 上跑,甚至用 GPU 做实时特征存储。这种架构的端到端延迟能压到 10ms 以内,但成本极高,只有日均亿级请求的超大型平台才需要。一万网络提供 A100 和 H100 多卡方案,可以支撑这种架构的部署。
| 显卡型号 | 显存 | 显存带宽 | FP32 算力 | 特征工程适配 | 推理适配 | 月付参考价 |
|---|---|---|---|---|---|---|
| NVIDIA T4 | 16GB GDDR6 | 320 GB/s | 8.1 TFLOPS | ★★★ 中等规模 embedding 够用 | ★★★★ 推理性价比之王 | ¥900/月(官网价) |
| RTX 3090 | 24GB GDDR6X | 936 GB/s | 35.6 TFLOPS | ★★★★ 大带宽适合大 embedding 表 | ★★★ 算力够但无 NVLink | ¥1,750/月(官网价) |
| V100S | 32GB HBM2 | 1,134 GB/s | 17.1 TFLOPS | ★★★★ 带宽高,适合 embedding | ★★★ 中规中矩 | ¥1,500/月(官网价) |
| A100 40G | 40GB HBM2e | 2,000 GB/s | 19.5 TFLOPS | ★★★★★ 万级 embedding 标配 | ★★★★★ 推理旗舰 | ¥2,800/月(官网价) |
| RTX 4090 | 24GB GDDR6X | 1,008 GB/s | 82.6 TFLOPS | ★★★★ 性价比高,但无 NVLink | ★★★★ 算力强但显存偏小 | 约 ¥2,800–3,500(预估,以咨询为准) |
| H100 SXM | 80GB HBM3 | 3,350 GB/s | 67 TFLOPS | ★★★★★ 天花板级,但太贵 | ★★★★★ 极致吞吐 | 整机约 ¥8–12万/月(官网价),单卡切片约 ¥1.2–1.8万(预估,以咨询为准) |
关键结论:特征工程选卡,先看显存带宽再算算力,T4 走中低规模、A100 走大规模;推理阶段选卡,先看算力再看显存容量,并发量不大用 T4 足够,日均千万级用 A100 单卡或多卡。别拿 H100 做纯推理,浪费钱——H100 的 FP8 加速在推理场景用不上,除非你的推荐模型是 100 亿参数以上的超大 DLRM。另外注意一点:RTX 3090 虽然显存带宽高(936 GB/s),但没 NVLink,多卡分布式推理时通信走 PCIe,延迟高不少。如果计划做多卡推理,优先选 A100 或 T4 的 NVLink 版本。
很多团队图省事,特征工程和推理共用同一批 GPU。这其实不划算。特征工程卡的利用率通常只有 30–50%(因为主要瓶颈在 I/O 和带宽),推理卡利用率能到 70–80%。混在一起,特征工程吃掉了推理的卡,导致推理延迟飙升。
| 方案 | GPU 配置 | 月租参考 | 延迟表现 | 适配场景 |
|---|---|---|---|---|
| 合二为一 | 4×A100 40G 共用 | 约 ¥11,200/月 | P99 50–80ms(特征工程争抢) | 小团队、日均百万级请求 |
| 分离配置 | 特征工程 2×T4 + 推理 2×A100 | 约 ¥7,400/月 | P99 15–30ms(互不干扰) | 中型团队、日均千万级请求 |
| 分离配置升级 | 特征工程 2×A100 + 推理 4×A100 | 约 ¥16,800/月 | P99 10–20ms | 大型平台、日均亿级请求 |
分离配置不仅延迟更低,月总成本反而便宜——因为 T4 单卡才 ¥900,两卡才 ¥1,800,比用 4 张 A100 做特征工程省了将近 ¥8,000。一万网络的人工定制 GPU 和 AI 算力云都支持单卡独立租用,T4 整卡 ¥900/月、A100 整卡 ¥2,500/月,特征工程和推理可以分开配,不用绑定整机。
关键词维度:T4 16GB | 320GB/s 显存带宽 | INT8 130 TOPS | ¥900/月 | 含 100M BGP 独享 | 年付 8 折
推荐配置:8 核 64G 内存 / 50G 系统盘 + 200G 数据盘 / Tesla T4 16GB / 100M BGP 独享带宽。CUDA 12.x + TensorRT 预装,工程师 1 对 1 部署,开机即用。每款限售 80 台。
价格参考:单卡月付 ¥900(官网价),年付 8 折仅 ¥8,640/年。如果特征工程阶段需要 2 张 T4 做 embedding 分片,月付 ¥1,800,年付不到 ¥17,280。
适配场景:日均百万级请求的中小电商推荐系统,特征工程 embedding 表规模 < 3 亿行、每行 64 维的场景。T4 的 16GB 显存能装下约 2.5 亿个 64 维 float32 embedding,够大多数中小平台用了。推理阶段并发量不大(< 500 QPS)时,T4 也能直接跑推理。
关键词维度:A100 40GB | 2TB/s 带宽 | 6912 CUDA | TF32 加速 | ¥2,800/月 | 年付 8 折
推荐配置:8 核 64G 内存 / 200G 系统盘 + 200G 数据盘 / NVIDIA A100 40GB / 100M BGP 独享带宽。支持升级 CPU 16 核(+¥400/月)、内存 128G(+¥600/月)、硬盘 1T(+¥300/月)、带宽 200M(+¥400/月)。
价格参考:单卡月付 ¥2,800(官网价),年付 8 折 ¥26,880(预估)/年。同账户复购再减 ¥100/月/卡,可叠加。建议特征工程配 2 张 A100(¥5,600/月),推理配 4 张 A100(¥11,200/月),分离配置总月租 ¥16,800,年付约 ¥16万(预估价格,实际以核算为准)。
适配场景:日均千万级到亿级请求的大型推荐平台。A100 的 40GB 显存可承载 6 亿+ 行 64 维 embedding 表,2TB/s 带宽保证 embedding lookup 延迟在 5ms 以内。推理阶段 TF32 算力 156 TFLOPS(稀疏),batch size 256 时单卡可支撑 1,500+ QPS。
如果你的推荐系统还在早期阶段,不确定特征工程到底需要多少 GPU 算力,一万网络的 AI 算力云支持 A100 1/20 切片(4G 显存 ¥900/月)、RTX 3090 整卡(24G ¥1,750/月)等弹性方案。先租 1 片跑 Embedding 测试,扛不住了再升级到整卡,不用一上来就绑整机。
为什么坑:H100 训练确实猛,但它的 FP8 核心在推理场景用不上——推荐模型推理主流还是 FP32/FP16。H100 推理时 FP32 算力 67 TFLOPS,A100 是 19.5 TFLOPS,差 3 倍多,但价格差了 5 倍以上。用 H100 做推理,ROI 算不过来账。
怎么避:推理场景首选 T4(低并发)或 A100(高并发)。特征工程 embedding 表特别大(> 100 亿行)才考虑 H100 MIG 切片。
为什么坑:不少团队图省事,把 embedding 表放 CPU 内存,每次推理前从 CPU 拷到 GPU。DDR4 带宽 50–100 GB/s,GPU 显存带宽 1–2 TB/s,差 20 倍。embedding 查找延迟直接翻到 50ms+,P99 延迟直接崩。
怎么避:embedding 表必须放 GPU 显存里。选显存带宽高的卡(A100 / V100S / RTX 3090),选显存容量大的卡(40G+)。如果显存不够,用 NVLink 跨卡共享 embedding 表。
为什么坑:有人想着省钱,T4 和 A100 混在一起做推理,觉得反正都是 NVIDIA 卡。但不同卡型之间 NVLink 带宽不同,通信延迟不对称,慢卡拖慢快卡,整体吞吐反而下降。
怎么避:推理集群统一卡型,要么全 T4 要么全 A100。一万网络支持整机同型配置,不会出现混卡问题。
为什么坑:推荐系统是 IO 密集型——特征工程阶段要频繁读取外部存储(Redis、HBase、Kafka),单机 100M 带宽在大规模特征工程场景下就是瓶颈。一个 100M 端口实际可用吞吐约 11 MB/s,跑 embedding 的 IO 压力大了直接堵死。
怎么避:特征工程服务器建议选 200M 或 1G 带宽。一万网络支持带宽升级(200M +¥400/月、更高带宽可定制),且为 BGP 多线 + CN2 GIA 回国线路,延迟稳定。
为什么坑:PyTorch 直接跑推理,跟 TensorRT 优化后跑推理,延迟能差 2–5 倍。很多团队租了卡发现延迟不达标,以为是卡不够,其实是推理引擎没优化。
怎么避:一万网络提供工程师 1 对 1 预装 TensorRT 并做模型优化,帮你把模型转成 TensorRT engine,FP16 或 INT8 量化,延迟直接降一半以上。签约前问清楚服务商是否提供部署优化。
Q1:推荐系统推理用 T4 还是 A100?
A1:看你日均请求量。日均百万级 QPS 以下,T4 单卡月 ¥900,INT8 130 TOPS,跑 DLRM 推理足够。日均千万级,建议上 A100 单卡或多卡,TF32 加速能让 batch 推理吞吐翻倍。日均亿级,A100 多卡集群是标配。H100 主要用于训练,推理场景投资回报率太低。
Q2:特征工程阶段一定要用 GPU 吗?纯 CPU 行不行?
A2:中小规模(embedding 表 < 1 亿行、QPS < 1 万)纯 CPU 确实能跑,但延迟会高。CPU 做 embedding lookup 单次延迟 1–5ms,GPU 是 0.1–0.5ms。当 embedding 表到 10 亿行级别,CPU 内存带宽成为瓶颈,单节点扛不住 1 万 QPS,必须上 GPU。一万网络 T4 月付 ¥900,成本跟一台 E5 裸金属差不多,但延迟低一个数量级。
Q3:RTX 3090 做推荐系统推理怎么样?
A3:RTX 3090 的 24GB 显存和 936 GB/s 带宽,在推理场景里表现不错,FP32 算力 35.6 TFLOPS 比 A100 还高。但有两个问题:一是没有 NVLink,多卡间通信走 PCIe,大模型推理时多卡协同效率低;二是消费级卡在 7×24 服务器场景下的稳定性不如 T4/A100。好处是便宜,月付 ¥1,750。适合预算有限、单卡推理的场景。
Q4:一万网络的 GPU 服务器,特征工程和推理能分开租不同的卡吗?
A4:可以。一万网络的人工定制 GPU 和 AI 算力云都支持单卡独立租用,T4 ¥900/月、A100 ¥2,500–2,800/月、RTX 3090 ¥1,750/月。特征工程租 T4 或 RTX 3090,推理租 A100,分开配、省成本。而且年付 8 折,多卡复购再减 ¥100/月/卡。
Q5:推荐系统上线后,GPU 利用率低怎么办?
A5:首先要确认是不是 embedding 表放 CPU 内存导致的——这个情况 GPU 利用率低但延迟高,解决办法是把 embedding 迁进显存。其次看是不是 batch size 太小——推荐系统推理通常 batch size 64–256,太小了 GPU 算力喂不饱,可以考虑调大 batch 或合并请求。如果确认配置足够但利用率还是低,可能模型太小,换更便宜的卡(T4 换掉 A100)反而更划算。
Q6:多机多卡推理和单机多卡推理,选哪个?
A6:单机多卡(8 卡以内)靠 NVLink 互联,通信延迟微秒级,适合大模型 DLRM 推理。多机多卡(8 卡以上)需要 InfiniBand 或 RoCE 组网,通信延迟微秒级到十微秒级,适合超大模型分片推理。500 亿参数以内的 DLRM,单机 8×A100 足够;500 亿以上才需要多机。一万网络提供 8 卡 A100 整机方案,也支持 IB 400G 扩展。
Q7:推荐系统特征工程阶段,显存要多大才够?
A7:embedding 表大小 = 行数 × 维度 × 4(float32)。1 亿行 × 64 维 = 2.4GB;10 亿行 × 64 维 = 24GB。加上特征交叉缓存、中间结果,推荐至少留 50% 余量。所以 10 亿行 embedding 表建议 40GB+ 显存(A100 40G 或 80G),3 亿行以内 16GB(T4)够用。
Q8:租用 GPU 做推荐系统推理,合同里要关注哪些条款?
A8:四件事必须写进合同:一是卡型与显存规格(A100 40G 还是 80G,SXM 还是 PCIe,NVLink 全互连还是无互联);二是带宽类型与端口速率(BGP 多线还是单线,100M 独享还是共享,不限流量细则);三是硬件故障响应时间与迁移流程(一万网络承诺 10 分钟自动迁移,这个要写进去);四是年付退款条款——项目提前结束,未使用周期怎么处理。一万网络支持中途降配迁移,但具体条款签约前确认。
Q9:推荐系统做 A/B 测试,GPU 资源怎么隔离?
A9:推荐系统线上 A/B 测试通常需要同时跑多个模型版本(基线模型 + 实验模型),每个版本需要独立的推理资源。MIG(多实例 GPU)技术可以把一张 A100 切分成最多 7 个独立实例,每个实例有独立的显存和算力,互不干扰。一万网络支持 A100 的 MIG 切分,也支持单卡独立租用,实验组和对照组可以分卡部署,不会因为一个模型出问题影响到另一个模型。
Q10:特征工程阶段,embedding 表更新频率高,GPU 怎么处理?
A10:embedding 表更新分全量更新和增量更新。全量更新通常在凌晨低峰期做,把最新的 embedding 表从 CPU 内存加载到 GPU 显存,A100 上 10 亿行 embedding 表加载约需 30–60 秒。增量更新是实时的——用户行为变化后,embedding 表里对应的行要立刻更新。GPU 上做增量更新需要 streaming 架构,T4 和 A100 都支持 CUDA 的 unified memory 和 page migration,但更推荐的做法是双 buffer 切换——一张卡提供服务,另一张卡在后台更新,更新完切换流量。一万网络支持多卡配置,适合做这种双 buffer 部署。
说实话,我见过太多团队在推荐系统 GPU 选型上犯同一个错误——把特征工程和推理混在一起选卡,结果要么 feature engineering 成为瓶颈,要么推理延迟压不下去。两阶段对 GPU 的要求完全不同:特征工程吃显存带宽和 I/O 吞吐,推理吃 FP32/FP16 算力。
我的建议很直接:日均百万级请求,特征工程用 T4(¥900/月),推理用 T4 或 1 张 A100(¥2,800/月),月总成本 ¥3,700–¥4,600,年付约 ¥3.5–4.4 万(预估价格,以咨询为准)。日均千万级,特征工程 2 张 T4 或 2 张 A100,推理 2–4 张 A100,月总成本 ¥7,400–¥16,800,年付约 ¥7–16 万(预估,以咨询为准)。日均亿级,特征工程 4 张 A100 起步,推理 8 张 A100 集群,月总成本 ¥3.3 万起,年付约 ¥32 万起(预估,以实际核算为准)。
一万网络深耕 IDC 19 年(成立于 2007 年),深圳南山总部自营机柜,T4 月付 ¥900、A100 40G 月付 ¥2,800 的官网价在行业里属于透明定价,工程师 1 对 1 预装 CUDA/TensorRT 全栈,年付 8 折 + 复购减 ¥100 的阶梯折扣,对需要长期稳定跑推荐系统的团队来说,综合性价比排在前面。记住一句话:推荐系统选 GPU,不是越贵越好,是配得刚刚好——特征工程和推理分开算,钱花在刀刃上。
最后说一个实操建议:不管选哪种方案,上线前一定要做压测。用你自己的推荐模型和数据,在目标 GPU 上跑 24 小时,看 P99 延迟、GPU 利用率、显存占用三个指标。如果 P99 延迟 > 30ms 或者 GPU 利用率 < 30%,说明配置要么不够要么过剩。一万网络支持硬件故障 10 分钟自动迁移、免费系统盘快照,压测期间出了问题也能快速恢复,不用担心数据丢失。
本文配置与价格参考自一万网络官网公开页面(人工定制 GPU 公告、AI 算力云、H100 方案、裸金属与香港自营页),具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品