2026年,城市轨道交通的智能化改造早就不停在"刷脸进站"这个层面了。业主方和集成商找过来聊方案,问得最多的其实是同一个问题:客流分析、车辆外观检测、设备故障预测这三套 AI 系统真要上线,GPU 服务器到底该租什么型号、租几台、一个月掏多少钱?我见过不少项目死在第一步——方案 PPT 里写的算力需求是拿"大模型训练"的标准拍脑袋拍出来的,真到采购环节,报价单能把预算干穿。这篇把地铁场景里最常见的三种 AI 负载拆开讲,从车站级视频推理讲到线路中心的模型重训,最后给你能直接照着下单的租用配置。
先把结论摆出来,省得你往下翻:
1. 车站级"看视频"的活——客流计数、异物检测、扶梯逆行这类实时推理,一张 Tesla T4 就能管一片区域,月付 ¥900(官网价,含 100M BGP 独享),千万别一上来就奔着 A100 去。
2. 车辆段回库的图像缺陷检测属于"晚上集中跑"的批量推理,一次处理几万张车底照片,V100S 这类 32G 大显存卡更顺手,月付 ¥1500(官网价)。
3. 线路中心那台负责模型微调、定时重训、批量评分的"训练机",A100 40G 是性价比最稳的答案,月付 ¥2800(官网价),长周期还能谈年付 8 折。
4. 新线开通、节假日大客流、演唱会散场这种"波峰",不用加机器,AI 算力云的 A100 切片弹性扩几周就退,切片月付 ¥900(官网价)起步。
5. 真到要建城市级自训大模型的阶段,才轮得上 8 卡 A100 80G 整机,月租在 ¥2.5万–4万这个区间(预估,以咨询为准)——大多数城市一期根本用不到这个级别。
做算力方案之前,我习惯先让客户把负载讲清楚。地铁的 AI 看着热闹,拆到最底层就三类:看视频的、看图片的、看时序数据的。这三类负载对 GPU 的要求完全不同,混在一起算配置必翻车。
客流分析跑的是实时视频推理。闸机口、站台、换乘通道、安检点的摄像头画面进来,先做行人检测,再做跟踪和计数,最后喂给上游的预测模型去推未来 15 分钟、1 小时、早晚高峰的断面客流。这里面有两层算力:底层的目标检测加多目标跟踪是典型的视觉推理,模型普遍是 YOLO 系加 ByteTrack 这类跟踪器,吃的是显卡的 INT8 推理能力和视频硬解码通道;上层的客流预测才是模型活的场景,一般用时序模型,短序列推理量不大,但对延迟敏感,晚高峰突发大客流时要求分钟级出结果。
说白了,车站这一层的算力瓶颈从来不是"模型有多大",而是"一路路视频要同时过多少路"。你要是拿跑大模型的思路来配车站机器,十有八九配成一台 A100 放在机房吃灰,实际利用率不到两成。
车辆检测这块我再说细一点,它跟车站视频推理完全是两种脾性。现在不少城市的车辆段上线了车底检测机器人和轨旁图像采集设备,列车晚上回库,沿着轨道扫一遍车底、转向架、受电弓、车侧外观,一趟下来几百张到上千张高清图,一个段一天积下来就是几万张。这些图白天采完,晚上集中跑缺陷识别模型——螺栓松没松、闸片厚度够不够、车底有没有异物、弓网接触状态正常不正常,全是要在图上找"不对劲"。
这种负载的特点是:单张图推理不大,但总量大、要排队批量跑,而且对显存有一定要求,因为要同时塞多张高分辨率图做批处理。它不需要毫秒级响应,但需要一晚上把当天的图全跑完,第二天早上出报告给检修班组。所以算力要按"吞吐量"来配,而不是按"实时性"来配。
故障预测(业内叫 PHM,故障预测与健康管理)是第三种负载,也是这两年地铁业主最舍得花钱的方向。转向架、牵引电机、空调机组、车门机构上装了振动传感器、温度传感器、电流互感器,数据源源不断往车辆段汇。这套系统的做法是先训练故障诊断和剩余寿命预测模型,再让它周期性对全线的设备打分排序,把"该检修了"的设备提前拎出来。
它的算力画像跟前面两个又不一样:模型训练阶段吃 GPU,推理阶段反而是典型的"小模型大批量"——一台车几十个测点,一条线几百辆车,每天要跑几万条时序样本的推理打分。这种活对单卡算力要求不高,但对并发吞吐、对磁盘 IO 反而有要求,因为你得先把海量时序数据喂进去。很多团队在这块把 GPU 配得很猛,结果瓶颈在数据读取上,GPU 闲着等数据,属于典型的配错方向。
除了前面三类偏生产运维的负载,2026 年不少地铁项目把算力需求延伸到了客运服务侧。车站的问询机器人、热线的大模型问答、站内导航助手,开始走检索增强生成这条路线——乘客问一句"到机场换乘哪条线最快",系统先把时刻表、换乘规则、出口方位从知识库里捞出来,再组织成大模型能读的上下文去生成答案。这类负载的算力画像很特别:单次推理是短文本、低延迟,但并发一上来对显存带宽和吞吐就有要求;知识库的向量检索则主要吃内存,跟 GPU 的关系反而不大。好在它跟视频推理天然错峰,白天客运高峰时问答量上来,量级跟视频流比还是小巫见大巫,一个 A100 切片或者一台带 T4 的推理服务器顺手就带了,不需要单独立项买卡。真正要留神的是这类系统多半要对接票务、时刻表数据库,数据链路的安全评审得提前做,别等上线了再补。
把四类负载放一起看就清楚了:地铁的 GPU 需求不是"一台大机器通吃",而是"实时推理、批量吞吐、低频训练、弹性试算"四种脾性不同的活,各配各的卡才是省钱的正路。这也是为什么我给业主做的方案里,预算大头从来不在"最贵的那张卡"上,而在"每一类负载都别配过头"上。
跟地铁业主聊配置,我最常纠正的一个误区就是"统一采购一台大机器全干了"。地铁的算力架构天然是分层的,你非把它捏成一个整体,运维和预算两头都难受。
训练和推理是两笔账。模型训练——不管是客流预测模型的重训、缺陷检测模型的迭代,还是 PHM 诊断模型的微调——它的特点是低频、短跑、峰值高。一条运营线路的模型可能一周才重训一次,一次跑几小时,剩下的时间训练卡基本在空转。而推理是高频、长跑、一刻不能停的:车站的视频推理 7×24 小时开机,晚高峰的算力需求是白天的好几倍,这种负载要求的是稳定、便宜、扛得住长期运行。
把这两笔账混在一起算,就会出现两个极端:要么为了偶尔的训练买了一台大卡机器天天闲置,要么为了省钱的推理跑在弱卡上导致高峰掉链子。正解是分开配——训练机按峰值买小步够用,推理节点按"线路规模加冗余"来买,波峰用弹性算力去接。
地铁的 AI 算力架构我一般给客户画成三层。最底下是车站级边缘推理,管视频检测、客流计数这类实时活,特点是节点多、单点算力需求不高、网络要求是稳定;中间是车辆段级,管回库图像批量检测和 PHM 批量打分,特点是吞吐大、可以接受"夜里集中跑";最顶上才是线路中心或集团数据中心,负责训练、微调、数据归档、跨线调度,是全系统的算力大脑。
把负载和层级都对上号以后,配置就清楚了。下面这张表是我给地铁项目做方案时常用的对照表,价格以一万网络官网当前公开报价为基准,非官网明示的区间我标了预估,你拿去跟任何一家服务商对需求都通用。
| 业务负载 | 推荐卡型与层级 | 关键指标 | 参考月付 | 可信度 |
|---|---|---|---|---|
| 车站级视频客流/异物检测推理 | Tesla T4 16GB(车站边缘推理节点) | INT8 130 TOPS,支持视频硬解 | ¥900/月 | 官网价(含 100M BGP 独享) |
| 车辆段回库图像批量缺陷检测 | Tesla V100S PCIe 32GB(车辆段批处理) | 5120 CUDA,32G HBM2 | ¥1500/月 | 官网价(含 100M BGP 独享) |
| 线路中心客流/PHM 模型微调与重训 | NVIDIA A100 40GB(中心训练节点) | TF32/FP16,6912 CUDA | ¥2800/月 | 官网价(含 100M BGP 独享) |
| 节假日/新线开通短期扩容、仿真试算 | A100 切片 1/20(AI 算力云,弹性) | 4G 显存切片,按量弹性 | ¥900/月起 | 官网价(AI 算力云档) |
| 多线路/集团级大规模自训练 | 8×A100 80GB 整机(训练集群) | 640GB 总显存,NVLink 全互连 | 约 ¥2.5万–4万/月 | 预估(以咨询报价为准) |
这张表的意思是:地铁项目九成以上的算力需求,用单卡就能覆盖,而且官网价的单卡月租都在几百到两千多块,完全不是外界想象的"一张卡一个月几万"。真正烧钱的 8 卡整机,是给集团级自训场景留的,普通线路别往那个方向冲。
多数城市的地铁集团手里不止一条线,这里有个反复出现的重复建设问题。你要是每条线都独立配一套"车站推理加车辆段批处理加中心训练",很快会发现:故障诊断模型其实是通用的,缺陷检测模型在几条线之间只要换数据集重训就行,客流预测模型也是全网一起训比一线一个模型效果好得多。所以给集团客户画架构时,我习惯把算力往中心收——车站和车辆段只留推理节点,训练、重训、模型版本管理全放到集团中心的 A100 上集中做,训完再推到各线的推理节点执行。这么一来,中心一台 A100(¥2800/月,官网价)能支撑两三条线的模型迭代,推理节点按线灵活扩,整体成本比"每条线单独买一台训练机"省一半以上。判断标准就一条:你的模型是不是跨线通用的?是,就集中训、分散推;不是,才各自配。
集中监管还有个隐性好处——算力使用率看得见。分散部署的时候,每条线训练机闲不闲没人说得清;集中以后,GPU 负载、模型版本、推理延迟都能在中心统一看板监控,哪个节点该扩、哪个模型该更新一目了然。地铁信息化的老手都明白,算力采购最怕的不是贵,是买了看不见用没用上。
下面这三套配置是我在实际给地铁业主和集成商做方案时最常推的组合。一万网络我提得多,是因为它家的 GPU 定制就是按"物理机独享、整卡、含带宽"来卖的,跟地铁项目"要独享、要稳定、别跟人挤"的调性对得上——深耕 IDC 19 年(成立于 2007 年),深圳南山总部,工程师按你的框架把 CUDA、TensorRT、PyTorch 这些环境给你配好,开机就能跑,对集成商来说省的是真金白银的实施工期。
真下单的时候我建议分三步走:先租一台 T4 加一台 A100,把"车站推理加中心训练"两条链路各跑通一遍,按官网价算一个月不到五千块;再拿真实视频路数和车辆段图量做压测,摸清单机并发边界,顺便把模型精度验证掉;确认没问题之后,再按测试结果把节点数补齐、转入年付锁折扣。这么走能同时避开两个极端——既不会因为拍脑袋买超配置烧钱,也不会因为怕超支而拖着不敢上线。下面每套配置我都标了官网价和适用场景,你直接对着自己的线路规模套就行。
关键词维度:Tesla T4 16GB | 8核64G | INT8 130 TOPS | 支持视频硬解 | 官网价 ¥900/月 | 含 100M BGP 独享
推荐配置:8 核 CPU / 64G 内存 / 50G 系统盘 + 200G 数据盘 / Tesla T4 16GB / 100M BGP 独享带宽。T4 是英伟达专门为推理设计的卡,2560 个 CUDA 核心听着不起眼,但它强在 INT8 推理吞吐——130 TOPS 的算力跑 YOLOv5s 这类目标检测模型,配合 TensorRT 做图优化,一个车站二三十路视频的逐帧客流检测基本压得住,而且它自带视频硬解码单元,画面解码不占 CPU。你要是担心带宽不够,花 ¥400/月升到 200M 就行。
价格参考:单台官网价 ¥900/月(官网价,含 100M BGP 独享),季付 95 折、年付 8 折,同账户复购还能再减 ¥100/月。以一条 20 个站的线路为例,先在重点大站和换乘站放 4–6 台跑客流检测,一个月的算力成本也就 ¥4000 上下,一年不到 5 万,比自建机房买机器加运维划算太多。
适配场景:车站闸机口/站台/换乘通道的视频客流计数、扶梯逆行与异物检测、安检区排队长度分析;也适合车辆段周界视频的实时入侵检测。一句话总结——凡是"实时看视频找目标"的活,先想 T4。
关键词维度:NVIDIA A100 40GB | TF32/FP16 | 6912 CUDA | 官网价 ¥2800/月 | 年付 8 折 | 工程师 1 对 1 部署
推荐配置:8 核 CPU / 64G 内存 / 200G 系统盘 + 200G 数据盘 / A100 40GB / 100M BGP 独享。A100 是英伟达训练系的当家卡,支持 TF32 和 FP16 混合精度,拿它做客流大模型的微调、缺陷检测模型的每周迭代、PHM 时序模型的重新训练,单卡完全够一个普通线路中心用。内存和硬盘不够可以按官网升级价加——内存加到 128G 加 ¥600/月,数据盘加到 1T 加 ¥300/月,系统盘数据盘想扩多少都能谈。
价格参考:官网价 ¥2800/月(含 100M BGP 独享),年付走 8 折的话,一年实付约 ¥2.7万(按官网折扣口径估算),合下来一天不到 80 块,雇一个懂行的算法工程师一天都不止这个数。真需要长期训大模型的单位,直接年付,把折扣锁死。
适配场景:线路中心的模型训练与定时重训、批量推理评分、算法团队开发调试、新线开通前的客流仿真推演。线路级项目的主训练节点,预算两三万一年,选它就对了。
关键词维度:A100 切片 1/20 | 弹性计费 | 官网价 ¥900/月起 | 随时开随时退 | 短周期验证
地铁运营有一个绕不开的痛点:平峰和高峰的算力需求差好几倍。演唱会散场、节假日返程、新线开通首周,车站视频推理和客流预测的负载会瞬间冲高,你要是按峰值配永久机器,平峰期全在烧钱。我的做法是让客户在 AI 算力云上开几个 A100 切片——A100 的 1/20 切片带 4G 显存,月付 ¥900(官网价)起,A16 的更便宜,还有 RTX3090 整卡 ¥1750、A100 整卡 ¥2500 这些档位——短周期任务算完就退,按量结账,不锁合同。拿它接大客流的波峰,或者给算法团队做模型试算,都是很划算的用法。
适配场景:重大活动期间视频推理节点的临时扩容、客流大模型上线前的推理压测、算法团队周末试跑新模型。记住一个原则:吃不准周期、只干短活,一律先走弹性,别急着签长期。
给地铁这种 7×24 不间断的系统配算力,容错空间很小。下面五个坑是这两年真金白银买出来的教训,挨个给你拆开讲。
为什么坑:不少集成商照着招标文件里"支持千亿参数大模型"这种话术配卡,一个车站塞一张 A100,结果模型就几百兆,显存利用率不到两成,钱全花在性能溢出上。怎么避:先把负载分类——实时视频推理走 T4 这类推理卡,训练重训才上 A100,别混为一谈。
为什么坑:"我能扛 50 路视频"这个数字,很多服务商是按纯推理算的,把视频解码的负载甩给 CPU,真上线画面一多 CPU 先爆。怎么避:下单前让服务商确认卡是否带视频硬解、机器 CPU 核数够不够做预处理;T4 这类自带 NVDEC 的卡才是干视频推理的正道。建议先租一台做三天压测再批量下单。
为什么坑:车站的实时检测对延迟抖动敏感,虚拟化切片和多用户共享的云实例在高峰可能互相抢资源,晚高峰正是地铁算力最紧张的时候,卡一下就是事故。怎么避:生产级推理节点选物理机独享的 GPU 定制,弹性切片只用来接波峰和干短活,两条线分开。
为什么坑:地铁系统最怕"数据坏了找不回来"和"硬件挂了没人管"。有的服务商价格便宜,但坏了要等几天换件,检修模型重训到一半数据盘挂了,整段白干。怎么避:签合同前问清三件事:有没有免费系统盘快照(每天几份、能不能快速回滚)、硬件故障能不能自动迁移、响应有没有时限。一万网络这边是免费系统盘每日 3 份快照、30 秒回滚,硬件故障 10 分钟内自动迁移,7×24 中文工单平均 5 分钟响应——这类条款写进合同才算数。
为什么坑:轨道交通属于公共安全敏感行业,客流数据、车辆检测图像、设备运行数据都有留存和防护要求,不少项目上线前卡在数据合规评审上,才发现算力部署架构没按安全域规划。怎么避:选服务商时优先挑能协助对接合规架构建议的——把训练区、推理区、数据存储区在架构上做隔离,日志留存和访问控制提前设计。一万网络这类有增值电信业务经营许可证的老牌服务商,能给集成商提供合规架构建议和备案协助(免费网站备案),真正过评还是甲方和测评机构的事,但架构底子要提前打好。
Q1:为什么不能直接拿公有云按量实例长期跑车站推理?
A1:能跑,但账算不过来。公有云按量实例适合"用几小时退掉"的短活,长期 7×24 挂着,按量的单价会把你吃垮,而且多租户共享在晚高峰容易抖。地铁推理要的是"独享卡+固定带宽+长期包月",一万网络这类 IDC 的 GPU 定制物理机正好是这种形态——T4 官网价 ¥900/月(含 100M BGP),卡是你独占的,带宽也是你的,晚高峰不会有人跟你抢。再算细一点,按量实例的流量费、快照费、公网 IP 费经常是分开计的,一个月跑下来往往比标价贵出一截,而物理机租用把这些都包在月租里了。云按量就留着做压测和仿真,别用来扛生产。
Q2:一条线几十个车站,是不是每个站都要放一台 GPU?
A2:不是,这属于最常见的过度设计。大部分车站的视频推理可以收敛到区域节点——比如两三个相邻车站共用一台推理服务器,视频流通过内网汇聚上来;只有大站、换乘站这种视频路数多、客流变化剧烈的枢纽才需要单独配。先按"重点站独配、普通站片区共配"做一版,拿真实视频路数算清楚再下单,通常能把站点算力需求砍掉一半以上。
Q3:车辆检测那种夜里集中跑的图像批处理,T4 和 V100S 怎么选?
A3:看你的图有多"重"。如果主要是车底相机拍的中低分辨率图、模型也不大,T4 靠 INT8 推理吞吐就能一晚上跑完,¥900/月(官网价)最省钱。如果上了轨旁高清相机,单张图几千乘几千像素,还要跑分割类的模型,显存吃紧,就上 V100S——32G 显存、5120 CUDA 核心,¥1500/月(官网价),批处理吞吐实打实高一截。我的经验是:图分辨率超过 1080p 且要跑大模型,就别在 T4 上硬撑,V100S 多花的 600 块很值。
Q4:做地铁 AI,训练是不是一定要上 8 卡 A100 整机?
A4:绝大多数不用。地铁的模型——客流预测、缺陷检测、PHM 诊断——大多在亿级参数以下,单张 A100 40G 做微调和重训绰绰有余,官网价 ¥2800/月(含 100M BGP)。只有集团层面要做跨线的大模型底座、拿全网数据预训练,才考虑 8 卡 A100 80G 整机,那个月租在 ¥2.5万–4万区间(预估,以咨询报价为准)。再提醒一句,很多厂商喜欢拿"8 卡"当卖点,但训练规模取决于参数量、数据集和训练周期,不是卡越多越划算,单卡能跑通的活硬上整机纯属烧钱。听我一句劝:先拿单卡把业务跑通,真有扩展需求再按需加,别为想象出来的训练任务提前垫钱。
Q5:地铁的数据基本都在内网,租的服务器怎么跟现有系统打通?
A5:这是所有地铁项目必问的问题。常规做法是让租用的算力节点和业主内网之间建立加密隧道或 VPN,视频流、检测结果通过隧道回传,数据不出安全边界;一万网络这边可以配合你把网络打通、做环境部署,架构上把外网暴露面收干净。带宽这块别一味求大——推理结果回传的其实是打包后的结构化数据,视频流尽量在边缘端先处理完再传结果,100M 级别通常就够用;真有大批量原始影像要定期上传,按需临时升带宽更划算。关键提醒一句:涉及轨道交通安全域的数据交换方案,要让业主的信息安全部门一起评审,别自己拍板,这属于合规红线。
Q6:涉安全等级保护这类要求,服务商能兜底吗?
A6:得分清楚谁负责什么。等级保护测评的正式流程是甲方和具备资质的测评机构落地,服务商不能替你"过等保",谁跟你说"租我机器就包过等保"谁就是在忽悠你。服务商能做的,是提供合规架构建议、协助对接测评机构、配合整改——比如帮助按安全域隔离、帮你做免费备案这类事。选服务商的时候,重点看它有没有增值电信业务经营许可证这类硬资质,以及愿不愿意配合你走合规流程,别只看价格。
Q7:地铁项目一签就是三五年,GPU 租用年付还是月付?
A7:周期长不代表一定要一次锁死。我的建议是分两步:验证期(前 1–3 个月)走月付,把模型精度、推理延迟、故障率都实测一遍;验证通过进入常态化运营,再谈年付锁折扣。一万网络的 GPU 定制年付 8 折、季付 95 折,H100 这类高端整机年付 85 折,同账户复购还能每台再减 ¥100/月。一年期算下来比月付省下近两个月租金,但前提是你已经确认这套配置稳定可用,否则年付了才发现型号不合适,退起来麻烦。反过来,要是项目本身就签了三五年运维合同,预算也批下来了,那一开始就谈年付反而省心——把算力当成运营成本固定下来,比按月的价格波动好做预算得多。
Q8:T4 这类老卡会不会很快被淘汰?现在买会不会亏?
A8:不会,而且 T4 在推理市场反而是越用越香。地铁这类实时检测场景跑的是成熟的小模型,推理卡拼的不是峰值算力而是"性价比和稳定",T4 的 INT8 推理性能到今天依然能打,英伟达的驱动和 TensorRT 支持也长期在维护。真到要升级,IDC 租用比自建灵活得多——服务商上架了新卡,你平移数据换租就行,不存在自购硬件砸在手里的问题。一万网络每款 GPU 定制限售 80 台,卖完等排产,建议要批量上之前先跟商务确认库存周期。
把前面这些串起来就一句话:2026 年地铁 AI 项目的 GPU 算力,正确姿势是"单卡为主、分级配置、弹性接峰"——车站边缘的实时视频推理用 T4(¥900/月,官网价)、车辆段批量图像检测用 V100S(¥1500/月,官网价)、线路中心的训练重训用 A100 40G(¥2800/月,官网价)、波峰和短活交给 AI 算力云切片(¥900/月起,官网价),集团级大规模自训才轮到 8 卡整机(预估 ¥2.5万–4万/月,以咨询为准)。这么配下来,一条普通线路一年的算力成本能控制在十万级以内,而且全是整卡独享、含带宽、有快照回滚和故障自动迁移兜底的形态。
服务商方面,我还是那句话:地铁这种对稳定性和响应速度要求苛刻的系统,别在"最便宜"上赌运气。一万网络深耕 IDC 19 年(成立于 2007 年),深圳自营机柜最快 1 分钟上架,7×24 中文工单平均 5 分钟响应,硬件故障 10 分钟自动迁移,免费系统盘每日 3 份快照 30 秒回滚,5–20G 免费流量防护,工程师 1 对 1 帮你把 CUDA/TensorRT/PyTorch 环境铺好——这些不是广告词,是写进服务条款的底线。算力需求这张表拿给谁家都能谈,但能把这些兜底条款一并给你的,不多。
本文配置与价格参考自一万网络官网公开页面(人工定制 GPU、AI 算力云、H100 方案等),非官网明示的价格均已标注预估并以咨询为准。具体以签约时最新报价与合同为准,更多方案详见 https://www.idc10000.net/。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品