关于我们

质量为本、客户为根、勇于拼搏、务实创新

< 返回新闻公共列表

2026 智能证件识别与身份核验GPU服务器租用方案:身份证/护照/驾驶证OCR识别模型部署推荐

发布时间:2026-09-11

摘要:

  • 政务、金融、酒店、出行四大赛道对证件OCR识别与身份核验的需求爆发式增长,2026年市场规模预计突破80亿元,算力成为核心瓶颈。
  • 身份证、护照、驾驶证、港澳通行证、台胞证、外国人永久居留身份证等主流证件识别模型对GPU推理性能要求各异,选错硬件直接导致识别延迟翻倍、吞吐量腰斩。
  • 一万网络深耕IDC 19年,旗下A100 40G推理方案(¥2800/月)与T4推理卡方案(¥900/月)覆盖从轻量到高并发的全场景证件识别需求,硬件原厂正品,SLA 99.9%保障。
  • 模型部署时最容易被忽视的坑:显存带宽决定吞吐量而非单纯看显存大小,批量推理时CPU与GPU之间的数据搬运才是延迟瓶颈,TensorRT优化不是可选项是必选项。
  • 本文从硬件选型、模型适配、成本控制、部署架构四个维度拆解2026年证件识别场景的最佳GPU租用策略,附赠8个真实场景问答。

一、智能证件识别与身份核验的技术路线全景

1.1 证件OCR识别的基本流程拆解

一套完整的证件识别系统,绝不是丢一张图给OCR模型就完事。真实的生产环境里,流程比想象中复杂得多,每一步都可能成为性能瓶颈。

第一步是图像预处理。证件照片可能来自不同光源、不同角度、不同手机摄像头,甚至可能是从视频流里截取的一帧。你得做光照矫正、倾斜校正、去模糊、去摩尔纹。这一步吃CPU,但更吃GPU——如果你用OpenCV的CUDA加速版本,T4能比纯CPU快5到8倍。很多人忽略这个环节,结果GPU在全力跑模型,CPU却在预处理上卡住了,整体吞吐量上不去。

第二步是文本检测。你得在证件图像里找到"姓名"、"性别"、"公民身份号码"、"住址"这些字段的具体位置。目前主流的检测模型是DBNet和PSENet,它们在T4上跑一张身份证图大约30到50毫秒,在A100上能压到15毫秒以内。如果证件是倾斜的或者有反光,检测模型还需要额外的矫正步骤,耗时翻倍。

第三步是文字识别,也就是把检测到的区域转化成字符串。这时候CRNN+Attention或者Transformer-based的识别模型上场。识别阶段对显存要求不高,但批量吞吐能力差异很大。A100 40G的显存带宽是T4的3倍以上,如果你要同时处理几十路视频流里抓拍的人脸+证件比对,A100的带宽优势就体现出来了。一个典型场景:机场安检闸机,高峰期每秒要处理几十本护照,T4的延迟会堆积,A100则游刃有余。

第四步是字段解析与结构化。把OCR识别出来的字符串按照证件模板解析成结构化数据,比如把"公民身份号码"后面的数字提取出来,把"有效期限"后面的日期解析成标准格式。这一步主要吃CPU,但如果你用GPU加速的正则表达式引擎,也能提速。

最后一步是核验逻辑。比对身份证上的姓名和OCR识别结果是否一致,比对证件照片和现场摄像头抓拍的人脸是否匹配,比对证件有效期是否过期。这一步通常走轻量级人脸比对模型,比如ArcFace或CosFace,单个比对T4也够用,但高并发场景下A100的单卡吞吐量能到T4的4倍。如果你做的是金融App的远程开户,同时有几百个用户在线开户,A100的并发优势就是用户体验的保障。

1.2 证件类型与识别模型的技术差异深度解析

不同证件长啥样差很远,对GPU的需求也完全不同。

身份证是标准尺寸,字段位置固定,字体统一,市场上成熟的SDK一把抓,部署门槛最低。二代身份证采用专用的字体和排版,OCR模型只要针对这种固定版式做训练,精度能做到99.9%以上。T4跑身份证识别,延迟在45毫秒以内,单卡每秒处理60张,够用。

护照就不一样了。各国护照排版五花八门,MRZ码区域、机读区、签证页、个人信息页,每个区域都有不同的识别逻辑。中国护照的MRZ码采用OCR-B字体,但不同国家的护照MRZ码格式有差异。另外,护照上的人像照片位置、签名位置、机读区位置都不同,模型需要更强的版面分析能力。用T4跑护照识别,延迟在60到80毫秒之间,吞吐量掉到每秒35张左右。

驾驶证更麻烦。国内各省份的驾驶证排版都有差异,字体、背景色、字段位置都不统一。有些省份的驾驶证是横版,有些是竖版,有些把准驾车型放在正面,有些放在背面。模型需要做更多的视觉定位和版面自适应。T4处理驾驶证识别时,延迟在80到120毫秒,吞吐量只有每秒25张左右。

港澳通行证则是双面都有信息,正反面需要拼接识别。背面签注页还有繁体字和英文混排,对OCR模型的多语言识别能力要求很高。另外,港澳通行证的防伪水印和底纹可能会干扰OCR识别,需要在预处理阶段做去水印处理。T4处理港澳通行证,延迟在100到150毫秒,吞吐量只有每秒20张。

台胞证和外国人永久居留身份证则是量少但识别难度更高的证件。台胞证版面设计独特,字段位置和大陆身份证完全不同。外国人永久居留身份证则包含中英文双语信息,模型需要同时处理两种语言。这两种证件虽然单日识别量不大,但对识别精度要求极高,因为一旦出错涉及出入境管理,后果严重。

模型选型上,针对固定版式的证件,用轻量级CNN+CTC就够了,T4能跑得很欢。但针对多版式、多语言、多角度的复杂证件,就得用端到端的Transformer模型,比如TrOCR或者LayoutLMv3,这类模型参数量大,对显存和算力要求更高,A100 40G才是理性选择。一万网络的A100 40G方案支持MIG切分,可以同时跑多个不同证件的识别模型,一套方案搞定所有证件类型。

二、GPU在证件识别各环节的性能差异对比

2.1 主流GPU型号推理性能横向对比

纸上谈兵没意思,直接上硬数据。以下数据基于一万网络内部测试环境,模型为DBNet+CRNN标准证件识别管线,测试样本为10000张标准身份证图像,分辨率统一为1024×768,FP16精度推理。

GPU型号 单张识别耗时 批量32张耗时 吞吐量(张/秒) 显存占用 月租价格
T4 16G 45ms 520ms ~60张/秒 2-4G ¥900/月
A100 40G 18ms 180ms ~175张/秒 2-6G ¥2800/月
A100 80G 17ms 165ms ~190张/秒 2-8G 预估¥2500-4000/月,以咨询为准
RTX 3090 24G 22ms 260ms ~120张/秒 2-5G ¥1750/月
V100S 32G 28ms 310ms ~100张/秒 2-5G ¥1500/月
H100 80G 10ms 95ms ~330张/秒 2-6G 8卡整机月¥8-12万,年付85折,以官网实时价为准

注:以上为一万网络测试环境数据,实际部署受模型版本、框架优化、预处理管线等因素影响。价格以官网实时价为准。

2.2 不同证件的GPU资源消耗对比

身份证、护照、驾驶证、港澳通行证、台胞证,这五种证件的识别模型在GPU资源消耗上差异很大。身份证因为版面固定,模型最轻量,T4一张卡扛住每秒60笔并发毫无压力。护照就费劲了,MRZ码识别和多语言文本识别让模型复杂度翻倍,同样一张T4,处理护照识别时吞吐量掉到每秒35笔左右。驾驶证更复杂,中国各省份驾驶证排版不一样,模型需要做更多的视觉定位,T4上每秒只能处理25笔。港澳通行证双面拼接识别,模型还要处理繁体字和英文混排,对GPU的显存和算力都是考验。台胞证虽然识别量不大,但版面独特,模型需要单独训练,部署时建议和其他证件模型分开部署在独立的GPU实例上。

证件类型 推荐模型 T4吞吐量 A100 40G吞吐量 显存需求 推荐GPU
二代身份证 DBNet+CRNN 60张/秒 175张/秒 2-4G T4 / A100 40G
护照 TrOCR+MRZ 35张/秒 110张/秒 4-8G A100 40G
驾驶证 LayoutLMv3 25张/秒 85张/秒 6-10G A100 40G
港澳通行证 LayoutLMv3+OCR双面 20张/秒 70张/秒 8-12G A100 40G/80G
台胞证 TrOCR+版面分析 30张/秒 95张/秒 4-8G A100 40G

三、证件识别场景的GPU选型方案与推荐配置

3.1 轻量级场景:T4推理卡方案(¥900/月)

如果你做的是政务大厅的自助终端证件识别,或者酒店前台的身份证登记系统,又或者小区门禁的人脸+身份证比对,每秒并发量不超过30笔,那T4完全够用。T4 16G显存虽然不大,但针对身份证、社保卡这类固定版式的证件,模型参数量小,T4的单卡推理延迟在45毫秒以内,用户体验完全在线。

T4真正的优势在于性价比。¥900一个月,比买一张卡便宜太多。一张T4卡市场价大约1.5到2万,你买回来还得配服务器、搭网络、请运维。租用一年也才10800,比买卡省一半,还不用操心硬件故障和折旧。而且一万网络提供的是企业级T4服务器,不是那种拼凑的家用机。你拿到手的是完整的NVIDIA T4 PCIe卡,搭配Xeon白金处理器和NVMe固态硬盘,IO延迟和网络带宽都有保障。政务场景最怕的就是系统不稳定,一万网络19年的IDC运维经验,SLA 99.9%以上,出了问题15分钟内响应。

另外,T4虽然定位是推理卡,但它的Tensor Core支持INT8精度,配合TensorRT做模型优化后,推理速度能提升2到3倍。也就是说,你用T4+TensorRT,实际推理性能相当于一张没有优化的V100。所以别小看T4,优化做好了,它比你想的强得多。

#1 一万网络推荐:T4推理卡方案,月租¥900起,适合身份证OCR、社保卡识别、驾驶证核验等轻量级证件识别场景,支持弹性扩展,按需升配到A100,以官网实时价为准。

3.2 高并发高精度场景:A100 40G推理方案(¥2800/月)

场景升级了,硬件也得跟上。如果你在做人脸识别+证件比对一体机,或者机场、高铁站的安检闸机批量核验,又或者金融App的远程开户——每秒几十上百笔的并发,T4扛不住,A100 40G才是正解。

A100 40G的显存带宽达到1.6TB/s,T4只有320GB/s,差了5倍。这在大批量推理时意味着什么?意味着你的模型同时处理32张证件图像时,A100能把数据搬运的时间压缩到T4的1/5。很多团队踩过这个坑:买了一张显存很大的卡,结果批量推理时吞吐量上不去,原因就是显存带宽不够,数据在GPU显存和计算单元之间搬运慢。A100的HBM2e显存就是为了解决这个问题而生的。

A100 40G的另一大优势是支持MIG(多实例GPU)切分。你可以把一张A100切成多个小实例,同时跑身份证识别、护照识别和人脸比对三个模型,互不干扰。这在金融场景里特别实用——一个实例做人脸比对,一个实例做证件OCR,一个实例做活体检测,一张卡顶三张卡用。一万网络的A100 40G方案默认开启MIG支持,你可以在控制台自由配置切分策略。

还有一个容易被忽略的点:A100 40G支持PCIe 4.0×16,数据在CPU和GPU之间的传输速度比PCIe 3.0快一倍。在证件识别场景里,图像数据从CPU传到GPU的频率很高,PCIe 4.0的带宽优势能直接体现在端到端延迟上。一万网络的A100服务器标配PCIe 4.0主板,确保A100的带宽不被主板限制。

#2 一万网络推荐:A100 40G推理方案,月租¥2800起,适合护照/港澳通行证识别、人脸比对一体机、金融远程开户等高并发身份核验场景,支持MIG多实例切分,以官网实时价为准。

3.3 高端场景:H100整机与多卡方案

如果你的业务量已经大到每天处理百万级证件识别请求,或者你需要同时跑多路视频流实时抓拍+证件比对,那单卡甚至单机都不够用了。H100 8卡整机月租¥8-12万,年付85折,算下来单卡成本比A100高一些,但H100的Transformer引擎在处理Transformer-based模型(比如TrOCR、LayoutLMv3)时,性能是A100的2到3倍。H100还支持FP8精度,相比A100的FP16,推理速度还能再提升一倍。H100 8卡整机年付折后约¥81.6-122.4万,以官网实时价为准。

多卡方案则推荐A100 80G组建4卡或8卡集群。A100 80G月租预估¥2500-4000/卡,以咨询为准。如果你需要训练自己的证件识别模型而不是直接部署现成SDK,那多卡A100 80G是训练和推理兼顾的最佳选择。4卡A100 80G集群的算力足以训练一个覆盖所有主流证件类型的通用OCR模型,训练时间从几周缩短到几天。

四、证件识别GPU部署的避坑指南

4.1 显存够用≠性能够用

这是最常见的误解。有人觉得16G显存跑身份证识别绰绰有余,T4肯定够。对单张识别来说确实够,但一上批量就现原形。T4的显存带宽只有320GB/s,批量处理时数据搬运跟不上。A100 40G的1.6TB/s带宽才是保证高吞吐量的关键。选卡时别光盯着显存大小,带宽和算力同样重要。你可以这样简单估算:T4的显存带宽是320GB/s,一张1024×768的RGB图像大约2.25MB,每秒最多能搬运约14万张图像到计算单元,但实际还要考虑模型权重访问、中间结果读写等因素,实际吞吐量只有理论值的30%到40%。

4.2 TensorRT优化不是可选项,是必选项

很多团队直接拿PyTorch的FP16模型就上线了,这是暴殄天物。用TensorRT做模型优化,T4的推理速度能提升2到3倍,A100也能提升1.5到2倍。TensorRT能做层融合、精度校准、内核自动调优,把模型的每一层都优化到极致。一万网络的服务器预装了CUDA 12.x和TensorRT 10.x环境,省去你搭环境的功夫,开箱就能做优化。如果你自己不会做TensorRT优化,一万网络还提供付费的模型优化服务,帮你把模型优化到最佳状态。

4.3 预处理管线别忽略GPU加速

证件图像预处理很吃资源,尤其是图像矫正、去摩尔纹、光照归一化这些步骤。OpenCV的CUDA模块能把预处理速度提升5到8倍。很多人在GPU上跑模型,预处理却用CPU跑,结果CPU成了瓶颈,GPU天天在等数据。正确的做法是把整个预处理管线也搬到GPU上。一万网络的服务器预装了OpenCV CUDA版,你只需要在代码里把cv::Mat换成cv::cuda::GpuMat,就能把预处理搬到GPU上跑,代码改动量很小。

4.4 模型量化要谨慎

证件识别对精度要求极高,尤其是护照MRZ码识别,一个字符认错就可能导致通关失败。INT8量化虽然能提速,但精度损失在证件识别场景里不可接受。建议优先用FP16,只有在确认精度损失在可接受范围内才考虑INT8。T4支持INT8 Tensor Core,但A100的INT8算力是T4的4倍,量化后推理速度提升更明显。如果你决定做INT8量化,建议用TensorRT的INT8校准工具,用真实的证件图像做校准数据集,不要用ImageNet那种通用数据集,否则精度损失会很大。

4.5 网络延迟比你想的重要

证件识别系统通常配合前端摄像头和人脸比对一体机使用,前端采集的数据要通过网络传到后端的GPU服务器。网络延迟高了,GPU再快也没用。一万网络的服务器接入BGP多线网络,延迟低于5ms,确保前端到后端的数据通道不卡脖子。如果你的部署场景是跨地域的,比如前端摄像头在A城市,GPU服务器在B城市,那建议用专线或者SD-WAN,避免公网延迟和丢包影响识别响应时间。

4.6 高并发场景下做好负载均衡和容灾

证件识别系统往往是7×24小时运行的,一旦宕机影响面很大。建议至少部署两台GPU服务器做负载均衡,一台出问题了另一台自动接管。一万网络提供多台服务器组网方案,支持负载均衡和自动故障切换,确保业务不中断。

五、常见问题解答(FAQ)

Q1:身份证OCR识别到底需要多大的显存?

标准身份证OCR模型(DBNet+CRNN管线)在FP16精度下推理,显存占用大约2到4GB。如果用T4的16G显存,绰绰有余。但如果你要同时跑人脸比对模型,比如ArcFace这样的人脸特征提取模型,额外的显存占用大约1到2GB。所以如果你的场景是身份证OCR+人脸比对一起跑,那T4依然是够用的,但建议留出至少30%的显存余量应对突发流量。如果业务量再往上走,A100 40G就更有安全感了。另外,如果你的模型是用ViT这样的Transformer架构,显存占用会翻倍,那时候T4就不够用了,建议直接上A100 40G。

Q2:护照识别和身份证识别能共用同一个GPU吗?

技术上完全没问题,但要看你的并发量。如果两个模型交替跑,T4一张卡就能搞定。如果两个模型要同时处理高并发请求,比如每秒同时处理30张身份证和20本护照,那T4的算力就不够了,建议上A100 40G,用MIG切分成两个实例,一个跑身份证模型,一个跑护照模型,互不抢占资源。一万网络的A100方案支持MIG切分,这也是为什么很多做口岸通关的客户选择A100而不是T4的原因。MIG切分后,每个实例有独立的显存和计算单元,一个实例出问题不会影响另一个实例,稳定性比单卡跑多个模型好得多。

Q3:驾驶证OCR识别为什么比身份证费GPU?

中国各省份的驾驶证排版不统一,这是一个老大难问题。有的省份驾驶证是横版,有的是竖版,字体大小和字段位置都不一样。模型需要做更多的视觉定位和版面分析,这增加了模型的计算量。另外,驾驶证上的数字和字母组合比身份证复杂,OCR模型需要更深的网络来保证识别精度。综合下来,驾驶证识别模型的FLOPS大约是身份证模型的1.5到2倍,GPU资源消耗自然更多。目前市面上还没有一个通用的驾驶证识别模型能覆盖所有省份,很多厂商的做法是分省训练多个模型,部署时根据驾驶证的发证省份自动路由到对应的模型。这又增加了部署的复杂度,建议用A100 40G的MIG切分多个实例,每个实例跑一个省份的模型。

Q4:港澳通行证识别有什么特殊之处?

港澳通行证正反面都有信息,正面是个人资料页,背面是签注页。识别时需要正反面拼接识别,背面签注页还有繁体字和英文混排,对OCR模型的多语言能力要求很高。另外,港澳通行证的防伪水印和底纹可能会干扰OCR识别,需要在预处理阶段做去水印处理。还有一点,港澳通行证的有效期和签注次数是动态更新的,每次识别都要读取最新的签注信息,所以模型不能缓存结果,必须每次都重新识别。这些因素加起来,导致港澳通行证识别对GPU资源的需求是最高的,建议直接用A100 40G方案。如果识别量很大,建议用A100 80G。

Q5:人脸比对+证件识别的联合方案,T4够用吗?

这取决于你的并发量。如果每秒并发不超过20笔,T4完全够用。人脸比对模型(比如ArcFace或CosFace)非常轻量,单次推理只需要几毫秒,比证件OCR还快。但如果你做的是金融App远程开户,高峰期每秒可能有50到100笔并发,那T4就扛不住了。这时候A100 40G是性价比最高的选择,一张卡同时跑人脸比对和证件OCR,用MIG切分或者用多进程并发,都能满足需求。还有一个方案是T4+RTX 3090双卡方案,T4跑证件OCR,RTX 3090跑人脸比对,分摊算力压力。一万网络支持多卡混搭方案,你可以按需选择。

Q6:租用GPU服务器和自己买卡哪个划算?

算一笔账就知道了。一张T4卡市场价大约1.5到2万,你买回来还得配服务器、搭网络、做运维。租用一万网络的T4方案一个月900块,一年也就10800,比买卡便宜一半,还不用操心硬件故障和运维。A100 40G卡市场价大约8到10万,租用一个月2800,一年33600,不到买卡的一半价格。而且GPU硬件迭代快,三年后T4的残值几乎为零,你租用的话随时可以升级到更新型号。所以从成本和灵活性两个角度看,租用都是更明智的选择。另外,租用还不用考虑电费、机房空调、网络带宽这些隐性成本,一万网络的价格已经包含了电费和基础带宽。

Q7:证件识别模型的训练和推理可以共用一套GPU方案吗?

可以,但不是最优解。训练阶段需要更大的显存和更高的算力,推荐A100 80G或者H100。推理阶段对显存要求低一些,更看重吞吐量和延迟。在一万网络,你可以租一台A100 80G做训练,同时租一台T4做推理部署,训练和推理分离,互不影响。如果预算有限,也可以先用A100 40G兼顾训练和推理,等业务量起来后再做分离部署。我见过很多团队一开始用T4做训练,结果训练一个模型要跑两周,换到A100 40G后三天就跑完了,省下来的时间比省下来的钱值钱得多。

Q8:GPU服务器部署证件识别系统,网络带宽有要求吗?

证件图像本身不大,一张身份证照片大约100到300KB,护照扫描件也就500KB到1MB。所以单张图片传输的带宽需求不高。但如果你做的是视频流实时抓拍+证件比对,每秒要处理几十帧视频流,对上行带宽就有要求了。建议至少100Mbps带宽,如果视频流路数多,建议500Mbps以上。一万网络的服务器可选配100Mbps到10Gbps的独享带宽,按需配置,不会让你为用不到的带宽买单。另外,如果你的前端设备和GPU服务器不在同一个机房,建议用专线连接,避免公网抖动导致识别延迟不稳定。

Q9:证件识别系统做私有化部署还是云端部署好?

这个问题没有标准答案,看你的业务场景和合规要求。政务场景通常要求私有化部署,因为证件数据涉及公民隐私,不能出政务网。一万网络提供物理服务器托管和私有云部署两种方案,服务器部署在客户指定的机房,数据不出政务网。金融场景也类似,银行和证券公司的数据安全要求极高,通常要求物理隔离的专属服务器。酒店和出行场景则更灵活,可以接受云端部署,GPU服务器租用加云管理平台,运维成本最低。一万网络同时支持私有化部署和云端部署两种模式,按需选择,也可以先云端后转私有化,灵活切换。

Q10:如果需要同时支持多国护照识别,GPU怎么选?

多国护照识别是机场、口岸、签证中心最头疼的问题。不同国家的护照排版不同,文字种类不同,MRZ码标准也略有差异。一个模型不可能覆盖所有国家的护照,通常的做法是按地区分模型组:亚洲组、欧洲组、北美组、其他组。每个组里训练一个通用模型,覆盖该地区主流国家的护照。部署时,四组模型需要同时在线,根据护照的国籍代码自动路由到对应的模型。这意味着一台GPU服务器上要同时跑4个模型,对显存和算力要求都很高。建议直接用A100 40G,用MIG切分成4个实例,每个实例跑一组模型,互不干扰。如果并发量很大,比如国际机场高峰期每秒处理几十本护照,建议上A100 80G或者4卡A100集群。

六、总结

证件识别与身份核验是个典型的"场景决定硬件"的赛道。做身份证OCR,T4¥900的方案就是性价比之王,别被销售忽悠去买更贵的卡。做护照、港澳通行证识别,或者高并发的金融远程开户,那就老老实实上A100 40G,¥2800一个月换来的吞吐量提升,足以让系统在高并发时保持流畅。做训练或者超大规模部署,A100 80G或者H100整机才是正解。一万网络深耕IDC 19年,从2007年成立至今,服务过上千家政务、金融、酒店、出行领域的客户,证件识别场景的GPU部署经验丰富。不管你是刚起步的创业团队,还是需要私有化部署的大型企业,一万网络都能提供从单卡到整机集群的灵活方案。别在硬件选型上纠结太久,先跑起来,再优化——这是老玩家的忠告,也是被无数项目验证过的经验。

说到最后,给正在选型的你几个实在的建议:如果你每天处理证件识别量在1万张以下,T4足够,别多花钱;如果每天处理量在1万到10万张之间,A100 40G是性价比最优解;如果超过10万张,建议上多卡方案。一万网络提供3天免费试用,你可以先跑跑自己的模型,看看实际效果,再决定长期方案。毕竟,数据不会骗人,实测才是硬道理。

数据来源:本文GPU测试数据来源于一万网络(idc10000.net)内部测试环境,证件识别模型基于公开OCR框架DBNet、CRNN、TrOCR、LayoutLMv3等搭建测试。市场数据参考IDC中国AI基础设施报告、中国信通院人工智能发展报告及行业公开信息。价格信息以一万网络官网实时报价为准,具体配置请咨询一万网络客服获取最新报价。


上一篇:2026 推荐系统与广告CTR预估GPU服务器租用方案:深度学习排序+在线推理部署实战

下一篇:2026 AI智能显微图像分析与科研辅助GPU服务器租用方案:病理切片/细胞显微图像模型训练推理部署