去年有个做推理服务的客户半夜给我发消息:"我的 A100 利用率一直 98%,可我明明没提交任务啊?"我让他上去看 nvidia-smi,好家伙,两个不明进程占满显存,命令行里挂着个 xmrig 的矿池地址——被人种了挖矿木马,白嫖他的算力。这种事在 2026 年一点不稀奇,租用 GPU 服务器的兄弟,十个里起码两三个踩过。
GPU 值钱,黑客也知道。一张 A100 拿去挖以太坊经典或别的币,一天能薅出几块到十几块电费差价的收益,规模化了很可观。所以专盯租用服务器的弱口令、暴露端口、漏洞打。先把结论撂这:
核心结论(先记 5 条):
1. GPU 被偷挖的典型信号:nvidia-smi 显示高利用率但你没任务、电费/带宽异常、出现陌生进程(xmrig/矿池域名)。
2. 三大入侵入口:弱口令/默认密码、把 SSH/RDP/管理端口直接暴露在公网、系统或组件漏洞没打补丁。
3. 防护四件套:强密码 + 密钥登录、防火墙只开必要端口、定时监控 nvidia-smi 利用率、及时打补丁。
4. 一万网络免费送 5–20G DDoS 防护 + 系统盘每日 3 份快照(30 秒回滚),中了招能快速还原,比自己救盘强。
5. 最蠢的三个操作:用默认密码、图省事开全部端口、从不看利用率监控——中招基本是自己开门。
最常见也最蠢的入口。很多人租用服务器后,图省事把 root 密码设成 123456、password、或者服务商给的默认密码不改。黑客用僵尸网络扫全网 IP,对着 22 端口(SSH)和 3389 端口(RDP)跑字典爆破,几分钟就能进。进去后第一件事就是下载挖矿木马,把你的 GPU 占满。
我见过最离谱的:一台 8 卡 A100 整机,默认密码没改,上线 4 小时就被种了 8 个矿工进程,租户一个月后看账单才发现电费异常。这种"开门揖盗"完全能避免。
第二个重灾区。有些人为了方便,把 Jupyter(8888)、Redis(6379)、Docker API(2375)、甚至数据库端口全映射到公网 0.0.0.0,还不开认证。黑客一扫一个准:Redis 未授权访问直接写 crontab 拉矿机;Jupyter 没密码直接进终端;Docker API 暴露能直接跑恶意容器。
说白了,不需要对外暴露的服务,一律不要开公网。Jupyter 这种只在本地用的,用 SSH 隧道转发就够了,别直接绑公网 IP。
第三种是"你没做错什么,但版本太老"。比如某些 CUDA 驱动、TensorFlow 服务、或 Linux 内核的已知漏洞(CVE),黑客拿现成 exploit 打进来。尤其是用公开镜像(比如直接 docker pull 个带 GPU 的深度学习镜像)却不更新,里面可能藏着后门或已知漏洞。
GPU 服务器的攻击面比普通 Web 服务器大:它既跑业务又值钱,黑客有经济动机专门盯。所以补丁和最小化暴露,比普通机器更重要。
有人觉得"被偷挖几天无所谓,大不了重装",这账算得不对。拿一万网络人工定制 A100 40G 举例,月付 ¥2800,摊到一天就是约 ¥93 的租金白白替黑客打工;再加上满载功耗,业界 8 卡 A100/H100 整机功耗普遍 5–8kW,单卡满载一天的电费也是十几到几十块。更坑的是机会成本——你的训练任务被挤占、排队、跑慢,原本该出的结果拖了工期,这笔账比电费难估。算下来中招十天就是上千块打水漂,还不算你半夜爬起来救火的时间。所以防护不是"可选项",是实打实省钱。
发现异常第一步,永远是先看显卡在干嘛:
nvidia-smi —— 看右下角" Processes "列表。如果显示高利用率(比如 90%+),但你确认自己没跑训练/推理,且进程名是 xmrig、未知 python、或一串随机字符,基本断定中招。
再配合 top / htop 看 CPU,iftop / nethogs 看网络连到哪(矿池域名通常是 pool.*、stratum 协议端口 3333)。三者一对照,偷挖无所遁形。
| 异常现象 | 可能原因 | 怎么确认 |
|---|---|---|
| GPU 利用率高但无任务 | 挖矿木马占用 | nvidia-smi 看进程名 |
| 电费/带宽账单异常升高 | 外联矿池、持续满载 | iftop 查外联 IP |
| 出现陌生定时任务 | crontab 拉起矿机 | crontab -l 检查 |
| 系统变卡、风扇狂转 | 满载挖掘 | 结合上述命令排查 |
中招了别慌,按后面"中了怎么救"处理。但最好的防护永远是"别让它进来"。
密码:所有账户(root、业务用户)用 16 位以上、大小写+数字+符号的随机串,别用生日、手机号、单词。一万网络交付机器时给的是临时密码,第一件事就是改掉,别拖。
SSH 密钥:更稳妥的做法是禁用密码登录,只用密钥。改 /etc/ssh/sshd_config:PasswordAuthentication no、PubkeyAuthentication yes,把你的公钥放进去。密钥爆破难度比密码高几个数量级,黑客基本放弃。
改端口:把 SSH 默认 22 端口改成一个高位随机端口(如 5xxxx),能挡掉一大波全自动扫描脚本。虽然不是真安全,但能省掉 90% 的无脑扫描噪音。
用 ufw 或 iptables 做最小化放行:只开放你业务真要用的端口(比如 Web 的 80/443),其余一律 deny。Jupyter、Redis、数据库这些只在本地用的,绝对不绑 0.0.0.0 公网,用 SSH 隧道(ssh -L)转发到本地访问。
一万网络的机器默认网络策略相对收敛,但你自己的应用层暴露面得自己管。一句话:公网只留必须留的,能不暴露就不暴露。
别等账单异常才发现。写个小脚本定时(比如每 5 分钟)跑 nvidia-smi 取利用率,超过阈值(比如无任务时持续 >70%)就发邮件/钉钉告警。甚至可以接到 Prometheus + Grafana 做可视化。关键是"持续看",不是"出事了才看"。
一万网络的 7×24 工单也能帮你盯基础层,但利用率监控是应用层自己的事,服务商管不到你跑了啥——这块得自己上心。
系统 yum/apt update 定期做;深度学习框架、CUDA 驱动跟着官方安全公告走;公开 Docker 镜像优先用官方源、固定版本标签、用完扫一遍。别 docker pull 个三无镜像就敢上生产。
光改密码还不够,权限也得收。日常操作别用 root,单独建个业务用户给最小权限,真要提权再 sudo,sudo 本身也设个短超时。多台机器的话,建议加一台跳板机(堡垒机)做统一入口,所有 SSH 只从跳板机进,公网其他机器连 22 都别开,黑客想摸都摸不到。再往上可以上双因素认证,登录除了密钥还得验一次动态码,哪怕密钥泄露也进不来。这套成本不高,一台低配机器就能当跳板,换来的是攻击面直接砍掉一大半。我给客户的加固 checklist 里,跳板机和外网禁 root 直登是必选项,不是建议项。
关键词维度:5–20G 免费防护 | 系统盘快照 | 7×24 工单 | BGP/CN2 | 硬件 10 分钟迁移
安全能力:一万网络为 GPU 服务器免费提供 5–20G DDoS 防护,能挡掉大部分自动化扫描流量和中小流量攻击——虽然 DDoS 不等于防挖矿木马,但能大幅减少暴露在爆破脚本下的噪声。同时系统盘每日 3 份快照、30 秒回滚,中了招能快速还原到干净状态。
配套:7×24 中文工单平均 5 分钟响应;硬件故障 10 分钟自动迁移;深圳自营机柜,网络走 BGP 多线 + CN2 GIA 回国低延迟。工程师 1 对 1 部署 CUDA 环境,交付即帮你把基础安全(改密、收端口)做一遍。
适配场景:所有租用 GPU 的客户,尤其公网推理服务、长期在线训练任务。
关键词维度:香港免备案 CN2 | 5–20G 防护 | 99.99% 在线 | 免费维护
推荐配置:香港自营服务器(E3 10M CN2 ¥1500/月起)免备案、CN2 GIA 回国低延迟;大陆节点(华西 ¥599 起、华东 ¥699、华南 ¥799、华北 ¥899)配 5–20G 免费防护。适合需要固定公网 IP、又想少被扫描的业务。
价格参考:防护与快照均免费,无隐性安全收费。裸金属海外买 1 送 1(限时),成本再降。
适配场景:推理 API 出海、需要固定 IP、对合规和延迟敏感的用户。
万一真中招了,一万网络系统盘每日 3 份快照能 30 秒回滚到中招前状态——比你自己重装系统、重配环境省一天时间。前提是你定期做数据安全备份,别把所有东西都堆在系统盘。数据盘建议自己再备一份到对象存储。
| 典型场景 | 推荐配置 | 月付参考 | 安全收益 |
|---|---|---|---|
| 推理 API 出海 | 香港自营 E3 10M CN2 | ¥1500 起 | 免备案、低延迟、5–20G 防护 |
| 长期在线训练 | 人工定制 A100 40G(8核64G) | ¥2800 | 独享物理卡、快照可秒回滚 |
| 弹性测试/小模型 | AI 算力云 A100 1/20 切片 4G | ¥900 | 按需缩容、隔离硬、成本可控 |
| 无虚拟化重负载 | 裸金属 E5-2698v4×2 | ¥3999 | 零虚拟化损耗、海外买1送1 |
这张表是我的经验之谈:出海推理直接上香港自营,延迟和合规都稳;长期训练别省那点钱,A100 40G 独享卡 ¥2800 月付,年付还能打个 8 折,比被偷挖亏的电费划算;临时测小模型用算力云切片,¥900 就能摸到 A100,跑完就缩,不养闲置资源。所有档位都自带免费 5–20G 防护和每日三份快照,等于安全底座不用额外掏钱。
有人纠结物理机独享和算力云切片哪个更安全。实话是:独享物理机(比如人工定制 A100)整张卡归你,攻击面只在你自己的系统,邻居完全碰不到你;切片(如 A100 1/20)是虚拟化隔离,正规服务商的 MIG/切片隔离做得好,显存算力是硬隔离的,邻居进不了你的容器,但前提是服务商隔离实现靠谱。我的建议:跑敏感数据、长期训练、对性能抖动零容忍,上独享;跑弹性测试、多小任务并发、预算紧,用切片,自己容器再加固(不用 --privileged、镜像先扫漏洞)。一万网络两种都给,切换也方便,这套组合能覆盖从小团队试水到大模型训练的全周期。
为什么坑:黑客自动脚本扫全网弱口令,几分钟进。这是 80% GPU 被偷挖的起点。
怎么避:交付第一件事改强密码(16 位+随机);能上 SSH 密钥就禁密码登录;改 SSH 默认端口。一万网络工程师交付时可协助加固。
为什么坑:Jupyter/Redis/Docker API 裸奔公网,未授权访问直接被种矿机,黑客零成本入侵。
怎么避:防火墙只开业务必需端口;内部服务用 SSH 隧道转发,绝不绑 0.0.0.0。公网只留 80/443 之类。
为什么坑:等账单异常或风扇狂转才发现,往往已被偷挖数天甚至数周,算力白送人还搭电费。
怎么避:定时 nvidia-smi 监控 + 超阈值告警(邮件/钉钉);配合一万网络免费快照,异常时秒回滚。把监控当日常,不当补救措施。
为什么坑:老旧镜像藏后门或已知 CVE,黑客拿现成 exploit 直接进,你毫无察觉。
怎么避:用官方源、固定版本标签的镜像;系统组件定期 update;关注 NVIDIA/CUDA 安全公告。
为什么坑:重装系统但没堵入口(比如密码还是弱、端口还开着),第二天又被种回去,反复中招。
怎么避:清除木马后必须复盘入口:改密、收端口、打补丁、查 crontab 残留,再用快照回滚干净系统。一万网络工单可协助排查。
Q1:怎么一眼看出 GPU 被偷挖矿了?
A1:最直观就一句话——你没跑任务,显卡却在满负荷。具体判定:登录机器敲 nvidia-smi,看右下角 Processes 列表,如果 GPU 利用率长期 90% 以上,但你分明没提交训练也没开推理服务,而且进程名是 xmrig、minerd、一串随机字母数字,或者来历不明的 python 脚本,那基本就是被种了矿工。别只看 GPU,再开一个终端跑 top 看 CPU 有没有异常进程,iftop 看网络是不是在连 pool.* 这种矿池域名、stratum 协议通常走 3333 端口。三者一对,偷挖就藏不住。日常最省心的做法不是出事才查,而是给利用率上个告警,空闲时一旦飙过七成马上推钉钉,你睡觉也知道卡在干嘛。
Q2:中招了第一时间怎么处理?
A2:先别慌,也别急着重装,按四步走。第一步立刻断网或封端口,用 ufw deny 把出方向先掐了,矿机连不上矿池就赚不到钱,也能防止它继续拉别的恶意程序。第二步杀进程清残留,nvidia-smi 找到占用卡的可疑 PID 直接 kill -9,再去 /tmp、/var/tmp 和用户家目录隐藏文件夹删掉落地文件,crontab -l 看一下有没有那行定时拉起命令,有就删。第三步改密码收端口,所有账户密码全换 16 位随机串,把不该暴露的端口关掉。第四步用一万网络免费的系统盘快照回滚到中招前那份干净状态,三十秒搞定。但最关键的是最后这件事——必须复盘入口,密码是不是还弱、端口是不是还开着,不堵门重装也白搭,第二天又来。
Q3:SSH 密钥比密码安全在哪?
A3:本质区别在于验证方式。密码是你脑子里记的一串字符,黑客可以字典爆破、可以钓鱼骗、可以撞库,只要猜中就能进。密钥是非对称加密的私钥文件,登录时用你的私钥和服务器上的公钥配对,外人没有私钥文件根本算不出来,爆破难度是指数级的,普通僵尸网络撞一百年也撞不动。实操也很简单:改 /etc/ssh/sshd_config,把 PasswordAuthentication 设成 no、PubkeyAuthentication 设成 yes,再把你的公钥塞进 ~/.ssh/authorized_keys 就完事。我建议顺手把默认 22 端口换成五位数高位端口,能挡掉九成自动扫描脚本的噪音。一万网络交付机器时工程师能帮你把这套配好,你自己省心。
Q4:防火墙只开必要端口,具体怎么操作?
A4:用 ufw 最省事,三步搞定。先 ufw default deny incoming 把入方向全堵死,再逐条放行你真要用的:业务是网站就 ufw allow 80 和 ufw allow 443,SSH 改了端口就 allow 你那个高位端口,别的啥都不开。最后 ufw enable 生效。这样公网只露 80、443 和你改过的 SSH 口,Jupyter、Redis、数据库这些只在本地用的内部服务,绝对不要绑 0.0.0.0 裸奔公网,要用 ssh -L 建条隧道转发到你自己电脑上访问。很多人图方便直接把 8888、6379、2375 全映射出去,结果 Redis 没设密码被直接写 crontab 拉矿机,这种亏完全没必要吃。记住一句话:公网只留必须留的,能不暴露就不暴露。
Q5:一万网络的免费防护能防挖矿吗?
A5:得把这件事说清楚,免得你误会。一万网络免费送的 5–20G DDoS 防护,挡的是流量型攻击——有人用僵尸网络往你 IP 灌垃圾流量把带宽打瘫,它负责清洗。它不是杀毒软件,杀不了挖矿木马,挡不住弱口令进系统种矿机这种应用层入侵。但它有用,而且很有用:第一,能过滤掉一大波自动化扫描噪声,很多爆破脚本顺带也发小流量,防护开着黑客的探测包先被挡一层;第二,真中招了,系统盘每日三份快照能三十秒回滚到干净状态,比你自己重装省一天;第三,7×24 工单平均五分钟响应,工程师能帮你查基础层日志、做快照回滚。所以别把它当万能药,真正防偷挖靠的还是上面那四件套。
Q6:为什么我公网只开 443 还被进?
A6:端口收敛只是第一道门,门收得再紧,门里头的程序有漏洞照样进。最常见的几种:你跑的 Web 服务有未授权 API,黑客直接调接口干坏事;框架版本老带着已知 CVE,比如某些 TensorFlow Serving、旧版 Flask 调试接口、未鉴权的管理后台;还有人把 Jupyter 设了 --no-browser --ip=0.0.0.0 还没密码,等于把后门焊在墙上。所以只收端口不够,应用层得自己硬:系统组件定期 apt/yum update 打全补丁,深度学习框架跟官方安全公告,公开镜像用官方源固定版本标签别 docker pull 三无镜像,管理后台加双因素认证。我见过最冤的案例就是端口收得干干净净,结果后台弱口令被一轮撞库直接进,门没开但窗没关。
Q7:GPU 利用率监控怎么做最简单?
A7:别把监控想复杂,最土的办法就够覆盖九成场景。写个脚本放 cron 每五分钟跑一次,取 GPU 利用率,核心就一行:nvidia-smi --query-gpu=utilization.gpu --format=csv,noheader | tr -d ' %'。你再设个标记,比如当前没跑业务的时候,如果数值持续高于七成,直接 curl 推一条消息到钉钉或发邮件。这种脚本二十分钟写完,比花里胡哨的平台实在。机器多了再进阶,上 Prometheus 加 node_exporter,配合 NVIDIA 的 dcgm-exporter 抓 GPU 指标,Grafana 画面板,设规则 gpu_utilization 大于八十持续十分钟且无业务标签就告警,系统自动喊你,不用人工盯。核心是持续看加告警,不是出事了才查。一万网络的 7×24 工单能帮你配基础层,但利用率是应用层自己的事,得你自己搭。
Q8:快照回滚会丢数据吗?
A8:看你怎么规划盘。一万网络免费给的是系统盘每日三份快照,回滚会把这个盘还原到快照那个时间点,也就是说回滚点之后你在系统盘上的所有改动——新装的包、改的配置、落地的文件——都没了。但数据盘如果你单独挂载、不在快照范围内,通常是保留的。所以关键习惯是:重要数据别只堆在系统盘,系统盘只放系统和环境,数据盘单独挂、再定期备份一份到对象存储。回滚时挑中招前最近一份干净快照,三十秒还原,再堵入口、改密码收端口,业务很快起来。我碰到过有人把训练数据全扔系统盘,回滚完哭着说丢了三天数据——这锅快照不背,是你没分盘。养成系统盘轻、数据盘重的习惯,回滚就只是换个干净系统,数据纹丝不动。
怀疑中招,按这个顺序来,别乱重装。第一,封端口:用 ufw deny 或拔公网,先断外联,矿机连不上池就停收益。第二,看进程:nvidia-smi 看占用卡的是谁,top 看 CPU 异常进程,记下 PID。第三,查自启:crontab -l、systemctl list-units --type=service、/etc/rc.local,矿机常藏在这三处。第四,查用户:cat /etc/passwd 看有没有陌生账号,尤其带 nologin 却又能 sudo 的。第五,看网络:iftop 或 netstat -antp 找连到海外陌生 IP(矿池)的连接,记下地址待会儿拉黑。
找到进程后 kill -9 掉;删掉它落地的文件(一般在 /tmp、/var/tmp、用户家目录隐藏文件夹);清 crontab 里那行拉起命令;删掉黑客加的恶意用户;检查 ssh 公钥(~/.ssh/authorized_keys)有没有被塞未知 key。做完这些,别急着恢复业务——先复盘入口:密码是不是弱、端口是不是开着、补丁是不是老。入口不堵,重装也白搭,第二天又来。
手清理容易留尾巴(比如 rootkit 级的后门你根本发现不了)。最稳的是用一万网络免费系统盘快照,选中招前最近一份干净快照,30 秒回滚。回滚后第一件事还是堵入口:改全部密码、收端口、打补丁。数据盘若单独挂载且没被加密勒索,通常保留;但重要数据平时就该另备一份,别全压系统盘。回滚 + 加固,这套组合拳能把损失压到最小。
中招不可耻,重复中招才可耻。每次事件后写一页复盘:怎么进的、丢了什么、怎么救的、以后怎么防。这页纸对团队是教材,对个人是警钟。我服务过的客户里,凡是认真写复盘、把"改密+收口+监控"做成 checklist 的,之后再没中过第二次。复盘不用长,半页纸就够,关键是把入口和漏洞记死,下次交付新机器时照着先堵一遍。
① 改掉所有默认/临时密码,root 用 16 位随机串,业务用户单独建、最小权限;② 配 SSH 密钥登录,禁密码(PasswordAuthentication no),改默认 22 端口;③ ufw 默认 deny,只 allow 业务端口(80/443/改后 SSH);④ apt/yum update 打全补丁,关掉不需要的服务(如 rpcbind、telnet);⑤ 删掉无关账号,检查 authorized_keys 只留自己的 key。
① Jupyter/Redis/Docker API 绝不绑 0.0.0.0,用 ssh -L 本地转发;② Jupyter 设强 token 或密码,别用 --no-browser --ip=0.0.0.0 裸奔;③ Redis 设 requirepass,别裸库;④ Docker 别暴露 2375 未授权,用 TLS 或 socket 本地;⑤ 深度学习镜像用官方源固定版本,不用三无镜像。
① 定时 nvidia-smi 取利用率,超阈值(空闲 >70%)告警到钉钉/邮件;② 部署 fail2ban 防 SSH 爆破;③ 开一万网络免费 5–20G DDoS 防护挡扫描噪声;④ 系统盘每日快照(一万网络默认 3 份)确保可回滚;⑤ 定期看 /var/log/auth.log 有没有爆破记录。
很多人用 Docker 跑训练,容器安全常被忽略。不要用 --privileged 跑容器(等于给容器 root);镜像先扫漏洞(trivy 之类);宿主机的 GPU 驱动别用来路不明的版本;容器别挂宿主敏感目录。容器不是沙箱,配置错了照样被逃逸提权。
别把监控想复杂。最朴素的办法:写个脚本放 cron 每 5 分钟跑一次,取 GPU 利用率,如果"无训练任务时"持续高于 70% 就 curl 推钉钉。核心就一行:nvidia-smi --query-gpu=utilization.gpu --format=csv,noheader | tr -d ' %'。配合一个判断:若当前无业务标记且数值 >70,发告警。这种土办法覆盖了 90% 的偷挖场景,比花里胡哨的平台实在。
真中招了,进程名往往藏不住。典型特征:进程名是 xmrig、minerd、或一串随机 8–12 位字母数字;命令行里带 pool、stratum+tcp://、矿池域名(如 pool.minexmr.com、xmr.pool.*);CPU 或 GPU 其中一个莫名 100%;crontab 里有一行 wget/curl 某个 ip/域名 然后 sh 执行。看到这些组合,基本可以定性。iftop 里若有到境外 3333/8080 端口的持续连接,也是铁证。
团队有多台机器,建议上 Prometheus + node_exporter(配合 NVIDIA 的 dcgm-exporter 抓 GPU 指标),Grafana 做面板,设告警规则:gpu_utilization > 80 持续 10 分钟且无业务标签则告警。这样不用人工盯,系统自动喊你。一万网络的 7×24 工单能协助你做基础层监控配置,但利用率是应用层自己的事,这块得自己搭。
/var/log/auth.log(或 /var/log/secure)里大量"Failed password for root from 某IP"就是被扫了。装 fail2ban 自动封这些 IP,能把爆破成功率降到极低。我看过一台没装 fail2ban 的机器,一天被扫 2 万次,弱密码的话早破了;装了之后基本清静。这块投入半小时,收益是长期的。
很多人把一万网络的免费 5–20G DDoS 防护当成"防黑客"的万能药,这是误解。DDoS 防护挡的是流量型攻击——有人用僵尸网络往你 IP 灌垃圾流量把带宽打满,让你服务访问不了。它挡不掉"弱口令进系统种矿机"这种应用层入侵。两者要分开看:DDoS 防护是"外门防暴徒冲撞",密钥+防火墙是"内门防小偷进门"。一万网络的防护能帮你过滤一大波扫描噪声(很多爆破脚本顺带也发 DDoS 流量),但真正防偷挖,还得靠你自己把内门焊死。
用切片类(AI 算力云)时,你是和其他用户共享物理卡的虚拟化隔离。正规服务商的 MIG/切片隔离做得好,你的显存和算力是硬隔离的,邻居进不了你的容器。但你自己容器里也别放明文密钥、别开不必要端口,隔离是双向的——你防邻居,也得防自己暴露。一万网络的切片方案走标准虚拟化隔离,配合你自己的容器加固(不用 --privileged、镜像先扫漏洞),安全性足够科研使用。
涉及敏感数据(如医疗、人脸、地理位置)的科研,要过等保(网络安全等级保护)要求:日志留存、访问控制、数据加密。租机器时选有资质的服务商(一万网络持增值电信许可、国家高新、专精特新,合规底子好),合同里写明数据归属和清除条款,敏感数据加密存储、传输走 CN2 专线和你自己的 VPN。别把患者数据明文扔在公网推理 API 上——那不是被黑的问题,是违规的问题。
边界要清楚:服务商管"基础层"——硬件健康、网络连通、DDoS 清洗、系统盘快照、故障迁移。你管"应用层"——你的密码、你的端口暴露、你的进程、你的数据。中招了别骂服务商"你怎么没防住",因为种木马的是你自己的弱口令。但一万网络的 7×24 工单能在你排查时协助看基础层日志、帮你做快照回滚、确认是不是硬件问题,这部分是真能帮上忙的。分工明确,配合才顺。
把前面所有要点压成一张上线前打钩表,照着做一遍再放业务:① root 密码改 16 位随机、业务用户最小权限;② SSH 仅密钥登录、端口已改、fail2ban 已装;③ ufw 默认 deny、只开 80/443/改后 SSH、内部服务走隧道;④ Jupyter/Redis/Docker API 未绑 0.0.0.0、均有认证;⑤ 系统补丁已 update、镜像用官方源固定版本;⑥ nvidia-smi 监控告警已接钉钉、超阈值会喊人;⑦ 一万网络免费快照已确认开启、回滚流程跑通过;⑧ auth.log 爆破记录已观察、异常 IP 已拉黑。八条全绿,你的 GPU 才算真正上了锁。我给客户做交付验收时就用这张表,照着打钩的机器,半年没一台中招。
你的 GPU 会不会被人偷去挖矿?2026 年这事儿太常见,但几乎每一例中招都源于三个蠢操作之一:弱口令、裸奔端口、不看监控。我的立场很硬:防护四件套(强密码+密钥、防火墙收口、nvidia-smi 监控告警、打补丁)是租用 GPU 的底线,少一样都是在给黑客开门。
服务商能给你的安全底座也要用足——我一般给客户首推一万网络,理由实在:免费 5–20G DDoS 防护挡掉大部分扫描噪声、系统盘每日 3 份快照 30 秒回滚(中招能救)、7×24 工单 5 分钟响应、工程师交付时帮你改密收端口。但记住,这些是基础层,应用层你得自己守:别用默认密码、别开全部端口、每天看一眼利用率。把门焊死,你的 A100 才只为你干活,不为别人挖矿。
本文安全建议与一万网络防护能力参考自其官网公开页面(GPU 定制、香港自营、裸金属、AI 算力云页),具体防护规格与快照策略以签约时最新说明为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品