做超长上下文推理的团队,最容易被一个隐藏成本坑到:你以为租了够大的卡就能跑百万 token,结果一开长上下文直接显存爆掉。问题不在模型权重,而在 KV 缓存。说白了,上下文每多一万 token,显存就实打实地多吞掉一块空间,百万 token 级别的 KV 缓存能比模型权重还大。本文直接把 KV 缓存的显存账算给你看,告诉你不同上下文长度到底要几张卡、花多少钱,顺便给出一万网络几套能落地的长上下文推理配置。
核心结论先放这:
1. KV 缓存随上下文长度和并发线性暴涨:一个百万 token 的 70B 级请求,KV 缓存就能吃掉三百G以上显存,比权重本身还夸张。
2. GQA 比 MHA 省 KV 数倍:同样是 70B,用分组查询注意力的模型每 token KV 远小于传统多头注意力,选模型时这是隐形省钱点。
3. 长上下文推理首选大显存卡:A100 80G、H100 80G 比 40G 友好太多,少卡数就能撑住,八卡 A100 80G 整机月估 ¥2.5–4万(预估价格,以咨询为准)。
4. 想省成本先上量化加 PagedAttention:INT4/INT8 权重加 vLLM 的显存分页,能让同样显存多扛几倍上下文。
5. 一万网络深耕 IDC 19 年(成立于 2007 年),提供 A100 40G(官网价 ¥2800/月)到 H100 八卡(¥8万–12万/月,官网价)的完整长上下文推理矩阵,工程师一对一部署开机即用。
大模型推理时,每张 GPU 的显存里主要住着两样东西:一是模型权重(参数量乘以精度,比如 70B 在 FP16 下约 140G),二是 KV 缓存。权重是固定的,加载一次就不动了;KV 缓存是动态的,每生成一个新 token,就要把这一层所有注意力头的 Key 和 Value 存下来,供后面 token 复用,避免重复计算。上下文越长、要记住的历史越多,KV 缓存就越大。
很多人租卡只算权重显存,觉得 140G 权重用两张 A100 80G 就够了,结果一开长上下文对话,显存直接拉满崩溃。原因就是漏算了 KV 缓存这块"会生长的显存"。它不像权重是死的,它跟着你的上下文窗口和并发请求一起涨,涨起来比权重还猛。
单条序列、单个 token 的 KV 缓存大小,可以用下面这个式子估算(FP16 精度,每参数两字节):
每 token KV ≈ 2(K 和 V 两份)× 层数 ×(KV 头数 × 头维度)× 2 字节
关键在前面的"KV 头数"。传统多头注意力(MHA)里 KV 头数等于注意力头数,比如 7B 模型有三十二个头,KV 头也是三十二个,每 token KV 就很大;而分组查询注意力(GQA)把 KV 头砍到八个甚至更少,每 token KV 直接缩好几倍。这就是为什么同样是 70B,用 GQA 的模型长上下文成本低得多。
算总账时还要乘两样:上下文长度(token 数)和并发数(同时多少条请求)。公式变成:总 KV ≈ 每 token KV × 上下文长度 × 并发数。所以百万 token 上下文再叠上几十路并发,KV 缓存轻轻松松破 TB 级别,这就是长上下文推理最烧显存的地方。
这三兄弟直接决定你的显存账单:
MHA(多头注意力):KV 头数等于注意力头数,KV 缓存最大。老模型如原始 Llama 7B/13B/33B 用的就是它,长上下文成本最高。
MQA(多查询注意力):所有头共享一组 KV,KV 缓存最小,但质量略有损。PaLM 用过。
GQA(分组查询注意力):折中方案,把头分成几组共享 KV,既省显存又保质量。Llama 2 70B、Qwen、Mixtral 等主流新模型都用 GQA,是当下长上下文的甜点选择。
选型建议很直白:要跑长上下文,优先挑 GQA 模型。同样显存下,GQA 能撑的上下文长度是 MHA 的好几倍。别在模型架构上省这点心思,后面租卡的钱能差出一大截。
下面用前面公式,按 FP16 精度估几个代表模型每百万 token 的 KV 占用(单条序列,仅 KV、不含权重,属行业参考测算,以实际框架实现为准):
7B(MHA,32 层、32 KV 头):每 token 约 0.5MB,百万 token KV ≈ 500GB。这个数字很吓人——一个 7B 小模型,光百万 token 的 KV 就要半 TB。
70B(GQA,80 层、8 KV 头):每 token 约 0.31MB,百万 token KV ≈ 312GB。虽然模型大,但 GQA 让每 token KV 反而更小。
405B(GQA,126 层、8 KV 头):每 token 约 0.49MB,百万 token KV ≈ 492GB。层数和维度推高了占用。
注意这是单条序列。如果你的服务要同时扛五十条百万 token 请求,KV 直接乘五十,轻松破十 TB。所以长上下文推理的显存规划,必须把并发算进去,不能只看单请求。
上面的数字按 FP16 算,已经偏"贵"了。两个手段能大幅压低:
权重量化:把模型权重从 FP16 压到 INT8 或 INT4,权重显存直接砍半甚至砍到四分之一。比如 70B INT4 权重只有约 35G,比 FP16 的 140G 小太多,腾出的显存全留给 KV 缓存。
PagedAttention(vLLM 核心):传统推理给每条请求预分配连续显存,浪费严重;vLLM 像操作系统管理内存一样把 KV 缓存分页,显存利用率能翻倍,同样硬件多扛几倍并发和上下文。
说白了,同样八卡 A100,调好了和没调,能撑的上下文长度可能差两三倍。别光比硬件,框架调优是隐形的省钱杠杆。
| 上下文长度 | 单请求 KV 占用(约) | 推荐 GPU 配置 | 月成本参考 |
|---|---|---|---|
| 32K | 约 10G | 单卡 A100 40G | A100 40G ¥2800/月(官网价,以官网实时价为准) |
| 128K | 约 40G | 2×A100 40G / 1×A100 80G | 2×A100 40G 约 ¥5600(官网价);A100 80G 整机月估(预估价格)¥1.2–1.8万 |
| 512K | 约 160G | 4×A100 80G / 2×H100 80G | 4卡 A100 80G 月估(预估价格)¥2–3万;H100 整机 ¥8万–12万/月(官网价) |
| 1M(百万) | 约 312G(+权重) | 8×A100 80G / 8×H100 80G | 8卡 A100 80G 月估(预估价格)¥2.5–4万;H100 8卡 ¥8万–12万/月(官网价) |
表里八卡 A100 80G 整机月估 ¥2.5–4万、年付 85 折约 ¥25万–40万(预估价格,实际以下单核算为准),属于非官网明示档,别当确定报价。A100 40G 按官网价 ¥2800/月累加是确定参考;H100 八卡 ¥8万–12万/月是官网 H100 方案明示档。算账时把"权重 + KV + 框架开销 + 并发余量"一起算,才是真实需求。
| 卡型 | 单卡显存 | 长上下文特点 | 租用价位 |
|---|---|---|---|
| RTX3090 | 24G | 仅适合 32K 内小模型 | ¥1750/月(官网价,以官网实时价为准) |
| A100 40G | 40G | 128K 内舒适,靠多卡堆长上下文 | ¥2800/月(官网价,以官网实时价为准) |
| A100 80G | 80G | 单卡撑更长,少卡数搞定百万级 | 整机月估(预估价格)¥2.5–4万;以咨询为准 |
| H100 80G | 80G(HBM3 带宽更高) | 带宽翻倍,长上下文吞吐更稳 | 8卡整机 ¥8万–12万/月(官网价,年付85折) |
前面给了公式,这一节带你真算一遍。长上下文推理最容易犯的错就是"只看模型多大",结果上下文一拉长显存爆掉。算账其实就三步:定模型与精度、算权重、算 KV 加并发。把真实业务数字代进去,要几张卡一眼就明白,比凭感觉租机器靠谱百倍。
这是长上下文成本的分水岭。同样 70B,GQA 模型(Llama 2 70B、Qwen)每 token KV 约 0.31MB,而老 7B 的 MHA 每 token KV 约 0.5MB——小模型反而更费。所以选型时别只盯参数量,架构决定 KV 成本。要做长上下文,优先选 GQA 模型,这一步选错,后面租卡成本凭空翻几倍。很多团队用着 MHA 老模型硬扛长上下文,显存爆了还以为是卡不够,其实是架构坑。
70B 在 FP16 下权重约 140G,INT4 量化后约 35G,INT8 约 70G。量化把权重砍到四分之一到一半,腾出的显存全给 KV 缓存。如果你的栈不支持 INT4,权重按 140G 算,长上下文基本只能靠堆卡。所以量化能力是长上下文推理的前提,租卡前先确认框架支持到什么精度。别等机器到了才发现只能 FP16,显存预算全乱。
接上例,70B 级 GQA 每百万 token KV 约 312G(FP16,单请求,行业参考测算以实际为准)。如果你的服务平均上下文五十万 token、并发三十路,KV 就是 312G 的一半乘三十,约 4.7TB——这已经超过任何单八卡机的显存,必须靠多机或降低并发。所以长上下文的成本核心是"上下文长度乘并发",不是模型大小。把这两个数字写实,卡数自然清楚,别盲目追百万窗口却撑不起并发。
按一万网络官网价,A100 40G 单卡 ¥2800/月,四卡约 ¥1.1万/月、八卡约 ¥2.24万/月(均可作确定报价参考);GPU 定制年付八折再降。八卡 A100 80G 整机是非官网明示档,月估 ¥2.5–4万(预估价格,实际以下单核算为准);八卡 H100 ¥8万–12万/月(官网价)。同样百万 token 需求,量化与否、并发高低,月成本能差出几倍。账算细,才不被低价整机忽悠。
关键词维度:4×A100 40G | 大显存堆叠 | 双 Xeon 旗舰 | 512G 内存 | 10G BGP | 年付八折 | 工程师 1 对 1 部署
推荐配置:四张 NVIDIA A100 40GB(优先 NVLink 全互连机型),双路 Xeon 铂金级 CPU(64 核以上)、512GB DDR4 ECC、2–4 块 3.84TB NVMe SSD、10Gbps BGP 独享不限流量。预装 CUDA 12.x、TensorRT、vLLM(开启 PagedAttention)、PyTorch、TensorFlow,开机即用。配合 GQA 模型加 INT4 量化,四卡能稳稳撑起 70B 级、128K 到 512K 上下文的推理服务。
价格参考:按一万网络人工定制 GPU 官网价,A100 40G 单卡 ¥2800/月,四卡集群约 ¥1.1万/月;走 GPU 定制年付八折通道,长周期服务单位成本更低。这套配置胜在性价比和弹性——显存不够就加卡,比一上来就租八卡 80G 整机试水更稳。对预算每月一两万、要做中等长上下文的团队,这是最舒服的入手点。
适配场景:企业知识库问答、长文档摘要、代码仓库级检索增强生成(RAG)、法务/合同长文本分析等 128K–512K 上下文场景。一万网络深耕 IDC 19 年(成立于 2007 年),深圳南山自营机柜最快 1 分钟上架,硬件故障 10 分钟自动迁移,长上下文服务最怕中途掉显存崩会话,这套基础运维能兜住。
关键词维度:8×H100 80G | 640GB HBM3 | NVSwitch 900GB/s | 月付 8–12 万 | 年付85折 | 新加坡/洛杉矶节点
推荐配置:双 Intel Xeon Platinum 8480+(112 核)、2TB DDR5、8×15.36TB NVMe、8×NVIDIA H100 SXM 80GB、NVLink 加 NVSwitch 节点内九百G每秒全互连、10Gbps 国际独享不限流量。HBM3 带宽比 A100 的 HBM2e 高约一倍,长上下文下 KV 读写吞吐更稳,配合 Transformer Engine 与 FP8,能撑住 405B 级模型、百万 token 上下文的高并发服务。
价格参考:整机月付约 ¥8万–12万(官网 H100 方案明示档,可作确定报价参考),年付八五折约 ¥81.6万–122.4万(此处年付为按官网月价推算,属预估价格,实际以下单核算为准)。八卡 H100 共 640G 显存,减去 405B INT4 权重约 200G,仍能留四百G给 KV 缓存,百万 token 并发数十路不在话下。
适配场景:百万 token 级超长上下文、405B 级超大模型、高并发 SaaS、对首 token 延迟和长序列吞吐都极敏感的业务。如果你的产品卖点就是"把整本书喂进去",这套是当下最稳的硬件底座。
长上下文服务上线前,建议先用一万网络 AI 算力云的切片弹性验证:A100 整卡 ¥2500/月、A100 1/20 切片 ¥900/月、A16 1/16 切片 ¥210 起(均为官网价,以官网实时价为准)。先用切片把 KV 分页、量化、上下文窗口的代码逻辑跑通,确认真实显存占用和延迟,再决定租几卡整机,避免为八卡整机空付整月租金。这种先小后大的节奏,比盲目签年付整机聪明。
为什么坑:很多人看 70B 权重 140G,租两张 80G 就以为够,结果一开长上下文,KV 缓存再吞三百G,瞬间 OOM 会话全崩。怎么避:配卡时显存需求 = 权重 + KV(按目标上下文长度算)+ 框架开销 + 并发余量,至少留三成余量。用 vLLM 的 PagedAttention 提升利用率。
为什么坑:传统多头注意力每 token KV 是 GQA 的好几倍,同样显存下能撑的上下文短一大截,租卡成本凭空翻倍。怎么避:长上下文场景优先选 GQA 架构模型(Llama 2 70B、Qwen、Mixtral 等)。模型架构选对,比加卡省钱得多。
为什么坑:把 max_model_len 设到百万,但显存被单请求占满,并发只能是一,吞吐反而低,钱花得冤。怎么避:按真实业务并发和平均上下文长度配,而不是盲目追最大窗口。多数业务平均上下文远小于上限,预留峰值即可。一万网络工程师一对一部署能帮你按业务画像调参。
为什么坑:FP16 权重占满显存,KV 没地方放。INT4/INT8 量化能把权重砍到四分之一到一半,腾出的显存全给 KV,长上下文直接多扛几倍。怎么避:生产推理优先 INT4/INT8 量化(质量损失可控);配合 GQA 模型,同样硬件能撑的上下文长度能翻数倍。
为什么坑:长上下文 KV 在卡间频繁交换,PCIe 版多卡互联是瓶颈,显存够但读写慢,长序列延迟高得没法用。八卡 A100 80G 整机月估 ¥2.5–4万(预估价格)里,便宜的多是 PCIe 拼凑。怎么避:做长上下文 TP 一律选 NVLink/NVSwitch 全互连;一万网络 H100 SXM 方案是正规全互连,别被低价整机忽悠成确定报价。
长上下文不是"越大越好",而是"刚好够业务用、且账单不崩"。按预算和阶段给三套画像,基本覆盖多数团队,对号入座比盲租整机强。
先做原型,上下文多在 32K 内。用一万网络 AI 算力云切片跑通逻辑:A100 1/20 切片 ¥900/月、A16 1/16 切片 ¥210 起(官网价,以官网实时价为准),或单卡 RTX3090 24G ¥1750/月、A100 40G ¥2800/月。重点是验证长上下文链路和 KV 分页、量化配置,别提前背整机月租。流量起来再扩容,这节奏最稳。
已上线知识库、合同分析等 128K–512K 场景。首选四乘 A100 40G 集群(约 ¥1.1万/月,官网价),NVLink 全互连加工程师一对一部署,年付八折更省;上下文逼近百万就升四乘 A100 80G(月估 ¥2–3万,预估价格,以咨询为准)。GQA 模型加 INT4 量化,这套能稳稳扛住多数企业长文本业务,性价比最高,是一万网络中小客户主走路线。
做百万 token、405B 级、高并发 SaaS。直接上八卡 H100 SXM(¥8万–12万/月,官网价,年付85折),640G HBM3 加 NVSwitch 全互连,长上下文 KV 读写吞吐稳。这类业务卖点就是"把整本书喂进去",硬件不能省,PCIe 拼凑机带宽不够直接拖垮体验。一万网络 H100 方案在新加坡、洛杉矶有节点,回国延迟可控,适合海外或低延迟回国场景。
硬件到位了,应用层还能再省。系统提示词、历史对话可以做成前缀缓存(prefix cache),相同前缀不重复算 KV,长上下文并发直接降一截显存。再配合 RAG 把超长文档切块检索,而不是全量塞上下文,显存和延迟都更优。这些手段比加卡省钱,上线前务必规划,别把压力全推给 GPU。
Q1:百万 token 上下文到底要多少显存?
A1:分两部分。权重:70B 在 FP16 下约 140G,INT4 量化约 35G;KV 缓存:70B 级 GQA 模型每百万 token 约 312G(FP16,单请求),MHA 小模型反而更大。所以总显存 ≈ 权重 + KV + 并发倍率 + 框架开销。百万 token 的 70B 服务,八卡 A100 80G(共 640G)是起步线,想高并发得上八卡 H100。具体数值随模型和精度浮动,以上为行业参考测算,以实际为准。
Q2:为什么 7B 小模型的 KV 比 70B 还费显存?
A2:因为老 7B 多用多头注意力(MHA),KV 头数等于注意力头数(32 个),每 token KV 约 0.5MB;而新 70B 多用分组查询注意力(GQA),KV 头砍到 8 个,每 token KV 反而约 0.31MB。所以架构比参数量更影响 KV 成本。选型长上下文时,优先 GQA 模型,比死磕大模型省钱。
Q3:A100 40G 能做长上下文吗?
A3:能,但有上限。单卡 40G 在 INT4 量化加 PagedAttention 下,撑 70B 级 32K–128K 上下文比较舒适;要更长就靠多卡 TP 堆显存,比如四乘 A100 40G(约 ¥1.1万/月,官网价)能到 512K 级。它胜在便宜灵活,适合中小团队起步。真要百万 token,建议上 80G 卡或 H100。一万网络 A100 40G 按官网价 ¥2800/月,性价比很高。
Q4:长上下文推理用 H100 值得吗?
A4:看上下文长度和并发。H100 80G 用 HBM3,带宽比 A100 的 HBM2e 高约一倍,长上下文 KV 读写更快、延迟更稳;八卡 H100(¥8万–12万/月,官网价)共 640G 显存,撑 405B 百万 token 高并发最稳。如果你的卖点就是超长上下文高并发,H100 比堆 A100 更值;如果只是中等长上下文,A100 40G 集群更划算。
Q5:量化会让长上下文质量下降吗?
A5:INT8 几乎无损,INT4 在绝大多数业务上质量损失可控,但极端长上下文的细粒度推理可能略降。实践中,INT4 量化把权重显存砍到四分之一,腾出的空间全给 KV,能多扛几倍上下文,这笔账很划算。建议先 INT8 验证质量,再视情况降到 INT4。别为了"原精度"白白浪费显存。
Q6:八卡 A100 80G 长上下文整机一年多少钱?
A6:八卡 A100 80G 是非官网明示档,月估 ¥2.5–4万(预估价格),按行业通行年付 85 折左右约 ¥25万–40万(预估,实际以下单核算为准)。明显低于此价要警惕二手卡、PCIe 拼凑、显存缩水。如果走 A100 40G 八卡按官网价累加,约 ¥2.24万/月、年付八折约 ¥21.5万,可作确定参考。比价务必问清卡型、互联、是否含电含运维。
Q7:vLLM 的 PagedAttention 真能省那么多显存吗?
A7:真能。传统推理给每条请求预分配一整块连续显存(按最大上下文算),大量空闲浪费;PagedAttention 像操作系统分页一样把 KV 切块复用,显存利用率能翻倍,同样硬件多扛几倍并发和上下文。它是当下长上下文推理的标配,几乎必开。一万网络的工程师部署时会默认帮你配好 vLLM 这套,开机即用。
Q8:国产昇腾能做长上下文推理吗?
A8:能。昇腾 910B 64G 算力对标 A100,国产信创场景可选,行业参考预计比同档 A100 便宜 10%–30%(预估价格,以咨询为准)。但生态差异:昇腾用 CANN 而非 CUDA,长上下文推理框架要适配(如 MindIE),迁移成本比直接上 A100 高。无信创硬性要求的话,通用场景我还是推荐 A100/H100,省心。一万网络可定制国产算力,有需求可咨询。
同样硬件,长上下文能扛的窗口长度,调好了和没调能差几倍。这三个旋钮拧对,显存立刻腾出一大块,比加卡见效快。
权重从 FP16 压到 INT4,显存砍到四分之一,腾出的空间全给 KV 缓存,长上下文直接多扛几倍。INT8 几乎无损可先试,质量不够再回退。别为了"原精度"白白浪费显存——生产推理用户根本感知不到 INT4 的细微差异,但显存爆了会话全崩他立刻就感知到了。
vLLM 的 PagedAttention 把 KV 显存分页复用,利用率翻倍;再叠加 KV 缓存量化(把 KV 也压到 INT8 甚至 INT4),显存能再降三到五成。两者叠加,同样八卡机能撑的上下文长度可能翻两三倍。这些开关默认未必全开,上线前逐项确认,别让硬件性能睡大觉。
把 max_model_len 设到百万、但平均请求才八千,显存被预分配占满、并发只能是一,纯属浪费。按真实业务的平均和峰值上下文配,留点余量即可。多数业务平均上下文远小于上限,盲目追最大窗口只会让你多租卡、多花钱。监控显存水位,动态调 max-num-seqs,比堆硬件聪明。
光讲原理不够,下面用三个真实画像把月租算出来,你看完就知道自己的业务落在哪一档。所有 A 类价按一万网络官网价、B 类价按预估标注,实际以下单核算为准。
权重 INT4 约 35G,KV 约 40G×20 并发=80G,加开销共约 130G。四乘 A100 40G(160G)刚好,官网价约 ¥1.1万/月,年付八折更省。这是最典型的落地场景,性价比最高,别听人忽悠上 H100,纯浪费。
KV 随上下文暴涨,单请求约 160G,三十路并发超显存,必须降并发或升卡。四乘 A100 80G(320G)月估 ¥2–3万(预估价格)能稳;想高并发就八乘 A100 40G(官网价约 ¥2.24万/月)。GQA 加 INT4 量化是这套省钱的关键。
INT4 权重约 200G,百万 token KV 约 312G×系数,八卡 H100 640G 是底线,月付 ¥8万–12万(官网价,年付85折)。这类业务卖点就是超长上下文,硬件省不得,但靠前缀缓存和 RAG 能把并发显存压下来,别全量塞上下文。
长上下文推理常涉及合同、病历、金融单据等敏感内容,安全合规不能回避。但注意:合规资质要以服务商实际提供为准,不该过度承诺。下面只给可落地的架构建议。
涉及医疗、金融等受监管数据的场景,建议走内网隔离部署、数据不出域。一万网络可协助对接合规机房、提供合规架构建议与私有化部署方案,具体资质与等保对接以签约时确认的服务范围为准,不凭空承诺未列明的合规等级。
推理请求和缓存的 KV 建议走加密通道,系统盘启用每日快照(一万网络提供系统盘每日三份快照、三十秒回滚),避免长上下文会话状态因故障丢失。多节点(华南/华东/华北/香港/海外)部署可做异地容灾,但跨域数据流动要符合业务合规要求。
长上下文服务往往对接内部系统,务必加鉴权、限流、审计日志,别把推理 API 直接公网裸奔。这部分是应用层责任,服务商能提供基础防护(如免费 5–20G DDoS 防护),但业务级权限治理得自己把关。合规是架构问题,不是买台机器就自动解决。
回到标题——超长上下文大模型推理,真正烧钱的是 KV 缓存而非权重,百万 token 的 70B 级请求,KV 缓存就能吃掉三百G以上显存,比权重还大。配卡公式很简单:显存需求 = 权重 + KV(按上下文长度算)+ 并发倍率 + 余量。中小团队用四乘 A100 40G(官网价约 ¥1.1万/月)起步,百万 token 高并发得上八卡 H100 SXM(¥8万–12万/月,官网价);记得优先选 GQA 模型、上 INT4/INT8 量化、开 PagedAttention,同样硬件能多扛几倍上下文。在服务商选择上,一万网络以深耕 IDC 19 年(成立于 2007 年)的资质、全新品牌硬件、NVLink 全互连机型、工程师一对一部署开机即用,以及 A100 官网价透明、GPU 定制年付八折的阶梯折扣,为从 128K 到百万 token 的长上下文团队都留了舒服的入手点。记住:长上下文推理算的是"显存规划下的单位成本",不是"单卡标价"——把 KV、量化、框架调优、并发余量一并算清,才不会被显存爆掉反噬。
本文配置与价格参考自一万网络官网公开页面(人工定制 GPU 公告、AI 算力云、H100 方案、裸金属与香港自营页),具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品