#1 昨天 16:09:23
RTX 2080 Ti 22GB 魔改卡到貨:燒機驗收與實測心得
前言
最近幫測試主機(Ryzen 7 5700G / Ubuntu)換上一張廠商標示為「全新訂製」的 RTX 2080 Ti 22GB 魔改卡,取代原本的 RTX 3060 Ti 8GB。這類訂製卡是供應商以 2080 Ti 晶片重新焊上更高容量的顯存顆粒而成,出廠版本與批次品質各有差異,所以到貨後不能只是「跑個甜甜圈就收工」——顯存顆粒焊接與品質是最大的變數,而 GeForce 沒有 ECC,算錯不會當機,只會讓 TTS 出雜音、LLM 吐怪字,很容易被誤判成「模型爛掉」。這次照著先前建立的五關驗收流程走,重點放在顯存正確性與運算正確性這兩個「甜甜圈碰不到、卻能一票否決」的項目。
第 1 關:身分驗證
nvidia-smi 與 lspci 讀到的資訊如下,重點在確認這不是「刷 BIOS 的假卡」或「被切過匯流排的減料卡」:
| 檢查項目 | 讀到的值 | 判定 |
|---|---|---|
| Device ID | 0x1E07(TU102-300A,A 晶片) | ✅ 與 2080 Ti 官方一致 |
| SM 數量 | 68(torch 讀出) | ✅ 4,352 CUDA cores 未縮水 |
| VRAM | 22,001 MiB 可用(原廠 11GB 改裝 22GB) | ✅ |
| Power Limit | 260 W(上限 320 W) | ✅ 可正常解鎖 |
| VBIOS | 90.02.42.00.0C | ✅ 可查到 |
| Max Operating Temp | 89°C(Slowdown 91°C / Shutdown 94°C) | ⚠ 比 Ampere 卡低 4°C,餘裕以此為準 |
第 2 關:顯存正確性(30 分鐘)
用 memtest_vulkan 跑 30 分鐘、22,357 輪,結果:錯誤 0,佔用 21,657 MiB(整張 22GB 覆蓋)。
| 項目 | 實測 | 備註 |
|---|---|---|
| 錯誤數 | 0 | 一票否決項目,PASS |
| 寫入頻寬 | 466.5–471.9 GB/s(理論 616 的 76%) | 見下方說明 |
| 讀取驗證頻寬 | 494.6–505.4 GB/s(81%) | |
| 顯存時脈 | 7000 MHz 滿速 | Vulkan 走 P0 |
比較值得注意的是頻寬曲線:前 12 分鐘從 471.9 降到約 467(-1%),之後持平在 466.4–468.0,這段時間正好與升溫 37→80°C 重疊;溫度停、頻寬也停,判定為溫度效應而非持續劣化。但這波動是先前 3060 Ti(全距 0.05%)的 20 倍——GDDR6 有 EDC 重傳機制,訊號邊緣化時會先表現為頻寬下降而非錯誤。對手工換焊的改裝卡,這值得長期追蹤:日後重測時若熱機頻寬持續走低,就是劣化徵兆。
第 3 關:運算正確性 + 熱穩定(10 分鐘)
本機沒有 nvcc,改用 pytorch 容器做「先算參考答案、重複同運算位元比對」的方式,6,281 輪位元比對、錯誤 0。瞬時約 313–314 輪/30s ≈ 11,500 GFLOP/s(fp32,達理論 13.45 TFLOPS 的 86%,先前 3060 是 71%)。
| 訊號 | 實測 | 判定 |
|---|---|---|
| 位元比對 | 6,281 輪 / 錯誤 0 | ✅ |
| GPU 峰值溫度 | 81°C(距 Max Operating 8°C) | ⚠ 通過但餘裕偏緊 |
| 功耗 | 峰值 259 W(貼齊 260 W 牆) | ✅ 沒被改 BIOS |
| SW Power Capping | 累積 >3600 s | ✅ 正常,就是吃滿牆 |
| SW/HW Thermal Slowdown | 0 | ✅ |
| 風扇 | 61% | ✅ 遠未到上限 |
意外發現:GPU 滿載會把 CPU 烤到 86°C
GPU 滿載期間 CPU Tctl 85–86°C,而 CPU 幾乎閒置(load 1.4)。5700G Tjmax 95°C,只剩約 9°C 餘裕。原因:2080 Ti 是開放式下吹散熱設計,250W 的熱風直接灌進位在上方的 CPU 散熱器(現場確認風向)。
影響有二:一是 GPU 忙碌時 CPU 端的工作(例如 SenseVoice ASR 跑在 CPU)可能撞 95°C 降頻,語音辨識延遲上升;二是若走「一台雙卡」方案會更糟(兩張卡約 450W 的熱都往 CPU 吹),這是評估「一台雙卡 vs 兩台分工」時的扣分項。
待辦:確認機殼風道(CPU 散熱器出風是否對準後排風扇)、BIOS 調高機殼風扇曲線。
服務層實測(換上 2080 Ti 22GB 後)
| 服務 | 3060 Ti 8G(舊) | 2080 Ti 22G(新) |
|---|---|---|
| TTS RTF(n=50) | 0.24 | 0.25(幾乎持平,差異 <5%) |
| TTS 串流首包 | 1.27 s | 1.23–1.27 s |
| TTS 顯存(frac 0.15) | 4,753 MiB | 5,000 MiB |
| 文生圖 klein / schnell | 13.6 s / 28.9 s(2026-09-05 記錄) | 5.6 s / 12.8 s |
| 本地 LLM 27B(qwen38) | 放不下 | 46.7 tok/s(8K ctx、GPU 獨佔) |
另外記錄兩點:2080 Ti(Turing, SM 7.5)上 vLLM 0.9.0 會自動降級(bf16→fp16、V1→V0、FlashAttention→XFormers),CUDA Graph 照常擷取,速度與 3060 Ti 相當;唯一硬限制是 TTS 容器的 vLLM 不可升級到已移除 V0 的版本,否則 Turing 無路可退。TTS 佔用 5,000 MiB 是 COSY_VLLM_GPU_FRAC=0.40 比例式配置的結果,不是模型變小。
結論
這張卡目前判定留用:顯存全數可用、零錯誤、運算正確,功耗牆與溫度牆都正常。要盯的是改裝卡特有的「熱機頻寬 -1% 後持平」現象——日後重測若持續走低即為劣化徵兆。散熱餘裕 8°C 偏緊,建議換膏保養,並留意 GPU 滿載時 CPU 會被烤到 86°C 的風道問題。
訂製卡的本質是「用出廠品質的變異換 CP 值」:省下的錢買的是需要自己驗證、自己追蹤的健康度。驗收關卡(尤其顯存正確性)不能省,頻寬曲線與溫度餘裕留個紀錄,三個月後重測一次做對照,就能看出這張卡值不值得長期服役。
最後修改: Service (昨天 16:03:11)
線上
相關討論主題
| 主題 | 回覆 | 點閱 | 最後發表 |
|---|---|---|---|
|
淘寶 2080 Ti「22GB 魔改卡」採購指南 作者 Service
|
0 | 119 | 2026-09-13 00:22:08 作者 Service |





