數位天堂

Nokia:科技始終來自於人性; 拜耳:如果文明不能使我們更相愛,那科技便失去意義!
歡迎您的加入,讓我們一起討論科技與環保的整合應用...

您尚未登入。

#1 昨天 16:09:23

Service
天使
註冊日期: 2007-07-15
文章數: 337
目前積分 :   

RTX 2080 Ti 22GB 魔改卡到貨:燒機驗收與實測心得

前言

最近幫測試主機(Ryzen 7 5700G / Ubuntu)換上一張廠商標示為「全新訂製」的 RTX 2080 Ti 22GB 魔改卡,取代原本的 RTX 3060 Ti 8GB。這類訂製卡是供應商以 2080 Ti 晶片重新焊上更高容量的顯存顆粒而成,出廠版本與批次品質各有差異,所以到貨後不能只是「跑個甜甜圈就收工」——顯存顆粒焊接與品質是最大的變數,而 GeForce 沒有 ECC,算錯不會當機,只會讓 TTS 出雜音、LLM 吐怪字,很容易被誤判成「模型爛掉」。這次照著先前建立的五關驗收流程走,重點放在顯存正確性與運算正確性這兩個「甜甜圈碰不到、卻能一票否決」的項目。

https://digiland.tw/uploads/3_20260918_155012_2080ti_card.jpg

第 1 關:身分驗證

nvidia-smi 與 lspci 讀到的資訊如下,重點在確認這不是「刷 BIOS 的假卡」或「被切過匯流排的減料卡」:

檢查項目讀到的值判定
Device ID0x1E07(TU102-300A,A 晶片)✅ 與 2080 Ti 官方一致
SM 數量68(torch 讀出)✅ 4,352 CUDA cores 未縮水
VRAM22,001 MiB 可用(原廠 11GB 改裝 22GB)
Power Limit260 W(上限 320 W)✅ 可正常解鎖
VBIOS90.02.42.00.0C✅ 可查到
Max Operating Temp89°C(Slowdown 91°C / Shutdown 94°C)⚠ 比 Ampere 卡低 4°C,餘裕以此為準
這台機器有兩個「看似異常其實正常」的現象:PCIe 顯示 Gen3 是對的(5700G 是 Cezanne APU,不支援 PCIe 4.0,這是 CPU 限制);閒置時 gen.current 會掉到 1(ASPM 省電)。別誤判成故障。

第 2 關:顯存正確性(30 分鐘)

用 memtest_vulkan 跑 30 分鐘、22,357 輪,結果:錯誤 0,佔用 21,657 MiB(整張 22GB 覆蓋)。
項目實測備註
錯誤數0一票否決項目,PASS
寫入頻寬466.5–471.9 GB/s(理論 616 的 76%)見下方說明
讀取驗證頻寬494.6–505.4 GB/s(81%)
顯存時脈7000 MHz 滿速Vulkan 走 P0
頻寬達成率 76% 比先前兩張 Ampere 卡(87–88%)低,但同為 Turing 架構的 2080 SUPER 在 memtest_vulkan 也只有寫入 73–79%(單一外部資料點),應屬架構差異,而非卡有問題。防偽判準(減料卡只能跑出約一半)遠遠通過。

比較值得注意的是頻寬曲線:前 12 分鐘從 471.9 降到約 467(-1%),之後持平在 466.4–468.0,這段時間正好與升溫 37→80°C 重疊;溫度停、頻寬也停,判定為溫度效應而非持續劣化。但這波動是先前 3060 Ti(全距 0.05%)的 20 倍——GDDR6 有 EDC 重傳機制,訊號邊緣化時會先表現為頻寬下降而非錯誤。對手工換焊的改裝卡,這值得長期追蹤:日後重測時若熱機頻寬持續走低,就是劣化徵兆。

第 3 關:運算正確性 + 熱穩定(10 分鐘)

本機沒有 nvcc,改用 pytorch 容器做「先算參考答案、重複同運算位元比對」的方式,6,281 輪位元比對、錯誤 0。瞬時約 313–314 輪/30s ≈ 11,500 GFLOP/s(fp32,達理論 13.45 TFLOPS 的 86%,先前 3060 是 71%)。
訊號實測判定
位元比對6,281 輪 / 錯誤 0
GPU 峰值溫度81°C(距 Max Operating 8°C)⚠ 通過但餘裕偏緊
功耗峰值 259 W(貼齊 260 W 牆)✅ 沒被改 BIOS
SW Power Capping累積 >3600 s✅ 正常,就是吃滿牆
SW/HW Thermal Slowdown0
風扇61%✅ 遠未到上限
散熱餘裕 8°C 是在九月、機殼開著的條件下量的,夏天關殼積灰後會更快吃完。訂製卡不論測試結果如何,換散熱膏與顯存墊都建議直接做——這是保養不是修理。

意外發現:GPU 滿載會把 CPU 烤到 86°C

GPU 滿載期間 CPU Tctl 85–86°C,而 CPU 幾乎閒置(load 1.4)。5700G Tjmax 95°C,只剩約 9°C 餘裕。原因:2080 Ti 是開放式下吹散熱設計,250W 的熱風直接灌進位在上方的 CPU 散熱器(現場確認風向)。

影響有二:一是 GPU 忙碌時 CPU 端的工作(例如 SenseVoice ASR 跑在 CPU)可能撞 95°C 降頻,語音辨識延遲上升;二是若走「一台雙卡」方案會更糟(兩張卡約 450W 的熱都往 CPU 吹),這是評估「一台雙卡 vs 兩台分工」時的扣分項。

待辦:確認機殼風道(CPU 散熱器出風是否對準後排風扇)、BIOS 調高機殼風扇曲線。

服務層實測(換上 2080 Ti 22GB 後)
服務3060 Ti 8G(舊)2080 Ti 22G(新)
TTS RTF(n=50)0.240.25(幾乎持平,差異 <5%)
TTS 串流首包1.27 s1.23–1.27 s
TTS 顯存(frac 0.15)4,753 MiB5,000 MiB
文生圖 klein / schnell13.6 s / 28.9 s(2026-09-05 記錄)5.6 s / 12.8 s
本地 LLM 27B(qwen38)放不下46.7 tok/s(8K ctx、GPU 獨佔)
文生圖快了約 2.3 倍。最大的買點是:本地 LLM 27B 終於放得下,GPU 獨佔下 46.7 tok/s。對照雲端模型 TTFT 中位數約 428ms——本地合規率較高但延遲慢約 5 倍,適合批次任務,即時語音場景仍建議雲端。

另外記錄兩點:2080 Ti(Turing, SM 7.5)上 vLLM 0.9.0 會自動降級(bf16→fp16、V1→V0、FlashAttention→XFormers),CUDA Graph 照常擷取,速度與 3060 Ti 相當;唯一硬限制是 TTS 容器的 vLLM 不可升級到已移除 V0 的版本,否則 Turing 無路可退。TTS 佔用 5,000 MiB 是 COSY_VLLM_GPU_FRAC=0.40 比例式配置的結果,不是模型變小。

結論

這張卡目前判定留用:顯存全數可用、零錯誤、運算正確,功耗牆與溫度牆都正常。要盯的是改裝卡特有的「熱機頻寬 -1% 後持平」現象——日後重測若持續走低即為劣化徵兆。散熱餘裕 8°C 偏緊,建議換膏保養,並留意 GPU 滿載時 CPU 會被烤到 86°C 的風道問題。

訂製卡的本質是「用出廠品質的變異換 CP 值」:省下的錢買的是需要自己驗證、自己追蹤的健康度。驗收關卡(尤其顯存正確性)不能省,頻寬曲線與溫度餘裕留個紀錄,三個月後重測一次做對照,就能看出這張卡值不值得長期服役。



WiFi 7 雙頻 3600Mbps AiMesh

最後修改: Service (昨天 16:03:11)


線上

 

相關討論主題

主題 回覆 點閱 最後發表
0 119 2026-09-13 00:22:08 作者 Service

友情連結

論壇頁尾

Powered by PunBB
© Copyright 2018 Rickard Andersson
RSS Feed