DeepSeek擬增用國產晶片訓練AI模型
DeepSeek創辦人梁文鋒表示,計劃採用更多華為等國產晶片訓練AI模型,並稱此舉為公司重大戰略部署。華為預計最快於2026年第四季或2027年首季交付相關晶片。梁文鋒又透露,公司正訓練一個擁有2萬億參數的模型,並計劃未來開發8萬億參數的模型。
中國人工智能實驗室DeepSeek創辦人梁文鋒表示,公司計劃採用更多國產晶片訓練AI模型,其中華為預計最快於2026年第四季或明年首季交付相關晶片。據《The Information》報道,梁文鋒將採用華為及其他國產晶片訓練AI,視為公司最大的戰略部署之一,並強調此舉必須成功。
梁文鋒評估,華為的AI晶片性能將於數年內追上輝達(Nvidia),因此決定採用輝達主導生態系統以外的硬件。他同時向投資者透露,公司正訓練一個擁有2萬億參數的模型,並計劃未來開發8萬億參數的模型。
市場估計,這個2萬億參數的模型將是即將推出的DeepSeek V4.1 Pro,預計最快於10月中至月底發布。據內地媒體計算,訓練2萬億參數的模型需要50萬億至60萬億個token,相等於3萬張輝達H100或H200晶片,或1.5萬張B200晶片的運算能力。
若改用華為昇騰910C或昇騰950系列晶片訓練,所需晶片數量將分別約為6萬張及3萬張。
資料來源:The Standard。
閱讀原文報道 →