Tesla 10k-नोड Nvidia H100 क्लस्टर चालू करता है

10,000 Nvidia H100 GPUs से बने supercomputer को चलाने की Tesla की योजना इस बात पर बहस छेड़ रही है कि यह क्षमता पैमाने और लागत, दोनों में, अग्रणी cloud और HPC installations की तुलना में वास्तव में कितनी महत्वपूर्ण है। Commenters सवाल करते हैं कि क्या यह Tesla के in-house Dojo hardware प्रयास को कमजोर करता है या उसका पूरक है, और क्या custom chips तथा Full Self-Driving timelines को लेकर Musk के सार्वजनिक दावे यथार्थवादी हैं या मुख्यतः प्रचारात्मक। अन्य लोग FLOPS metrics, networking, और power requirements जैसे तकनीकी विवरणों पर ध्यान देते हैं, साथ ही मूल समाचार रिपोर्टों की कमजोर sourcing की आलोचना करते हैं, जो उत्साही tweets के एक छोटे सेट पर भारी निर्भर हैं।

“Dojo” बनाम H100 क्लस्टर का दायरा और परिभाषा

  • शब्दावली को लेकर भ्रम: कुछ लोग Tesla के सभी ML training compute को “Dojo” कहते हैं; जबकि अन्य का कहना है कि Dojo विशेष रूप से custom-chip supercomputer को संदर्भित करता है।
  • उद्धृत सामग्री से संकेत मिलता है कि Tesla के पास दोनों हैं: एक Dojo system और एक अलग 10,000‑H100 training cluster।
  • कुछ लोगों का तर्क है कि “Dojo supercomputer” तब तक वास्तविक नहीं है जब तक बड़े पैमाने का custom hardware live न हो; अन्य कहते हैं कि chips TSMC में production में हैं और हजारों units का order दिया गया है, इसलिए इसे vaporware कहना गलत है।

पैमाना, लागत और इंफ्रास्ट्रक्चर

  • 10,000 H100s को एक बहुत बड़ा cluster बताया गया है, जो शीर्ष सूचीबद्ध supercomputers के समान order of magnitude में है; 100B+ parameter LLMs को pretrain करने के लिए पर्याप्त बड़ा।
  • ऐतिहासिक crypto mining operations (जैसे 150k पुराने AMD GPUs) की तुलना में, 10k संख्या में छोटा लग सकता है, लेकिन प्रति node और system के हिसाब से बहुत बड़ा है।
  • Commenters नोट करते हैं कि $300M GPU figure में प्रमुख लागतें शामिल नहीं हैं: storage, RAM, networking (400–800 Gbit links), power, cooling, racks, data center buildout, और vendor engineering support।
  • Supply को Nvidia‑bottlenecked बताया गया है; सुझाव है कि बड़े खरीदारों को hardware और NICs सुरक्षित करने के लिए रिश्तों की आवश्यकता होती है।

रिपोर्टों की विश्वसनीयता और hype level

  • कई लोगों का मानना है कि TechRadar/Tom’s Hardware coverage एक ही tweet और Tesla-friendly social media पर आधारित second-hand “blogspam” है।
  • “20x–30x performance” जैसे marketing claims पर, और इस पर भी संदेह कि 10k H100s वास्तव में installed हैं या केवल ordered/planned, क्योंकि भाषा future-tense में है और global H100 supply limits मौजूद हैं।
  • अन्य लोग social media sources का बचाव करते हैं, कहते हैं कि वे आम तौर पर Tesla/SpaceX news channels के लिए सटीक होते हैं, लेकिन आलोचकों के अनुसार tweets alone deployment के लिए कमजोर evidence हैं।

तकनीकी और HPC विवरण

  • perf metrics पर चर्चा: article और Nvidia marketing FP64 PFLOPS को आगे रखते हैं; यह असामान्य है क्योंकि consumer GPUs में अक्सर FP64 कमजोर होता है।
  • यह नुक्ताचीनी कि INT8 ops “FLOPS” नहीं हैं; उन्हें integer ops या “TOPS” के रूप में गिना जाना चाहिए।
  • कुछ लोग यह बहस करते हैं कि FP64 और FP32 throughput समान क्यों होगा; अनुमान है कि इससे ऐसे design tradeoffs का संकेत मिल सकता है जो FP32 को “hamstring” करते हैं।

व्यापक संदर्भ: Tesla, Musk, और FSD

  • इस पर बहस कि क्या Tesla, अधिक समृद्ध और अधिक स्थापित AI players की तुलना में AI hardware को बेहतर तरीके से बना सकता है।
  • Musk को लेकर मिश्रित राय: reusable rockets को सक्षम करने और EVs को लोकप्रिय बनाने के लिए सराहा गया; overpromising (जैसे robo‑taxis/FSD timelines), management style, और सार्वजनिक व्यवहार के लिए आलोचना की गई।
  • मज़ाक कि इस पूरे compute के बाद भी निष्कर्ष शायद यह हो कि FSD को अभी भी lidar की ज़रूरत है।