SMERF: स्ट्रीम करने योग्य, मेमोरी-कुशल रेडियंस फ़ील्ड्स
Google का SMERF प्रोजेक्ट streamable, memory-efficient neural radiance fields दिखाता है, जो उपयोगकर्ताओं को वेब ब्राउज़र में, पुराने स्मार्टफ़ोन पर भी, वास्तविक स्थानों के अत्यंत यथार्थवादी 3D reconstructions में चलने देता है। टिप्पणीकार गुणवत्ता, reflections, और “mirror worlds” से प्रभावित हैं, साथ ही बड़े scenes में spatial resolution, बड़े payload sizes, और लंबे multi-GPU training जैसे trade-offs पर भी सवाल उठाते हैं। चर्चा में SMERF की 3D Gaussian Splatting और पारंपरिक photogrammetry से तुलना, VR और real estate में संभावित उपयोग, और training code तथा tooling को open-source करने की संभावनाएँ भी शामिल हैं.
समग्र प्रतिक्रियाएँ और प्रदर्शन
- कई टिप्पणीकारों को वेब डेमो “stunning” और आश्चर्यजनक रूप से स्मूद लगे, यहाँ तक कि पुराने स्मार्टफ़ोन और मिड-रेंज डिवाइसों पर भी।
- डेस्कटॉप प्रदर्शन भी उत्कृष्ट बताया गया, उच्च गुणवत्ता पर रियल-टाइम फ़्रेम रेट्स के साथ।
- कुछ उपयोगकर्ताओं को Firefox में GPU/ANGLE/Direct3D समस्याओं के कारण दिक्कतें आईं; लेखक बताते हैं कि व्यूअर का वहाँ अच्छी तरह परीक्षण नहीं हुआ था और फिलहाल WebKit/Chromium की सलाह देते हैं।
उपलब्धता, मॉडल और टूलिंग
- प्रीट्रेंड मॉडल पहले से ही डेमो के माध्यम से सर्व किए जा रहे हैं; पेज चलाने पर वे डाउनलोड हो जाते हैं।
- वेब व्यूअर का स्रोत GitHub पर Apache 2.0 के अंतर्गत है; लोगों को इसे बदलने/बढ़ाने के लिए प्रोत्साहित किया जा रहा है (जैसे VR जोड़ना, बेहतर कंट्रोल्स)।
- आंतरिक लाइब्रेरीज़ पर निर्भरता के कारण पूरा ट्रेनिंग कोड अभी जारी नहीं किया गया है; लेखक आशा करते हैं कि इन्हें अलग करने के बाद इसे ओपन-सोर्स करेंगे।
- वर्तमान कैप्चर पाइपलाइन: कैमरा (अक्सर DSLR), कैमरा पोज़ के लिए structure-from-motion (जैसे COLMAP), teacher NeRF (Zip-NeRF), फिर SMERF ट्रेनिंग, और फिर व्यूअर के लिए एसेट एक्सपोर्ट।
तकनीकी विवरण और सीमाएँ
- प्रतिनिधित्व: एक neural radiance field, जिसके पीछे sparse low-res voxel grid और dense high-res triplanes हैं (“glowing fog” ray-marched)।
- बड़े स्पेसेज़ में गुणवत्ता spatial resolution द्वारा सीमित होती है; अधिक volume के लिए अधिक voxels चाहिए, इसलिए बड़े scenes में detail और coverage के बीच trade-off होता है।
- SMERF की गुणवत्ता Zip-NeRF teacher द्वारा भी ऊपरी रूप से सीमित रहती है।
- reflective surfaces (mirrors, glossy metal, TVs) “window into mirror-world” जैसे artifacts की तरह व्यवहार करते हैं; उपयोगकर्ता eerie mirror/fridge/TV “interiors” की रिपोर्ट करते हैं।
- scenes static हैं; ट्रेनिंग भारी है: प्रति scene बड़े multi-GPU setups पर लगभग 12–48 घंटे।
- व्यूअर कई sub-models को stream करता है और उन्हें memory में अंदर-बाहर स्वैप करता है; network payloads बड़े हैं, और compression एक खुली समस्या है।
अन्य तरीकों से तुलना
- NeRF से क़रीबी रूप से संबंधित; Gaussian Splatting “heavily inspired” है और समान inputs/outputs उपयोग करता है लेकिन अलग representation के साथ।
- SMERF के बारे में बताया गया है कि बड़े scenes पर इसकी quality 3D Gaussian Splatting से स्पष्ट रूप से अधिक है और छोटे scenes पर थोड़ी बेहतर, लेकिन इसे train करने में काफ़ी अधिक समय लगता है; CUDA GPUs पर rendering speed तुलनीय है।
- संबंधित बड़े-स्तरीय काम (जैसे Block-style NeRFs) बड़े environments के लिए कई regional models उपयोग करते हैं।
अनुप्रयोग, विचार और आलोचनाएँ
- VR/AR में, जिसमें standalone headsets भी शामिल हैं, और real-estate walkthroughs में मौजूदा 360-photo tours की तुलना में एक बड़ा उन्नयन होने के रूप में गहरी रुचि है।
- सुझावों में फ़ोनों पर motion/gyro controls, progressive/priority loading, और rasterized game characters को SMERF environments में compositing करना शामिल है।
- कुछ skepticism marketing tone और सीमाओं पर विस्तृत चर्चा की कमी को लेकर, तथा भारी optimization और per-scene reconstruction की मौजूदा आवश्यकता को लेकर दिखाई देती है।