SMERF: Campos de radiancia con memoria eficiente y transmisibles
El proyecto SMERF de Google muestra campos de radiancia neuronales transmisibles y eficientes en memoria que permiten recorrer reconstrucciones 3D muy realistas de espacios reales en un navegador web, incluso en smartphones antiguos. Los comentaristas están impresionados por la calidad, los reflejos y los “mundos espejo”, mientras examinan compensaciones como la resolución espacial en escenas grandes, los grandes tamaños de carga útil y el largo entrenamiento con múltiples GPU. El hilo también explora cómo SMERF se compara con 3D Gaussian Splatting y la fotogrametría tradicional, posibles aplicaciones en VR y bienes raíces, y las perspectivas de liberar como código abierto el código de entrenamiento y las herramientas.
Reacciones generales y rendimiento
- Muchos comentaristas encontraron las demos web “impresionantes” y sorprendentemente fluidas, incluso en smartphones antiguos y dispositivos de gama media.
- También se informó de un rendimiento excelente en escritorio, con tasas de fotogramas en tiempo real con alta calidad.
- Algunos usuarios tuvieron problemas en Firefox debido a problemas de GPU/ANGLE/Direct3D; los autores señalan que el visor no se probó bien allí y recomiendan por ahora WebKit/Chromium.
Disponibilidad, modelos y herramientas
- Los modelos preentrenados ya se sirven a través de la demo; al ejecutar la página se descargan.
- El código fuente del visor web está en GitHub bajo Apache 2.0; se anima a la gente a modificarlo (p. ej., añadir VR, mejores controles).
- El código completo de entrenamiento aún no se ha publicado debido a dependencias de bibliotecas internas; los autores esperan abrirlo una vez lo hayan desacoplado.
- Canalización actual de captura: cámara (a menudo DSLR), estructura desde movimiento (p. ej., COLMAP) para las poses de cámara, NeRF profesor (Zip‑NeRF), luego entrenamiento de SMERF, y después exportación del activo para el visor.
Detalles técnicos y limitaciones
- Representación: un campo de radiancia neuronal respaldado por una rejilla esparsa de vóxeles de baja resolución más triplanos densos de alta resolución (“niebla brillante” trazada por rayos).
- La calidad en espacios grandes está limitada por la resolución espacial; más volumen requiere más vóxeles, así que las escenas grandes intercambian detalle por cobertura.
- La calidad de SMERF también está limitada por arriba por el profesor Zip‑NeRF.
- Las superficies reflectantes (espejos, metal brillante, televisores) se comportan como artefactos de “ventana al mundo del espejo”; los usuarios informan de interiores inquietantes en espejos, frigoríficos y televisores.
- Las escenas son estáticas; el entrenamiento es pesado: aproximadamente 12–48 horas en configuraciones grandes con varias GPU por escena.
- El visor transmite varios submodelos y los intercambia dentro y fuera de la memoria; las cargas de red son grandes, y la compresión es un problema abierto.
Comparaciones con otros métodos
- Está estrechamente relacionado con NeRF; Gaussian Splatting está “fuertemente inspirado” y usa entradas/salidas similares pero una representación distinta.
- Según los informes, SMERF tiene una calidad visiblemente superior a 3D Gaussian Splatting en escenas grandes y algo mejor en escenas pequeñas, pero tarda mucho más en entrenarse; la velocidad de renderizado en GPU CUDA es comparable.
- Trabajos relacionados a gran escala (por ejemplo, NeRFs de estilo Block) usan muchos modelos regionales para entornos grandes.
Aplicaciones, ideas y críticas
- Hay un gran interés en VR/AR (incluidos visores autónomos) y en recorridos inmobiliarios como una mejora importante frente a los tours actuales con fotos 360.
- Las sugerencias incluyen controles de movimiento/giroscopio en teléfonos, carga progresiva/prioritaria y composición de personajes de juegos rasterizados dentro de entornos SMERF.
- Aparece cierto escepticismo sobre el tono de marketing y la falta de una discusión detallada de las limitaciones, así como sobre la necesidad actual de una fuerte optimización y reconstrucción por escena.