ArXiv ahora ofrece artículos en formato HTML

Las nuevas versiones HTML de artículos de investigación de ArXiv están siendo recibidas como una gran mejora de usabilidad y accesibilidad frente a los PDF tradicionales, especialmente para la lectura en móviles y para personas ciegas o con baja visión que dependen de lectores de pantalla. Quienes comentan contrastan la capacidad de respuesta, la facilidad para copiar y pegar y el potencial de personalización de HTML con las fortalezas fijas y orientadas a la impresión de PDF, debatiendo los compromisos en torno al diseño, las fuentes, las anotaciones y la citabilidad a largo plazo. Tras bastidores, señalan que convertir LaTeX en HTML fiel sigue siendo técnicamente difícil, pero ven la iniciativa de arXiv —apoyada en proyectos como ar5iv y LaTeXML— como un paso importante hacia una investigación más accesible.

Experiencia de lectura: HTML vs PDF

  • Muchos elogian HTML como muchísimo mejor en teléfonos y pantallas pequeñas. No hace falta hacer zoom ni desplazarse horizontalmente, el soporte para modo oscuro y el diseño adaptable reducen la fricción.
  • Los PDFs a dos columnas son ampliamente criticados en móviles por el desplazamiento en “zig‑zag”; otros sostienen que dos columnas son óptimas en pantallas más anchas para un escaneo más rápido.
  • Muchos siguen prefiriendo PDFs para monitores grandes, iPads e impresión. Valoran el diseño fijo, la paginación precisa (“arriba de la página 7”) y la anotación sencilla en herramientas de PDF.
  • Las fuentes y las combinaciones de color son un tema controvertido. Algunos encuentran desagradables la nueva fuente HTML y el tema oscuro; otros sustituyen las fuentes en el navegador. A unos pocos les gustaría que HTML usara las fuentes clásicas de LaTeX.
  • Se elogia HTML por el reflujo del texto, el estilo personalizado y copiar/pegar; los usuarios quieren controles para la fuente, el interlineado, los esquemas de color y, posiblemente, conmutadores de varias columnas.

Accesibilidad y discapacidades

  • Un beneficio importante mencionado es la accesibilidad, especialmente para personas ciegas. Los PDFs —en particular los generados con LaTeX— a menudo pierden la estructura semántica y son difíciles de leer con lectores de pantalla.
  • HTML y MathML se consideran más prometedores, aunque todavía no ideales para matemáticas avanzadas. Algunas personas ciegas siguen prefiriendo trabajar directamente con el código fuente LaTeX, a pesar de sus propios problemas.
  • El texto justificado y ciertas decisiones visuales pueden perjudicar la accesibilidad; algunos abogan por texto alineado a la izquierda, mientras otros señalan los compromisos.

Calidad de la conversión y desafíos técnicos

  • Se reconoce que la canalización de LaTeX→HTML (a través de LaTeXML / arxiv-readability) es frágil:
    • Un pequeño porcentaje de artículos falla por completo; una parte considerable tiene errores de conversión conocidos.
    • Los paquetes de LaTeX más recientes empeoran las tasas de fallo; las figuras, subfiguras y algoritmos son puntos problemáticos comunes.
  • Se reportan errores (por ejemplo, enlaces de referencias, listas de autores, espaciado). Quienes contribuyen esperan mejoras graduales, pero advierten que por ahora la cobertura será “irregular”.
  • TeX se describe como un lenguaje de composición tipográfica complejo, orientado a páginas, lo que dificulta producir HTML de alta fidelidad. Las construcciones ligadas a páginas, los flotantes y la falta de semántica complican la conversión.
  • Las sugerencias de usar visión por computadora o LLMs generan escepticismo por preocupaciones de fidelidad y reproducibilidad.

Despliegue, alcance y ecosistema

  • Actualmente, HTML solo está disponible para nuevas envíos; arXiv planea completar el corpus con el tiempo.
  • Se reconocen esfuerzos previos de terceros (ar5iv, arxiv-vanity, etc.) como precursores; algunos terminarán redirigiendo al HTML oficial.
  • Se espera que HTML permita mejor scraping, metaanálisis, TTS, flujos de trabajo para Kindle/epub e interfaces más ricas (por ejemplo, herramientas de descubrimiento), aunque el contenido interactivo al estilo “página de proyecto” se considera fuera del alcance de arXiv en sí.