Word2Vec recibió 'rechazo fuerte' cuatro veces en ICLR2013

Word2Vec, una técnica ahora fundamental para aprender representaciones vectoriales de palabras en NLP, fue rechazado repetidamente por una conferencia académica en 2013, lo que provocó un debate sobre hasta qué punto la revisión por pares maneja bien las ideas novedosas o influyentes. Los comentaristas discuten si las reseñas realmente mejoraron el rigor del artículo o si reflejaron sesgos sistémicos hacia el trabajo incremental y fácil de evaluar, abordando temas como la calidad de los revisores, los incentivos y la crisis de reproducibilidad. Varios proponen modelos alternativos de comunicación científica —desde plataformas abiertas como arXiv y OpenReview hasta flujos de trabajo más transparentes, parecidos a GitHub—, mientras que otros defienden la revisión por pares como un filtro de calidad necesario pero imperfecto.

Rol y límites de la revisión por pares

  • Muchos consideran que la revisión por pares no es adecuada para reconocer ideas novedosas; recompensa el “pensamiento de pares”, el trabajo incremental y el buen formato por encima de la innovación.
  • Otros sostienen que el proceso a menudo mejora la claridad y el rigor, incluso en artículos que terminan siendo influyentes, y que casi cualquier manuscrito puede fortalecerse mediante la revisión.
  • Varios señalan que no se supone que los revisores validen la corrección, sino que evalúen si el trabajo es claro y reproducible; la replicación y el trabajo posterior están pensados para comprobar la verdad.

Reseñas de Word2Vec y matices del título

  • Quienes leen las reseñas de ICLR consideran en general razonables los comentarios: critican la descripción mínima del modelo, las comparaciones poco claras y las explicaciones ausentes.
  • El hilo señala que las cuatro entradas de “strong reject” parecen ser duplicados de un solo revisor, lo que hace que el titular pueda resultar engañoso.
  • Algunos argumentan que las reseñas empujaron a los autores a aclarar y ampliar el trabajo; otros dicen que ideas importantes pero toscas quedan bloqueadas porque el listón del rigor es demasiado alto en relación con la novedad.

Innovación frente a rigor, calidad frente a impacto

  • Hay debate sobre si la “calidad” (claridad, rigor) debería juzgarse de forma independiente del impacto potencial; algunos creen que esta separación es un defecto central.
  • Otros enfatizan que la influencia futura es extremadamente difícil de predecir, por lo que el proceso debería centrarse en una exposición clara y una metodología sólida.
  • Varios afirman que las conferencias sobrevaloran la novedad, las nuevas arquitecturas y las métricas SOTA, y subestiman la simplificación, los resultados negativos y las replicaciones.

Problemas sistémicos en las conferencias de ML

  • Entre las quejas figuran demasiadas propuestas, dependencia excesiva de revisores inexpertos, reseñas genéricas o erróneas, y decisiones de aceptación/rechazo casi de suma cero.
  • Existe preocupación por la baja responsabilidad de los revisores y la falta de mecanismos reales de retroalimentación sobre el propio sistema de revisión.

Crédito, memoria y confianza

  • La discusión aborda disputas sobre quién originó ciertas ideas de traducción neuronal y la frustración por la falta de reconocimientos, vista como sintomática de un comportamiento impulsado por el dinero y el prestigio.
  • Algunos relatan resultados no reproducibles en trabajos relacionados y falta de respuesta por parte de coautores, lo que alimenta la desconfianza.

Propuestas de reforma y alternativas

  • Entre las sugerencias hay sistemas similares a GitHub con verificación de código/datos, comentarios abiertos al estilo OpenReview y foros de internet como revisión de facto posterior a la publicación.
  • Otros advierten que las plataformas con votos (p. ej., Reddit) muestran un fuerte pensamiento de grupo y sesgo de popularidad, así que no son una panacea.