Word2Vec 在 ICLR2013 中被“强烈拒稿”四次

Word2Vec 是 NLP 中如今已成为基础的方法之一,用于学习词向量;它在 2013 年被一场学术会议反复拒稿,引发了关于同行评审如何处理新颖或有影响力想法的讨论。评论者争论这些评审究竟是提升了论文的严谨性,还是反映了对渐进式、容易基准化工作的系统性偏向,并涉及评审质量、激励机制以及可复现性危机等问题。有人提出了科学交流的替代模式——从 arXiv 和 OpenReview 这样的开放平台,到更透明、类似 GitHub 的工作流——而另一些人则为同行评审辩护,认为它虽然有缺陷,但仍是必要的质量过滤器。

同行评审的作用与局限

  • 许多人认为同行评审并不适合识别新颖想法;它奖励的是“同行思维”、渐进式工作和良好的排版,而不是创新。
  • 也有人认为,这一过程即使对最终有影响力的论文,也常常能提升清晰度和严谨性,而且几乎任何稿件都能通过评审得到加强。
  • 还有人指出,评审人本不应验证正确性,只需评估工作是否清楚且可复现;复现和后续研究才是用来检验真理的。

Word2Vec 评审意见与标题细节

  • 阅读过 ICLR 评审意见的评论者认为这些意见总体上是合理的:它们批评了模型描述过于简略、比较不够清楚,以及缺少解释。
  • 讨论串指出,四条“强烈拒稿”看起来像是来自同一位评审者的重复项,因此这个标题可能具有误导性。
  • 有人认为这些评审推动作者澄清并扩展了工作;也有人表示,重要但粗糙的想法会被挡下,因为严谨性的门槛相对于新颖性来说太高。

创新与严谨、质量与影响

  • 争论集中在“质量”(清晰度、严谨性)是否应当独立于潜在影响来判断;有些人认为这种分离本身就是一个核心缺陷。
  • 也有人强调,未来影响极难预测,因此流程应聚焦于清晰表达和扎实方法。
  • 还有人声称,会议过度强调新颖性、新架构和 SOTA 指标,低估了简化、负结果和复现工作。

ML 会议中的系统性问题

  • 抱怨包括投稿过多、过度依赖缺乏经验的评审、泛泛而谈或有错误的评审,以及几乎零和的录用/拒稿决定。
  • 人们还担心评审者责任不足,以及对评审系统本身缺少真正的反馈机制。

署名、记忆与信任

  • 讨论涉及对某些神经机器翻译想法究竟由谁最先提出的争议,以及对缺少致谢的失望;这些被视为受金钱和声望驱动行为的症状。
  • 一些人讲述了相关工作中不可复现的结果,以及合著者不回应的情况,这进一步加深了不信任。

改革建议与替代方案

  • 建议包括带有代码/数据验证的 GitHub 式系统、类似 OpenReview 的公开评论,以及将互联网论坛作为事实上的发表后评审。
  • 也有人警告,带投票的平台(例如 Reddit)会表现出严重的群体思维和流行度偏差,因此它们并非灵丹妙药。