经济学论文背后未披露的 Excel “折腾”
一篇经济学论文已被撤稿,因为作者为了补全缺失值,在方法部分未披露的情况下使用了 Excel 的自动填充,甚至从邻近国家复制数据(例如用英国数据替代美国、用荷兰数据替代新西兰)。评论者争论问题核心究竟在于 Excel 之类工具的误用,还是故意或疏忽的数据伪造;他们指出,在严肃研究中,规范的插补方法和透明报告本就是标准要求。此事也被拿来与更广泛的数据处理问题、薄弱激励机制,以及经济学和社会科学部分领域较低的可重复性相提并论。
Excel “折腾” vs 不当行为
- 评论者澄清,问题并不是某种晦涩的 Excel 技巧,而是粗糙的数据伪造:从相邻行/列复制数值,甚至来自不同国家(例如用英国数据替代美国、用荷兰数据替代新西兰)。
- 有人认为,Excel 的自动填充和界面“鼓励”了这种行为,因为它隐藏了关系和模式;也有人坚持认为工具本身是中性的,这种行为完全是研究者自己的责任。
- 关于意图也存在分歧:有人认为这是为了拼凑出可发表数据集而故意造假;也有人把教授对数据的坦率态度解读为无能而非欺诈的证据。
插补、计量经济学与标准
- 几位评论者指出,正规的计量经济学会明确处理缺失数据,并使用部分识别或结构化插补;它不会默默用其他国家的数据来填补空缺。
- 有人说,最糟糕的问题未必是插值本身,而是借用那些名称相似或位置相邻国家的数值,这会让数据集失去推断价值。
- 还有人认为,核心的伦理违规在于未披露:如果插补过程被完整说明,同行评审很可能会拒绝这项工作,或把结论视为极其薄弱。
工具 vs 科学严谨性
- 多条评论反对把这件事描述为“Excel 问题”:同样的不当行为也可能发生在 R、Python,甚至纸笔上。
- 反方观点是:更好的工具和更清晰的界面可以减少无意错误,并让可疑操作更显眼,从而抬高实践底线。
- 还有几条评论把它类比为 LLM 和“智能”填充:强大但不透明的模式填充工具需要核验,否则可能悄悄引入虚假的结构。
社会科学、可重复性与激励机制
- 有人将讨论泛化到社会科学:举例说,小样本数据被激进插补夸大、定量能力薄弱,以及“不方便”的结果未发表。
- 也有人为社会科学整体辩护,认为不同子领域的可重复性不同,各门科学的激励都存在错配,解决办法是改进激励,而不是放弃该领域。
- 评论中引用了可重复性危机的数据:某些心理学子领域的重复性很差;某些医学研究则更糟。
期刊地位与政策影响
- 评论者指出,发表该文的期刊并不是公认的经济学期刊,也远非该学科的“前五”,而后者是普遍共识,并主导着终身教职决定。
- 他们还回忆起与 Excel 相关的历史错误:在关于紧缩政策的有影响力宏观经济研究中曾出现类似问题,并指出政策制定者往往会挑选能印证既有意识形态立场的研究。
大学品牌小插曲
- 另一段长篇旁支讨论涉及若干欧洲国家对“university”“college”“university of applied sciences”等术语的法律保护和营销方式,以及这如何误导国际学生对机构地位和学位价值的判断。