
En la literatura biomédica, las citas inventadas se han multiplicado por 12 en el lapso de dos años, según una auditoría de casi 2,5 millones de artículos publicada este 7 de mayo en forma de carta en The Lancet [1].
El análisis de los artículos indexados en PubMed reveló que aproximadamente uno de cada 277 artículos publicados en las primeras siete semanas de 2026 incluía una referencia a un artículo inexistente. Esto supuso un aumento con respecto al índice de 2025 (uno de cada 458) y al de 2023 (de uno de cada 2.828). Los investigadores, dirigidos por Maxim Topaz, del Instituto de Ciencia de Datos de la Universidad de Columbia, utilizaron la inteligencia artificial para “distinguir las falsificaciones genuinas de las discrepancias de formato, como el uso de títulos de revistas que se han abreviado de manera informal” [2].
El grupo de Topaz detectó el mayor aumento de referencias inventadas a mediados de 2024, lo que, según señalan, coincidió con el auge de las herramientas de redacción basadas en IA. Estos hallazgos se producen después de que la revista Nature informara el mes pasado sobre la posibilidad de que decenas de miles de publicaciones de 2025 “incluyeran referencias inválidas generadas con IA” [3]. Retraction Watch ha recibido numerosos informes sobre citas inventadas generadas por modelos de lenguaje de gran tamaño (LLM o Large Language Model) como ChatGPT [4-6].
En su muestra, Topaz y sus colegas pudieron verificar 97,1 millones de referencias, entre las cuales identificaron 4.406 referencias inventadas, que aparecían en un total de 2.810 artículos. Según la base de datos de Retraction Watch y otras fuentes, cuando se realizó la auditoria en febrero, la casa editorial no había tomado medidas para casi ninguno de los artículos en los que se detectaron referencias falsas, menos del 2%.
Un portavoz de Taylor & Francis nos indicó que la editorial está invirtiendo en “tecnología, personal especializado y procesos para detectar citas problemáticas”. Los artículos con referencias dudosas se devuelven al autor, señaló el portavoz, y añadió: “Si estas representan más que una pequeña proporción de las citas, y/o afectan sustancialmente la integridad general del manuscrito, este suele ser rechazado”.
Renee Hoch, jefa de ética editorial de PLOS, nos ha comunicado que están “explorando opciones para hacer un análisis de la integridad de las referencias en todo el sistema”. Hoch también ha señalado que PLOS no cataloga automáticamente las referencias inventadas en la categoría de mala praxis: “La mala praxis en la investigación se basa en una definición específica que incluye un elemento de intencionalidad, y la cuestión de si un evento se puede considerar mala praxis en la investigación se aborda a nivel institucional, no a nivel de la revista o de la editorial”, ha afirmado.
También nos pusimos en contacto con Elsevier, Wiley, Springer Nature, IEEE y Sage, pero no respondieron en el breve plazo de tiempo establecido en el embargo de The Lancet.
Las editoriales se deben tomar en serio el problema de las referencias inventadas, escriben Howard Bauchner y Frederick Rivara en un comentario que acompaña el análisis. Bauchner es el antiguo editor de JAMA, y Rivara, el antiguo editor de JAMA Pediatrics. Ambos sostienen que cuando aparece una referencia inventada, el artículo debería ser retractado.
Los investigadores, cuando aceptan ser autores, “asumen la responsabilidad de todo el contenido de ese artículo”, escriben Bauchner y Rivara. “La retractación de estos manuscritos podría dar lugar a que sus autores analicen las referencias con mayor minuciosidad”.
David Resnik, investigador especializado en la integridad de los manuscritos de los Institutos Nacionales de Salud (National Institutes of Health), no está de acuerdo y nos explica que la decisión de retractar un artículo por una cita inventada “depende del papel que desempeñe dicha cita para respaldar los resultados del estudio” [7]. Su opinión coincide con la de Topaz, quien nos dijo que un artículo se debería retractar cuando las referencias inventadas son fundamentales para las conclusiones del trabajo. Topaz dio un ejemplo del análisis en el que 18 de las 30 referencias parecen haber sido inventadas [8].
“En el caso de los artículos que contienen una o dos referencias inventadas, que son secundarias respecto a los resultados principales, creo que en lugar de la retractación puede ser más apropiado que se corrija y que haya transparencia”, nos comentó Topaz. Señaló que el 91% de los artículos incluidos en la base de datos de su grupo sobre trabajos problemáticos solo contenían una o dos referencias inventadas, muchas de las cuales “probablemente fueron errores auténticos cometidos por autores que utilizaron herramientas de IA sin verificar los resultados”.
Ella Flemyng, jefa de política editorial e integridad en la investigación en Cochrane, dijo que los resultados del nuevo estudio eran “graves”, pero que tenía dudas al respecto [9]. “Aunque la estrategia [de usar IA] se validó con 500 registros y se analizan las principales limitaciones, nos faltan detalles importantes sobre la metodología”, afirmó.
También señaló que, dado que las conclusiones se basan en una auditoría asistida por IA, “la confianza en los resultados depende menos de la cifra principal y más de cómo se diseñó y validó el sistema de IA, cómo se evaluaron y corrigieron los errores, y de cuán reproducible y transparente es el proceso en general”.
Mohammad Hosseini, que estudia la ética de la IA y la integridad de la investigación en la Facultad de Medicina Feinberg de la Universidad Northwestern, calificó el análisis de The Lancet de “simplista” [10]. En un artículo publicado en marzo, Hosseini y Resnik hicieron hincapié en distinguir entre las citas inventadas que influyen en las conclusiones científicas de un artículo, y aquellas que no lo hacen [11]. El grupo de Topaz no distinguió entre las referencias científicamente relevantes, que en la práctica funcionan como datos, y aquellas que eran relativamente menos importantes, señaló Hosseini.
Hosseini nos dijo que el estudio informa sobre “lo que es más fácil” de documentar y es la “punta del iceberg”. Afirmó que el “problema más importante” sigue siendo el de las citas generadas por la IA, que no son totalmente inventadas, pero que son inexactas, están sesgadas o son incompletas. “Estamos lejos de poder siquiera detectarlas o hacer algo al respecto”, afirmó.
Flemyng compartía una perspectiva similar y nos comentó que, además de abordar los casos concretos de citas inventadas, “también debían poner de relieve las presiones existentes en el ámbito académico, que crean un incentivo deliberado para la ciencia rápida (fast science); un investigador necesita más publicaciones, más citas, y no me sorprende que se tomen atajos y que los resultados no se verifiquen con cuidado”.
Hosseini y Resnik escribieron en su artículo que es probable que las citas inventadas mediante IA persistan, porque la “alucinación” está intrínsecamente ligada al funcionamiento de los modelos de lenguaje de gran tamaño.
Independientemente de si se espera que los modelos de lenguaje de gran tamaño dejen de “inventar (alucinar)” o no, Topaz nos dijo que “el daño ya está hecho” [12]. La “contaminación” con más de 4.000 referencias inventadas que su equipo encontró “no va a desaparecer cuando la IA mejore”, afirmó.
Últimamente, las referencias inventadas (alucionaciones) han atraído considerable atención de los detectives, investigadores de mala conducta científica y periodistas. A finales del año pasado informamos que un documento del Banco Mundial sobre tendencias de la obesidad contenía al menos 14 referencias falsas [13]. En marzo, escribimos sobre un bibliotecario que descubrió que 12 de las 14 referencias de un artículo sobre el manejo de la cirugía intestinal publicado en Springer Nature no existían [14]. Nuestro cofundador, Ivan Oransky, fue citado en una referencia inventada en un artículo que se publicó el año pasado en una revista de Springer Nature [15].
En una página web interactiva sobre su investigación, Topaz y sus colegas señalan que una casa editorial “generó referencias inventadas a un ritmo catorce veces superior al de las revistas más selectivas de la base de datos” [16]. Las casa editoriales con los índices más altos de referencias falsas no se nombran en el sitio web, porque “una comparación bruta de los índices, a nivel de casa editorial, sería engañosa sin ajustar por el volumen y el tipo de artículos que cada casa editorial indexa en PubMed”, nos explicó Topaz. Se negó a revelar los índices de cada casa editorial.
“Lo que puedo decir es que la concentración entre las grandes revistas y editoriales de acceso abierto es desproporcionada, lo cual concuerda con lo que otros han observado sobre dónde tiende a concentrarse la actividad de fabricación de artículos y las revisiones por pares menos rigurosas”, afirmó.
Topaz y sus coautores recomiendan una serie de medidas para hacer frente a lo que consideran un problema creciente. En primer lugar, sugieren combatir la IA con IA: “las editoriales deberían integrar la verificación automatizada de referencias en los flujos de entrega, antes de que comience la revisión por pares”. También desean que los servicios de indexación de artículos añadan metadatos de integridad para que las alertas acompañen a las referencias, y quieren que las referencias falsas se puedan rastrear en las bases de datos de integridad en la investigación. Por último, afirman que “las casas editoriales deberían revisar retroactivamente las publicaciones existentes y publicar correcciones o retractaciones cuando las referencias inventadas pongan en tela de juicio las conclusiones de un artículo”.
El equipo de investigación está especialmente preocupado por los artículos de revisión, que afirman que “presentaban un índice de falsificación un 57% superior al de otros tipos de artículos”.
Flemyng comparte esa preocupación. “En esta nueva era de la IA, la necesidad de revisiones sistemáticas completas, que cumplan con los estándares esperados, es primordial. Arriesgarse a introducir en la literatura científica contenido basura (sesgado y poco sistemático), generado con IA, supondría un grave paso en la dirección equivocada”, afirmó.
Referencias