Un estudio de la Universidad del Sur de California concluyó que los chatbots basados en modelos de lenguaje están homogeneizando la escritura sin alterar de forma relevante el significado de los textos. Ese cambio, advierten los autores, puede volver más difícil identificar rasgos de identidad, personalidad y salud mental

La investigación, publicada en Nature Human Behaviour, analizó más de 880.000 textos y encontró que, en el 87% de los casos, las versiones originales y las reescritas por sistemas de IA obtuvieron niveles de similitud semántica superiores al 95%. En otras palabras, el contenido se mantuvo, pero la forma de decirlo se volvió más uniforme

Menos variedad desde 2022

El equipo, encabezado por Zhivar Sourati, examinó materiales de distintos formatos: relatos de Reddit, artículos, trabajos académicos, ensayos, publicaciones en redes sociales y discursos políticos. También pidió a GPT-3.5, Llama 3 70B y Gemini Pro que reescribieran miles de textos redactados por personas

Al seguir la evolución de textos publicados en ArXiv, Reddit y Patch News antes y después del lanzamiento de ChatGPT, los investigadores observaron una caída sostenida en la diversidad lingüística desde noviembre de 2022. Según el trabajo, la reescritura con modelos de lenguaje redujo la variación en la complejidad de la escritura entre 21% y 50%

Los autores sostienen que esa homogeneización no es solo estética. Cuando millones de personas delegan la redacción en los mismos sistemas, se achican las diferencias lingüísticas que permiten distinguir voces, trayectorias y estilos propios

Rasgos que se diluyen

Después de la reescritura, los modelos informáticos utilizados para analizar los textos fueron, en promedio, seis puntos porcentuales menos precisos para identificar características personales de los autores

El estudio detectó que la IA tendió a atenuar asociaciones entre pronombres y extraversión, entre palabras vinculadas con amigos y lealtad, y entre referencias al futuro y edad. En cambio, otras huellas se mantuvieron, como las relacionadas con emoción negativa y neuroticismo, religión y pureza, y palabras sociales y género

Los investigadores también advirtieron que los modelos pueden amplificar patrones ligados a características predominantes y suprimir los de grupos minoritarios, lo que plantea un problema de representación. Además, observaron una inclinación de los sistemas hacia estilos asociados con culturas occidentales, con la posible pérdida de matices de otras tradiciones lingüísticas

El trabajo concluye que la escritura asistida por IA podría volver menos fiables evaluaciones basadas en el lenguaje en áreas como la psicología, la salud mental, la selección de personal y los servicios personalizados. Aún quedan preguntas abiertas sobre por qué algunas marcas personales resisten la reescritura y otras se debilitan