El conflicto legal entre The New York Times y OpenAI ha escalado, con nuevas acusaciones por parte del periódico y The Daily News. Ambas publicaciones sostienen que OpenAI ha ocultado deliberadamente su capacidad para buscar en los registros de chat de clientes y conjuntos de datos de entrenamiento en busca de sus obras protegidas por derechos de autor. Esta disputa, que lleva más de dos años, gira en torno a la presunta violación de leyes de derechos de autor por parte de OpenAI, al entrenar sus modelos de inteligencia artificial generativa utilizando contenido del Times y reproducir dicho periodismo en las respuestas generadas para los usuarios.
Durante el proceso judicial, OpenAI ha argumentado en repetidas ocasiones que no tenía la capacidad de buscar en su propio corpus de entrenamiento. La empresa también alegó que buscar o producir su vasta colección de conversaciones de ChatGPT sería técnicamente complicado y levantaría preocupaciones sobre la privacidad de los usuarios, debido a que los registros necesitarían ser recuperados, procesados y desidentificados. Los medios implicados han solicitado esta información para verificar si su periodismo protegido estaba presente en el conjunto de datos de entrenamiento de OpenAI, y con qué frecuencia ChatGPT generaba respuestas que usaban o reproducían su contenido.
Sin embargo, durante una declaración judicial ordenada en abril, el ingeniero de privacidad de datos de OpenAI, Vinnie Monaco, supuestamente reveló que la empresa ya había realizado búsquedas internas y evaluaciones de su corpus de entrenamiento para buscar trabajos periodísticos protegidos por derechos de autor.
Además, se alega que la declaración de Monaco reveló que, antes de que el Times presentara su demanda, OpenAI ya había acumulado una base de datos de aproximadamente 78 millones de conversaciones desidentificadas de ChatGPT, que utilizaba internamente para determinar el grado de infracción sobre los trabajos de otros. Sobre este conjunto de datos, OpenAI también habría implementado un filtro denominado “Bloom” como parte de un conjunto de herramientas llamado “Project Giraffe”, diseñado para detectar y registrar la repetición de contenidos en las respuestas generadas, poco después de que se presentara la demanda.
Estas revelaciones son particularmente significativas. Los demandantes inicialmente pidieron a OpenAI que proporcionara una muestra de 120 millones de registros de chat, pero la empresa negoció para reducir la muestra a solo 20 millones. OpenAI finalmente presentó esa muestra a los tribunales el pasado diciembre, pero supuestamente incluía tantas redacciones que la muestra resultó “inutilizable”, según el tribunal. Los demandantes también afirmaron que OpenAI eliminó miles de millones de salidas de ChatGPT después de que presentaron la demanda, violando directamente la orden de preservación del tribunal, y que la empresa sustituyó millones de registros en la muestra solicitada.
En otras palabras, sostienen que OpenAI ha dificultado innecesariamente la obtención de información que la empresa ya había recopilado. “Si OpenAI realmente creía que copiar el periodismo de nuestros clientes era justo y legal, no habría ocultado la verdad sobre haberlo hecho”, declaró Ian B. Crosby, abogado principal de los demandantes, en un comunicado.
Ahora, The New York Times y The Daily News están solicitando al juez que sancione a OpenAI por supuestamente ocultar pruebas y manipular el proceso de descubrimiento. Están pidiendo al tribunal que impida a OpenAI usar la muestra de 20 millones de registros de chat como evidencia, alegando que es poco confiable; que se acepte como hecho que los registros de ChatGPT habrían mostrado una repetición significativa y fundamentación del contenido de los demandantes; que se impida a OpenAI argumentar que sus registros de chat proporcionados no demuestran una repetición sustancial; y que OpenAI pague los honorarios legales por tener que perseguir esta evidencia.
En un comunicado, el portavoz de OpenAI, Drew Pusateri, negó las acusaciones, acusando al Times de intentar acceder a conversaciones privadas de usuarios a medida que su caso se debilita. “A medida que el caso del Times se debilita y se han visto obligados a retirar demandas contra nosotros, persisten en sus esfuerzos por invadir la privacidad de personas que no tienen nada que ver con este caso, incluyendo hacer estas acusaciones flagrantemente falsas”, dijo Pusateri. “Continuaremos defendiendo la privacidad de nuestros usuarios y los principios de uso justo largamente establecidos”.