La demanda por derechos de autor del New York Times contra OpenAI y Microsoft sumó otro documento desclasificado el 17 de septiembre. Se trata de un escrito legal presentado por el Times, antes archivado en una versión con partes tachadas; ahora se ha publicado la versión íntegra, que cita textualmente las palabras de un directivo de Microsoft en una presentación interna de enero de 2024.
Quien lo dijo fue Brent Hecht, director de ciencia aplicada de Microsoft. Según la cita del escrito, describió el uso de contenido periodístico para entrenar grandes modelos como:
"an astonishing theft of unprecedented proportions" / "the largest theft of labor in human history"
Un robo asombroso y sin precedentes, posiblemente el mayor robo de trabajo en la historia de la humanidad.
El escrito también afirma que Hecht advirtió a OpenAI de que revisar en el sistema qué contenido procedía de demandantes como el Times podía convertirse en un «encubrimiento accidental» (accidental cover up).
Las cifras que expone el escrito
La parte del Times detalló en el escrito la composición de varios conjuntos de datos, elaborados a partir del material de prueba del caso:
- Un conjunto de datos de entrenamiento intermedio de OpenAI contiene más de 91.692 copias de obras del New York Times, el Daily News y el Center for Investigative Reporting;
- Un conjunto de datos derivado de Common Crawl contiene más de 2 millones de archivos de nytimes.com;
- Un conjunto de datos con nombre en clave Project Mango reúne al menos 160.903 obras independientes de medios de comunicación.
La agencia AFP ofrece otra cifra total: OpenAI habría recopilado más de 10 millones de artículos, casi un tercio procedentes del New York Times. Esta cifra usa un criterio distinto al de los datos anteriores; prevalece el texto original del escrito.
Las acusaciones distinguen tres métodos: eludir los muros de pago para recopilar contenido, hacer scraping a gran escala a través de la indexación de Bing, y eliminar los avisos de derechos de autor antes de incorporar el contenido al entrenamiento. Este último punto corresponde a una cláusula específica de la ley de derechos de autor de EE. UU.; si se confirma, el cálculo de la indemnización es distinto al de una simple infracción de copia.
La reacción de las dos empresas
Un portavoz de Microsoft dijo a AFP que la declaración de Hecht es «la opinión personal de un empleado» y no representa la postura de la empresa. TechCrunch informó que ni OpenAI ni Microsoft respondieron a las solicitudes de comentarios. Hasta el cierre de esta edición, ninguna de las dos se ha pronunciado públicamente sobre el tamaño de los conjuntos de datos, los muros de pago ni la eliminación de avisos de derechos de autor, y el propio Hecht tampoco se ha manifestado.
En qué punto está el litigio tras tres años
La demanda la presentó el Times en diciembre de 2023 ante el tribunal federal del Distrito Sur de Nueva York, y después se le sumaron las demandas del Daily News y del Center for Investigative Reporting. Este sitio informó en junio que el editor del Times, Sulzberger, acusó públicamente a las empresas de IA de «robar contenido descaradamente» — aquello fue una declaración desde el lado del periódico; esta vez el peso está en que la acusación proviene de material interno de un empleado de la parte demandada.
Entre demandas similares, la que más ha avanzado es la demanda colectiva de autores contra Anthropic. En ese caso, el juez separó el entrenamiento con libros comprados legalmente de la descarga desde bibliotecas piratas; lo segundo pasó directamente a indemnización y terminó en un acuerdo de unos 1.500 millones de dólares. El foco de las acusaciones en el caso del Times está en la recopilación de contenido de pago y la eliminación de avisos de derechos de autor, más cercano a la parte que resultó desfavorable en aquel caso que a la simple pregunta de si entrenar cuenta como uso legítimo.
Cuánto peso le dará el juez a esta presentación es algo que el propio escrito no puede responder. Solo demuestra que dentro de Microsoft hay quien piensa así; que demuestre que ambas empresas actuaron a sabiendas dependerá del intercambio de pruebas y del juicio que sigan. El caso todavía no tiene fecha de juicio.
Fuentes: TechCrunch, Washington Post, CocoLoop, AFP, Futurism; el escrito legal íntegro del New York Times verifica la cita de Hecht y los tres conjuntos de datos, la declaración del portavoz de Microsoft sigue la cita de AFP.