¿Por qué Anthropic destruyó millones de libros con los que entrenó su IA?

Anthropic compró millones de libros, digitalizó su contenido y los destruyó para ampliar la información con la que entrenó su IA.

¿Por qué Anthropic destruyó millones de libros con los que entrenó su IA?
¿Por qué Anthropic destruyó millones de libros con los que entrenó su IA?Reuters

Anthropic compró millones de libros físicos para ampliar la información utilizada en el entrenamiento de sus modelos de inteligencia artificial. Primero, la empresa digitalizó el contenido de los ejemplares y posteriormente los destruyó.

La operación, conocida internamente como "Proyecto Panamá", se hizo público a través de documentos desclasificados como parte de una demanda colectiva por derechos de autor.

En 2024, los escritores Andrea Bartz, Charles Graeber y Kirk Wallace Johnson demandaron a Anthropic y acusaron a la empresa de utilizar sus obras sin autorización para entrenar a Claude.

El mes pasado, Anthropic acordó pagar 1.500 millones de dólares para poner fin al litigio. La cantidad contempla unas 500.000 obras incluidas en el acuerdo.

Justin Nelson, abogado principal de los autores, calificó la suma como la mayor compensación conocida hasta ahora por una infracción de derechos de autor.

¿Por qué Anthropic destruyó millones de libros con los que entrenó su IA?
Reuters

¿Por qué Anthropic compró libros físicos?

El entrenamiento de los modelos de inteligencia artificial requiere grandes volúmenes de información. Ante esta necesidad, Anthropic buscó obtener contenidos adicionales para incorporarlos al aprendizaje de Claude.

Para Anthropic, los libros físicos representaban una forma distinta de acceder a un contenido que no estaba disponible en la red. Esto ocurría especialmente con publicaciones antiguas que nunca pasaron por un proceso de digitalización, por lo que su información quedaba fuera del alcance de los sistemas de inteligencia artificial que trabajan con materiales disponibles en formato digital.

Especialistas consideraron que incorporar estos textos podía ampliar las fuentes de conocimiento utilizadas para entrenar los modelos.

Con ese objetivo, Anthropic adquirió grandes cantidades de libros usados, que posteriormente fueron trasladados para ser digitalizados y convertir su contenido en material procesable por sus sistemas.

Los documentos presentados ante el tribunal señalan que Ben Mann, cofundador de Anthropic, recurrió en junio de 2021 a LibGen, una plataforma conocida como una “biblioteca en la sombra”, para obtener una amplia colección de obras protegidas por derechos de autor.

¿Por qué Anthropic destruyó millones de libros con los que entrenó su IA?
Reuters

¿Cómo funcionaba el “Proyecto Panamá”?

El Proyecto Panamá contemplaba un método de digitalización que implicaba modificar físicamente los ejemplares.

Los libros eran sometidos a un proceso de digitalización destructiva. Las máquinas cortaban los lomos para separar las páginas y, una vez desprendidas, las hojas pasaban por escáneres de alta velocidad.

Con este procedimiento, el contenido de los libros podía convertirse en información digital de manera rápida y quedar disponible para el entrenamiento de los modelos de inteligencia artificial.

Sin embargo, el proceso impedía conservar los libros como ejemplares completos. Después de que las páginas eran escaneadas, los volúmenes ya no podían volver a utilizarse de la misma manera.

Los documentos señalan que los restos de los libros eran enviados posteriormente a empresas de reciclaje.

Así, los archivos, que suman más de 4 mil páginas, dejaron al descubierto los detalles de esta estrategia utilizada por la compañía.

Temas:

mgid