Durante años, buena parte de la inteligencia artificial actual se entrenó con contenidos disponibles en internet. Páginas web, foros, artículos, enciclopedias y repositorios digitales proporcionaron enormes cantidades de texto para enseñar a los grandes modelos de lenguaje. Pero la red empieza a mostrar sus límites. Algunas empresas tecnológicas han buscado otra fuente de conocimiento y han encontrado en los libros la solución.
A principios de 2026, The Washington Post reveló una de estas estrategias a partir de documentos judiciales relacionados con Anthropic, la empresa responsable del asistente de IA Claude. La investigación sacó a la luz “Project Panama”, un proyecto secreto iniciado en 2024 para adquirir libros impresos a gran escala. Los ejemplares se escaneaban y sus textos se incorporaban a los procesos de desarrollo de modelos de IA. Para acelerar el proceso, millones de libros fueron cortados, digitalizados y después enviados a reciclar.
El procedimiento muestra un cambio importante en la forma de valorar el libro. El objeto físico pierde importancia frente a su contenido. El texto puede extraerse, convertirse en datos y utilizarse para alimentar modelos de inteligencia artificial.
Anthropic no es la única compañía interesada en acceder a grandes colecciones de libros. En mayo de 2026, cinco grandes editoriales estadounidenses y el escritor Scott Turow demandaron a Meta y Mark Zuckerberg. Los acusaron de utilizar millones de libros y artículos procedentes de repositorios piratas para entrenar a su modelo Llama. Otros litigios contra empresas de IA apuntan en la misma dirección.
Los libros han adquirido así un nuevo valor estratégico. Ya no son solo objetos que contienen y transmiten conocimiento. También son grandes conjuntos de datos en la competición por desarrollar mejores modelos de inteligencia artificial.
¿Qué tienen los libros que no tenga internet?
Los grandes modelos de lenguaje necesitan enormes cantidades de texto. Sin embargo, cantidad y calidad no son necesariamente lo mismo.
Internet ofrece una diversidad difícil de encontrar en otro lugar. Pero también contiene textos breves, repetidos o poco revisados.
Además, desde 2022, cada vez hay más contenidos creados con IA en internet. Un estudio publicado en 2026 analizó páginas web aparecidas entre 2022 y 2025. A mediados de 2025, alrededor del 35 % de las nuevas páginas estudiadas incluían textos generados o modificados con IA. Esto no significa que el 35 % de internet haya sido creado por máquinas, pero sí muestra que estos contenidos tienen cada vez más presencia en la red.
El problema no es solo distinguir quién ha escrito qué. Una investigación publicada en Nature ya mostró en 2024 que entrenar sucesivas nuevas generaciones de modelos con contenidos producidos por modelos anteriores puede provocar una degradación progresiva de los resultados.
En este contexto, los libros anteriores a la expansión de la IA generativa adquieren un nuevo valor. Ofrecen a las empresas tecnológicas contenidos extensos y estructurados que, en muchos casos, han pasado por procesos profesionales de edición y corrección. Además, han sido escritos por personas.
Cuando el patrimonio se convierte en datos
Durante siglos hemos creado bibliotecas, archivos y universidades para conservar una parte de nuestra memoria colectiva. Estas instituciones no se limitan a almacenar sus fondos, también los catalogan, los preservan y los hacen accesibles.
La inteligencia artificial está dando un nuevo valor a ese patrimonio. No interesa el ejemplar físico; importa la información que contiene. Al digitalizarlo, el texto puede convertirse en datos y utilizarse para entrenar modelos de IA.
Desde la pasada primavera, libreros de España, Alemania, Australia y Nueva Zelanda han alertado de pedidos masivos y poco habituales realizados por la empresa canadiense Zoom Books. Esta compañía se dedica a la venta de libros de segunda mano por internet. Sus compras suelen realizarse a través de grandes plataformas como AbeBooks o Biblio. En ellas se pueden encontrar desde títulos baratos hasta ediciones raras y difíciles de conseguir.
Estos patrones de compra –y el precedente de Anthropic– han despertado sospechas. Sobre todo, por su volumen y por el interés en obras antiguas, descatalogadas o que no están disponibles en formato digital. Zoom Books niega que sea para alimentar a la IA y, por el momento, no existen pruebas concluyentes que permitan atribuirle ese fin.
Pero el fenómeno muestra hasta qué punto el contenido de los libros ha adquirido un nuevo valor. La información puede extraerse del objeto, convertirse en datos y circular de forma independiente. Muchos de estos textos nunca se han digitalizado, y algunos contienen conocimientos locales, especializados o publicados en lenguas con poca presencia en internet. Ofrecen información que todavía no está disponible en grandes bases de datos digitales.
Una nueva carrera por el conocimiento
Durante los últimos años hemos hablado de la carrera de la IA en términos de procesadores, energía, centros de datos y algoritmos. Pero la compra masiva de libros pone sobre la mesa otro recurso estratégico, mucho menos visible: el conocimiento humano.
Destruir un ejemplar puede parecer poco relevante cuando existen miles de copias. Pero no todos los libros están en esa situación. Muchos están descatalogados, tuvieron tiradas pequeñas o pertenecen a editoriales y ámbitos locales. Otros son difíciles de encontrar. En estos casos, cada ejemplar que desaparece dificulta el acceso a su contenido.
También importa qué libros se eligen. No todos los conocimientos están igual de representados en los datos que utilizan los modelos de IA. La selección puede reforzar desequilibrios que ya existen en internet.
La lengua es un buen ejemplo. También lo son el origen geográfico, la época o el tipo de conocimiento. Algunas culturas, perspectivas y formas de entender el mundo pueden estar muy presentes. Otras, mucho menos. Y otras pueden quedar al margen.
A esto se suma el debate sobre los derechos de autor. Escritores, editoriales y otros creadores cuestionan que sus obras puedan utilizarse para entrenar sistemas comerciales de IA sin permiso ni compensación. En Europa, la normativa sobre inteligencia artificial intenta aportar algo más de transparencia. Entre otras medidas, exige a las empresas responsables de los grandes modelos informar sobre los contenidos utilizados para entrenarlos y adoptar medidas para respetar la legislación europea sobre derechos de autor.
La cuestión, en todo caso, no es solo qué pueden aprender las nuevas herramientas tecnológicas de nuestros libros. Debemos preguntarnos qué ocurre con ellos tras su digitalización y procesamiento masivo, qué se conserva, qué puede llegar a desaparecer y qué conocimientos quedan fuera. Porque seleccionar los contenidos con los que aprende una IA también significa decidir qué voces estarán más presentes en sus respuestas y qué sesgos puede reproducir.
![]()
Paloma González Díaz, Assistant lecturer, UOC - Universitat Oberta de Catalunya
Este artículo fue publicado originalmente en The Conversation. Lea el original.









