El nuevo valor estratégico de los libros en la era de la IA
Durante años, los sistemas de inteligencia artificial se han alimentado principalmente de contenidos disponibles en la red: páginas web, foros, artículos, enciclopedias digitales. Pero internet tiene un problema cada vez más evidente: su calidad como fuente de entrenamiento se está degradando. Por eso las grandes empresas tecnológicas han descubierto una alternativa: los libros impresos, que ahora compran a escala masiva.
El caso más documentado es el de Anthropic, creadora del asistente Claude. Documentos judiciales revelados en 2026 sacaron a la luz un proyecto iniciado en 2024 para adquirir millones de libros, escanearlos y utilizar su contenido para desarrollar modelos de IA. Los ejemplares se cortaban, se digitalizaban y luego se desechaban. Lo interesante aquí es que el objeto físico dejaba de importar; lo que valía era extraer el texto y convertirlo en datos.
Anthropic no está sola. Meta ha sido demandada por utilizar millones de libros pirateados para entrenar su modelo Llama. Otros litigios señalan el mismo patrón. Los libros se han convertido en un recurso estratégico invisible en la competición por construir mejores modelos de IA.
¿Qué ofrecen los libros que la red no puede dar?
La respuesta está en la calidad del contenido. Internet crece en cantidad, pero no en calidad. Contiene textos breves, repetidos, poco editados y, cada vez más, contenido generado por máquinas. Estudios de 2026 muestran que alrededor del 35% de las nuevas páginas web entre 2022 y 2025 incluyen textos generados o modificados por IA. Entrenar nuevos modelos con contenido creado por modelos anteriores provoca una degradación progresiva de los resultados, según investigaciones publicadas en Nature.
Los libros, en cambio, ofrecen algo diferente: textos extensos, estructurados, que han pasado por procesos profesionales de edición. Fueron escritos por personas. Además, los libros publicados antes de la explosión de la IA generativa tienen un valor especial: son fuentes puras, sin contaminación de contenido máquina.
No es casualidad que las compras se concentren en obras antiguas, descatalogadas o que no están digitalizadas. Muchos contienen conocimientos locales, especializados o en lenguas con poca presencia en internet. Información que todavía no existe en las grandes bases de datos.
Lo que no ves cuando desaparece un libro
Aquí está el problema real. Cuando se destruye un ejemplar de un libro con miles de copias circulando, apenas importa. Pero muchos libros tienen tiradas pequeñas, están descatalogados o proceden de editoriales locales. En esos casos, cada ejemplar que desaparece dificulta el acceso permanente a su contenido.
Además, hay que preguntarse qué libros se eligen para este proceso. No todos los conocimientos están representados por igual en los datos que usan los modelos de IA. La selección puede reforzar desequilibrios que ya existen: ciertos idiomas, regiones geográficas, épocas y tipos de conocimiento pueden estar muy presentes en los entrenamientos, mientras que otros quedan marginados.
A esto se suma el debate sobre derechos de autor, que sigue sin resolverse. Lo que es seguro es que el libro ha dejado de ser solo un objeto que transmite conocimiento. Ahora es un conjunto de datos en disputa.
