La inteligencia artificial incorporó millones de libros en papel
El Proyecto Panamá consistió en comprar millones de libros en papel para cortarlos hoja por hoja, digitalizarlos y entrenar al modelo de inteligencia artificial Claude.
Circula una narrativa que nos presenta a la inteligencia artificial como una entidad etérea hecha de pura matemática y bytes en la nube. Pero, cuidado, porque detrás de la fluidez con la que un modelo de lenguaje responde nuestras preguntas hay una infraestructura material gigantesca. Existen enormes centros de datos que consumen mucha agua para enfriarse, toneladas de chips de silicio y millones de libros de papel que pasaron por guillotinas industriales.
Para que los grandes modelos de lenguaje se entrenen en redactar un ensayo, un poema o un informe médico, necesitan leer. Pero no leen como lo hace un ser humano, buscando significado o placer. Leen procesando billones de palabras para predecir cuál es la siguiente palabra más probable. Lo hacen mediante cálculos estadísticos. En esta carrera por construir algoritmos cada vez más precisos, las grandes empresas tecnológicas alimentan a los modelos de todas las formas posibles. Además de lo que hay en internet buscan incluir lo que los seres humanos escribimos en papel a lo largo de la historia.

Imagen de Gerd Altmann en Pixabay
Del web scraping al muro de datos
En los inicios del desarrollo de los modelos de IA generativa, la estrategia de recolección era sencilla porque consistía en "barrer" internet y tomar todo tipo de datos. Mediante herramientas de rastreo automático como el web scraping, las compañías incorporaron todo lo que estaba a su alcance. Desde Wikipedia, pasando por todos los hilos de Reddit, artículos periodísticos, blogs personales, publicaciones en infinidad de espacios digitales y repositorios, hasta contenido de redes sociales y foros de discusión. Textos, imágenes, audios, videos, etc.
Pero esta estrategia de web scraping pronto encontró dos límites:
- La calidad del texto. La escritura en internet suele ser fragmentaria, repetitiva y plagada de jerga. Puede tener malos usos y lenguaje sucio. Un modelo de IA entrenado solo con textos de redes sociales tiende a expresarse como un tuitero impulsivo. Una de las posibilidades para mejorar esa parte del entrenamiento es incorporar textos estructurados, editados, con ese “no sé qué” que solo los humanos podemos lograr. ¡Libros escritos por personas!
- La contaminación sintética o contenido basura generado por IA (AI Slop). Desde aproximadamente 2022, la web comenzó a llenarse de contenidos redactados por las propias inteligencias artificiales.
Al llegar a lo que los investigadores llaman el muro de datos (data wall ), las grandes empresas tecnológicas se dieron cuenta de que los contenidos de la internet accesible ya no alcanzaban para entrenar a los modelos de IA.

Fuente de la imagen María Cristina Escobar en Linkedin
La guillotina de los libros
Los libros impresos antes del auge masivo de la IA se convirtieron, casi de repente, en uno de los recursos más valiosos del ecosistema tecnológico. Estos textos tienen una garantía estructural, sintáctica y creativa única: fueron escritos, corregidos y editados exclusivamente por seres humanos.
Compañías como Anthropic, entre otras, se preguntaron cómo convertir millones de tomos físicos de papel y tinta en vectores matemáticos aprovechables por los algoritmos. Y la respuesta reveló una de las caras crudas de estas industrias tecnológicas. Aunque durante años las empresas recurrieron a bibliotecas piratas en internet, como Library Genesis o Books3, los problemas legales por violar los derechos de autor las obligaron a buscar otras estrategias. Fue así como nació el escaneado masivo de libros físicos. A través de iniciativas privadas y redes de intermediarios, algunas corporaciones de IA comenzaron a comprar millones de libros usados y descatalogados en todo el mundo para alimentar a sus modelos.
El procedimiento esel siguiente:
- Un operario coloca el libro en una cortadora hidráulica industrial que corta y separa el lomo de un solo golpe.
- Las páginas, ya sueltas, son leídas por escáneres de alta velocidad capaces de procesar miles y miles de hojas por hora.
- Una vez digitalizadas todas las hojas de cada texto mediante programas de reconocimiento óptico de caracteres (OCR), los restos de papel prensado y triturado se despachan a empresas de reciclaje o se tiran.
El libro físico deja de ser un objeto de conocimiento y memoria para convertirse en un insumo desechable, apenas una cáscara que se descarta.
El Proyecto Panamá
Un caso que puso esta práctica en el ojo público es el denominado Proyecto Panamá. Documentos judiciales de 2026 vinculan a la empresa Anthropic —creadora del modelo de IA Claude— con una operación masiva de compra y destrucción de millones de libros para entrenar a sus grandes modelos de lenguaje.
El Proyecto Panamá tuvo un fuerte impacto simbólico porque tocó una fibra sensible que es la relación entre la cultura escrita y la tecnología digital. No se trató solo de un debate técnico sobre entrenamiento de modelos, sino de una discusión más amplia sobre el valor de los libros, los derechos de autor y el límite entre innovación y apropiación. Por eso, el caso se convirtió en un emblema de las tensiones que hoy rodean a la inteligencia artificial. ¿Cuánto se puede tomar de la producción humana, bajo qué reglas y con qué compensación para quienes crearon ese contenido? ¿Cómo es posible que la práctica de escaneado masivo sea legal mientras el uso de copias digitales piratas desata demandas multimillonarias?

Imagen de Pexels en Pixabay
El periodista especializado en tecnología Will Oremus explica hasta qué punto las empresas de IA como Anthropic, Meta, Google, Microsoft y OpenAI compiten para obtener enormes cantidades de datos con los que entrenar a sus programas. Estos gigantes tecnológicos están en una carrera acelerada por adquirir la obra colectiva de la humanidad.
De la preservación al consumo
El historiador Robert Darnton concibe la historia del libro como una cadena continua de preservación, donde cada tecnología —del papiro al códice, del códice a la imprenta— busca prolongar la vida material de la palabra humana. El escaneado masivo de libros físicos invierte esa lógica. Por primera vez, se destruye el soporte físico original para convertirlo en el insumo de un sistema automatizado.
Como conclusión es importante no perder de vista que los modelos de inteligencia artificial no generan conocimiento de la nada, sino que dependen del trabajo, la imaginación y la disciplina de generaciones pasadas y presentes de escritores, editores e investigadores.
Recomendados
La materialidad de la inteligencia artificial y su costo ambiental
Texto
Detrás de las producciones de los grandes modelos de lenguaje de inteligencia artificial generativa como ChatGPT, Gemini, Copilot, Perplexity y Claude, entre otros, existen enormes infraestructuras materiales que sustentan su funcionamiento y tienen un fuerte impacto en el ambiente.
Narrativas sobre inteligencia artificial: percepciones y expectativas
Texto
Las historias que (nos) contamos sobre la inteligencia artificial (IA) son los filtros a través de los cuales la interpretamos, proyectando en ella tanto miedos como expectativas. Para comprender su complejidad es necesario quitarnos «las anteojeras» y explorar la IA desde distintas perspectivas culturales y técnicas.
Pódcast «Abanico de inteligencias»
Audio
Este pódcast no es sobre máquinas, sino sobre la diversidad de inteligencias. ¿Por qué insistimos en humanizar la inteligencia artificial? ¿En qué momento olvidamos que la IA es nuestro invento y no una mente independiente? ¿Por qué las inteligencias animales y vegetales no nos asombran tanto como la inteligencia artificial? Son 4 episodios breves.
Ficha
Publicado: 10 de agosto de 2026
Última modificación: 07 de septiembre de 2026
Audiencia
General
Área / disciplina
Educación Digital
Comunicación
Cultura y Sociedad
Educación Tecnológica y Digital
Nivel
Secundario
Superior
Categoría
Artículos
Modalidad
Todas
Formato
Texto
Etiquetas
inteligencia artificial (IA)
Autor/es
Carina Maguregui
Otros contribuyentes
Educ.ar
Licencia
Creative Commons: Atribución – No Comercial – Compartir Igual (by-nc-sa)