Etiqueta: Proyecto Panamá

  • Anthropic destruyó millones de libros físicos para entrenar su inteligencia artificial

    Anthropic destruyó millones de libros físicos para entrenar su inteligencia artificial

    Documentos judiciales revelaron el llamado “Proyecto Panamá”, mediante el cual la empresa compró libros usados, los deshojó y escaneó para alimentar sus modelos de IA.

    La empresa de inteligencia artificial Anthropic puso en marcha en 2024 una estrategia para adquirir millones de libros, retirarles los lomos, escanear sus páginas y utilizar la información para entrenar sus modelos de inteligencia artificial. El proyecto permaneció en secreto hasta que un juez en Estados Unidos hizo públicos más de 4 mil páginas de documentos relacionados con una demanda por derechos de autor.

    El llamado “Proyecto Panamá” contemplaba comprar libros usados, digitalizar su contenido y posteriormente entregar los ejemplares físicos a una empresa de reciclaje. Documentos revisados por The Washington Post revelaron además que Anthropic habría recurrido a libros y contenidos provenientes de sitios que distribuían material sin respetar derechos de autor, lo que abrió un nuevo debate sobre los límites legales del entrenamiento de IA.

    Especialistas de la UNAM explicaron que los modelos de IA requieren enormes cantidades de información para generar respuestas y realizar inferencias. Rocío Aldeco Pérez señaló que los libros antiguos representan una fuente de datos especialmente atractiva porque una parte de ellos nunca fue digitalizada. Ismael Everardo Bárcenas Patiño añadió que el uso comercial de obras protegidas plantea interrogantes sobre si las empresas deberían pagar derechos de autor.

    El juez de distrito William Alsup determinó que Anthropic podía utilizar libros adquiridos legalmente para entrenar sus modelos al considerar que el proceso era transformador. Sin embargo, dejó abierta la disputa sobre los ejemplares obtenidos mediante fuentes que presuntamente infringían derechos de autor, manteniendo vigente el debate sobre la responsabilidad de las compañías de IA.

    Para los especialistas, México aún está lejos de desarrollar una operación similar, debido a la infraestructura y capacidad de cómputo que requiere. No obstante, advirtieron que el país posee enormes cantidades de información potencialmente atractiva para estas empresas, desde producción editorial y contenidos digitales hasta datos gubernamentales públicos.

    Ante el avance de la IA generativa, los expertos consideraron necesario que México impulse tecnología propia y establezca reglas claras sobre el uso de obras y datos para entrenar modelos. El reto, señalaron, será definir cómo proteger los derechos de autor y la soberanía de la información frente a una industria que demanda cada vez más datos.