Caixas empilhadas com a marca Amazon, representando logística em larga escala
Tecnologia e IA

Amazon compra e destrói livros raros em massa para IA

Investigação rastreou um lote de obras raras até um centro da Amazon em Las Vegas, onde livros são cortados, escaneados e descartados para alimentar modelos de IA, segundo reportagens e relatos.

Danilo Gato

Danilo Gato

Autor

28 de setembro de 2026
9 min de leitura

Introdução

Amazon destrói livros raros para treinar IA. A frase parece improvável, mas foi exatamente o que uma investigação publicada em 17 de agosto de 2026 revelou ao rastrear um lote de obras até um centro da Amazon em Las Vegas, identificado como VGT3, onde os livros são cortados, escaneados e descartados após a digitalização. Funcionários relataram que o trabalho ali é receber paletes, remover a lombada para acelerar o escaneamento e alimentar conjuntos de dados para modelos de inteligência artificial. (404media.co)

A Amazon afirmou em resposta que compra livros por canais comerciais para ajudar a desenvolver e melhorar produtos e serviços, sem detalhar o uso específico para treinamento de IA. O ponto é central porque liga o varejo que nasceu nos livros a uma corrida por dados para treinar modelos cada vez mais grandes. (techcrunch.com)

Como a investigação chegou ao VGT3

O caso ganhou tração quando repórteres colocaram um rastreador, como um AirTag, dentro de um dos exemplares de uma encomenda com cerca de mil livros vendidos por um livreiro. O dispositivo percorreu vários estados até parar em um complexo da Amazon no nordeste de Las Vegas, conhecido como LAS8, onde opera a unidade VGT3. Lá, segundo relatos de funcionários, o processo é destrutivo, com o corte das lombadas para que as páginas passem planas por scanners industriais. (arstechnica.com)

A 404 Media detalhou ainda que VGT3 fica associado ao complexo LAS8 e teria marca própria, incluindo um logotipo interno com um dinossauro segurando um livro, uma imagem que circulou entre reportagens e fóruns de funcionários. Embora pitoresca, a marcação interna reforça que se trata de uma operação dedicada. (arstechnica.com)

Livros antigos em estante de madeira

O que a Amazon diz, o que o mercado entende

A declaração oficial repetida a diferentes veículos foi sucinta, dizendo que a empresa compra livros por canais comerciais para ajudar a desenvolver e melhorar produtos e serviços usados pelos clientes. Embora não cite IA diretamente, a prática se encaixa no movimento mais amplo de obtenção de textos longos, estruturados e diversos para treinar modelos de linguagem de grande porte. Ao TechCrunch e a outras publicações, a companhia manteve esse posicionamento. (techcrunch.com)

Diversos veículos independentes repercutiram a apuração original, com detalhes consistentes sobre o fluxo, o destino em Las Vegas e o procedimento de corte de lombadas. A cobertura de Ars Technica e The Next Web, por exemplo, destacou o caráter destrutivo do método e a ausência de especificidade no comunicado da Amazon sobre IA. Esse padrão de respostas tem sido comum na disputa por dados de treinamento. (arstechnica.com)

Por que livros raros e fora de catálogo interessam à IA

Modelos de linguagem precisam de dados extensos, variados e de alta qualidade. Livros impressos são artefatos editoriais revisados, com densidade informacional elevada e vocabulário rico. À medida que a oferta pública de dados de qualidade na web se exaure, companhias buscam corpora alternativos. A imprensa especializada já vinha mapeando a migração para acervos físicos, e fornecedores do setor editorial confirmaram uma demanda crescente por compras em volume por parte de empresas de tecnologia. Em janeiro de 2026, a Ingram Content Group comunicou a editoras um mecanismo de opt-out para vendas destinadas a empresas de IA, reconhecendo a tendência. (publishersweekly.com)

Outro indício veio de processos judiciais e documentos associados. Em 27 de janeiro de 2026, registros tornados públicos atribuídos à Anthropic descreviam planos para digitalização em massa de livros, em projeto que estimava de 500 mil a 2 milhões de obras em seis meses, explicitando a escala desejada. Embora trate de outra companhia, esse caso evidencia a direção da indústria e o apetite por estoque textual de alta qualidade. (washingtonpost.com)

Caixas com a marca Amazon, ilustrando logística e volume

Como o fluxo de aquisição funciona na prática

Pelas reportagens, o percurso começa com compras volumosas, muitas vezes em marketplaces de livros usados e raros. Uma parte das encomendas segue para o complexo LAS8, em North Las Vegas, onde VGT3 atua como uma espécie de esteira dedicada: receber, catalogar por ISBN, cortar a lombada, escanear páginas e descartar o exemplar físico. Essa rotina foi relatada de forma consistente por múltiplas fontes e veículos que acompanharam a história a partir de 17 e 18 de agosto de 2026. (techcrunch.com)

O detalhe do ISBN importa. Vários depoimentos citados sugerem que a leitura do código antecede o escaneamento, o que reforça a hipótese de uma abordagem sistemática, baseada em listas, organizada por edição. Isso explicaria o foco em livros raros, esgotados ou de difícil acesso, segmentos onde a digitalização cria vantagens informacionais que não estão facilmente disponíveis a concorrentes. (tomshardware.com)

Implicações legais, o que está em jogo

Existem duas frentes jurídicas relevantes. A primeira é a doutrina da primeira venda, pela qual quem adquire um exemplar físico pode dispor dele, inclusive destruí-lo. Comprar e cortar livros, per se, não é ilegal. A segunda é a questão autoral, que trata de transformar o conteúdo em dados para treinar sistemas comerciais. É aqui que se concentram processos contra diferentes laboratórios de IA. No caso da Anthropic, a imprensa reportou a estratégia de digitalização massiva e discutiu se o uso seria amparado por fair use, um debate que seguirá nos tribunais. (washingtonpost.com)

Para o caso específico da Amazon, a empresa não explicitou o uso para IA em seus comentários públicos, porém confirmou que as compras servem para melhorar produtos e serviços. Na prática, a discussão sobre o que constitui uso transformativo, e onde termina a cópia e começa a análise para treinamento, deve pautar as próximas ações judiciais. O histórico recente sugere que editoras e autores podem tentar delimitar o uso por contrato ou litígio, como mostra o próprio anúncio da Ingram sobre opções de bloqueio de vendas a empresas de tecnologia. (techcrunch.com)

Efeitos para editoras, livreiros e leitores

Para editoras, a digitalização destrutiva cria dilemas. De um lado, há receita com a venda física. De outro, o conteúdo pode abastecer modelos que, no limite, competem com produtos editoriais. Algumas casas já testam cláusulas de não revenda para escaneamento ou exploram licenças de dados, replicando o que aconteceu com música e streaming no passado. Fornecedores como a Ingram anteciparam o movimento, oferecendo mecanismos para evitar vendas a labs de IA. Isso indica que os grandes distribuidores enxergam risco de canibalização de valor. (publishersweekly.com)

Para livreiros especializados e sebos, o apetite corporativo por lotes raros pode elevar preços no curto prazo, mas também reduzir a disponibilidade de exemplares intactos, afetando bibliotecas e colecionadores. A cobertura da imprensa local de Las Vegas e de veículos de tecnologia reforçou que a operação é contínua, com paletes chegando ao longo de 2024 a 2026, segundo levantamentos paralelos. A pressão sobre fundos de acervos fora de catálogo tende a aumentar enquanto os modelos exigirem material novo e menos redundante. (reviewjournal.com)

O que isso revela sobre a corrida dos dados de IA

Há uma disputa real por fontes de dados com sinal mais forte, texto longo e curadoria. Livros impressos oferecem justamente isso. Quando uma das maiores empresas de tecnologia do mundo estrutura uma linha de escaneamento dedicada, a mensagem para o mercado é simples, dados de qualidade viraram infraestrutura. A consequência é um reordenamento de incentivos, onde empresas correm para garantir exclusividade, enquanto o ecossistema editorial tenta preservar a integridade de acervos e assegurar remuneração por usos secundários. A reação regulatória, se vier, deve mirar transparência, rastreabilidade de conjuntos de treinamento e licenciamento coletivo. (techcrunch.com)

Alternativas responsáveis, o que empresas podem fazer agora

  • Licenças diretas com editoras e autores, explorando modelos de remuneração por janela, por trecho efetivamente utilizado ou por impacto mensurável nos outputs do modelo.
  • Parcerias com bibliotecas e instituições de memória para digitalização não destrutiva, com contrapartidas de preservação e acesso público a versões fac-similares, quando juridicamente possível.
  • Programas de opt-in claros para catálogos vivos, comunicando aos leitores e ao mercado o destino dos dados e indicadores de governança, auditáveis por terceiros.
  • Adoção de data statements em documentação de modelos, indicando percentuais de fontes licenciadas, públicas e proprietárias, além de mecanismos de remoção sob solicitação fundamentada.

Essas linhas não impedem a inovação, mas reduzem assimetrias de informação e reforçam a confiança de quem cria conteúdo. A existência de ofertas como a da Ingram prova que intermediários já estão testando camadas contratuais para atender demandas de ambos os lados. (publishersweekly.com)

O que observar nos próximos meses

  • Processos e investigações, especialmente se autores, editoras ou associações buscarem delimitar o uso de cópias físicas para treinamento. O histórico da Anthropic antecipou parte da estratégia jurídica e continuará a influenciar a jurisprudência. (washingtonpost.com)
  • Movimentos de mercado em marketplaces de raridades. Se a compra em lote continuar, a escassez de certas edições pode ficar mais visível, afetando preços e disponibilidade em bibliotecas de referência.
  • Transparência corporativa. Comentários mais específicos de empresas como a Amazon podem surgir à medida que pressão pública e regulatória aumentar. Até aqui, a posição oficial é ampla e não cita IA nominalmente, o que mantém aberta a discussão. (arstechnica.com)

Conclusão

O rastreio de um lote de livros raros até o VGT3, em Las Vegas, acendeu um farol sobre um método brutalmente eficiente para transformar papel em dados para IA. A Amazon confirmou apenas a compra por canais comerciais para melhorar produtos e serviços, enquanto uma série de reportagens paralelas descreveu, com consistência, o procedimento de corte de lombadas, escaneamento em massa e descarte. Mesmo sem confissão explícita sobre o uso em treinamento, o contexto do setor e casos públicos de outras empresas deixam pouco mistério sobre a finalidade. (404media.co)

O debate que começa agora é sobre equilíbrio. Preservar patrimônio bibliográfico, remunerar adequadamente criadores e permitir que a IA avance com dados de alta qualidade não são objetivos incompatíveis. O caminho passa por contratos claros, governança de dados e métricas de transparência que mostrem, livro a livro, de onde vieram as palavras que treinam máquinas e para onde vai o valor que elas criam.

Leia também

Tecnologia e IA

Social Media Examiner 73% usam IA, Claude vence ChatGPT 2026

O relatório de IA 2026 da Social Media Examiner crava 73% de uso diário de IA entre marketers e vira o jogo, Claude é apontada como plataforma mais importante, à frente do ChatGPT. Entenda o que muda em conteúdo, agentes de IA, governança e ROI, com ações práticas para equipes B2B e B2C.

9 min de leitura
Tecnologia e IA

Google Vids grátis para todos, Gemini Omni 1.1 cria vídeo HD

Google Vids agora está disponível gratuitamente para qualquer conta Google. Com o Gemini Omni 1.1, é possível gerar cenas em 1080p, estender trechos com transições suaves e controlar a duração dos clipes. O recurso inclui marca d’água SynthID para transparência e integrações com o ecossistema Workspace.

9 min de leitura
Tecnologia e IA

Claude descobre sistema enzimático novo, tipo CRISPR, em busca massiva

Anthropic anunciou que Claude identificou um sistema enzimático inédito, associado a repetições tipo CRISPR, em fagos. O achado, batizado de ART, vem de uma varredura massiva de sequências e levanta hipóteses sobre novas operações em DNA. Entenda o que foi descoberto, o que é especulação e como isso pode afetar biotecnologia e P&D.

10 min de leitura
Tecnologia e IA

Gemini adiciona Adobe, Peloton, Airtable e mais com novos apps conectados

O Google anunciou novos Connected Apps no Gemini, com integrações de Adobe, Peloton, Airtable, Linear, monday.com, Picsart, Squarespace, Webflow, Experian, SeatGeek, apartments.com, Wispr AI e Zoho. O objetivo é executar tarefas completas sem trocar de aba, do briefing criativo à planilha e à reserva de treino. Veja os usos práticos, o que muda em privacidade e quem tem acesso.

11 min de leitura

Tags

IA generativamercado editorialdadoscopyright