As livrarias de usados não deveriam ser uma história de crescimento. Por anos, o setor lutou enquanto a leitura digital remodelava hábitos e o fluxo de pedestres diminuía. As vendas de livrarias atingiram o pico em 2007, com 17,18 bilhões de dólares, e têm caído substancialmente desde então. Agora, algumas dessas mesmas lojas estão processando pedidos em massa de milhares de volumes em um único dia. Os compradores não são leitores. São empresas de IA, e os livros podem não sobreviver ao encontro.
De Northumberland a Las Vegas: A escala da demanda
A Barter Books, uma livraria de usados em Northumberland, o condado menos densamente povoado da Inglaterra, normalmente movimenta entre 2.000 e 3.000 livros por semana. Recentemente, o proprietário recebeu um único pedido em massa de uma empresa canadense que correspondia a todo esse volume semanal. Várias livrarias vizinhas relatam padrões semelhantes.
Os pedidos chegam por meio de plataformas como a Biblio, que anonimiza os compradores, de modo que os vendedores raramente sabem com certeza quem está comprando ou o motivo. Mas a escala das transações torna inverossímil a explicação do “colecionador pessoal ávido”. Uma remessa contendo pelo menos um livro raro foi rastreada até uma instalação de treinamento de IA da Amazon em Las Vegas, uma instalação que escaneia livros de forma destrutiva para fins de treinamento de IA.
A digitalização destrutiva é exatamente o que parece. Os livros encadernados são fisicamente desmontados para que suas páginas individuais possam ser alimentadas em scanners de alta velocidade. O texto é então ingerido por um LLM. Uma vez concluído o processo, as páginas são descartadas, recicladas ou transformadas em polpa. O livro deixa de existir.
O cenário jurídico que tornou isso necessário
O aumento nas compras de livros usados não é aleatório. Ele segue um desenvolvimento jurídico específico. A Anthropic recentemente alcançou o que foi descrito como um dos maiores acordos de infração de direitos autorais da história, concordando em pagar 1,5 bilhão de dólares a mais de 300.000 escritores que haviam aberto um processo contra a empresa dois anos antes. A OpenAI continua enfrentando vários processos por infração de direitos autorais de fontes que incluem The New York Times, Encyclopedia Britannica, a comediante Sarah Silverman e vários autores de não ficção, que alegam que a empresa copiou seus livros para treinar seu LLM.
O acordo com a Anthropic, no entanto, produziu uma decisão judicial com implicações significativas. O tribunal determinou que treinar IA em obras protegidas por direitos autorais não é ilegal, desde que a empresa pague pelos livros que utilizou. Um juiz separado chegou a uma conclusão semelhante em relação à Meta. Essa decisão efetivamente criou um caminho legal: adquirir os livros físicos, pagar por eles, e o treinamento é permitido.
Os livros usados oferecem uma rota de aquisição mais barata do que comprar diretamente das editoras. As editoras também podem recusar o fornecimento de cópias para empresas de IA se o uso pretendido for conhecido. Comprar por meio de mercados anonimizados elimina ambos os problemas.
O caso da Anthropic também trouxe à tona uma iniciativa interna chamada “Project Panama”, que a empresa descreveu como seu esforço para “escanear destrutivamente todos os livros do mundo”. A documentação interna revelou que a empresa usou um codinome para o método de treinamento especificamente porque, nas suas próprias palavras, não queria que soubessem que estava trabalhando nisso. A Anthropic declarou desde então à BBC que nenhum de seus programas de aquisição de dados compra e destrói livros raros ou antiquários.
O que isso revela sobre como os sistemas de IA são realmente construídos
Aqui está o que a maior cobertura sobre o desenvolvimento de IA subestima: a qualidade e a amplitude dos dados de treinamento de um modelo de linguagem não são uma nota de rodapé técnica. É a base. Livros, particularmente os mais antigos, contêm formas de conhecimento, estrutura de prosa e especialização em domínio que não são facilmentereplicadas pela raspagem da web aberta. Livros raros e antiquários podem guardar informações que não existem em nenhum outro lugar em formato digital, o que é precisamente o que os torna atraiaentes como material de treinamento e o que torna sua potencial destruição uma preocupação legítima para historiadores, bibliotecários e arquivistas.
As garantias da Anthropic sobre livros raros aplicam-se apenas à Anthropic. É improvável que seja a única empresa a usar a digitalização destrutiva, e outras empresas podem não aplicar as mesmas restrições sobre o que processam.
Para os sebos, a dimensão ética é real, mas complicada. Muitos proprietários de lojas podem ter reservas sobre para onde os livros estão indo. A injeção de dinheiro, no entanto, é difícil de recusar para um setor que passou anos encolhendo. O setor viu uma recuperação modesta nos últimos três anos, mas muitas livrarias ainda tiveram que se reestruturar ou fechar permanentemente.
A situação coloca os livreiros independentes em uma posição desconfortável: eles estão se tornando, sem pleno conhecimento ou consentimento, fornecedores em um processo industrial que não conseguem ver ou verificar totalmente.
Em suma
As empresas de IA estão comprando livros usados em massa, em escala, como uma maneira legalmente defensável e econômica de adquirir dados de treinamento após decisões judiciais que permitem o treinamento em obras protegidas por direitos autorais quando as cópias físicas são pagas. O processo, conhecido como digitalização destrutiva, destrói fisicamente os livros após a digitalização. A prática levanta preocupações legítimas sobre volumes raros e insubstituíveis, a transparência da cadeia de suprimentos e o que significa quando uma categoria inteira de conhecimento humano é processada industrialmente e depois descartada. Para os sebos, a demanda é uma tábua de salvação financeira. Para o registro cultural mais amplo, as implicações merecem ser acompanhadas de perto.
Com base em reportagem de Fast Company - Tech.