Por pelo menos 100.000 anos, apenas um tipo de entidade na Terra conseguia aprender uma linguagem humana com total fluência: uma criança humana. Isso mudou há cerca de quatro anos. Os large language models agora conseguem manter conversas que são, na superfície, indistinguíveis de uma troca humana. E ainda assim, por trás dessa fluência, algo profundamente estranho está acontecendo. Esses sistemas exigem uma quantidade impressionante de dados para atingir um nível de competência que uma criança pequena alcança quase sem esforço. Compreender por que essa lacuna existe é agora uma das questões em aberto mais importantes tanto na ciência cognitiva quanto na pesquisa de IA.
A Escala do Problema É Difícil de Compreender
Os números envolvidos são difíceis de imaginar. Uma criança pré-adolescente criada em um ambiente linguisticamente rico pode ter ouvido cerca de 100 milhões de palavras até chegar à adolescência. Adicione a leitura ao cenário, e esse número pode subir para cerca de 300 milhões de palavras aos 20 anos. O modelo de peso aberto Llama 3.1 da Meta, em contrapartida, foi treinado com 15 trilhões de tokens, onde tokens são unidades de linguagem semelhantes a palavras. Modelos de fronteira podem estar sendo treinados com dez vezes essa quantidade, de acordo com Ethan Gotlieb Wilcox, um cientista cognitivo e linguista da Georgetown University.
Para tornar o contraste tangível: se você imprimisse todas as palavras usadas para treinar um large language model moderno, a pilha de papel ultrapassaria a Estação Espacial Internacional. Os 100 milhões de palavras que um pré-adolescente ouviu se acumulariam em cerca de 20 metros. Wilcox coloca de outra forma: o Claude viu a quantidade de linguagem que uma cidade inteira vivenciará em uma geração.
Isso é o que os pesquisadores chamam de lacuna de eficiência de dados. As crianças aprendem linguagem a partir de uma fração minúscula da entrada que as máquinas exigem, e o fazem de forma mais rápida, confiável e com muito menos instrução explícita. Crianças pequenas normalmente começam a produzir frases gramaticalmente corretas após ouvir algo entre 10 e 30 milhões de palavras. Treinar o GPT-2 com 30 milhões de palavras, como aponta Michael C. Frank, um cientista cognitivo da Stanford University, produz um gerador de disparates. Ele não produz nada que se pareça com uma criança.
Um Debate Que Moldou Tanto a Linguística Quanto a IA
A questão de como as crianças adquirem linguagem não é nova, e as respostas concorrentes a ela tiveram consequências reais para o modo como a IA se desenvolveu. Na década de 1950, o linguista do MIT Noam Chomsky argumentou que as crianças nascem com conhecimento gramatical embutido. Seu raciocínio era que a linguagem, especialmente sua sintaxe, é complexa demais e a exposição das crianças a ela é limitada demais para que o aprendizado aconteça puramente por meio da experiência. Ele chamou isso de “pobreza do estímulo”. Contra ele estava o psicólogo B.F. Skinner, que sustentava que a linguagem era aprendida inteiramente por meio do condicionamento ambiental, da mesma forma que os animais aprendem a responder a recompensas.
A visão de Chomsky dominou a linguística americana por décadas, e moldou a pesquisa inicial de IA diretamente. Os pesquisadores tentaram ensinar linguagem aos computadores codificando regras gramaticais explicitamente em programas, uma abordagem baseada em regras que se tornou parte do que foi chamado de symbolic AI. Essa abordagem falhou em grande parte ao tentar produzir sistemas capazes de lidar com linguagem humana real em escala. O interesse na área esfriou significativamente durante o período conhecido como o inverno da IA, que começou na década de 1970.
O retorno veio por um caminho totalmente diferente. As redes neurais, que aprendem reconhecendo padrões estatísticos em vez de seguir regras explícitas, começaram a superar os sistemas baseados em regras à medida que o hardware se tornava mais barato e a internet fornecia vastas quantidades de texto. Entre 2018 e 2019, modelos como o BERT e o GPT-2, construídos sobre uma nova arquitetura chamada transformer, demonstraram que aprender com quantidades massivas de dados podia funcionar para a linguagem. O sucesso do ChatGPT em 2022 tornou isso visível para o público em geral.
A ironia é marcante. Os large language models são, em essência, exatamente o tipo de máquina de aprendizado estatístico que Chomsky argumentou que nunca poderia adquirir linguagem. Eles não têm gramática inata, regras embutidas ou arquitetura biológica. E ainda assim funcionam, pelo menos em escala. As crianças, por sua vez, realizam o mesmo feito com uma fração dos dados e sem nenhuma infraestrutura computacional. Nenhum dos lados do velho debate explica completamente nenhum dos casos.
Por Que Essa Questão Importa Além do Laboratório
Há uma urgência prática aqui que vai além do debate acadêmico. A internet não é infinita. Os pesquisadores sugerem que o suprimento de dados de texto facilmente disponíveis para treinamento pode esgotar já na década de 2030. Se os sistemas de IA só conseguem melhorar consumindo mais dados, essa trajetória tem um teto. As crianças demonstram que o teto não é fundamental. É uma limitação dos métodos atuais, e não da tarefa em si.
Fechar a lacuna de eficiência de dados pode abrir possibilidades que os modelos atuais não conseguem alcançar: sistemas de IA treinados efetivamente com vídeo em vez de texto, ferramentas de linguagem construídas para comunidades de línguas minoritárias onde grandes corpora de texto simplesmente não existem, e modelos que generalizam a partir de exemplos limitados da mesma forma que os humanos fazem. Estudar como as crianças aprendem também oferece uma maneira de testar hipóteses de longa data sobre a mente humana, incluindo se a aquisição da linguagem requer estruturas biológicas inatas ou se o tipo certo de ambiente de aprendizado é suficiente.
O que este campo está realmente perguntando é uma versão de uma questão muito mais antiga: o que significa entender linguagem, e quanto desse entendimento é unicamente humano? A IA não respondeu a essa pergunta. Ela a tornou mais urgente.
Em Resumo
As crianças aprendem linguagem a partir de uma fração dos dados que os sistemas de IA exigem, uma lacuna tão grande que só pode ser descrita por meio de analogia. Os pesquisadores estão estudando como as crianças conseguem isso porque a resposta pode redefinir como os models de IA são construídos, e porque o suprimento de dados de treinamento tem limites. O debate entre o conhecimento inato e o aprendizado estatístico, que moldou tanto a linguística quanto a IA inicial, ainda não está resolvido. Os large language models são evidências poderosas de que a estatística pode ir longe. As crianças são evidências igualmente poderosas de que a estatística sozinha não é toda a história.
Com base em reportagem de MIT Technology Review.