O presidente da OpenAI, Greg Brockman, declarou recentemente que a “era da AGI” começou, após o lançamento do GPT-6 Astra. O CEO da Nvidia, Jensen Huang, ecoou o anúncio publicamente. A afirmação teve um peso considerável: a inteligência geral artificial, tratada por muito tempo como o horizonte distante da pesquisa em IA, estava sendo apresentada como uma realidade atual. O problema é que quase ninguém fora dessas empresas concorda sobre o que essa realidade realmente significa.
Uma Pontuação de Benchmark que Muda com o Software
A evidência mais citada para a capacidade em nível de AGI do Astra é seu desempenho no ARC-AGI-3, um benchmark projetado pelo pesquisador de IA François Chollet especificamente para resistir ao tipo de treinamento direcionado que tornou muitos testes de IA pouco confiáveis. O benchmark coloca modelos em ambientes de jogos de vídeo desconhecidos e mede se eles conseguem descobrir as regras, se adaptar e vencer. Ele é, por design, mais difícil de burlar do que a maioria.
O Astra teve um desempenho notavelmente bom. Usando o próprio harness de teste da OpenAI, a camada de software que faz a mediação entre o modelo e o benchmark, ele pontuou 99,9%. Usando a configuração de teste padrão do ARC-AGI-3, projetada para dar a todos os modelos uma interface mais uniforme, a pontuação caiu para 62,7%. Essa lacuna não é uma nota de rodapé técnica menor. Ela levanta uma pergunta direta: o modelo é genuinamente capaz, ou ele está parcialmente otimizado para as condições sob as quais está sendo avaliado?
O próprio Chollet abordou isso diretamente. O benchmark, explicou ele, testa um conjunto não exaustivo de atributos em pequenas escalas. A inteligência do mundo real envolve horizontes de tempo muito mais longos para o aprendizado, complexidade muito maior na modelagem do mundo e objetivos muito mais ambiciosos. Resolver o ARC-AGI-3, na visão dele, é um sinal significativo de progresso. Não é prova de AGI, e nunca teve a intenção de ser.
O Problema da Definição é a Verdadeira História
Eis o que a maior parte da cobertura sobre este anúncio deixa escapar: o debate sobre se a AGI chegou é inseparável do debate sobre o que AGI sequer significa. Não existe uma definição universalmente aceita, e essa ausência cria um espaço significativo para interpretação.
A definição atual da OpenAI descreve AGI como “sistemas altamente autônomos que superam os humanos na maior parte do trabalho economicamente valioso”. O Center for AI Safety usa uma estrutura mais exigente que requer alto desempenho em dez domínios cognitivos distintos, abrangendo raciocínio, memória e percepção. Pesquisadores independentes frequentemente trabalham a partir de definições ainda mais rigorosas.
Gary Marcus, professor da New York University e um cético proeminente da IA, descreveu a afirmação da AGI como marketing, argumentando que ela ou mal-entende as definições originais do termo ou abaixa o nível deliberadamente. O argumento dele sobre o desempenho do Astra no Epoch Capabilities Index é instrutivo: o Astra realmente estabeleceu um recorde, pontuando 169 contra uma alta anterior de 163, mas a própria análise da Epoch AI descobriu que a melhoria continuou consistente com a trajetória existente do progresso da IA. Um novo recorde, sim. Um salto descontínuo, não.
Ben Goertzel, o pesquisador que cunhou o termo “inteligência geral artificial” em 2005, ofereceu talvez o enquadramento mais preciso. Após usar o Astra, a avaliação dele foi de que o modelo é super-humano em certas áreas, particularmente matemática e programação, enquanto permanece mais fraco em outras. Compará-lo a um ser humano, disse ele, “acaba sendo complicado em vez de um simples sim ou não”. Ele também identificou lacunas específicas que a infraestrutura de software não pode fechar: como o modelo entende a si mesmo, como ele retém e aplica a memória através de sua experiência e como ele coordena objetivos conflitantes.
Andy Konwinski, que cofundou Databricks, Perplexity e Laude, colocou a questão de forma mais simples. Esses sistemas ainda não conseguem pensar de forma independente por longos períodos. Eles conseguem escrever software complexo e identificar bugs, mas a maior parte do valor do mundo não vem da engenharia de software. Eles não estão cultivando alimentos, construindo infraestrutura ou governando sociedades.
Por Que o Rótulo Importa Além do Laboratório
O debate sobre a AGI pode parecer uma disputa técnica entre pesquisadores, mas suas implicações se estendem muito além das pontuações de benchmark. Quando figuras influentes na indústria declaram que um limite foi cruzado, isso molda as expectativas públicas, conversas políticas, decisões de investimento e a maneira como as pessoas entendem a tecnologia com a qual estão convivendo cada vez mais.
Brockman não é o primeiro a fazer esse tipo de declaração. Huang fez uma afirmação semelhante no início do ano. O CEO da OpenAI, Sam Altman, descreveu o momento atual como o início da Singularidade, uma fase em que os sistemas de IA assumiram o controle e aceleraram o desenvolvimento de novos modelos, com os humanos amplamente removidos desse ciclo. Cada uma dessas declarações carrega peso justamente por causa de quem as está dizendo, e cada uma delas chega sem um padrão compartilhado contra o qual medir a afirmação.
A analogia da rede celular é adequada: as operadoras historicamente rotularam suas redes com o marcador da próxima geração antes que a tecnologia subjacente atendesse totalmente ao padrão técnico. O rótulo impulsiona a adoção e a percepção. A lacuna entre o rótulo e a realidade se fecha mais tarde, silenciosamente.
As capacidades da IA estão avançando. Isso não está em disputa. O que permanece genuinamente em aberto é se o conceito de AGI, tal como foi definido e redefinido pelas pessoas mais motivadas a alcançá-lo, ainda descreve algo preciso o suficiente para ser significativo.
Em Resumo
O GPT-6 Astra é um modelo capaz, e seus resultados de benchmark representam progresso real. Mas a afirmação de que a AGI chegou se baseia em uma definição que as empresas que fazem a afirmação moldaram para se adequar aos seus próprios sistemas. Pesquisadores que cunharam o termo, desenharam os benchmarks e estudam IA de forma independente não estão convencidos. A coisa mais importante a entender não é se a AGI está aqui. É que a resposta depende inteiramente de quem pode definir a pergunta.
Com base em reportagem de Fast Company - Tech.