História recente: por que funcionou agora e não antes
As ideias centrais do aprendizado profundo são velhas. As redes neurais artificiais datam de meados do século XX, o algoritmo que as treina se popularizou nos anos oitenta, e mesmo assim o campo passou décadas prometendo coisas que não podia entregar. A pergunta interessante não é de onde saíram as ideias: é por que começaram a funcionar só agora.
A resposta curta é que não mudou a teoria, mudou a escala. A v1 deste guia contava três fatores, os três girando sobre o mesmo conceito —o dado—: produzi-los, guardá-los e processá-los. Hoje fazem falta mais dois.
Processamento: máquinas que fazem mais por segundo
Uma medida cômoda do progresso é a quantidade de transistores num processador. Em 1965, Gordon Moore observou que esse número vinha dobrando a cada ano desde a invenção do transistor e arriscou que seguiria assim por mais uma década. A observação ficou conhecida como “lei de Moore”, embora de lei tenha pouco: é uma tendência industrial, e uma que está se esgotando contra limites físicos da miniaturização.
O importante é a forma da curva. Se a capacidade dobra a cada dois anos, em quatro anos não há o dobro: há muito mais que o dobro. O Intel 4004 de 1971 tinha 2.300 transistores em 12 × 12 milímetros; os processadores atuais têm bilhões em menos superfície.
Com uma correção que importa: o hardware que tornou possível o aprendizado profundo não é o processador de propósito geral mas a placa gráfica, projetada para videogames e reconvertida porque renderizar polígonos e multiplicar matrizes são o mesmo problema. Boa parte da geopolítica atual dos semicondutores se explica por esse acidente.
Produção: dados por todo lado
Quase tudo o que fazemos pode virar dado, porque há uma mediação digital que registra a mudança de estado mais mínima:
- Os cliques numa página geram dados sobre que conteúdos atraem atenção.
- As buscas geram dados sobre o que as pessoas querem saber.
- As curtidas, comentários e compartilhamentos geram dados sobre popularidade.
- Os históricos e os cookies geram dados sobre padrões de navegação.
- As avaliações de produtos geram dados sobre preferências de consumo.
- O GPS do telefone gera dados sobre os movimentos das pessoas.
- Os dispositivos conectados geram dados ambientais, de atividade física, de consumo energético e de produção industrial.
Luciano Floridi chamou de infoesfera o ambiente informacional que as tecnologias digitais criaram ao redor do planeta: a totalidade do que se produz, armazena, compartilha e processa por meios digitais. Sua tese é que, assim como os organismos vivos interagem com a biosfera e a constituem, nós interagimos com a infoesfera e a constituímos. Daí sua proposta de nos pensarmos como organismos informacionais que vivem uma existência onlife, sem fronteira nítida entre o conectado e o não conectado.
A metáfora tem um limite que convém ter presente, e é o mesmo que tem “a nuvem”: nomeia como etéreo algo que está num galpão, consome eletricidade e ocupa um terreno com endereço postal.
Armazenamento: ter onde colocá-los
Há tantos dados disponíveis em parte porque há onde guardá-los, e isso é um problema tecnológico tão difícil quanto o do processamento. Aqui o fator decisivo é econômico: o custo por gigabyte caiu tantas ordens de magnitude que deixou de ser uma restrição de projeto. No fim dos anos oitenta armazenar um gigabyte custava da ordem de cem mil dólares; hoje se mede em centavos.
Posto na escala de Turing: o gigabyte que ele estimava necessário para o jogo da imitação teria custado, em discos da década de 1950, da ordem de nove milhões de dólares, e em memória rápida uma cifra que não vale a pena escrever porque além disso era tecnicamente impossível.
Fonte: Our World in Data.
Nota algo estranho na forma do gráfico? Olhe que escala usa o eixo vertical.
Arquitetura: o transformer
Os três fatores anteriores explicam a possibilidade, não o resultado. A peça que faltava chegou em 2017 com o transformer, a arquitetura proposta em Attention is all you need, cuja vantagem decisiva não é tanto que entenda melhor a linguagem quanto que se paraleliza: pode aproveitar milhares de placas ao mesmo tempo, onde as arquiteturas anteriores processavam em sequência.
Isso converteu o problema da inteligência artificial num problema de orçamento. Se mais computação e mais dados produzem sistematicamente modelos melhores, a pergunta deixa de ser “que ideia nos falta?” e passa a ser “quem pode pagar o próximo treinamento?”. O corte público chegou no fim de 2022, quando essa mudança técnica virou um produto de consumo massivo.
E quanto custa a escala
Aqui a v1 deste guia parava, e hoje não dá. A escala não é grátis: o treinamento de um modelo grande consome eletricidade e água, é feito em centros de dados instalados onde a energia e o solo são baratos —o que não costuma coincidir com onde mora quem usa o modelo— e depende de trabalho humano mal pago para rotular dados e corrigir respostas.
Não é um apêndice ético do assunto técnico: é parte da explicação de por que isso funcionou agora. Um modelo que só é viável porque a água de refrigeração e o trabalho de rotulagem são baratos é um artefato cuja condição de possibilidade é uma repartição desigual. Essa discussão, com suas fontes, está em Pensar a IA a partir do Sul Global.
O que é, então, uma rede neural
Juntemos os pontos. Quando se fala d’“o algoritmo” da Netflix, do Spotify ou de uma rede social, em sentido estrito não se está falando de um algoritmo: um algoritmo garante um resultado, e aqui não há tal garantia. O que há é um conjunto de processos computacionais —esses sim, algoritmos, e bem simples de programar— que configuram uma estrutura de rede neural artificial capaz de fazer uma tarefa a partir do estado ao qual chegou explorando dados.
Uma rede neural é uma estrutura lógica em camadas, com nós que recebem sinais, os processam e passam o resultado a outros nós. O distintivo são as conexões ponderadas entre nós, os pesos. Treinar consiste em ajustar iterativamente esses pesos conforme a retroalimentação dos dados, até que a rede modele a relação entre o que entra e o que se quer que saia. Para muitíssimas tarefas não fazem falta instruções precisas sobre como distinguir um cachorro de um gato: bastam muitos exemplos e muita computação.
E aí aparece o problema que abre a entrada seguinte. Resolvemos uma coisa e criamos outra: se não sei exatamente o que a rede está fazendo para conseguir o que lhe pedi, como sei que está fazendo bem, e que vai continuar fazendo bem diante de algo que nunca viu? Dito de outro modo: como sei que ela sabe? E, antes disso, como sei eu que sei algo?
Para aprofundar
Floridi, L. (2014). The fourth revolution: How the infosphere is reshaping human reality. Oxford University Press.
Ilcic, A. A. Desafíos epistémicos de la técnica: ¿aprenden las máquinas con su machine learning? Manuscrito.
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N.,
Kaiser, Ł. e Polosukhin, I. (2017). Attention is all you need. Advances in
Neural Information Processing Systems, 30.
https://arxiv.org/abs/1706.03762
Se você não tem medo da matemática, a explicação técnica completa está no percurso de Começar, em particular na série do 3Blue1Brown e no Zero to Hero de Karpathy.
Vídeos sobre a história da IA
The machine that changed the world
The Thinking Machine (MIT, 1961), incluído nesta compilação de documentários sobre a história da IA:
Esta entrada revisa e atualiza História (últimos anos) da v1, disponível em espanhol.