Historia reciente: por qué funcionó ahora y no antes
Las ideas centrales del aprendizaje profundo son viejas. Las redes neuronales artificiales datan de mediados del siglo XX, el algoritmo que las entrena se popularizó en los años ochenta, y sin embargo el campo pasó décadas prometiendo cosas que no podía entregar. La pregunta interesante no es de dónde salieron las ideas: es por qué empezaron a funcionar recién ahora.
La respuesta corta es que no cambió la teoría, cambió la escala. La v1 de esta guía contaba tres factores, los tres girando sobre el mismo concepto —el dato—: producirlos, guardarlos y procesarlos. Hoy hacen falta dos más.
Procesamiento: máquinas que hacen más por segundo
Una medida cómoda del progreso es la cantidad de transistores en un procesador. En 1965, Gordon Moore observó que ese número se venía duplicando cada año desde la invención del transistor y arriesgó que seguiría haciéndolo una década más. La observación se conoció como “ley de Moore”, aunque de ley tiene poco: es una tendencia industrial, y una que se está agotando contra límites físicos de la miniaturización.
Lo importante es la forma de la curva. Si la capacidad se duplica cada dos años, en cuatro años no hay el doble: hay mucho más que el doble. El Intel 4004 de 1971 tenía 2.300 transistores en 12 × 12 milímetros; los procesadores actuales tienen miles de millones en menos superficie.
Con una corrección que importa: el hardware que hizo posible el aprendizaje profundo no es el procesador de propósito general sino la placa gráfica, diseñada para videojuegos y reconvertida porque resulta que renderizar polígonos y multiplicar matrices son el mismo problema. Buena parte de la geopolítica actual de los semiconductores se explica por ese accidente.
Producción: datos por todos lados
Casi todo lo que hacemos puede convertirse en dato, porque hay una mediación digital que registra el cambio de estado más mínimo:
- Los clics en una página generan datos sobre qué contenidos atraen atención.
- Las búsquedas generan datos sobre lo que la gente quiere saber.
- Los “me gusta”, comentarios y compartidos generan datos sobre popularidad.
- Los historiales y las cookies generan datos sobre patrones de navegación.
- Las reseñas de productos generan datos sobre preferencias de consumo.
- El GPS del teléfono genera datos sobre los movimientos de las personas.
- Los dispositivos conectados generan datos ambientales, de actividad física, de consumo energético y de producción industrial.
Luciano Floridi llamó infoesfera al entorno informacional que las tecnologías digitales crearon alrededor del planeta: la totalidad de lo que se produce, almacena, comparte y procesa por medios digitales. Su tesis es que así como los organismos vivos interactúan con la biosfera y la constituyen, nosotros interactuamos con la infoesfera y la constituimos. De ahí su propuesta de pensarnos como organismos informacionales que viven una existencia onlife, sin frontera nítida entre lo conectado y lo no conectado.
La metáfora tiene un límite que conviene tener presente, y es el mismo que tiene “la nube”: nombra como etéreo algo que está en un galpón, consume electricidad y ocupa una parcela con una dirección postal.
Almacenamiento: tener dónde ponerlos
Hay tantos datos disponibles en parte porque hay dónde guardarlos, y eso es un problema tecnológico tan difícil como el del procesamiento. Acá el factor decisivo es económico: el costo por gigabyte cayó tantos órdenes de magnitud que dejó de ser una restricción de diseño. A fines de los ochenta almacenar un gigabyte costaba del orden de cien mil dólares; hoy se mide en centavos.
Puesto en la escala de Turing: el gigabyte que él estimaba necesario para el juego de la imitación habría costado, en discos de la década de 1950, del orden de nueve millones de dólares, y en memoria rápida una cifra que no vale la pena escribir porque además era técnicamente imposible.
Fuente: Our World in Data.
¿Notás algo raro en la forma del gráfico? Mirá qué escala usa el eje vertical.
Arquitectura: el transformer
Los tres factores anteriores explican la posibilidad, no el resultado. La pieza que faltaba llegó en 2017 con el transformer, la arquitectura propuesta en Attention is all you need, cuya ventaja decisiva no es tanto que entienda mejor el lenguaje cuanto que se paraleliza: puede aprovechar miles de placas a la vez, donde las arquitecturas anteriores procesaban en secuencia.
Eso convirtió el problema de la inteligencia artificial en un problema de presupuesto. Si más cómputo y más datos producen sistemáticamente mejores modelos, la pregunta deja de ser “¿qué idea nos falta?” y pasa a ser “¿quién puede pagar el próximo entrenamiento?”. El corte público llegó a fines de 2022, cuando ese cambio técnico se volvió un producto de consumo masivo.
Y qué cuesta la escala
Acá la v1 de esta guía se detenía, y hoy no se puede. La escala no es gratis: el entrenamiento de un modelo grande consume electricidad y agua, se hace en centros de datos que se instalan donde la energía y el suelo son baratos —lo que no suele coincidir con donde vive quien usa el modelo—, y depende de trabajo humano mal pagado para etiquetar datos y corregir respuestas.
No es un apéndice ético del asunto técnico: es parte de la explicación de por qué esto funcionó ahora. Un modelo que resulta viable sólo porque el agua de refrigeración y el trabajo de etiquetado son baratos es un artefacto cuya condición de posibilidad es un reparto desigual. Esa discusión, con sus fuentes, está en Pensar la IA desde el Sur Global.
Qué es, entonces, una red neuronal
Juntemos los puntos. Cuando se habla de “el algoritmo” de Netflix, de Spotify o de una red social, en sentido estricto no se está hablando de un algoritmo: un algoritmo garantiza un resultado, y acá no hay tal garantía. Lo que hay es un conjunto de procesos computacionales —esos sí, algoritmos, y bastante simples de programar— que configuran una estructura de red neuronal artificial capaz de hacer una tarea a partir del estado al que llegó explorando datos.
Una red neuronal es una estructura lógica en capas, con nodos que reciben señales, las procesan y pasan el resultado a otros nodos. Lo distintivo son las conexiones ponderadas entre nodos, los pesos. Entrenar consiste en ajustar iterativamente esos pesos según la retroalimentación de los datos, hasta que la red modele la relación entre lo que entra y lo que se quiere que salga. Para muchísimas tareas no hacen falta instrucciones precisas sobre cómo distinguir un perro de un gato: alcanza con muchos ejemplos y mucho cómputo.
Y ahí aparece el problema que abre la entrada siguiente. Resolvimos una cosa y nos creamos otra: si no sé exactamente qué está haciendo la red para lograr lo que le pedí, ¿cómo sé que lo está haciendo bien, y que lo va a seguir haciendo bien ante algo que no vio nunca? Dicho de otro modo: ¿cómo sé que sabe? Y, antes que eso, ¿cómo sé yo que sé algo?
Para profundizar
Floridi, L. (2014). The fourth revolution: How the infosphere is reshaping human reality. Oxford University Press.
Ilcic, A. A. Desafíos epistémicos de la técnica: ¿aprenden las máquinas con su machine learning? Manuscrito.
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N.,
Kaiser, Ł. y Polosukhin, I. (2017). Attention is all you need. Advances in
Neural Information Processing Systems, 30.
https://arxiv.org/abs/1706.03762
Si no le tenés miedo a la matemática, la explicación técnica completa está en el recorrido de Arrancar, y en particular en la serie de 3Blue1Brown y en el Zero to Hero de Karpathy.
Videos sobre la historia de la IA
The machine that changed the world
The Thinking Machine (MIT, 1961), incluido en esta compilación de documentales sobre la historia de la IA:
Esta entrada revisa y actualiza Historia (últimos años) de la v1.