IA explicada

Cómo piensan las máquinas, en gráficos

Del perceptrón a los modelos de lenguaje: una guía visual y sin tecnicismos para entender las ideas que hacen funcionar a la inteligencia artificial.

01El ladrillo básico

El perceptrón: la neurona artificial

Todo arranca acá. Un perceptrón aprende un 'molde' de lo que busca y, cuando le llega algo, mide cuánto encaja. Veámoslo con ejemplos.

Ejemplo 1 · Reconocer un dígito escrito

El dibujo

Encaja con el molde: alta coincidencia.

El molde del 7 (aprendido)

azul suma · rojo resta

¿Es un 7?

Sí, es un 7
coincidencia con el molde94%

Cómo agrupa lo que aprende

Cada dibujo es un punto. Los parecidos caen cerca y forman grupos; uno nuevo se reconoce por el grupo al que se acerca.

los unoslos sieteslos ochoseste dibujo

Ejemplo 2 · ¿Perro o gato? (más píxeles)

Con una 'foto' de más píxeles funciona igual: el molde aprende que el gato tiene orejas puntiagudas arriba (azul) y el perro, orejas caídas a los lados (rojo).

La foto

Orejas puntiagudas: encaja con el molde.

El molde de gato (aprendido)

azul suma · rojo resta

¿Es un gato?

Sí, es un gato
coincidencia con el molde95%

Y también los agrupa

Cada foto es un punto: los gatos caen de un lado, los perros del otro.

los gatoslos perrosesta foto

Por dentro · Suma, resta y un número

¿Cómo mide la coincidencia? Multiplica cada píxel por su peso: algunos suman (azul) y otros restan (rojo). Todo eso se junta en un solo número.

píxelpesoaporta
0.9+0.80+0.72
0.1-0.60-0.06
0.8+0.70+0.56
0.2-0.90-0.18
0.7+0.50+0.35
Σ suma todo+1.39
0+

activación

0.80

…y con muchos, un vector

0.800.200.55

Ese número (y el vector que forma con otros) es la coordenada que ubica el punto en el mapa de grupos.

Y sirve para todo · Audio, video, documentos

Para la máquina no hay diferencia entre una foto, una canción o un texto: todo se convierte en una lista de números. Por eso el mismo mecanismo lee cualquier medio digital.

Audio

onda → números

0.20.80.10.60.9

Imagen

píxeles → números

0.70.30.50.20.8

Video

cuadros → números

0.40.90.60.10.5

Documento

letras → números

0.60.20.70.80.3

Todo: una lista de números

[ 0.2 0.8 … ]

la misma red

Cambiando el molde (los pesos), el mismo mecanismo reconoce un 7, un gato o cualquier cosa. Y ajustar ese molde solo, a partir de los errores, es lo que veremos en el gráfico 2.

02Cómo aprende

Retropropagación: aprender de los errores

Un solo perceptrón es limitado; la magia aparece al conectar muchos en capas. La red hace una predicción, la compara con la respuesta correcta y mide cuánto se equivocó. Ese error viaja hacia atrás ajustando cada peso para acercarse. Repetido millones de veces, la red aprende sola.

gradiente del errorentradacapa ocultaŷsalidapredijo0.72objetivo1.00error: 0.28Paso hacia adelante

Adelante calcula una respuesta; atrás reparte la culpa del error entre los pesos y los corrige. Ese ida y vuelta, una y otra vez, es 'entrenar' un modelo.

03Modelos de lenguaje

Qué es un LLM (como ChatGPT)

Un Large Language Model es una red enorme entrenada con esta misma idea, pero con casi todo el texto de internet. Lee tu frase como una secuencia de piezas (tokens), decide con 'atención' qué palabras importan más y predice la palabra más probable que sigue. Encadenando esas predicciones, escribe.

Texto de entrada

Elgatosesubióal___
Atención (Transformer)N× capas

Próxima palabra probable

tejado88%
árbol7%
techo3%
auto2%

No 'entiende' como una persona: calcula probabilidades sobre patrones que aprendió de millones de textos. Por eso a veces suena seguro incluso cuando se equivoca.

04Para qué sirve

Dónde ya lo usamos todos los días

La misma idea básica, entrenada con datos distintos, resuelve problemas muy concretos en todos los sectores. Seguro interactuás con varios de estos sin darte cuenta.

Redes neuronales

aprendizaje profundo

Visión por computadora

Cámaras que 'ven': reconocen objetos, rostros o fallas en una foto.

Salud

Detectan tumores o lesiones en radiografías, a veces antes que el ojo humano.

Lenguaje natural

Asistentes que entienden, responden, traducen y resumen texto.

Detección de fraude

Frenan un pago sospechoso en el instante en que ocurre.

Recomendación

Sugieren la próxima serie, canción o producto que te va a gustar.

Vehículos autónomos

Autos que interpretan la calle y deciden cómo conducir.

En todos los casos es la misma receta: muchos ejemplos, una red que ajusta sus pesos y una predicción al final.

El salto de escala

De decenas a billones de parámetros

El perceptrón de 1958 ajustaba unos pocos números. Los modelos de hoy ajustan más de un billón. Y con esa escala pasa algo inesperado.

~1.000Perceptrón195860 milLeNet-5199860 millonesAlexNet2012340 millonesBERT2018175 mil millonesGPT-32020~1 billónGPT-42023

Escala logarítmica: cada escalón es ~1000 veces más grande.

Tamaño del modeloCapacidadumbraltraducirresumirescribir códigorazonar y conversar

Propiedades emergentes

Pasado cierto tamaño, el modelo empieza a hacer cosas que nadie programó ni podía predecir: traducir, razonar paso a paso, escribir código. No se agregaron una por una; surgen solas de la escala.

Ilusión de complejidad

Por dentro sigue siendo lo mismo: sumar y multiplicar números. Pero a semejante escala la conversación se vuelve tan fluida que parece que del otro lado hay una persona experta. No la hay: es estadística a lo grande.

Un poco de historia

70 años en 10 hitos

La idea no es nueva: nació en los años 40 y avanzó a saltos, con inviernos y primaveras.

  1. 1943

    Nace la idea

    McCulloch y Pitts imaginan la primera 'neurona' matemática: una decisión de sí o no a partir de varias señales.

  2. 1958

    El perceptrón

    Frank Rosenblatt construye la primera máquina que aprende de ejemplos. La prensa fantasea con robots que caminarán y hablarán.

  3. 1969

    El primer freno

    Minsky y Papert demuestran los límites del perceptrón simple. Se corta la financiación: llega el 'invierno de la IA'.

  4. 1986

    Aprender de los errores

    Se populariza la retropropagación: las redes por fin ajustan solas sus pesos, capa por capa. Todo vuelve a moverse.

  5. 1989

    Ojos artificiales

    Yann LeCun usa redes convolucionales para leer códigos postales escritos a mano. La visión por computadora despega.

  6. 1997

    Memoria

    Las redes LSTM aprenden a recordar el contexto de una secuencia: un salto clave para voz y texto.

  7. 2012

    El gran despegue

    AlexNet gana por lejos un concurso de visión. Con GPUs y datos masivos, empieza el boom del 'deep learning'.

  8. 2017

    La atención

    El paper 'Attention is all you need' crea los Transformers, la arquitectura detrás de casi toda la IA actual.

  9. 2022

    IA para todos

    ChatGPT pone los grandes modelos de lenguaje en manos del público general y cambia la conversación.

  10. Hoy

    Multimodal

    Modelos que combinan texto, imagen, audio y video en un mismo sistema, y empiezan a actuar como agentes.

¿Querés aplicar IA en tu negocio?

Hablemos