● Capítulo 2 · Redes Neuronales

Redes Neuronales Convolucionales

Cómo un puñado de kernels de 3×3 convierte 144 píxeles en una sola probabilidad — la arquitectura que ve bordes, resume regiones y decide una clase.

MSc. Freddy León Cruz · Escuela de Informática · Quito, Ecuador
Ciberseguridad & Big Data — 2026

El pipeline en una imagen
imagen conv+pool flatten densa softmax "7" ✓
01 Introducción

¿Qué es una red convolucional?

Una CNN es una red neuronal especializada en datos con estructura espacial —sobre todo imágenes—. Su arquitectura típica encadena una capa de entrada, capas convolucionales, capas de agrupación (pooling), capas de activación, capas totalmente conectadas y una capa de salida.

Análisis de imágenes

Clasificar qué contiene una imagen: un dígito, un rostro, un tumor.

Detección de objetos

Localizar dónde están los objetos dentro de la escena.

Segmentación

Dividir la imagen en regiones, etiquetando cada píxel.

Lenguaje natural

También se aplican al procesamiento de texto (NLP).

La idea de fondo. El vector de entrada x es cualquier cosa que pueda codificarse como números. Una imagen es solo una rejilla de píxeles; a partir de ahí, todo es aritmética.

02 Desarrollo

Anatomía de una CNN clasificadora

Una sola convolución no clasifica nada. La magia está en apilarlas: convolución, pooling, convolución, pooling… hasta que un puñado de números resume la imagen entera y una capa densa decide la clase.

28×28×1 entrada 28×28×6 Conv₁ · 6 kernels 14×14×6 Pool₁ 2×2 14×14×16 Conv₂ · 16 kernels 7×7×16 Pool₂ 784 flatten densa 10 logits softmax "7" Σ = 1.0
El volumen se estrecha y se hace profundo: pierde resolución espacial (28→14→7) y gana canales de significado (1→6→16).
  1. Entrada.

    Una imagen de 28×28 (p. ej. un dígito MNIST). Volumen inicial 28×28×1.

  2. Conv₁.

    Aplica varios kernels en paralelo (digamos 6). Salida 28×28×6 — seis mapas, uno por kernel: bordes verticales, horizontales, diagonales, esquinas…

  3. Pool₁.

    Max-pool 2×2 reduce a 14×14×6. La red ya no sabe exactamente dónde estaba cada borde, solo que estaba en esa región.

  4. Conv₂.

    Otros 16 kernels combinan los 6 mapas anteriores. Salida 14×14×16: patrones compuestos, como una esquina formada por un borde vertical y uno horizontal.

  5. Pool₂.

    Reduce a 7×7×16 = 784 números.

  6. Flatten.

    Se aplana el volumen 7×7×16 a un único vector de 784 entradas — la huella digital de la imagen.

  7. Dense.

    Una capa totalmente conectada toma esos 784 números y produce un vector de 10 logits — uno por dígito.

  8. Softmax.

    Convierte los 10 logits en 10 probabilidades que suman 1. El máximo es la predicción.

03 Desarrollo

Capas convolucionales

Una capa densa con una imagen de 224×224 RGB requeriría 224·224·3 = 150 528 conexiones por neurona. Una capa convolucional con un kernel de 3×3 solo necesita 9 parámetros, sin importar el tamaño de la imagen.

Esa es la idea central: peso compartido + localidad espacial. El mismo kernel se desliza por toda la imagen, así que aprende un detector una vez y lo reutiliza en todas partes.

Cada kernel detecta un patrón específico —bordes, esquinas, texturas— y produce un mapa de características. Apilando convoluciones, la red aprende detectores cada vez más abstractos: las primeras capas ven bordes; las profundas ven ojos, ruedas, fonemas.

Densa · 224×224×3
150 528
parámetros por neurona
Convolucional · kernel 3×3
9
parámetros — reutilizados en toda la imagen

Prueba la convolución 🔍

Un kernel de borde vertical se desliza sobre la imagen. Pasa el cursor (o toca) una celda del mapa de salida para ver qué región lee y cómo se calcula.

Entrada 6×6
Kernel 3×3
=
Mapa 4×4
Pasa el cursor por el mapa de salida…
04 Desarrollo

Capas de agrupación (pooling)

Tras una convolución tenemos un mapa de características tan grande como la imagen. Una capa de pooling lo recorre en bloques (típicamente 2×2) y reemplaza cada bloque por un solo número. Cada paso reduce a la mitad cada dimensión: 32→16→8→4→…

Max-pooling 2×2

Cada bloque de 2×2 se resume con su valor máximo. Toca “Aplicar”.

Mapa 4×4
Salida 2×2

1 · Reduce el cómputo

Cada reducción a la mitad deja 4× menos píxeles. Sin pooling, una red profunda sobre imágenes reales sería inviable.

2 · Invariancia traslacional

Si un borde se desplaza un píxel, max-pool 2×2 suele seguir capturándolo. Se reconoce el patrón sin importar su posición exacta.

3 · Amplía el campo receptivo

Una neurona profunda ve indirectamente una región mucho mayor. Las primeras capas miran 3×3; las profundas integran cientos de píxeles.

4 · Fuerza la abstracción

Como hay que descartar información, la red aprende a quedarse con la pista más informativa de cada región.

05 Desarrollo

Activación, aplanado y softmax

El ejemplo lo resume todo: 144 píxeles entraron, una probabilidad salió. Entre medio: convolución (detectar bordes), ReLU (descartar lo irrelevante), pooling (resumir y reducir), flatten (aplanar a vector), dense (combinar evidencias) y softmax (normalizar a probabilidades).

ƒ

ReLU

Activación: pone a cero lo negativo y deja pasar lo positivo. Descarta lo irrelevante.

Flatten

Convierte el volumen final en un único vector — la entrada de la capa densa.

Σ

Softmax

Transforma los logits en probabilidades positivas que suman 1.

Softmax en vivo Σ = 1.0

Mueve los logits (la puntuación cruda de tres clases). Softmax los normaliza: la clase de mayor logit gana y todas suman 1.

logit “3”1.0
logit “7”4.0
logit “8”0.0
06 Resultados

Tipos de capa y sus hiperparámetros

La capa de convolución y la de agrupación se pueden ajustar mediante hiperparámetros. La capa totalmente conectada cierra la clasificación.

CapaQué haceEfecto sobre el volumenHiperparámetros
ConvolucionalDesliza kernels que detectan patrones locales y producen mapas de características.Mantiene el tamaño espacial; añade profundidad (canales).tamaño de kernel, nº de filtros, stride, padding
Agrupamiento (Pooling)Resume bloques (max-pool) para reducir y dar invariancia.Reduce el tamaño espacial a la mitad; conserva la profundidad.tamaño de ventana, stride
Completamente conectadaCombina toda la evidencia del vector aplanado y produce los logits.Vector → vector (10 logits en MNIST).nº de neuronas / salidas

En una frase: convolución detecta, ReLU filtra, pooling resume, flatten aplana, densa combina y softmax normaliza. Cada pieza tiene un único trabajo.

Referencia: Stanford CS-230 — stanford.edu/~shervine/teaching/cs-230/cheatsheet-convolutional-neural-networks

07 Evaluación en línea

Escanea y responde desde tu móvil

El QR aparecerá al iniciar el servidor

Cada estudiante recibe 10 preguntas al azar de un banco de 80. Al terminar verás tu calificación final y podrás descargar tu boleta para enviarla al docente.

  1. Escanea el QR con la cámara del teléfono.
  2. Escribe tu nombre y responde las 10 preguntas.
  3. Pulsa Calificar → revisa aciertos y errores.
  4. Tu resultado se envía automáticamente al panel del docente (y puedes descargarlo como respaldo).
— inicia el servidor para ver el enlace —
08 Banco de preguntas

Evaluación: 10 preguntas aleatorias

Seleccionadas al azar de un banco de 80. Para aprobar necesitas 7 de 10. Puedes reintentar con un nuevo conjunto.