¿Qué es una red convolucional?
Una CNN es una red neuronal especializada en datos con estructura espacial —sobre todo imágenes—. Su arquitectura típica encadena una capa de entrada, capas convolucionales, capas de agrupación (pooling), capas de activación, capas totalmente conectadas y una capa de salida.
Análisis de imágenes
Clasificar qué contiene una imagen: un dígito, un rostro, un tumor.
Detección de objetos
Localizar dónde están los objetos dentro de la escena.
Segmentación
Dividir la imagen en regiones, etiquetando cada píxel.
Lenguaje natural
También se aplican al procesamiento de texto (NLP).
La idea de fondo. El vector de entrada x es cualquier cosa que pueda codificarse como números. Una imagen es solo una rejilla de píxeles; a partir de ahí, todo es aritmética.
Anatomía de una CNN clasificadora
Una sola convolución no clasifica nada. La magia está en apilarlas: convolución, pooling, convolución, pooling… hasta que un puñado de números resume la imagen entera y una capa densa decide la clase.
- Entrada.
Una imagen de 28×28 (p. ej. un dígito MNIST). Volumen inicial 28×28×1.
- Conv₁.
Aplica varios kernels en paralelo (digamos 6). Salida 28×28×6 — seis mapas, uno por kernel: bordes verticales, horizontales, diagonales, esquinas…
- Pool₁.
Max-pool 2×2 reduce a 14×14×6. La red ya no sabe exactamente dónde estaba cada borde, solo que estaba en esa región.
- Conv₂.
Otros 16 kernels combinan los 6 mapas anteriores. Salida 14×14×16: patrones compuestos, como una esquina formada por un borde vertical y uno horizontal.
- Pool₂.
Reduce a 7×7×16 = 784 números.
- Flatten.
Se aplana el volumen 7×7×16 a un único vector de 784 entradas — la huella digital de la imagen.
- Dense.
Una capa totalmente conectada toma esos 784 números y produce un vector de 10 logits — uno por dígito.
- Softmax.
Convierte los 10 logits en 10 probabilidades que suman 1. El máximo es la predicción.
Capas convolucionales
Una capa densa con una imagen de 224×224 RGB requeriría 224·224·3 = 150 528 conexiones por neurona. Una capa convolucional con un kernel de 3×3 solo necesita 9 parámetros, sin importar el tamaño de la imagen.
Esa es la idea central: peso compartido + localidad espacial. El mismo kernel se desliza por toda la imagen, así que aprende un detector una vez y lo reutiliza en todas partes.
Cada kernel detecta un patrón específico —bordes, esquinas, texturas— y produce un mapa de características. Apilando convoluciones, la red aprende detectores cada vez más abstractos: las primeras capas ven bordes; las profundas ven ojos, ruedas, fonemas.
Prueba la convolución 🔍
Un kernel de borde vertical se desliza sobre la imagen. Pasa el cursor (o toca) una celda del mapa de salida para ver qué región lee y cómo se calcula.
Capas de agrupación (pooling)
Tras una convolución tenemos un mapa de características tan grande como la imagen. Una capa de pooling lo recorre en bloques (típicamente 2×2) y reemplaza cada bloque por un solo número. Cada paso reduce a la mitad cada dimensión: 32→16→8→4→…
Max-pooling 2×2
Cada bloque de 2×2 se resume con su valor máximo. Toca “Aplicar”.
1 · Reduce el cómputo
Cada reducción a la mitad deja 4× menos píxeles. Sin pooling, una red profunda sobre imágenes reales sería inviable.
2 · Invariancia traslacional
Si un borde se desplaza un píxel, max-pool 2×2 suele seguir capturándolo. Se reconoce el patrón sin importar su posición exacta.
3 · Amplía el campo receptivo
Una neurona profunda ve indirectamente una región mucho mayor. Las primeras capas miran 3×3; las profundas integran cientos de píxeles.
4 · Fuerza la abstracción
Como hay que descartar información, la red aprende a quedarse con la pista más informativa de cada región.
Activación, aplanado y softmax
El ejemplo lo resume todo: 144 píxeles entraron, una probabilidad salió. Entre medio: convolución (detectar bordes), ReLU (descartar lo irrelevante), pooling (resumir y reducir), flatten (aplanar a vector), dense (combinar evidencias) y softmax (normalizar a probabilidades).
ReLU
Activación: pone a cero lo negativo y deja pasar lo positivo. Descarta lo irrelevante.
Flatten
Convierte el volumen final en un único vector — la entrada de la capa densa.
Softmax
Transforma los logits en probabilidades positivas que suman 1.
Softmax en vivo Σ = 1.0
Mueve los logits (la puntuación cruda de tres clases). Softmax los normaliza: la clase de mayor logit gana y todas suman 1.
Tipos de capa y sus hiperparámetros
La capa de convolución y la de agrupación se pueden ajustar mediante hiperparámetros. La capa totalmente conectada cierra la clasificación.
| Capa | Qué hace | Efecto sobre el volumen | Hiperparámetros |
|---|---|---|---|
| Convolucional | Desliza kernels que detectan patrones locales y producen mapas de características. | Mantiene el tamaño espacial; añade profundidad (canales). | tamaño de kernel, nº de filtros, stride, padding |
| Agrupamiento (Pooling) | Resume bloques (max-pool) para reducir y dar invariancia. | Reduce el tamaño espacial a la mitad; conserva la profundidad. | tamaño de ventana, stride |
| Completamente conectada | Combina toda la evidencia del vector aplanado y produce los logits. | Vector → vector (10 logits en MNIST). | nº de neuronas / salidas |
En una frase: convolución detecta, ReLU filtra, pooling resume, flatten aplana, densa combina y softmax normaliza. Cada pieza tiene un único trabajo.
Referencia: Stanford CS-230 — stanford.edu/~shervine/teaching/cs-230/cheatsheet-convolutional-neural-networks
Escanea y responde desde tu móvil
Cada estudiante recibe 10 preguntas al azar de un banco de 80. Al terminar verás tu calificación final y podrás descargar tu boleta para enviarla al docente.
- Escanea el QR con la cámara del teléfono.
- Escribe tu nombre y responde las 10 preguntas.
- Pulsa Calificar → revisa aciertos y errores.
- Tu resultado se envía automáticamente al panel del docente (y puedes descargarlo como respaldo).
Evaluación: 10 preguntas aleatorias
Seleccionadas al azar de un banco de 80. Para aprobar necesitas 7 de 10. Puedes reintentar con un nuevo conjunto.
Calificaciones en vivo
Se actualiza automáticamente conforme los estudiantes envían su evaluación. Docente: MSc. Freddy León Cruz.
| # | Estudiante | Nota | % | Resultado | Fecha | Acción |
|---|---|---|---|---|---|---|
| Aún no hay respuestas. Comparte el QR con tus estudiantes. | ||||||