📖 Temario Teórico

Definiciones Fundamentales de Deep Learning

🧠
Conceptos Fundamentales

Deep Learning

Subconjunto del aprendizaje automático que utiliza redes neuronales artificiales con múltiples capas ocultas para aprender representaciones jerárquicas de datos complejos, construyendo automáticamente conceptos complejos a partir de conceptos simples.

Jerarquía IA → ML → DL

El aprendizaje profundo es una técnica específica dentro del aprendizaje automático, que a su vez es un área dentro de la inteligencia artificial. Cada nivel añade especialización y capacidades más sofisticadas.

Red Neuronal Artificial

Modelo computacional inspirado en las redes neuronales biológicas, compuesto por nodos (neuronas artificiales) interconectados que procesan información mediante funciones matemáticas y aprenden patrones a través del ajuste de pesos.

Neurona Artificial

Unidad básica de procesamiento que recibe múltiples entradas (inputs), las combina mediante pesos (weights), añade un sesgo (bias), y aplica una función de activación para producir una salida.

Función de la Neurona

y = f(∑(wi × xi) + b)

Donde: y = salida, f = función de activación, wi = pesos, xi = entradas, b = bias

Backpropagation

Algoritmo fundamental para entrenar redes neuronales que calcula el gradiente de la función de pérdida con respecto a cada peso de la red, propagando el error hacia atrás desde la salida hasta las capas de entrada.

Función de Pérdida (Loss Function)

Función matemática que cuantifica la diferencia entre las predicciones del modelo y los valores reales, proporcionando una medida del error que debe minimizarse durante el entrenamiento.

Gradient Descent

Algoritmo de optimización que ajusta iterativamente los parámetros del modelo en la dirección opuesta al gradiente de la función de pérdida, buscando minimizar el error de manera eficiente.

🔥
Funciones de Activación

Función de Activación

Función matemática aplicada a la salida de una neurona que introduce no linealidad en la red, determinando si y en qué grado la neurona debe activarse. Sin funciones de activación, una red neuronal sería equivalente a una regresión lineal.

Sigmoid

Función de activación que mapea cualquier valor real a un rango entre 0 y 1, con forma de S. Históricamente importante pero problemática en redes profundas debido a la saturación de gradientes.

Sigmoid

σ(x) = 1 / (1 + e^(-x))

Rango: (0, 1)

Derivada: σ'(x) = σ(x)(1 - σ(x))

Tanh (Tangente Hiperbólica)

Función de activación similar a sigmoid pero centrada en cero, con rango entre -1 y 1. Mejor que sigmoid porque sus salidas están centradas, pero aún sufre problemas de saturación.

Tanh

tanh(x) = (e^x - e^(-x)) / (e^x + e^(-x))

Rango: (-1, 1)

Derivada: tanh'(x) = 1 - tanh²(x)

ReLU (Rectified Linear Unit)

Función de activación que devuelve el valor de entrada si es positivo, y cero si es negativo. Se ha convertido en la función de activación por defecto en redes profundas debido a su simplicidad computacional y ausencia de saturación en el régimen positivo.

ReLU

f(x) = max(0, x)

Rango: [0, ∞)

Derivada: f'(x) = 1 si x > 0, 0 si x ≤ 0

Leaky ReLU

Variante de ReLU que permite un pequeño gradiente negativo cuando la entrada es negativa, evitando el problema de "neuronas muertas" que puede ocurrir con ReLU tradicional.

Softmax

Función de activación que convierte un vector de valores reales en una distribución de probabilidad, donde cada elemento está entre 0 y 1 y la suma total es 1. Utilizada típicamente en la capa de salida para clasificación multiclase.

Softmax

softmax(xi) = e^xi / ∑(j=1 to n) e^xj

Propiedades: ∑ softmax(xi) = 1, softmax(xi) ∈ (0,1)

Saturación de Gradientes

Fenómeno donde el gradiente de una función de activación se acerca a cero para valores extremos de entrada, causando que el aprendizaje se vuelva muy lento o se detenga en capas profundas.

🛡️
Técnicas de Regularización

Regularización

Conjunto de técnicas utilizadas para reducir el sobreajuste (overfitting) en modelos de aprendizaje automático, mejorando su capacidad de generalización a datos no vistos mediante la limitación de la complejidad del modelo.

Overfitting (Sobreajuste)

Fenómeno donde un modelo aprende demasiado bien los datos de entrenamiento, memorizando patrones específicos y ruido en lugar de aprender patrones generalizables, resultando en mal rendimiento en datos nuevos.

Regularización L1 (Lasso)

Técnica que añade una penalización proporcional a la suma de los valores absolutos de los parámetros del modelo, promoviendo la escasez (sparsity) al forzar algunos pesos a ser exactamente cero.

L1 Regularization

Loss_total = Loss_original + λ ∑|wi|

Donde λ es el parámetro de regularización

Regularización L2 (Ridge)

Técnica que añade una penalización proporcional a la suma de los cuadrados de los parámetros del modelo, favoreciendo pesos pequeños y distribuyendo la importancia entre todas las características.

L2 Regularization

Loss_total = Loss_original + λ ∑wi²

Donde λ controla la fuerza de la regularización

Dropout

Técnica de regularización que durante el entrenamiento desactiva aleatoriamente un porcentaje de neuronas, forzando a la red a no depender de neuronas específicas y mejorando la generalización.

Early Stopping

Estrategia de regularización que detiene el entrenamiento cuando el rendimiento en un conjunto de validación comienza a empeorar, evitando que el modelo continúe ajustándose excesivamente a los datos de entrenamiento.

Batch Normalization

Técnica que normaliza las entradas de cada capa para tener media cero y varianza unitaria, estabilizando el entrenamiento, permitiendo tasas de aprendizaje más altas y actuando como regularización implícita.

Data Augmentation

Técnica que aumenta artificialmente el tamaño del conjunto de datos aplicando transformaciones que preservan la etiqueta (rotaciones, traslaciones, cambios de brillo, etc.), mejorando la generalización sin recopilar más datos.

🏗️
Arquitecturas de Redes Neuronales

Convolutional Neural Networks (CNN)

Arquitectura especializada en procesamiento de datos con estructura de cuadrícula (como imágenes), que utiliza filtros convolucionales para detectar características locales y jerárquicas, manteniendo la información espacial.

Convolución

Operación matemática que aplica un filtro (kernel) sobre una región local de la entrada, calculando el producto punto entre el filtro y la región correspondiente, detectando características específicas como bordes o texturas.

Pooling

Operación de submuestreo que reduce la dimensionalidad espacial de las representaciones, típicamente tomando el valor máximo (max pooling) o promedio (average pooling) de una región, proporcionando invarianza a pequeñas traslaciones.

Recurrent Neural Networks (RNN)

Arquitectura diseñada para procesar secuencias de datos manteniendo un estado interno (memoria) que captura información de pasos de tiempo anteriores, permitiendo modelar dependencias temporales.

RNN Basic Formula

ht = f(Whh · ht-1 + Wxh · xt + bh)

Donde ht es el estado oculto, xt la entrada actual

Long Short-Term Memory (LSTM)

Variante avanzada de RNN que utiliza puertas especializadas (forget, input, output) para controlar el flujo de información, resolviendo el problema de gradientes que se desvanecen y permitiendo capturar dependencias a largo plazo.

Gated Recurrent Unit (GRU)

Versión simplificada de LSTM que combina las puertas forget e input en una sola puerta de actualización, ofreciendo un compromiso entre complejidad computacional y capacidad de modelado.

Autoencoder

Arquitectura de red neuronal no supervisada que aprende a comprimir datos en una representación de menor dimensión (encoding) y luego reconstruir la entrada original (decoding), útil para reducción de dimensionalidad y detección de anomalías.

Fully Connected Layer

Capa donde cada neurona está conectada a todas las neuronas de la capa anterior, típicamente utilizada en las capas finales de clasificación después de capas especializadas como convolucionales.

Skip Connections (Residual Connections)

Conexiones que permiten que la información "salte" una o más capas, sumando la entrada de una capa a su salida. Fundamentales en redes muy profundas para evitar gradientes que se desvanecen y facilitar el entrenamiento.

📝
Procesamiento de Lenguaje Natural

Word Embeddings

Representaciones vectoriales densas de palabras en un espacio continuo de menor dimensión, donde palabras semánticamente similares tienen representaciones cercanas, capturando relaciones semánticas y sintácticas.

Representación Distribuida

Paradigma donde el significado de una palabra se codifica a través de múltiples dimensiones numéricas, en contraste con representaciones discretas como one-hot encoding, permitiendo capturar similitudes semánticas.

Word2Vec

Modelo que aprende representaciones vectoriales de palabras prediciendo palabras en contexto (Skip-gram) o prediciendo una palabra dado su contexto (CBOW), basado en la hipótesis distribucional de que palabras similares aparecen en contextos similares.

Skip-gram

Arquitectura de Word2Vec que utiliza una palabra central para predecir las palabras de su contexto circundante, efectiva para detectar relaciones semánticas y funciona bien con datasets pequeños y palabras raras.

Continuous Bag of Words (CBOW)

Arquitectura de Word2Vec que utiliza las palabras del contexto para predecir la palabra central, más eficiente computacionalmente que Skip-gram y funciona bien con palabras frecuentes.

Negative Sampling

Técnica de optimización en Word2Vec que, en lugar de calcular gradientes sobre todo el vocabulario, utiliza solo una muestra pequeña de palabras "negativas" junto con las palabras positivas, haciendo el entrenamiento más eficiente.

Bag of Words (BoW)

Representación simple de texto que cuenta la frecuencia de aparición de cada palabra en un documento, ignorando el orden y la gramática, útil para tareas básicas pero perdiendo información contextual importante.

Sequence-to-Sequence (Seq2Seq)

Arquitectura que utiliza dos RNNs: un encoder que procesa la secuencia de entrada y un decoder que genera la secuencia de salida, fundamental para tareas como traducción automática y generación de resúmenes.

Attention Mechanism

Mecanismo que permite a un modelo "atender" a diferentes partes de la secuencia de entrada cuando genera cada elemento de la salida, resolviendo limitaciones de los modelos seq2seq tradicionales para secuencias largas.

Transformer

Arquitectura basada exclusivamente en mecanismos de atención, sin componentes recurrentes o convolucionales, que permite paralelización completa y ha revolucionado el procesamiento de lenguaje natural con modelos como BERT y GPT.

🚀
Temas Avanzados

Generative Adversarial Networks (GANs)

Arquitectura que entrena dos redes neuronales en competencia: un generador que aprende a crear datos sintéticos realistas y un discriminador que aprende a distinguir entre datos reales y sintéticos, convergiendo hacia un equilibrio Nash.

Generator Network

Red neuronal en una GAN que toma como entrada un vector de ruido aleatorio y genera datos sintéticos (imágenes, texto, etc.) con el objetivo de engañar al discriminador para que los clasifique como reales.

Discriminator Network

Red neuronal en una GAN que actúa como clasificador binario, distinguiendo entre datos reales del conjunto de entrenamiento y datos sintéticos generados por el generador, proporcionando retroalimentación para mejorar ambas redes.

Adversarial Training

Proceso de entrenamiento donde el generador y discriminador se entrenan alternadamente en un juego de suma cero, donde el objetivo del generador es minimizar la capacidad del discriminador para detectar datos falsos.

Deep Reinforcement Learning

Combinación de aprendizaje por refuerzo con redes neuronales profundas, donde un agente aprende a tomar decisiones óptimas en un entorno a través de interacciones trial-and-error, maximizando recompensas acumuladas.

Q-Learning

Algoritmo de aprendizaje por refuerzo que aprende la función de valor de acción-estado Q(s,a), representando la recompensa esperada de tomar una acción específica en un estado dado y seguir la política óptima posteriormente.

Transfer Learning

Técnica que aprovecha el conocimiento aprendido en una tarea (dominio fuente) para mejorar el aprendizaje en una tarea relacionada (dominio objetivo), especialmente útil cuando los datos del dominio objetivo son limitados.

Fine-tuning

Proceso de ajustar un modelo pre-entrenado en un dataset grande para una tarea específica, típicamente congelando capas iniciales y re-entrenando capas superiores con una tasa de aprendizaje menor.

Meta-Learning

Paradigma de "aprender a aprender" donde el objetivo es entrenar modelos que puedan adaptarse rápidamente a nuevas tareas con pocos ejemplos, mimicando la capacidad humana de generalizar conocimiento a situaciones nuevas.

Few-Shot Learning

Capacidad de aprender nuevos conceptos o tareas con muy pocos ejemplos de entrenamiento, típicamente de 1 a 5 ejemplos por clase, contrastando con el aprendizaje tradicional que requiere grandes cantidades de datos.

Neural Architecture Search (NAS)

Proceso automatizado de diseño de arquitecturas de redes neuronales utilizando algoritmos de búsqueda inteligente, eliminando la necesidad de diseño manual de arquitecturas y descubriendo diseños óptimos para tareas específicas.

🗺️ Mapa Mental Interactivo

🧠 DEEP LEARNING
🔥 FUNCIONES DE ACTIVACIÓN
Activación
Sigmoid: σ(x) = 1/(1+e^(-x))
Tanh: [-1, 1] centrada en 0
ReLU: max(0, x) - DEFAULT
Leaky ReLU: Fix dead neurons
Softmax: Probabilidades normalizadas
Saturación: Gradiente → 0
No linealidad: Capacidad expresiva
🛡️ REGULARIZACIÓN
Regularización
L1: Sparsity - |w|
L2: Weight decay - w²
Dropout: Random deactivation
Early Stopping: Validation monitoring
Batch Norm: Normalize inputs
Data Augmentation: Synthetic data
Overfitting: Memorización vs Generalización
🏗️ ARQUITECTURAS
Arquitecturas
CNN: Convolutional - Imágenes
RNN: Recurrent - Secuencias
LSTM: Long Short-Term Memory
GRU: Gated Recurrent Unit
Autoencoder: Encode-Decode
Convolución: Filtros locales
Pooling: Downsampling
Gates: Control información
📝 PROCESAMIENTO LENGUAJE
NLP
Word Embeddings: Representación vectorial
Word2Vec: Skip-gram & CBOW
Bag of Words: Frecuencia palabras
Seq2Seq: Encoder-Decoder
Attention: Mecanismo atención
Transformer: Self-attention
Representación distribuida vs discreta
🚀 TEMAS AVANZADOS
Avanzados
GANs: Generator vs Discriminator
Deep RL: Reinforcement Learning
Transfer Learning: Knowledge transfer
Meta-Learning: Learn to learn
Few-Shot: Pocos ejemplos
NAS: Architecture search
Adversarial training: Min-max game
Q-Learning: Action-value function
⚙️ CONCEPTOS FUNDAMENTALES
Fundamentos
Backpropagation: Propagación gradientes
Gradient Descent: Optimización
Loss Function: Medida error
Forward Pass: Cálculo salida
Backward Pass: Cálculo gradientes
Jerarquía: Simple → Complejo
Representación: Features automáticas

📚 Resumen Ejecutivo

Deep Learning utiliza redes neuronales profundas con funciones de activación no lineales para aprender representaciones jerárquicas de datos complejos. Las técnicas de regularización previenen overfitting, mientras que arquitecturas especializadas como CNN y RNN optimizan el procesamiento para tipos específicos de datos. Los avances modernos incluyen GANs para generación, transfer learning para eficiencia, y meta-learning para adaptabilidad rápida.