Subconjunto del aprendizaje automático que utiliza redes neuronales artificiales con múltiples capas ocultas para aprender representaciones jerárquicas de datos complejos, construyendo automáticamente conceptos complejos a partir de conceptos simples.
El aprendizaje profundo es una técnica específica dentro del aprendizaje automático, que a su vez es un área dentro de la inteligencia artificial. Cada nivel añade especialización y capacidades más sofisticadas.
Modelo computacional inspirado en las redes neuronales biológicas, compuesto por nodos (neuronas artificiales) interconectados que procesan información mediante funciones matemáticas y aprenden patrones a través del ajuste de pesos.
Unidad básica de procesamiento que recibe múltiples entradas (inputs), las combina mediante pesos (weights), añade un sesgo (bias), y aplica una función de activación para producir una salida.
y = f(∑(wi × xi) + b)
Donde: y = salida, f = función de activación, wi = pesos, xi = entradas, b = bias
Algoritmo fundamental para entrenar redes neuronales que calcula el gradiente de la función de pérdida con respecto a cada peso de la red, propagando el error hacia atrás desde la salida hasta las capas de entrada.
Función matemática que cuantifica la diferencia entre las predicciones del modelo y los valores reales, proporcionando una medida del error que debe minimizarse durante el entrenamiento.
Algoritmo de optimización que ajusta iterativamente los parámetros del modelo en la dirección opuesta al gradiente de la función de pérdida, buscando minimizar el error de manera eficiente.
Función matemática aplicada a la salida de una neurona que introduce no linealidad en la red, determinando si y en qué grado la neurona debe activarse. Sin funciones de activación, una red neuronal sería equivalente a una regresión lineal.
Función de activación que mapea cualquier valor real a un rango entre 0 y 1, con forma de S. Históricamente importante pero problemática en redes profundas debido a la saturación de gradientes.
σ(x) = 1 / (1 + e^(-x))
Rango: (0, 1)
Derivada: σ'(x) = σ(x)(1 - σ(x))
Función de activación similar a sigmoid pero centrada en cero, con rango entre -1 y 1. Mejor que sigmoid porque sus salidas están centradas, pero aún sufre problemas de saturación.
tanh(x) = (e^x - e^(-x)) / (e^x + e^(-x))
Rango: (-1, 1)
Derivada: tanh'(x) = 1 - tanh²(x)
Función de activación que devuelve el valor de entrada si es positivo, y cero si es negativo. Se ha convertido en la función de activación por defecto en redes profundas debido a su simplicidad computacional y ausencia de saturación en el régimen positivo.
f(x) = max(0, x)
Rango: [0, ∞)
Derivada: f'(x) = 1 si x > 0, 0 si x ≤ 0
Variante de ReLU que permite un pequeño gradiente negativo cuando la entrada es negativa, evitando el problema de "neuronas muertas" que puede ocurrir con ReLU tradicional.
Función de activación que convierte un vector de valores reales en una distribución de probabilidad, donde cada elemento está entre 0 y 1 y la suma total es 1. Utilizada típicamente en la capa de salida para clasificación multiclase.
softmax(xi) = e^xi / ∑(j=1 to n) e^xj
Propiedades: ∑ softmax(xi) = 1, softmax(xi) ∈ (0,1)
Fenómeno donde el gradiente de una función de activación se acerca a cero para valores extremos de entrada, causando que el aprendizaje se vuelva muy lento o se detenga en capas profundas.
Conjunto de técnicas utilizadas para reducir el sobreajuste (overfitting) en modelos de aprendizaje automático, mejorando su capacidad de generalización a datos no vistos mediante la limitación de la complejidad del modelo.
Fenómeno donde un modelo aprende demasiado bien los datos de entrenamiento, memorizando patrones específicos y ruido en lugar de aprender patrones generalizables, resultando en mal rendimiento en datos nuevos.
Técnica que añade una penalización proporcional a la suma de los valores absolutos de los parámetros del modelo, promoviendo la escasez (sparsity) al forzar algunos pesos a ser exactamente cero.
Loss_total = Loss_original + λ ∑|wi|
Donde λ es el parámetro de regularización
Técnica que añade una penalización proporcional a la suma de los cuadrados de los parámetros del modelo, favoreciendo pesos pequeños y distribuyendo la importancia entre todas las características.
Loss_total = Loss_original + λ ∑wi²
Donde λ controla la fuerza de la regularización
Técnica de regularización que durante el entrenamiento desactiva aleatoriamente un porcentaje de neuronas, forzando a la red a no depender de neuronas específicas y mejorando la generalización.
Estrategia de regularización que detiene el entrenamiento cuando el rendimiento en un conjunto de validación comienza a empeorar, evitando que el modelo continúe ajustándose excesivamente a los datos de entrenamiento.
Técnica que normaliza las entradas de cada capa para tener media cero y varianza unitaria, estabilizando el entrenamiento, permitiendo tasas de aprendizaje más altas y actuando como regularización implícita.
Técnica que aumenta artificialmente el tamaño del conjunto de datos aplicando transformaciones que preservan la etiqueta (rotaciones, traslaciones, cambios de brillo, etc.), mejorando la generalización sin recopilar más datos.
Arquitectura especializada en procesamiento de datos con estructura de cuadrícula (como imágenes), que utiliza filtros convolucionales para detectar características locales y jerárquicas, manteniendo la información espacial.
Operación matemática que aplica un filtro (kernel) sobre una región local de la entrada, calculando el producto punto entre el filtro y la región correspondiente, detectando características específicas como bordes o texturas.
Operación de submuestreo que reduce la dimensionalidad espacial de las representaciones, típicamente tomando el valor máximo (max pooling) o promedio (average pooling) de una región, proporcionando invarianza a pequeñas traslaciones.
Arquitectura diseñada para procesar secuencias de datos manteniendo un estado interno (memoria) que captura información de pasos de tiempo anteriores, permitiendo modelar dependencias temporales.
ht = f(Whh · ht-1 + Wxh · xt + bh)
Donde ht es el estado oculto, xt la entrada actual
Variante avanzada de RNN que utiliza puertas especializadas (forget, input, output) para controlar el flujo de información, resolviendo el problema de gradientes que se desvanecen y permitiendo capturar dependencias a largo plazo.
Versión simplificada de LSTM que combina las puertas forget e input en una sola puerta de actualización, ofreciendo un compromiso entre complejidad computacional y capacidad de modelado.
Arquitectura de red neuronal no supervisada que aprende a comprimir datos en una representación de menor dimensión (encoding) y luego reconstruir la entrada original (decoding), útil para reducción de dimensionalidad y detección de anomalías.
Capa donde cada neurona está conectada a todas las neuronas de la capa anterior, típicamente utilizada en las capas finales de clasificación después de capas especializadas como convolucionales.
Conexiones que permiten que la información "salte" una o más capas, sumando la entrada de una capa a su salida. Fundamentales en redes muy profundas para evitar gradientes que se desvanecen y facilitar el entrenamiento.
Representaciones vectoriales densas de palabras en un espacio continuo de menor dimensión, donde palabras semánticamente similares tienen representaciones cercanas, capturando relaciones semánticas y sintácticas.
Paradigma donde el significado de una palabra se codifica a través de múltiples dimensiones numéricas, en contraste con representaciones discretas como one-hot encoding, permitiendo capturar similitudes semánticas.
Modelo que aprende representaciones vectoriales de palabras prediciendo palabras en contexto (Skip-gram) o prediciendo una palabra dado su contexto (CBOW), basado en la hipótesis distribucional de que palabras similares aparecen en contextos similares.
Arquitectura de Word2Vec que utiliza una palabra central para predecir las palabras de su contexto circundante, efectiva para detectar relaciones semánticas y funciona bien con datasets pequeños y palabras raras.
Arquitectura de Word2Vec que utiliza las palabras del contexto para predecir la palabra central, más eficiente computacionalmente que Skip-gram y funciona bien con palabras frecuentes.
Técnica de optimización en Word2Vec que, en lugar de calcular gradientes sobre todo el vocabulario, utiliza solo una muestra pequeña de palabras "negativas" junto con las palabras positivas, haciendo el entrenamiento más eficiente.
Representación simple de texto que cuenta la frecuencia de aparición de cada palabra en un documento, ignorando el orden y la gramática, útil para tareas básicas pero perdiendo información contextual importante.
Arquitectura que utiliza dos RNNs: un encoder que procesa la secuencia de entrada y un decoder que genera la secuencia de salida, fundamental para tareas como traducción automática y generación de resúmenes.
Mecanismo que permite a un modelo "atender" a diferentes partes de la secuencia de entrada cuando genera cada elemento de la salida, resolviendo limitaciones de los modelos seq2seq tradicionales para secuencias largas.
Arquitectura basada exclusivamente en mecanismos de atención, sin componentes recurrentes o convolucionales, que permite paralelización completa y ha revolucionado el procesamiento de lenguaje natural con modelos como BERT y GPT.
Arquitectura que entrena dos redes neuronales en competencia: un generador que aprende a crear datos sintéticos realistas y un discriminador que aprende a distinguir entre datos reales y sintéticos, convergiendo hacia un equilibrio Nash.
Red neuronal en una GAN que toma como entrada un vector de ruido aleatorio y genera datos sintéticos (imágenes, texto, etc.) con el objetivo de engañar al discriminador para que los clasifique como reales.
Red neuronal en una GAN que actúa como clasificador binario, distinguiendo entre datos reales del conjunto de entrenamiento y datos sintéticos generados por el generador, proporcionando retroalimentación para mejorar ambas redes.
Proceso de entrenamiento donde el generador y discriminador se entrenan alternadamente en un juego de suma cero, donde el objetivo del generador es minimizar la capacidad del discriminador para detectar datos falsos.
Combinación de aprendizaje por refuerzo con redes neuronales profundas, donde un agente aprende a tomar decisiones óptimas en un entorno a través de interacciones trial-and-error, maximizando recompensas acumuladas.
Algoritmo de aprendizaje por refuerzo que aprende la función de valor de acción-estado Q(s,a), representando la recompensa esperada de tomar una acción específica en un estado dado y seguir la política óptima posteriormente.
Técnica que aprovecha el conocimiento aprendido en una tarea (dominio fuente) para mejorar el aprendizaje en una tarea relacionada (dominio objetivo), especialmente útil cuando los datos del dominio objetivo son limitados.
Proceso de ajustar un modelo pre-entrenado en un dataset grande para una tarea específica, típicamente congelando capas iniciales y re-entrenando capas superiores con una tasa de aprendizaje menor.
Paradigma de "aprender a aprender" donde el objetivo es entrenar modelos que puedan adaptarse rápidamente a nuevas tareas con pocos ejemplos, mimicando la capacidad humana de generalizar conocimiento a situaciones nuevas.
Capacidad de aprender nuevos conceptos o tareas con muy pocos ejemplos de entrenamiento, típicamente de 1 a 5 ejemplos por clase, contrastando con el aprendizaje tradicional que requiere grandes cantidades de datos.
Proceso automatizado de diseño de arquitecturas de redes neuronales utilizando algoritmos de búsqueda inteligente, eliminando la necesidad de diseño manual de arquitecturas y descubriendo diseños óptimos para tareas específicas.
Deep Learning utiliza redes neuronales profundas con funciones de activación no lineales para aprender representaciones jerárquicas de datos complejos. Las técnicas de regularización previenen overfitting, mientras que arquitecturas especializadas como CNN y RNN optimizan el procesamiento para tipos específicos de datos. Los avances modernos incluyen GANs para generación, transfer learning para eficiencia, y meta-learning para adaptabilidad rápida.