El Perceptrón Multicapa (MLP) es un tipo de Redes Neuronales similar a un Perceptrón simple pero con mayor cantidad de neuronas. Solucionan el problema de que los perceptrones simples solo pueden aprender funciones linealmente separables.
Regla Delta
La regla delta o Least Mean Squared (LMS) es el método para hallar el vector de pesos deseado. Siendo la salida deseada, la salida obtenida, y el número de patrones, se minimiza el error cuadrático medio definido como:
Las modificaciones en los pesos son proporcionales al gradiente decreciente del error:
El error cuadrático medio se calcula al final de cada época teniendo en cuenta cada error de patrón obtenido al aplicar un patrón individual.
Regla Delta Generalizada
La regla delta generalizada (backpropagation) permite entrenar redes neuronales con capas ocultas. Las funciones de activación deben ser crecientes, continuas y derivables.
El error de patrón y error global resultan:
Control de Convergencia
Dado un dataset dividido en dataset de entrenamiento y dataset de validación, se tiene un error global asociado al entrenamiento y un error de validación. Estos errores deberían ser similares.
Si el error global y el error de validación divergen antes de que termine el entrenamiento, puede haber sobreajuste (overfitting). Esto es un comportamiento no deseado que provoca que el modelo no se generalice bien a nuevos datos. El modelo tiene que generalizar bien, por lo que el overfitting es un problema.
Para solucionar el overfitting se debe ajustar el modelo o su entrenamiento:
- Cambiar la inicialización de los pesos.
- Cambiar la función de transferencia.
- Cambiar la cantidad de capas.
- Cambiar la cantidad de neuronas por capa.
Momento
Se puede agregar un término momento en la regla delta generalizada:
El momento ayuda a acelerar la convergencia y filtrar oscilaciones. El coeficiente determina la importancia del término momento.
Este tipo de técnicas se llaman optimizadores: algoritmos que ajustan los parámetros durante el entrenamiento para minimizar el error. El momento es un optimizador básico. Adam es una mejora sobre el momento que funciona mejor.