El aprendizaje es un proceso que ayuda a un sistema informático a mejorar su rendimiento en una tarea.
Los modelos más básicos de Inteligencia Artificial no pueden aprender por sí mismos, sino que necesitan que una persona recopile y represente ese contenido.
Aprendizaje Supervisado
El aprendizaje automático es una disciplina dentro de la IA que desarrolla algoritmos informáticos que evolucionan mediante experiencia y datos.
Se llama dataset al conjunto de datos utilizados en un problema de clasificación:
- es un conjunto de registros (o ejemplos) descritos por un conjunto de atributos.
- es un conjunto de clases. Cada registro pertenece a una clase.
Se busca usar un modelo para representar el Conocimiento del dataset. Se quiere, a partir de datos históricos, clasificar nuevos datos. Esto es el aprendizaje supervisado. El dataset se divide en:
- Conjunto de entrenamiento: para definir el modelo.
- Conjunto de test: para evaluar la precisión del modelo.
flowchart LR subgraph S1 [Fase de entrenamiento] A[(Learning data)] --> B[Learning algorithm] end B--> C([Model]) subgraph S2 [Fase de prueba] D[(Test data)] --> E([Accuracy]) end C --> D
Inicialmente el modelo no existe, sino que se va construyendo durante el proceso de aprendizaje. Existen muchas métricas para evaluar la precisión del modelo, por ejemplo:
Se dice que el entrenamiento de este modelo es offline porque el modelo no aprende durante su funcionamiento normal.
Aprendizaje No Supervisado
En algunos casos, los datos no están etiquetados y el usuario necesita explorar los datos para encontrar estructuras intrínsecas (patrones) en ellos. Esto se considera aprendizaje no supervisado. Clustering es la técnica más común para identificar esos patrones.