← Volver a los quizzesQuiz gratuito

Fundamentos de aprendizaje automático

El aprendizaje automático (Machine Learning) es una rama de la inteligencia artificial que permite a las máquinas aprender patrones a partir de datos sin ser programadas explícitamente para…

10 preguntas~5 min
Fundamentos de aprendizaje automático — Qwi
0 / 10
Puntuación: 0%
1

¿Cuál es la diferencia esencial entre aprendizaje supervisado y no supervisado?

2

En un árbol de decisión, ¿qué ocurre cuando se alcanza una hoja?

3

Una red neuronal convolucional (CNN) es particularmente adecuada para:

4

Si un modelo muestra alta precisión pero baja recall, ¿qué tipo de error es más probable?

5

¿Qué característica distingue a los bosques aleatorios de un solo árbol de decisión?

6

En el contexto de aprendizaje por refuerzo, ¿qué representa la recompensa?

7

¿Cuál es la función principal de un autoencoder durante el entrenamiento?

8

Cuando se habla de 'any-of' en clasificación multietiqueta, se indica que:

9

¿Qué implica una alta tasa de aprendizaje en el entrenamiento de una red neuronal?

10

En la métrica F-score, ¿qué ocurre si la precisión es alta pero el recall es bajo?

Fundamentos de aprendizaje automático

El aprendizaje automático (Machine Learning) es una rama de la inteligencia artificial que permite a las máquinas aprender patrones a partir de datos sin ser programadas explícitamente para cada tarea. En este curso exploraremos los conceptos clave que aparecen en el cuestionario, proporcionando explicaciones claras, ejemplos prácticos y consejos para recordar cada idea.

1. Aprendizaje supervisado vs. no supervisado

Una de las distinciones más básicas en el campo es entre aprendizaje supervisado y aprendizaje no supervisado. La diferencia esencial radica en el uso de etiquetas:

  • Supervisado: los datos de entrenamiento incluyen una etiqueta o salida conocida (por ejemplo, la categoría de una imagen). El objetivo es aprender una función que prediga esas etiquetas para datos nuevos.
  • No supervisado: los datos no poseen etiquetas. El algoritmo busca estructuras internas, como agrupaciones (clusters) o representaciones latentes.

Recuerda: "Supervisado = con guía, No supervisado = sin guía". Esta regla mnemotécnica ayuda a distinguir rápidamente los dos paradigmas.

2. Árboles de decisión y hojas

Los árboles de decisión son modelos basados en reglas que dividen los datos en función de características relevantes. Cada nodo interno representa una prueba, y cada hoja es un nodo terminal que contiene la predicción final.

Cuando el algoritmo alcanza una hoja, se devuelve la etiqueta o valor asociado a esa hoja. No se realizan más divisiones ni cálculos adicionales.

Cómo recordarlo: "HOJA → HAlta la Opción". Al llegar a la hoja, la decisión está tomada.

  • Una hoja no tiene hijos.
  • Al llegar a ella, el árbol ya no divide los datos.
  • El resultado es la etiqueta o el valor almacenado.

3. Redes neuronales convolucionales (CNN)

Las CNN están diseñadas para datos con estructura espacial, como imágenes o mapas de calor. Sus capas convolucionales extraen características locales (bordes, texturas) y las combinan en representaciones más abstractas.

Por lo tanto, una CNN es particularmente adecuada para procesar datos con estructura espacial, como imágenes. No se utilizan típicamente para generación de texto, reducción de dimensionalidad tabular o modelado de secuencias largas (para eso se prefieren RNN o Transformers).

4. Métricas de clasificación: precisión vs. recall

En problemas de clasificación, precisión mide la proporción de predicciones positivas correctas, mientras que recall mide la capacidad de capturar todos los casos positivos.

Un modelo con alta precisión pero bajo recall tiende a producir pocos falsos positivos pero muchos falsos negativos. Es decir, el modelo es conservador al etiquetar una muestra como positiva, lo que lleva a omitir casos positivos.

Ejemplo práctico: en detección de fraude, un alto recall es crítico para no pasar por alto transacciones fraudulentas, aunque eso implique algunos falsos positivos.

5. Bosques aleatorios (Random Forest)

Un bosque aleatorio combina múltiples árboles de decisión entrenados de forma independiente. Cada árbol se construye con un subconjunto aleatorio de datos (bootstrap) y un subconjunto aleatorio de características.

La característica distintiva frente a un solo árbol es que combina predicciones de múltiples árboles para reducir el sobreajuste. La agregación (votación mayoritaria para clasificación o promedio para regresión) estabiliza la predicción.

Ventajas clave:

  • Mayor robustez frente a ruido.
  • Mejor generalización.
  • Importancia de variables incorporada.

6. Aprendizaje por refuerzo y recompensas

En aprendizaje por refuerzo, un agente interactúa con un entorno y aprende a través de una señal de recompensa. La recompensa es una señal numérica que indica la bondad de la acción tomada en un estado particular.

El objetivo del agente es maximizar la suma acumulada de recompensas a lo largo del tiempo, lo que lo lleva a descubrir políticas óptimas.

Ejemplo: en un juego de ajedrez, ganar una partida otorga una recompensa alta (+1), mientras que una derrota genera una recompensa negativa (-1).

7. Autoencoders

Un autoencoder es una red neuronal que aprende a reconstruir su propia entrada. Su arquitectura consta de dos partes:

  • Encoder: comprime la entrada en una representación latente de menor dimensión.
  • Decoder: intenta reconstruir la entrada original a partir de esa representación.

Durante el entrenamiento, la función objetivo es minimizar la diferencia entre la entrada y la salida reconstruida. Así, el autoencoder aprende una representación comprimida y reconstruye la entrada original.

Aplicaciones típicas incluyen reducción de dimensionalidad, detección de anomalías y preentrenamiento de capas en redes profundas.

8. Clasificación multietiqueta y el enfoque "any-of"

En problemas de clasificación multietiqueta, una instancia puede pertenecer a varias clases simultáneamente. El enfoque "any-of" indica que una instancia puede pertenecer a varias clases al mismo tiempo, a diferencia de la clasificación multiclase tradicional donde cada muestra pertenece a una única clase.

Ejemplo: una foto puede contener simultáneamente las etiquetas "playa", "atardecer" y "personas".

Para modelar este tipo de problemas se utilizan técnicas como binary relevance, classifier chains o redes neuronales con activación sigmoide en la capa de salida.

Resumen y buenas prácticas

Los conceptos revisados forman la base para comprender y aplicar algoritmos de aprendizaje automático en escenarios reales. A continuación, se presentan algunas recomendaciones para consolidar el conocimiento:

  • Practica con datasets reales: experimenta con conjuntos como Iris, MNIST o CIFAR-10 para observar cómo funcionan los algoritmos.
  • Evalúa con métricas adecuadas: elige precisión, recall, F1‑score o AUC según la naturaleza del problema.
  • Controla el sobreajuste: utiliza validación cruzada, regularización y técnicas de ensamblado como bosques aleatorios.
  • Visualiza resultados: gráficos de curvas ROC, matrices de confusión y mapas de activación en CNN facilitan la interpretación.

Dominar estos fundamentos te permitirá avanzar hacia técnicas más avanzadas como redes generativas adversariales (GAN), transformers y aprendizaje por refuerzo profundo.