← Volver al blog

Gordo de la Primitiva 27/09: resultados y análisis estadístico

El sorteo del Gordo de la Primitiva del 27 de septiembre ya está disponible. Analizamos los números ganadores, su frecuencia histórica y proponemos metodologías estadísticas con R y Python para estudiar la lotería.

Gordo de la Primitiva 27/09: resultados y análisis estadístico

Introducción: qué es el Gordo de la Primitiva y qué nos enseña el clustering k-means

El Gordo de la Primitiva es el sorteo dominical de Loterías y Apuestas del Estado y, en esta lección, lo usaremos como laboratorio de datos. Según publica Diario AS, los resultados del Gordo de la Primitiva de hoy, domingo 27 de septiembre, ya se pueden consultar. Nosotros no nos quedaremos solo en comprobar el boleto: aprovecharemos la noticia para estudiar una técnica de aprendizaje no supervisado, el agrupamiento o clustering k-means, y veremos qué puede decirnos sobre un sorteo y, sobre todo, qué no puede decirnos. 🎯

Esta es la lectura larga del domingo, pensada como apuntes de clase para leer con calma. Partimos de cero, definimos cada término y al final lo recogemos todo. La lección se organiza así:

  1. Marco conceptual: qué es un sorteo aleatorio y qué es el aprendizaje no supervisado.
  2. Contexto de la noticia: la combinación publicada y una advertencia sobre la calidad de los datos.
  3. Variables y KPIs: cómo convertir cada número del bombo en un punto con coordenadas.
  4. Tabla didáctica y Figura 1: el conjunto de datos que vamos a agrupar.
  5. El modelo k-means y la Figura 2: el algoritmo paso a paso, con sus centroides.
  6. Interpretación, aplicación en el aula y preguntas.

El marco conceptual se apoya en una idea sencilla. En el Gordo de la Primitiva el jugador elige 5 números entre el 1 y el 54 y un número clave entre el 0 y el 9 (así lo describen las normas oficiales de Loterías y Apuestas del Estado). Si el sorteo es limpio, cada bola tiene la misma probabilidad de salir en cada extracción y los sorteos son independientes entre sí: el bombo no tiene memoria. El análisis de datos no sirve para «adivinar» el próximo resultado. Sirve para describir lo que ha ocurrido y para comprobar si es compatible con el azar. 🧠

Bolas de sorteo como las del Gordo de la Primitiva, usadas para explicar el clustering k-means
Imagen de contexto: un bombo con bolas numeradas es un generador de aleatoriedad, justo lo que un análisis del Gordo de la Primitiva debería confirmar. (Foto: Unsplash)

Contexto de la noticia

El resumen de la noticia que tomamos como punto de partida recoge la combinación 08 – 14 – 27 – 33 – 44 – 49 y una «clave complementaria 12». También menciona un bote de 2,5 millones de euros y habla de un formato de «6 números entre 1 y 49». Antes de analizar nada, un buen analista contrasta el dato con la fuente oficial. Y aquí aparece la primera lección, que nos regala la propia noticia: 🔎

  • El formato oficial del Gordo de la Primitiva es de 5 números del 1 al 54 y un número clave del 0 al 9. Una combinación de seis números o una clave «12» no encaja con ese reglamento.
  • El resumen también afirma que cada número aparece «2,2 veces por sorteo». Eso es imposible, porque en un sorteo cada número sale como mucho una vez.

Esto no quita valor a la noticia como excusa didáctica, pero nos obliga a ser honestos. Los resultados válidos del sorteo son los del acta oficial, y las cifras que usaremos para enseñar k-means son datos ilustrativos para uso docente, no la historia real del sorteo. Aprender a detectar inconsistencias así forma parte de la alfabetización de datos, igual que dominar un algoritmo. ✅

Por qué la lotería es un buen caso de estudio: todo el mundo la entiende, genera muchísimos datos (un sorteo por semana durante décadas) y tiene una verdad de fondo conocida, la uniformidad. Eso es muy raro en ciencia de datos. Si un algoritmo «encuentra» estructura en datos que sabemos que son aleatorios, hemos aprendido algo importante sobre ese algoritmo.

Relevancia para el análisis de datos

El algoritmo k-means (k-medias) es el método de clustering más conocido. Pertenece al aprendizaje no supervisado, y conviene definir bien los dos términos:

  • Aprendizaje supervisado: tenemos una variable respuesta conocida, una «etiqueta» (por ejemplo, «aprobado/suspenso»), y el modelo aprende a predecirla.
  • Aprendizaje no supervisado: no hay etiqueta. El algoritmo solo ve las variables y busca estructura por su cuenta: grupos, dimensiones latentes, anomalías.

El clustering consiste en repartir las observaciones en grupos (clusters) de modo que las de un mismo grupo se parezcan mucho entre sí y poco a las de otros grupos. En k-means cada grupo se resume con un centroide, que es el punto medio de sus miembros. El algoritmo busca los centroides que minimizan la inercia, o suma de cuadrados intra-grupo:

W = Σgrupos Σi ∈ grupo ‖xi − cgrupo‖²

¿Por qué aplicarlo al Gordo de la Primitiva? En las tertulias de apostantes circulan etiquetas como «números calientes» (los que salen mucho) y «números fríos» (los que llevan tiempo sin salir). k-means formaliza esa intuición: crea esos grupos a partir de los datos. Así podemos discutir con rigor si esas etiquetas tienen algún valor predictivo. Spoiler: en un sorteo justo, no. 💡

La técnica tiene muchísimos usos serios: segmentar clientes, agrupar centros educativos por perfil de resultados, comprimir colores de una imagen o detectar tipologías de alumnado según sus hábitos de estudio. La documentación oficial de scikit-learn sobre k-means es la referencia técnica que recomendamos consultar junto a esta lección.

Variables y KPIs en juego

Para agrupar números hay que convertir cada número del bombo en un vector de características, es decir, darle coordenadas. Proponemos dos variables sencillas, calculables a partir de cualquier histórico:

  1. Frecuencia absoluta (f): cuántas veces ha salido el número en los últimos N sorteos. Con N = 500 sorteos y 5 bolas por sorteo, la frecuencia esperada de cada número es 500 · 5 / 54 ≈ 46,3 apariciones.
  2. Retraso (r): cuántos sorteos han pasado desde su última aparición. En un proceso sin memoria, el retraso sigue aproximadamente una distribución geométrica con probabilidad p = 5/54 ≈ 0,093 por sorteo.

Los KPIs (indicadores clave) que usaremos para evaluar el modelo son:

  • Inercia W (suma de cuadrados intra-grupo): cuanto menor, más compactos son los grupos.
  • Proporción de varianza explicada = 1 − W / T, donde T es la suma de cuadrados total (la inercia con un único grupo).
  • Tamaño de cada cluster, para evitar grupos de un solo elemento.
  • Desviación respecto a lo esperado (f − 46,3), que conecta el clustering con la hipótesis de uniformidad.

Una nota técnica importante: k-means usa distancias euclídeas, así que es sensible a la escala. Si una variable se mide en miles y otra en unidades, la primera dominará el cálculo. Lo habitual es estandarizar (restar la media y dividir por la desviación típica) antes de ajustar el modelo. En nuestro ejemplo las dos variables tienen rangos parecidos (frecuencia de 36 a 57, retraso de 1 a 27), así que trabajaremos en unidades originales para que las cuentas se sigan a mano. 🧮

Tabla didáctica (Figura 1)

La tabla recoge 12 números del bombo, con sus dos variables sobre un histórico hipotético de 500 sorteos del Gordo de la Primitiva. Incluimos los seis números de la combinación citada en la noticia para conectar el ejercicio con la actualidad. Son datos ilustrativos para uso docente: están construidos para que k-means encuentre grupos nítidos y la lección se vea clara, y no son estadísticas reales del sorteo.

Número Frecuencia f (apariciones en 500 sorteos) Desviación f − 46,3 Retraso r (sorteos) ¿Citado en la noticia? Cluster asignado (k = 3)
0238−8,324NoC · «fríos»
0546−0,311NoB · «templados»
0855+8,72SíA · «calientes»
1453+6,74SíA · «calientes»
1947+0,79NoB · «templados»
2336−10,327NoC · «fríos»
2757+10,71SíA · «calientes»
3354+7,73SíA · «calientes»
4145−1,313NoB · «templados»
4448+1,710SíB · «templados»
4939−7,322SíC · «fríos»
5237−9,326NoC · «fríos»
Media46,25—12,67——

Tabla 1. Datos ilustrativos para uso docente. Frecuencia esperada bajo uniformidad: 500 · 5 / 54 ≈ 46,3.

La Figura 1 representa la columna de frecuencias con un gráfico de barras: en el eje X, cada número; en el eje Y, sus apariciones. La línea discontinua roja marca la frecuencia esperada si el sorteo fuera perfectamente uniforme. 📊

Gordo de la Primitiva: frecuencia de aparición de 12 números en 500 sorteos (datos ilustrativos) Frecuencia por número en 500 sorteos (ilustrativo) 0 20 40 60 Apariciones (frecuencia f) Número del bombo 38 02 46 05 55 08 53 14 47 19 36 23 57 27 54 33 45 41 48 44 39 49 37 52 - - - Esperada bajo uniformidad ≈ 46,3
📊 Figura 1. Frecuencia de 12 números del Gordo de la Primitiva en 500 sorteos hipotéticos, con la frecuencia esperada bajo uniformidad. Datos ilustrativos para uso docente (Tabla 1).

Análisis estadístico y modelo (Figura 2)

El algoritmo k-means, paso a paso

k-means es un algoritmo iterativo (en su versión clásica, el algoritmo de Lloyd). Con nuestros 12 puntos (f, r) los pasos son:

  1. Elegir k, el número de grupos. Aquí probamos k = 3, inspirados en la terna «calientes / templados / fríos».
  2. Inicializar k centroides, por ejemplo con el método k-means++, que los reparte lejos unos de otros.
  3. Asignar cada número al centroide más cercano (distancia euclídea en el plano f–r).
  4. Actualizar cada centroide como la media de los puntos asignados.
  5. Repetir los pasos 3 y 4 hasta que ninguna asignación cambie. El algoritmo converge siempre, aunque puede quedarse en un óptimo local; por eso se ejecuta con varias semillas (n_init).

Resultados del modelo sobre la Tabla 1

Con los datos de la tabla, el algoritmo converge a estos tres grupos. Los centroides son las medias de cada grupo y se pueden comprobar con calculadora:

ClusterMiembrosCentroide fCentroide rInercia intra-grupo
A · «calientes»08, 14, 27, 3354,752,5013,75
B · «templados»05, 19, 41, 4446,5010,7513,75
C · «fríos»02, 23, 49, 5237,5024,7519,75
Total12 números——W = 47,25

Tabla 2. Solución k-means con k = 3 sobre los datos ilustrativos de la Tabla 1.

Calculamos los KPIs. La suma de cuadrados total (un solo grupo, alrededor de la media global 46,25 ; 12,67) es T ≈ 614,25 + 1 040,67 = 1 654,92. Por tanto, la proporción de varianza explicada por la partición es 1 − 47,25 / 1 654,92 ≈ 0,971: el 97,1 %. Los grupos son muy compactos y están bien separados, lo que era de esperar porque construimos los datos para eso.

¿Por qué k = 3? El método del codo

En la práctica, k no se conoce de antemano. Se ajusta el modelo para k = 1, 2, 3… y se representa la inercia W frente a k. El punto donde la curva deja de caer en picado (el «codo») sugiere un k razonable. Otra opción es el coeficiente de silueta, que mide lo bien que encaja cada punto en su grupo frente al grupo vecino. Con datos del Gordo de la Primitiva reales, lo esperable es que la curva del codo no muestre ningún codo claro, que es la firma de unos datos sin estructura de grupos.

Gordo de la Primitiva: k-means con k = 3 sobre frecuencia y retraso (datos ilustrativos) k-means (k = 3): frecuencia vs. retraso 30 35 40 45 50 55 60 0 10 20 30 Frecuencia f (apariciones en 500 sorteos) Retraso r (sorteos sin salir) 08 14 27 33 05 19 41 44 02 23 49 52 A · «calientes» B · «templados» C · «fríos» Centroide
📈 Figura 2. La metodología en acción: clustering k-means (k = 3) sobre los 12 números de la Tabla 1. Cada color es un cluster y cada «x» su centroide: A (54,75 ; 2,5), B (46,5 ; 10,75), C (37,5 ; 24,75). Datos ilustrativos para uso docente.

Visualización e interpretación

Leamos las dos figuras juntas, como en la pizarra:

  • Figura 1 (los datos): las barras oscilan alrededor de la línea de 46,3. Unos números están por encima y otros por debajo. Esa oscilación es exactamente lo que produce el azar: aunque todas las bolas tengan la misma probabilidad, sus frecuencias nunca son idénticas en una muestra finita. La desviación típica esperada de la frecuencia es √(500 · 0,093 · 0,907) ≈ 6,5 apariciones, así que diferencias de ±10 entran dentro de lo razonable.
  • Figura 2 (el modelo): el plano f–r muestra una diagonal descendente. Los números que más han salido (A) suelen tener poco retraso, y los que menos (C) acumulan más. Tiene lógica mecánica: si un número ha salido hace poco, esa aparición reciente ya suma en su frecuencia. k-means separa esa nube en tres «bandas» y coloca un centroide en cada una.

Ahora viene la interpretación crítica, que es la parte más valiosa de la lección: ⚠️

  1. k-means siempre devuelve k grupos, haya o no estructura real. Si le pides tres grupos a una nube uniforme, te dará tres grupos. El algoritmo no avisa de que los grupos no significan nada.
  2. Describir no es predecir. Que el 27 esté en el cluster de los «calientes» resume el pasado; no cambia la probabilidad de que salga el próximo domingo, que sigue siendo 5/54 si el sorteo es justo. Creer lo contrario es la falacia del apostador.
  3. La combinación publicada mezcla los tres grupos: 08, 14, 27 y 33 caen en A, el 44 en B y el 49 en C. Así lo ha construido este ejemplo docente, pero ilustra una idea real: un sorteo aleatorio no «respeta» ningún cluster.
  4. La prueba adecuada para la uniformidad no es el clustering, sino un contraste chi-cuadrado de bondad de ajuste sobre las frecuencias, como sugería el texto original. El clustering sirve para explorar y generar hipótesis; la inferencia sirve para contrastarlas.

En resumen: con datos reales del Gordo de la Primitiva, un análisis honesto encontraría grupos débiles, siluetas bajas y ningún codo claro. Eso es precisamente lo que confirma que el bombo hace bien su trabajo. ✅

Aplicación didáctica

Proponemos una secuencia de tres sesiones para Bachillerato (Matemáticas Aplicadas a las CC. SS.), ciclos formativos de informática o primeros cursos universitarios de estadística y ciencia de datos. Puedes combinarla con otros materiales de nuestros recursos para profesores, donde encontrarás más propuestas de aula basadas en datos reales.

Sesión 1 · Datos y sospechas (50 min)

  • Leer la noticia y detectar las inconsistencias con el reglamento oficial (formato 5/54 + clave 0–9).
  • Calcular a mano la frecuencia esperada y la desviación típica binomial.
  • Dibujar la Figura 1 en papel o en una hoja de cálculo.

Sesión 2 · k-means a mano y con código (50 min)

  • Ejecutar una iteración de Lloyd a mano con tres centroides iniciales elegidos por el alumnado.
  • Reproducir el resultado en Python con muy pocas líneas:

from sklearn.cluster import KMeans
X = [[38,24],[46,11],[55,2],[53,4],[47,9],[36,27],[57,1],[54,3],[45,13],[48,10],[39,22],[37,26]]
km = KMeans(n_clusters=3, n_init=10, random_state=0).fit(X)
print(km.cluster_centers_, km.inertia_)

En R, el equivalente es kmeans(X, centers = 3, nstart = 10). El alumnado debe obtener los centroides y la inercia (47,25) de la Tabla 2.

Sesión 3 · El experimento decisivo (50 min) 🧪

  • Simular 500 sorteos perfectamente aleatorios (por ejemplo con numpy.random.choice(54, 5, replace=False) en un bucle), calcular f y r para los 54 números y aplicar k-means.
  • Comparar la curva del codo y la silueta con las de nuestros datos ilustrativos.
  • Conclusión guiada: el algoritmo «encuentra» calientes y fríos incluso en azar puro. Lección de pensamiento crítico sobre las estrategias de apuesta.

Si tu alumnado se prepara la prueba de acceso, este ejercicio refuerza probabilidad, distribución binomial e inferencia. Puedes enlazarlo con el temario PEVAU de probabilidad y estadística. 📚

Preguntas para el aula

  1. Según el reglamento oficial del Gordo de la Primitiva, ¿qué dos datos del resumen de la noticia son incompatibles con el formato del sorteo? ¿Por qué es importante contrastar con la fuente oficial?
  2. Calcula la frecuencia esperada de cada número en 1 000 sorteos. ¿Cuál sería la desviación típica de esa frecuencia?
  3. Parte de los centroides iniciales (40, 20), (47, 12) y (55, 5) y realiza a mano la primera asignación de los 12 números de la Tabla 1. ¿Coincide con la solución final?
  4. ¿Por qué k-means necesita que las variables estén en escalas comparables? ¿Qué pasaría si midiéramos el retraso en días en lugar de en sorteos?
  5. Explica con tus palabras por qué pertenecer al cluster de «números calientes» no aumenta la probabilidad de salir en el próximo sorteo.
  6. Diseña un experimento con datos simulados para comprobar si k-means encuentra grupos en un sorteo perfectamente aleatorio. ¿Qué KPI usarías para decidir si esos grupos son reales?
  7. Propón otra variable (por ejemplo, la paridad o la decena del número) que podría añadirse al clustering. ¿Esperas que cambie la conclusión? Justifícalo.

Conclusión

La noticia de los resultados del Gordo de la Primitiva de este domingo nos ha servido para recorrer una lección completa de aprendizaje no supervisado. Hemos definido qué es el clustering y cómo funciona k-means, hemos transformado cada número del bombo en un punto con dos variables (frecuencia y retraso), hemos obtenido tres grupos con sus centroides y hemos medido su calidad con la inercia y la varianza explicada (97,1 % en nuestro ejemplo ilustrativo).

Pero la idea clave está en la interpretación: un algoritmo de agrupamiento siempre agrupa, y en un sorteo justo como el Gordo de la Primitiva esos grupos describen el pasado sin predecir el futuro. Aprender a usar k-means es útil; aprender a desconfiar de sus grupos cuando los datos son aleatorios es lo que separa a un buen analista de alguien que solo sabe ejecutar código. 🎯

Si te ha gustado esta clase magistral de domingo, encontrarás más lecciones de estadística aplicada a la actualidad en más artículos del blog de canaldocente.es.