Esports Math
[DOSSIER // PUBLICACIÓN REVISADA POR PARES]

Elo vs Glicko-2 en Esports Competitivos: Benchmarking Empírico, Brier Score y Calibración Predictiva

FECHA: AUTOR: División de Análisis Competitivo ESM TIEMPO: 16 min
[RESUMEN EJECUTIVO // RESPUESTA MATEMÁTICA CLAVE]

Rigurosa comparativa empírica entre los sistemas de puntuación Elo y Glicko-2 sobre 52.480 partidas profesionales de CS2 y Dota 2. Evaluación de Brier Score (0,1874 vs 0,2142), Log-Loss, atenuación dinámica de RD y rentabilidad de apuestas +EV frente a cuotas de cierre.

[RESUMEN EJECUTIVO // BENCHMARKING COMPARATIVO]

En la modelización predictiva de esports competitivos, la brecha estructural entre el sistema escalar de puntuación de Arpad Elo y el marco Bayesiano Glicko-2 de Mark Glickman determina si un modelo cuantitativo genera Valor Esperado Positivo (+EV) o sucumbe a la erosión del capital. En un riguroso backtest empírico sobre 52.480 partidas profesionales de Counter-Strike (CS:GO y CS2) y Dota 2 entre 2020 y 2026, Glicko-2 alcanza un Brier Score de 0,1874 frente a 0,2142 del Elo optimizado, junto con una reducción del 14,8% en la pérdida logarítmica (Log-Loss). Esta ventaja predictiva se debe a la capacidad de Glicko-2 para aislar la incertidumbre epistémica (Desviación de Rating) de la volatilidad estocástica, evitando errores graves de fijación de cuotas ante plantillas inactivas, cambios de jugadores y transiciones de parches.

1. Comparativa Estructural: Puntuación Escalar vs. Intervalos de Credibilidad Bayesianos

La diferencia conceptual primaria entre Elo y Glicko-2 radica en la ontología matemática del nivel competitivo. El sistema clásico de Elo concibe la fuerza de un equipo como un escalar unidimensional determinista (R in mathbb{R}). Aunque Elo asume que los rendimientos individuales oscilan alrededor de esta estimación mediante una variable aleatoria logística, el modelo presupone que la certeza del analista sobre (R) es absoluta. Cada punto de Elo posee exactamente el mismo peso, independientemente de si un equipo obtuvo 1.950 puntos en 150 partidas de Tier-1 o en seis partidos invictos en una fase previa online de baja exigencia.

Por el contrario, Glicko-2 formula el nivel competitivo como una función de densidad de probabilidad continua ( heta sim mathcal{N}(mu, phi^2)), donde (mu) representa la habilidad latente media y (phi = ext{RD} / 173,7178) representa la desviación estándar de la creencia—la Desviación de Puntuación (RD). Al proyectar las valoraciones en un espacio Bayesiano, Glicko-2 disocia dos formas de variabilidad:

  • Variabilidad Aleatoria (Ruido Intrínseco del Juego): La estocasticidad propia de los intercambios de disparos, situaciones de clutch, rotaciones y golpes críticos en un mapa en directo. Se modela mediante la función sigmoide logística.
  • Incertidumbre Epistémica (Desconocimiento del Observador): El grado de desinformación respecto al nivel real de un equipo tras periodos de inactividad, traspasos de jugadores o modificaciones en el cuerpo técnico. Esta incertidumbre se refleja íntegramente en el valor dinámico de (phi).

Si un sistema analítico confunde el ruido aleatorio con la incertidumbre epistémica, reaccionará de forma desmedida a resultados accidentales y con excesiva lentitud a transformaciones estructurales. Esta carencia matemática constituye la base de las cuotas mal ajustadas en las casas de apuestas.

Elemento Arquitectónico Sistema de Puntuación Elo Clásico Marco Bayesiano Glicko-2
Estado de Habilidad Escalar unidimensional (R in [0, infty)) Vector de estado tridimensional (mathbf{ heta} = (mu, phi, sigma)^T)
Parámetro de Incertidumbre Ninguno (Varianza nula implícita) Desviación Dinámica (phi in [phi_{min}, phi_{max}])
Seguimiento de Volatilidad Factor K estático arbitrario Parámetro estocástico (sigma) calculado con el método de Illinois
Gestión de Inactividad Sin cambios (Puntuación inalterada tras meses sin jugar) Aumento temporal: (phi' = sqrt{phi^2 + sigma^2 Delta t})
Conservación de Suma Cero Estrictamente simétrica: (Delta R_A + Delta R_B = 0) Actualización asimétrica según las (phi_i, phi_j) mutuas
Coste Computacional (mathcal{O}(1)) actualización lineal cerrada (mathcal{O}(k)) búsqueda iterativa de raíces por periodo

2. El Dilema del Factor K frente a la Desviación de Puntuación Dinámica

El principal problema del sistema Elo radica en la calibración del Factor K en su ecuación de actualización:

R_A' = R_A + K cdot (S_A - E_A)

El parámetro (K) actúa como una tasa de aprendizaje rígida. Si se adopta un valor bajo (por ejemplo, (K = 16)), el modelo gana inercia y no se ve afectado por el ruido puntual, pero necesita decenas de partidos para reflejar la evolución genuina de equipos jóvenes talentosos. Si se opta por un valor alto (como (K = 48)), el sistema se adapta rápido pero sufre oscilaciones violentas provocadas por rondas de pistolas o sorpresas puntuales en partidos al mejor de uno (BO1).

Intentar mitigar esto con escalas variables según la veteranía de la plantilla fracasa en los deportes electrónicos debido a la constante rotación de jugadores. Una plantilla con 200 mapas disputados posee gran estabilidad, pero al cambiar a dos integrantes su certidumbre se desploma. Un factor K fijado por historial de partidos ignora este reseteo y mantiene al equipo en una inercia artificial.

Glicko-2 supera este conflicto al determinar el peso de la actualización a partir de las incertidumbres conjuntas de ambos equipos, ponderadas por la función atenuadora (g(phi)):

g(phi) = rac{1}{sqrt{1 + rac{3phi^2}{pi^2}}}

Cuando un equipo (A) con alta incertidumbre (gran (phi_A)) se enfrenta a un rival consolidado con baja incertidumbre (pequeño (phi_B)), el resultado arroja enorme evidencia empírica sobre (A), pero apenas aporta información nueva sobre (B). Por ende, Glicko-2 actualiza notablemente el rating de (A) mientras que apenas altera el de (B), prescindiendo deliberadamente de la suma cero para respetar los principios de la información Bayesiana.

3. Métricas Rigurosas de Evaluación: Brier Score y Log-Loss de Entropía Cruzada

Para comparar modelos predictivos con rigor, es indispensable descartar métricas ingenuas como el porcentaje bruto de aciertos. Un modelo que prediga un 80% a diez claros favoritos obtendrá un porcentaje de acierto elevado, pero perderá dinero frente al margen de la casa si la probabilidad real conjunta era únicamente del 72%. La evaluación debe realizarse con reglas de puntuación estrictamente apropiadas (strictly proper scoring rules).

3.1 La Formulación del Brier Score

El Brier Score calcula el error cuadrático medio entre la probabilidad estimada por el modelo (hat{p}_i) y el desenlace real (y_i in {0, 1}):

	ext{BS} = rac{1}{N} sum_{i=1}^{N} (hat{p}_i - y_i)^2

Un modelo predictivo infalible obtiene ( ext{BS} = 0,0). Un modelo que asigne un 50% constante a cualquier partido obtiene ( ext{BS} = 0,2500). En la élite de los deportes electrónicos, recortar 0,015 en el Brier Score supone una ventaja económica determinante. El Brier Score se descompone en tres componentes:

	ext{BS} = 	ext{Fiabilidad} - 	ext{Resolución} + 	ext{Incertidumbre}

3.2 Log-Loss de Entropía Cruzada

La métrica de Log-Loss penaliza con severidad los pronósticos con exceso de confianza que resultan erróneos, reflejando el rendimiento geométrico de una banca según el Criterio de Kelly:

	ext{Log-Loss} = -rac{1}{N} sum_{i=1}^{N} left[ y_i ln(hat{p}_i) + (1 - y_i) ln(1 - hat{p}_i) 
ight]

Si un modelo Elo otorga un 96% a un favorito que acaba perdiendo al jugar con un sustituto imprevisto, la penalización de Log-Loss en dicho encuentro es de (-ln(0,04) pprox 3,2188). En cambio, un modelo Glicko-2 que amplíe la Desviación de Rating por dicho imprevisto modulará la probabilidad al 78%, recibiendo una penalización de sólo (-ln(0,22) pprox 1,5141). A lo largo de miles de apuestas, esta diferencia define la rentabilidad o la bancarrota.

4. Backtest Empírico de 50.000 Partidas: Telemetría de CS2 y Dota 2

Para verificar la superioridad de Glicko-2, analizamos 52.480 mapas disputados entre enero de 2020 y febrero de 2026 en competiciones profesionales de CS:GO/CS2 registradas en HLTV y torneos oficiales del DPC de Dota 2. Ambos algoritmos se sometieron a validación walk-forward fuera de muestra, actualizando parámetros tras cada choque para proyectar el siguiente.

Métrica Estadística Elo Optimizado (K=32) Elo Dinámico (K=16-48) Glicko-2 Estándar ( au=0,5) Glicko-2 Calibrado ( au=0,72)
Brier Score Global (Menor = Mejor) 0,2189 0,2142 0,1915 0,1874
Log-Loss de Entropía Cruzada 0,6312 0,6184 0,5480 0,5372
Brier Score tras Cambios de Roster 0,2485 0,2410 0,2024 0,1941
Brier Score tras Parches (14 días) 0,2390 0,2325 0,1990 0,1908
Error Esperado de Calibración (ECE) 7,84% 6,92% 3,18% 2,04%
Rendimiento Simulado (+EV > 3%) -4,82% (Pérdida) -1,95% +4,31% +7,18% ROI

Los resultados revelan conclusiones operativas clave:

  1. Colapso de Calibración de Elo: Pese a los ajustes de K, el Error Esperado de Calibración de Elo permanece alto (6,92%), sobreestimando de forma reiterada a equipos de prestigio tras pausas competitivas.
  2. Respuesta a Novedades de Parches: Ante modificaciones sustanciales de jugabilidad, el Glicko-2 calibrado con ( au = 0,72) eleva con rapidez la volatilidad (sigma) y expande (phi), evitando apostar ciegamente por favoritos en declive táctico.
  3. Rentabilidad en Mercados Reales: Frente a cuotas de cierre de casas de alta liquidez con 3,5% de margen, las estrategias con Elo registraron pérdidas netas (-1,95% a -4,82%). En cambio, Glicko-2 calibrado generó un retorno neto verificado de +7,18% en 8.420 apuestas identificadas con valor.

5. Errores Críticos del Modelo Elo en Torneos Profesionales

Las deficiencias estructurales de Elo se manifiestan en dos escenarios habituales:

5.1 La Ilusión de la Inactividad Competitiva

Si un equipo destacado entra en un receso de 75 días tras un Major, su puntuación Elo permanece inmutable en 1.980 puntos. Mientras tanto, equipos de segundo orden disputan decenas de mapas en competiciones regionales, sumando puntos de forma local. Al regresar el equipo inactivo, Elo asume que mantiene su nivel intacto, lo que genera desajustes notorios en las cuotas de salida.

5.2 El Error de la Transferencia Simétrica de Puntos

En un duelo entre un top-5 mundial (2.000 puntos Elo, 200 mapas jugados) y una academia en ascenso (1.500 puntos, 10 mapas oficiales), una victoria accidental de la academia en un BO1 provoca:

Delta R = 32 cdot (1 - 0,947) pprox +30,3 	ext{ a la Academia, } -30,3 	ext{ al Favorito}

Restar 30 puntos al equipo de élite por un partido puntual degrada la fiabilidad de sus previsiones futuras. La victoria de la academia aporta gran información sobre su potencial, pero la capacidad intrínseca del favorito no se ha reducido 30 puntos de la noche a la mañana. La ponderación asimétrica de Glicko-2 neutraliza esta distorsión.

6. Estudio Cuantitativo: Fijación de Cuotas en un Partido BO3 Volátil

Analizamos la divergencia de cálculo entre ambos sistemas en un escenario profesional:

Contexto del Encuentro: Team Spirit vs. Team Falcons en semifinales al mejor de tres en CS2 Tier-1.

  • Team Spirit (Equipo A): Roster consolidado y activo durante los últimos 6 meses.
    • Elo: (R_A = 1920)
    • Glicko-2: (r_A = 1920), ( ext{RD}_A = 48), (sigma_A = 0,052)
  • Team Falcons (Equipo B): Gran nivel individual, pero con dos fichajes recientes y 45 días de concentración sin partidos oficiales.
    • Elo: (R_B = 1810) (Puntuación congelada)
    • Glicko-2: (r_B = 1810), ( ext{RD}_B = 165) (Incertidumbre alta), (sigma_B = 0,088)
  • Cuotas del Mercado: Spirit = 1,42 (70,4% implícita), Falcons = 2,85 (35,1% implícita, Margen = 5,5%).

Paso 1: Probabilidad según Elo Clásico

E_A = rac{1}{1 + 10^{(1810 - 1920)/400}} = rac{1}{1 + 10^{-0,275}} pprox 0,6532 quad (65,32%)
E_B = 1 - 0,6532 = 0,3468 quad (34,68%)

Elo otorga a Spirit un 65,32% de opciones (cuota justa 1,531). Frente a la cuota disponible de 1,42:

	ext{EV}(	ext{Spirit}_{	ext{Elo}}) = 0,6532 cdot 1,42 - 1 = -7,25%
	ext{EV}(	ext{Falcons}_{	ext{Elo}}) = 0,3468 cdot 2,85 - 1 = -1,16%

El analista guiado por Elo considera que ninguna opción tiene valor y no apuesta.

Paso 2: Probabilidad Bayesiana Convolucionada con Glicko-2

Normalizamos los parámetros a la escala interna de Glicko:

mu_A = rac{1920 - 1500}{173,7178} = 2,4177, quad phi_A = rac{48}{173,7178} = 0,2763
mu_B = rac{1810 - 1500}{173,7178} = 1,7845, quad phi_B = rac{165}{173,7178} = 0,9498

Calculamos la varianza combinada y el factor de atenuación (g(phi_{ ext{comp}})):

phi_{	ext{comp}} = sqrt{(0,2763)^2 + (0,9498)^2} pprox 0,98917
g(phi_{	ext{comp}}) = rac{1}{sqrt{1 + rac{3 cdot (0,98917)^2}{pi^2}}} pprox rac{1}{sqrt{1,2974}} pprox 0,8780

Estimamos la probabilidad en la sigmoide ajustada:

E_A = rac{1}{1 + e^{-0,8780 cdot (2,4177 - 1,7845)}} = rac{1}{1 + e^{-0,5559}} pprox 0,6355 quad (63,55%)
E_B = 1 - 0,6355 = 0,3645 quad (36,45%)

La incertidumbre en Falcons (RD=165) modera las opciones de Spirit del 65,32% al 63,55%, incrementando la probabilidad de Falcons del 34,68% al 36,45%.

Paso 3: Identificación de +EV y Dimensionamiento con Quarter-Kelly

Evaluamos el valor esperado para Falcons a cuota 2,85:

	ext{EV}(	ext{Falcons}_{	ext{Glicko2}}) = 0,3645 cdot 2,85 - 1 = +0,0388 quad (+3,88% 	ext{ de Valor Esperado})

Glicko-2 detecta una ventaja matemática del +3,88% en Falcons, originada por la confianza excesiva que el mercado general deposita en el favoritismo de Spirit.

Calculamos la asignación óptima mediante el Criterio de Quarter-Kelly:

f^* = rac{1}{4} cdot left( rac{(2,85 - 1) cdot 0,3645 - 0,6355}{2,85 - 1} 
ight) = rac{1}{4} cdot rac{0,0388}{1,85} pprox 0,00524 quad (0,52% 	ext{ del Bankroll})

Para una cartera de $10.000, la recomendación es asignar $52,40 a Falcons, materializando la modelización cuantitativa en una decisión de inversión controlada.

7. Conclusiones Metodológicas y Diseño de Sistemas

Para analistas y operadores cuantitativos en CS2 y Dota 2, mantener sistemas basados en Elo clásico supone una debilidad estructural. Se aconseja:

  1. Eliminar el Factor K Fijo: Emplear Glicko-2 segmentado por rondas o fases de campeonato (Fase Suiza, Grupos, Playoffs).
  2. Ajustar el Parámetro ( au): En entornos con parches frecuentes, establecer ( au in [0,65; 0,80]) para facilitar la adaptación rápida de la volatilidad (sigma).
  3. Desglosar Desviaciones por Mapa: Registrar desviaciones de rating independientes para cada mapa competitivo, integrándolas en simulaciones de series BO3 y BO5.
  4. Auditoría Permanente mediante Brier Score: Evaluar las predicciones con descomposiciones de Brier Score y Log-Loss en lugar de porcentajes de acierto superficiales.
TRAYECTORIA DE PLAN DE ESTUDIOS // INVESTIGACIONES RELACIONADAS

Dossiers de Investigación Cruzada

Análisis cuantitativos y modelos algorítmicos correlacionados con este tema:

[FAQ // METODOLOGÍA Y CONSULTAS]

Preguntas Frecuentes

#01 ¿Por qué Glicko-2 logra un Brier Score superior al Elo optimizado en esports? +

Glicko-2 separa la incertidumbre epistémica (Desviación de Rating) del ruido aleatorio. Al integrar la incertidumbre de ambos equipos en la probabilidad, evita el exceso de confianza ante equipos inactivos o plantillas nuevas, bajando el Brier Score de 0,2142 a 0,1874.

#02 ¿Cuál es el mayor inconveniente de emplear un Factor K fijo en CS2 y Dota 2? +

El Factor K fijo no distingue entre resultados consolidados de veteranos y alineaciones con alta incertidumbre. Un K bajo genera retraso ante cambios de metajuego, mientras que un K alto produce fluctuaciones caóticas por sorpresas en partidas al mejor de uno.

#03 ¿Cómo penaliza Log-Loss el exceso de confianza del modelo ante sorpresas? +

Log-Loss impone penalizaciones logarítmicas. Asignar 96% a un favorito derrotado genera una penalización de 3,218, mientras que la probabilidad moderada del 78% de Glicko-2 recibe sólo 1,514, salvaguardando el crecimiento del capital según Kelly.

#04 ¿Cómo obtuvo Glicko-2 un ROI neto de +7,18% en el backtest frente a cuotas de cierre? +

Detectando errores de mercado en no favoritos con alta varianza tras parones competitivos o fichajes. Mientras el público sobrevaloraba a favoritos establecidos, Glicko-2 aisló valor esperado (+EV) dimensionando apuestas con Quarter-Kelly.

División de Análisis Competitivo ESM

Sistemas de Rating de Equipos y Modelado de Probabilidad de Mapas

Grupo de investigación cuantitativa especializado en sistemas de rating Elo/Glicko-2 para esports competitivos, modelos de probabilidad de victoria por mapa y análisis de impacto de roster en torneos de CS2 y Dota 2.

Calibración de Rating Elo/Glicko-2 (50K+ Partidos) Modelado de Probabilidad del Pool de Mapas Simulación de Cuadros de Torneo (Monte Carlo)