ETACheck ← Volver

El método, completo y abierto

Un número sin método no sirve para tomar decisiones. Acá está exactamente cómo medimos, qué descartamos y cómo nos validamos. Si encuentras un error, escríbenos.

1. Qué se mide contra qué

Un ETA se juzga contra una referencia. Usamos dos, en este orden de preferencia:

Cada corredor se consulta cada 30 minutos, de forma continua, para tener la curva completa del día y no una foto conveniente.

2. Cuándo dos mediciones se pueden comparar

Un par es una predicción y una observación del mismo viaje. Para que cuente exigimos dos cosas:

Por qué importa el segundo filtro: un par mal emparejado no se nota en el resultado, se aprende como si fuera sesgo. Al apretar ese umbral de 15% a 6%, la dispersión dentro de una misma ruta bajó de 6,6% a 6,0%, perdiendo solo 8 pares de 99.

3. El factor de corrección

Para cada par calculamos el cociente entre lo observado y lo predicho, en logaritmo:

coeficiente = log(tiempo real / tiempo predicho)

En logaritmo, pasarse un 20% y quedarse corto un 20% pesan igual, que es lo correcto: un ETA optimista y uno pesimista cuestan distinto, pero se equivocan lo mismo.

El factor de una ruta y franja es el promedio de esos coeficientes, encogido hacia el nivel superior cuando hay poca evidencia: la franja se apoya en el resto de la ruta, y la ruta en "no corregir". Así una sola medición no arrastra la corrección a un extremo.

Cuántas mediciones hacen falta

Mediciones previas de esa rutaError al predecir la siguiente
113,1%
25,8%
3 o más5,7%

La segunda medición es la que vale. La tercera casi no aporta. Por eso el piloto dura dos semanas y no dos meses.

4. Cómo nos validamos

La trampa habitual en este tipo de medición es evaluar el modelo con datos que ya vio. Nosotros reportamos la métrica honesta: entrenar solo con el pasado y predecir la medición siguiente, que es exactamente lo que ocurre en producción.

Forma de validarError calibrado
Hacia adelante en el tiempo (la que reportamos)6,3%
Dejando una medición fuera (optimista)5,5%
Sin corregir, fuente cruda11,9%

Y el límite, dicho por nosotros: en un corredor nunca medido, calibrar no sirve de nada (12,0% contra 12,7% sin corregir). El sesgo es propio de cada ruta y no se traslada entre ciudades. Cualquiera que te venda un factor genérico te está vendiendo humo.

5. Lo que probamos y descartamos

Publicamos también lo que no funcionó, porque ahorra tiempo a quien quiera replicar esto:

6. Qué hacemos con los datos