Week 101 - Análisis de robustez - Resultados parciales
Actualmente se continúa ampliando la cantidad de muestras utilizadas en los experimentos de robustez. Las métricas presentadas en esta actualización se calculan únicamente sobre las ejecuciones exitosas, es decir, aquellas en las que el vehículo alcanza correctamente la meta.
Configuración experimental
Test 1 – Robustez bajo condiciones iniciales
Se evalúan 15 condiciones iniciales diferentes. Cada condición se ejecuta 15 veces para un total de:
\[15 \times 15 = 225\]ejecuciones por configuración experimental.
Test 4 – Perturbación online durante inferencia
Se realizan igualmente 225 ejecuciones por configuración experimental. Durante la ejecución del vehículo se introducen perturbaciones online que modifican temporalmente la observación utilizada por la política de conducción.
Definición de las mezclas de entrenamiento
Sea $\alpha \in [0,1]$ la proporción de muestras augmentadas utilizadas dentro del dataset final.
Las mezclas basadas en DAgger se definen como:
\[D_{\alpha}^{B}=(1-\alpha)A'+\alpha B'\]Las mezclas basadas en Noise Injection se definen como:
\[D_{\alpha}^{C}=(1-\alpha)A'+\alpha C'\]donde:
- $A’$: Dataset Burbuja
- $B’$: Dataset DAgger
- $C’$: Dataset Noise Injection
Además, se evalúa una mezcla híbrida:
\[D^{M}=0.70A'+0.20B'+0.10C'\]denominada Magic Mix.
Ejemplos de interpretación
| Configuración | Composición |
|---|---|
| $D^{A}$ | 100% Burbuja |
| $D_{0.50}^{B}$ | 50% Burbuja + 50% DAgger |
| $D_{0.75}^{B}$ | 25% Burbuja + 75% DAgger |
| $D_{0.50}^{C}$ | 50% Burbuja + 50% Noise Injection |
| $D_{0.75}^{C}$ | 25% Burbuja + 75% Noise Injection |
| $D^{M}$ | 70% Burbuja + 20% DAgger + 10% Noise Injection |
Test 1 – Robustez bajo condiciones iniciales
Burbuja
| Métrica | $D^{A}$ |
|---|---|
| Successful runs | 100.0% (225/225) |
| Collisions | 0.000 |
| Average speed (km/h) | 54.71 |
| Dev mean (m) | 0.767 |
DAgger
| Métrica | $D_{0.30}^{B}$ | $D_{0.50}^{B}$ | $D_{0.75}^{B}$ |
|---|---|---|---|
| Successful runs | 100.0% (225/225) | 97.3% (219/225) | 40.4% (91/225) |
| Collisions | 1.000 | 0.013 | 1.121 |
| Average speed (km/h) | 57.12 | 55.96 | 38.20 |
| Dev mean (m) | 0.884 | 0.843 | 1.469 |
Noise Injection
| Métrica | $D_{0.30}^{C}$ | $D_{0.50}^{C}$ | $D_{0.75}^{C}$ |
|---|---|---|---|
| Successful runs | 91.9% (207/225) | 74.2% (167/225) | 45.3% (102/225) |
| Collisions | 0.000 | 0.004 | 0.583 |
| Average speed (km/h) | 59.27 | 56.27 | 52.99 |
| Dev mean (m) | 0.788 | 0.775 | 0.853 |
Comparación general
| Modelo | Successful Runs | Collisions | Speed (km/h) | Dev Mean (m) |
|---|---|---|---|---|
| $D^{A}$ | 100.0% (225/225) | 0.000 | 54.71 | 0.767 |
| $D_{0.30}^{B}$ | 100.0% (225/225) | 1.000 | 57.12 | 0.884 |
| $D_{0.50}^{B}$ | 97.3% (219/225) | 0.013 | 55.96 | 0.843 |
| $D_{0.75}^{B}$ | 40.4% (91/225) | 1.121 | 38.20 | 1.469 |
| $D_{0.30}^{C}$ | 91.9% (207/225) | 0.000 | 59.27 | 0.788 |
| $D_{0.50}^{C}$ | 74.2% (167/225) | 0.004 | 56.27 | 0.775 |
| $D_{0.75}^{C}$ | 45.3% (102/225) | 0.583 | 52.99 | 0.853 |
Análisis del Test 1
Los resultados actualizados muestran que las configuraciones más cercanas al dataset original continúan obteniendo el mejor desempeño bajo condiciones nominales. Sin embargo, la incorporación de nuevas mezclas permite observar con mayor claridad el efecto de la proporción de muestras augmentadas sobre el comportamiento de la política.
El modelo base $D^{A}$ alcanza un 100% de successful runs (225/225), sin colisiones y con la menor desviación lateral media observada. Estos resultados confirman que el dataset Burbuja contiene suficiente diversidad para resolver correctamente las condiciones iniciales consideradas en este conjunto de pruebas.
En las configuraciones basadas en DAgger se observa un comportamiento particularmente interesante. La mezcla $D_{0.30}^{B}$ también alcanza un 100% de successful runs (225/225), igualando el desempeño del modelo base y obteniendo además una velocidad media ligeramente superior. La configuración $D_{0.50}^{B}$ mantiene un desempeño muy elevado con un 97.3% de successful runs (219/225). Sin embargo, al incrementar la proporción de muestras DAgger hasta el 75% y el 100%, el rendimiento se degrada significativamente, observándose una reducción drástica de la tasa de éxito, un aumento de las colisiones y una mayor desviación lateral.
Las configuraciones basadas en Noise Injection muestran una tendencia similar. La mezcla $D_{0.30}^{C}$ alcanza un 91.9% de successful runs (207/225) y la mayor velocidad media observada entre todas las configuraciones evaluadas. No obstante, al aumentar la proporción de muestras con ruido hasta el 50% y el 75%, la tasa de éxito disminuye progresivamente hasta alcanzar un 45.3% (102/225) para $D_{0.75}^{C}$.
En conjunto, los resultados sugieren que existe una proporción óptima de muestras augmentadas tanto para DAgger como para Noise Injection. Cantidades moderadas de datos augmentados parecen aportar información útil para mejorar la robustez de la política sin alterar excesivamente la distribución original de conducción. Por el contrario, cuando las muestras augmentadas dominan el dataset de entrenamiento, el rendimiento disminuye de forma significativa.
De manera preliminar, los resultados indican que las mejores configuraciones del Test 1 corresponden a $D^{A}$ y $D_{0.30}^{B}$, seguidas por $D_{0.50}^{B}$ y $D_{0.30}^{C}$. Esto sugiere que una incorporación moderada de ejemplos de recuperación puede ser beneficiosa, mientras que proporciones excesivas de datos DAgger o Noise Injection terminan alejando al modelo de la distribución nominal de conducción.
Test 4 – Perturbación online durante inferencia
DAgger
| Métrica | $D_{0.15}^{B}$ | $D_{0.30}^{B}$ | $D_{0.50}^{B}$ | $D_{0.75}^{B}$ |
|---|---|---|---|---|
| Successful runs | 30.2% (68/225) | 71.1% (160/225) | 62.2% (140/225) | 20.0% (45/225) |
| Collisions | 0.221 | 0.994 | 0.129 | 0.978 |
| Average speed (km/h) | 56.8 | 53.9 | 54.5 | 47.6 |
| Dev mean (m) | 0.593 | 0.641 | 0.702 | 0.817 |
Noise Injection
| Métrica | $D_{0.15}^{C}$ | $D_{0.30}^{C}$ | $D_{0.50}^{C}$ | $D_{0.75}^{C}$ |
|---|---|---|---|---|
| Successful runs | 82.2% (185/225) | 79.6% (179/225) | 91.1% (205/225) | 47.1% (106/225) |
| Collisions | 0.076 | 0.179 | 0.054 | 0.509 |
| Average speed (km/h) | 52.9 | 56.2 | 54.6 | 52.2 |
| Dev mean (m) | 0.530 | 0.554 | 0.466 | 0.828 |
Burbuja y Magic Mix
| Modelo | Successful Runs | Collisions | Avg Speed | Dev Mean |
|---|---|---|---|---|
| $D^{A}$ | 58.2% (131/225) | 0.519 | 43.3 | 1.048 |
| $D^{M}$ | 88.9% (200/225) | 0.085 | 55.1 | 0.512 |
Análisis del Test 4
A diferencia de lo observado en el Test 1, las configuraciones basadas en Noise Injection continúan mostrando el mejor desempeño frente a perturbaciones online durante la inferencia.
La mejor configuración corresponde a $D_{0.50}^{C}$, que alcanza un 91.1% de successful runs (205/225), acompañado por la menor desviación lateral media observada (0.466 m) y el menor número de colisiones (0.054) entre todas las configuraciones evaluadas. Este resultado sugiere que una proporción intermedia de muestras Noise Injection proporciona un equilibrio adecuado entre estabilidad y capacidad de recuperación frente a perturbaciones continuas.
La incorporación de la nueva configuración $D_{0.15}^{C}$ aporta información adicional sobre el comportamiento de esta estrategia. Con un 82.2% de successful runs (185/225), una desviación lateral de 0.530 m y únicamente 0.076 colisiones, se observa que incluso pequeñas cantidades de muestras Noise Injection producen mejoras significativas respecto al modelo base Burbuja. Sin embargo, el mejor desempeño continúa apareciendo en torno al 50% de mezcla, mientras que proporciones más elevadas ($D_{0.75}^{C}$) provocan una degradación apreciable del rendimiento.
Las configuraciones basadas en DAgger presentan un comportamiento más complejo. La mezcla $D_{0.30}^{B}$ continúa siendo la mejor configuración de esta familia con un 71.1% de successful runs (160/225). Sin embargo, tanto la reducción hasta $D_{0.15}^{B}$ como el incremento hacia $D_{0.50}^{B}$ y $D_{0.75}^{B}$ producen una disminución del desempeño. En particular, $D_{0.15}^{B}$ alcanza únicamente un 30.2% de successful runs (68/225), mientras que $D_{0.75}^{B}$ desciende hasta el 20.0% (45/225).
Este comportamiento resulta especialmente interesante porque contradice parcialmente la expectativa inicial de que pequeñas cantidades de ejemplos DAgger serían suficientes para mejorar la robustez frente a perturbaciones. Los resultados sugieren que existe una región relativamente estrecha alrededor del 30% donde las muestras DAgger aportan beneficios, mientras que proporciones demasiado bajas o demasiado altas terminan degradando el rendimiento global de la política.
La mezcla híbrida $D^{M}$ (Magic Mix) presenta uno de los resultados más destacados de esta actualización. Con un 88.9% de successful runs (200/225), únicamente 0.085 colisiones y una desviación lateral media de 0.512 m, se aproxima notablemente al desempeño obtenido por $D_{0.50}^{C}$ y supera ampliamente tanto al modelo base Burbuja como a todas las configuraciones basadas exclusivamente en DAgger.
En conjunto, los resultados indican que las perturbaciones online evaluadas en el Test 4 favorecen claramente las estrategias basadas en Noise Injection. De manera preliminar, esto sugiere que las correcciones locales y continuas introducidas durante la generación de este dataset producen políticas más robustas frente a pequeñas perturbaciones repetidas durante la conducción. Al mismo tiempo, los resultados de Magic Mix muestran que la incorporación controlada de ejemplos DAgger puede seguir aportando información útil cuando se combina adecuadamente con muestras Noise Injection y Burbuja.
Comparación entre Test 1 y Test 4
Los resultados muestran que las distintas estrategias de generación de datos fortalecen propiedades diferentes de la política de conducción.
En el Test 1, las mejores configuraciones corresponden a Burbuja ($D^{A}$) y DAgger 30% ($D_{0.30}^{B}$), ambas con un 100% de successful runs, lo que indica un excelente desempeño bajo condiciones nominales y estados iniciales conocidos. También destacan DAgger 50% y Noise 30%, confirmando que proporciones moderadas de muestras augmentadas pueden mejorar la robustez sin alterar significativamente la distribución original del dataset.
Por el contrario, en el Test 4 las configuraciones basadas en Noise Injection obtienen los mejores resultados frente a perturbaciones online. La mejor política observada corresponde a $D_{0.50}^{C}$, con un 91.1% de successful runs, seguida muy de cerca por Magic Mix ($D^{M}$) con un 88.9%.
De forma preliminar, los resultados sugieren que:
- Burbuja ($D^{A}$) favorece el desempeño nominal bajo condiciones conocidas.
- DAgger ($D^{B}$) mejora la capacidad de recuperación cuando se utiliza en proporciones moderadas.
- Noise Injection ($D^{C}$) favorece la estabilidad frente a perturbaciones continuas durante la inferencia.
- Magic Mix ($D^{M}$) ofrece un compromiso interesante entre estabilidad y robustez.
En conjunto, los resultados indican que no existe una única configuración óptima para todos los escenarios. Mientras que las mezclas basadas en DAgger muestran ventajas en condiciones iniciales controladas, las mezclas basadas en Noise Injection resultan más efectivas cuando el vehículo debe enfrentarse a perturbaciones online durante la conducción.
Análisis adicional: diferencia entre la generación del dataset DAgger y el Test 4
Al revisar en detalle la configuración utilizada para generar el dataset DAgger y la configuración empleada posteriormente durante el Test 4, se observó que ambas no son equivalentes.
La siguiente tabla resume las principales diferencias:
| Parámetro | Dataset DAgger | Test 4 |
|---|---|---|
| Frecuencia de perturbación | 12 s | 6 s |
| Duración de la perturbación (hold) | 0.40 s | 0.30 s |
| Duración del recovery | 0.50 s | 0.60 s |
| Steer máximo aplicado | ±0.40 | ±0.18 |
La principal diferencia aparece en la magnitud de las perturbaciones. Durante la generación del dataset DAgger se utilizaron acciones con amplitudes de hasta:
\[steer = \pm 0.40\]mientras que en el Test 4 las perturbaciones máximas fueron:
\[steer = \pm 0.18\]Sin embargo, las perturbaciones del Test 4 se aplican con una frecuencia aproximadamente dos veces mayor, pasando de una perturbación cada 12 segundos a una perturbación cada 6 segundos.
Desde una perspectiva conceptual, el dataset DAgger fue generado mediante episodios de recuperación relativamente severos y poco frecuentes:
Perturbación fuerte
↓
Recuperación humana
↓
Conducción normal durante varios segundos
↓
Nueva perturbación
Por el contrario, el Test 4 introduce perturbaciones más suaves pero mucho más frecuentes:
Perturbación suave
↓
Recuperación
↓
Pocos segundos de conducción
↓
Nueva perturbación
Esto implica que el Test 4 podría estar evaluando principalmente la estabilidad continua de la política frente a pequeñas perturbaciones repetidas, más que la capacidad de recuperación frente a estados claramente fuera de distribución.
Esta diferencia resulta especialmente relevante al interpretar los resultados obtenidos. Mientras que Noise Injection fue diseñado precisamente para exponer al modelo a pequeñas perturbaciones alrededor de la trayectoria nominal, DAgger fue concebido para incorporar ejemplos de recuperación desde estados potencialmente más alejados de la distribución original.
Por tanto, una posible explicación de la superioridad observada de $D_{0.50}^{C}$ en el Test 4 es que el escenario de evaluación se asemeja más al proceso utilizado para generar el dataset Noise Injection que al procedimiento empleado para construir el dataset DAgger.
Como trabajo futuro se plantea repetir el Test 4 utilizando exactamente las mismas perturbaciones empleadas durante la generación del dataset DAgger. Esto permitirá determinar si las ventajas teóricas de DAgger aparecen con mayor claridad cuando las condiciones de evaluación coinciden con las condiciones bajo las cuales fueron recolectadas las muestras de recuperación.