Week 103 - Prueba rápida del Test 1 en Town11
Se actualizó Week 102 con nuevas métricas y cambios en el orden de las tablas.
1. Objetivo
Evaluar si las tendencias observadas previamente en Town02 se mantienen al trasladar los tests de robustez a Town11, un entorno con mayor densidad de curvas. El análisis considera el caso canónico, las variaciones en la posición y la velocidad inicial, y las perturbaciones aplicadas durante la inferencia.
Además, se estudia la generalización de las políticas en el mapa comunitario csonthomisi, cuya geometría no fue utilizada durante el entrenamiento. Ambos experimentos se analizan de forma independiente para distinguir la robustez dentro de un mapa conocido de la transferencia hacia un escenario nuevo.
2. Experimento 1 — Evaluación en Town11
2.1 Escenario de evaluación
Se seleccionó un recorrido corto de aproximadamente 1.5 km, con mayor densidad de curvas que el utilizado en Town02.
2.2 Configuración experimental
Respecto al Test 1 original, se introdujeron dos modificaciones en las condiciones iniciales:
- Cambio de escenario: Town02 → Town11.
- Incremento de la perturbación angular inicial en 15°, pasando de ±15° a ±30° respecto a la orientación nominal de la vía.
Se evaluaron 15 condiciones iniciales, resultado de combinar cinco desplazamientos laterales con tres orientaciones iniciales.
| Caso | Posición lateral | Offset (m) | X (m) | Y (m) | Z (m) | Yaw (°) |
|---|---|---|---|---|---|---|
| 1 | Duro Izquierda | +4.80 | 4802.80 | -5679.508 | 100.175 | 98.801 |
| 2 | Duro Izquierda | +4.80 | 4802.80 | -5679.508 | 100.175 | 128.801 |
| 3 | Duro Izquierda | +4.80 | 4802.80 | -5679.508 | 100.175 | 158.801 |
| 4 | Suave Izquierda | +2.40 | 4800.40 | -5679.508 | 100.175 | 98.801 |
| 5 | Suave Izquierda | +2.40 | 4800.40 | -5679.508 | 100.175 | 128.801 |
| 6 | Suave Izquierda | +2.40 | 4800.40 | -5679.508 | 100.175 | 158.801 |
| 7 | Centrado | 0.00 | 4798.00 | -5679.508 | 100.175 | 98.801 |
| 8 | Centrado | 0.00 | 4798.00 | -5679.508 | 100.175 | 128.801 |
| 9 | Centrado | 0.00 | 4798.00 | -5679.508 | 100.175 | 158.801 |
| 10 | Suave Derecha | −2.40 | 4795.60 | -5679.508 | 100.175 | 98.801 |
| 11 | Suave Derecha | −2.40 | 4795.60 | -5679.508 | 100.175 | 128.801 |
| 12 | Suave Derecha | −2.40 | 4795.60 | -5679.508 | 100.175 | 158.801 |
| 13 | Duro Derecha | −4.80 | 4793.20 | -5679.508 | 100.175 | 98.801 |
| 14 | Duro Derecha | −4.80 | 4793.20 | -5679.508 | 100.175 | 128.801 |
| 15 | Duro Derecha | −4.80 | 4793.20 | -5679.508 | 100.175 | 158.801 |
2.3 Resultados
Nota metodológica. Salvo Successful Runs, las métricas se calculan únicamente sobre los episodios exitosos. Por esta razón, las colisiones, invasiones de carril, velocidad y desviación deben interpretarse junto con la tasa de finalización de cada modelo.
| Modelo | Successful Runs | Collisions | Lane Inv. | Speed (km/h) | Mean Lateral Error (m) |
|---|---|---|---|---|---|
| Burbuja | 28/30 (93.3%) | 0.00 | 4.93 | 76.78 | 0.283 |
| DAgger 50% | 30/30 (100%) | 0.00 | 26.07 | 61.10 | 0.427 |
| Noise 50% | 30/30 (100%) | 0.00 | 6.93 | 65.95 | 0.199 |
Test 0 – Caso canónico
| Modelo | Successful Runs | Collisions | Lane Invasions | Speed (km/h) | Dev Mean (m) |
|---|---|---|---|---|---|
| $D^{A}$ | 100.0% (30/30) | 0.000 | 8.233 | 71.72 | 0.361 |
| $D_{0.15}^{B}$ | 100.0% (30/30) | 0.000 | 12.300 | 66.70 | 0.356 |
| $D_{0.30}^{B}$ | 100.0% (30/30) | 0.000 | 21.367 | 72.12 | 0.429 |
| $D_{0.50}^{B}$ | 96.7% (29/30) | 0.000 | 24.621 | 62.33 | 0.409 |
| $D_{0.75}^{B}$ | 100.0% (29/29) | 0.000 | 33.276 | 65.98 | 0.523 |
| $D_{0.15}^{C}$ | 100.0% (30/30) | 0.000 | 11.933 | 63.37 | 0.341 |
| $D_{0.30}^{C}$ | 96.7% (29/30) | 0.000 | 12.345 | 67.40 | 0.312 |
| $D_{0.50}^{C}$ | 100.0% (30/30) | 0.000 | 5.767 | 63.99 | 0.231 |
| $D_{0.75}^{C}$ | 100.0% (30/30) | 0.000 | 15.400 | 54.12 | 0.277 |
En el caso canónico, casi todas las configuraciones completan la totalidad de los recorridos y no se registran colisiones. En DAgger, las invasiones de carril crecen conforme aumenta la proporción de datos perturbados, mientras que las mezclas más altas mantienen una desviación elevada sin aportar una mejora equivalente en la tasa de éxito.
Noise Injection mantiene tasas de finalización altas y un seguimiento lateral más preciso. En particular, $D_{0.50}^{C}$ presenta el mejor compromiso del test, con 100 % de éxito, 5.767 invasiones de carril y una desviación media de 0.231 m. El aumento hasta 75 % conserva la tasa de éxito, pero no mejora estas métricas y reduce la velocidad media, lo que sugiere que una mayor proporción de datos perturbados no aporta beneficios adicionales en condiciones nominales.
Test 1 – Diferentes posiciones de inicio
| Modelo | Successful Runs | Collisions | Lane Invasions | Speed (km/h) | Dev Mean (m) |
|---|---|---|---|---|---|
| $D^{A}$ | 93.3% (28/30) | 0.000 | 4.929 | 76.78 | 0.289 |
| $D_{0.30}^{B}$ | 100.0% (30/30) | 0.000 | 27.067 | 61.02 | 0.427 |
| $D_{0.50}^{B}$ | 100.0% (30/30) | 0.000 | 26.067 | 61.10 | 0.415 |
| $D_{0.75}^{B}$ | 100.0% (30/30) | 0.000 | 34.300 | 62.06 | 0.546 |
| $D_{0.30}^{C}$ | 100.0% (30/30) | 0.000 | 13.567 | 66.89 | 0.321 |
| $D_{0.50}^{C}$ | 100.0% (30/30) | 0.000 | 7.172 | 65.95 | 0.228 |
| $D_{0.75}^{C}$ | 93.1% (27/29) | 0.000 | 15.481 | 55.66 | 0.299 |
Frente a las posiciones y orientaciones iniciales perturbadas, $D^{A}$ reduce su tasa de éxito a 93.3 %, aunque conserva pocas invasiones de carril y la mayor velocidad media. Las configuraciones DAgger evaluadas completan todas las ejecuciones, lo que sugiere una mayor capacidad de recuperación, pero presentan entre 26.067 y 34.300 invasiones y una desviación superior a la de Burbuja.
Noise Injection ofrece un mejor compromiso entre recuperación y precisión. $D_{0.30}^{C}$ y $D_{0.50}^{C}$ alcanzan 100 % de éxito, mientras que $D_{0.50}^{C}$ reduce las invasiones a 7.172 y obtiene una desviación de 0.228 m. Al aumentar la proporción a 75 %, la tasa de éxito cae a 93.1 %, por lo que la mejora no es monotónica.
Test 2 – Diferentes sectores de inicio
Pendiente de ejecución. En Town11, al tratarse de una trayectoria abierta, el Test 2 utilizará tres posiciones iniciales diferentes y recorridos de igual longitud (~700 m), con 10 ejecuciones por posición y por modelo, para un total de 30 episodios por configuración.
Test 3 – Diferentes velocidades iniciales
| Modelo | Successful Runs | Collisions | Lane Invasions | Speed (km/h) | Dev Mean (m) |
|---|---|---|---|---|---|
| $D^{A}$ | 64.3% (18/28) | 0.000 | 7.278 | 75.54 | 0.314 |
| $D_{0.15}^{B}$ | 85.7% (24/28) | 0.000 | 14.333 | 67.87 | 0.338 |
| $D_{0.30}^{B}$ | 96.4% (27/28) | 0.000 | 23.593 | 74.95 | 0.474 |
| $D_{0.50}^{B}$ | 100.0% (28/28) | 0.000 | 28.250 | 63.59 | 0.425 |
| $D_{0.75}^{B}$ | 96.4% (27/28) | 0.000 | 33.667 | 65.82 | 0.520 |
| $D_{0.15}^{C}$ | 77.8% (21/27) | 0.000 | 12.238 | 65.97 | 0.317 |
| $D_{0.30}^{C}$ | 57.1% (16/28) | 0.000 | 13.625 | 69.04 | 0.296 |
| $D_{0.50}^{C}$ | 82.1% (23/28) | 0.000 | 6.957 | 66.78 | 0.222 |
| $D_{0.75}^{C}$ | 59.3% (16/27) | 0.000 | 17.000 | 56.52 | 0.292 |
Las distintas velocidades iniciales reducen el éxito de $D^{A}$ a 64.3 %. DAgger mejora progresivamente la tasa de finalización hasta $D_{0.50}^{B}$, que completa 28/28 ejecuciones; sin embargo, esta mejora coincide con más invasiones de carril y mayor desviación lateral. Con 75 % de DAgger, la tasa de éxito deja de aumentar y las métricas laterales vuelven a degradarse.
Noise Injection muestra tasas de éxito menores que las mejores configuraciones DAgger, pero mayor precisión en los episodios completados. $D_{0.50}^{C}$ presenta el mejor seguimiento lateral, con 6.957 invasiones y 0.222 m de desviación, aunque finaliza 82.1 % de las ejecuciones. Por tanto, el test muestra un compromiso entre la capacidad de completar el recorrido y la precisión de trayectoria; una menor desviación entre episodios exitosos no implica por sí sola una robustez global superior.
Test 4 – Perturbación online
| Modelo | Successful Runs | Collisions | Lane Invasions | Speed (km/h) | Dev Mean (m) |
|---|---|---|---|---|---|
| $D^{A}$ | 0.0% (0/30) | — | — | — | — |
| $D_{0.15}^{B}$ | 83.3% (25/30) | 0.000 | 29.080 | 46.91 | 0.365 |
| $D_{0.30}^{B}$ | 90.0% (27/30) | 0.000 | 28.778 | 57.46 | 0.434 |
| $D_{0.50}^{B}$ | 96.7% (29/30) | 0.000 | 31.069 | 54.32 | 0.426 |
| $D_{0.75}^{B}$ | 73.3% (22/30) | 0.000 | 47.500 | 57.24 | 0.506 |
| $D_{0.15}^{C}$ | 0.0% (0/30) | — | — | — | — |
| $D_{0.30}^{C}$ | 70.0% (21/30) | 0.000 | 22.143 | 61.20 | 0.328 |
| $D_{0.50}^{C}$ | 100.0% (30/30) | 0.000 | 19.167 | 57.46 | 0.228 |
| $D_{0.75}^{C}$ | 73.3% (22/30) | 0.000 | 25.409 | 50.94 | 0.285 |
La perturbación online resulta especialmente exigente para las configuraciones sin suficiente capacidad de recuperación: $D^{A}$ y $D_{0.15}^{C}$ no completan ninguna de las 30 ejecuciones. Dentro de DAgger, $D_{0.50}^{B}$ alcanza la mayor tasa de éxito (96.7 %), mientras que aumentar la mezcla a 75 % produce una degradación en finalización, invasiones de carril y desviación.
$D_{0.50}^{C}$ presenta el mejor compromiso global del test: completa las 30 ejecuciones y obtiene menos invasiones de carril y menor desviación que las configuraciones DAgger. Las proporciones de 30 % y 75 % de Noise Injection mantienen métricas laterales relativamente bajas entre los episodios exitosos, pero solo alcanzan 70.0 % y 73.3 % de éxito. No se registran colisiones en ninguna de las configuraciones que completan episodios.
2.4 Discusión general de Town11
En Town11, $D^{A}$ conserva un desempeño sólido en el caso canónico, pero pierde capacidad de finalización ante cambios en la posición, la velocidad inicial y, especialmente, bajo perturbación online. Las configuraciones DAgger mejoran la recuperación y alcanzan las mayores tasas de éxito en varios escenarios exigentes, aunque este comportamiento suele estar acompañado por más invasiones de carril y mayor desviación.
Noise Injection, particularmente $D_{0.50}^{C}$, presenta el mejor compromiso entre robustez y precisión lateral: mantiene 100 % de éxito en los Tests 0, 1 y 4, y obtiene las menores desviaciones en los cuatro tests ejecutados. No obstante, en el Test 3 su tasa de finalización es inferior a la de varias mezclas DAgger. En conjunto, los resultados sugieren que DAgger favorece la recuperación, mientras que una proporción intermedia de Noise Injection combina mejor la finalización con un seguimiento preciso. El Test 2 permanece pendiente y no se incluye en esta interpretación.
3. Experimento 2 — Generalización en el mapa csonthomisi
3.1 Motivación
Evaluar la capacidad de generalización de las políticas aprendidas en un escenario completamente ajeno a los mapas oficiales distribuidos con CARLA, con el fin de aislar la capacidad de transferencia del modelo frente a una geometría vial no vista durante el entrenamiento.
3.2 Escenario de evaluación
Se utilizó el mapa comunitario csonthomisi, publicado originalmente con el nombre Example_2 en el repositorio CARLA_Custom_Maps. El escenario cuenta con una red OpenDRIVE de 452 waypoints y dos puntos de aparición.
Fuente y autoría. El mapa fue creado y compartido por csonthomisi, desarrollador de la comunidad de CARLA. Su perfil público de GitHub incluye proyectos relacionados con mapas personalizados para CARLA, desarrollo sobre el simulador y modelado vehicular. El recurso utilizado fue tomado del repositorio csonthomisi/CARLA_Custom_Maps, donde aparece publicado originalmente como
Example_2.
Características del circuito, en contraste con Town04:
- Un único carril.
- Superficie completamente plana.
- Sin obstáculos ni elementos generadores de colisiones.
- Delimitado exclusivamente por líneas continuas.
- Geometría con forma aproximada de la letra “C”.
Estas características permiten centrar la evaluación en la capacidad de seguimiento de carril y recuperación de trayectoria, minimizando la influencia de otros factores del entorno (intersecciones, tráfico, elevación, obstáculos).
3.3 Configuración experimental
Debido a las características del circuito, el protocolo se adaptó respecto al Test 1: en lugar de quince posiciones iniciales sobre múltiples carriles, se definieron nueve condiciones iniciales, combinando tres posiciones longitudinales con tres orientaciones iniciales por posición.
Tomando como orientación nominal del carril 95.11°:
| Posición angular | Orientación |
|---|---|
| Izquierda | 65.11° |
| Centro | 95.11° |
| Derecha | 125.11° |
Cada una de las nueve condiciones iniciales se repitió múltiples veces por modelo, siguiendo el mismo procedimiento de los experimentos anteriores.
Justificación: este experimento no busca aumentar la dificultad del entorno, sino evaluar la capacidad de transferencia de las políticas a un mapa completamente diferente al de entrenamiento. Al eliminar intersecciones, tráfico, cambios de elevación y obstáculos, las diferencias entre modelos pueden atribuirse principalmente a su capacidad de mantener la trayectoria y recuperarse de errores de orientación inicial en una geometría no vista previamente.
3.4 Resultados
Test 0 – Caso canónico
| Modelo | Successful Runs | Collisions | Lane Invasions | Speed (km/h) | Dev Mean (m) |
|---|---|---|---|---|---|
| $D^{A}$ | 0.0% (0/24) | — | — | — | — |
| $D_{0.15}^{B}$ | 31.8% (7/22) | 0.000 | 31.714 | 45.62 | 0.361 |
| $D_{0.30}^{B}$ | 84.0% (21/25) | 0.000 | 42.619 | 29.28 | 0.424 |
| $D_{0.50}^{B}$ | 84.0% (21/25) | 0.000 | 32.571 | 40.37 | 0.400 |
| $D_{0.75}^{B}$ | 80.0% (20/25) | 0.000 | 57.000 | 34.55 | 0.459 |
| $D_{0.15}^{C}$ | 29.2% (7/24) | 0.000 | 41.143 | 48.09 | 0.509 |
| $D_{0.30}^{C}$ | 20.0% (5/25) | 0.000 | 40.200 | 43.99 | 0.459 |
| $D_{0.50}^{C}$ | 84.0% (21/25) | 0.000 | 32.571 | 43.12 | 0.419 |
| $D_{0.75}^{C}$ | 95.8% (23/24) | 0.000 | 29.391 | 39.73 | 0.364 |
| $D^{M}_{30/30/40}$ | 96.0% (24/25) | 0.000 | 38.833 | 39.32 | 0.436 |
El caso canónico ya representa una dificultad importante de transferencia: $D^{A}$ no completa ninguna ejecución y las mezclas con 15 % de datos perturbados mantienen tasas de éxito cercanas al 30 %. DAgger mejora al utilizar proporciones de 30–50 %, ambas con 84.0 % de éxito, mientras que 75 % incrementa notablemente las invasiones de carril y no mejora la finalización.
En Noise Injection se observa una diferencia marcada entre proporciones: 15–30 % ofrecen poca capacidad de generalización, mientras que $D_{0.75}^{C}$ alcanza 95.8 % de éxito y presenta menos invasiones que las configuraciones DAgger de alto desempeño. $D^{M}{30/30/40}$ obtiene la mayor tasa de éxito, con 96.0 %, aunque su desviación e invasiones son superiores a las de $D{0.75}^{C}$. Por tanto, Magic Mix destaca en finalización y Noise Injection 75 % presenta el mejor compromiso lateral entre las configuraciones con mayor éxito.
Test 1 – Diferentes posiciones de inicio
| Modelo | Successful Runs | Collisions | Lane Invasions | Speed (km/h) | Dev Mean (m) |
|---|---|---|---|---|---|
| $D^{A}$ | 7.7% (2/26) | 0.000 | 36.000 | 52.31 | 0.515 |
| $D_{0.15}^{B}$ | 26.9% (7/26) | 0.000 | 32.857 | 45.56 | 0.347 |
| $D_{0.30}^{B}$ | 81.5% (22/27) | 0.000 | 42.955 | 28.32 | 0.437 |
| $D_{0.50}^{B}$ | 77.8% (21/27) | 0.000 | 37.143 | 40.50 | 0.403 |
| $D_{0.75}^{B}$ | 91.3% (21/23) | 0.000 | 62.095 | 35.23 | 0.455 |
| $D_{0.15}^{C}$ | 20.8% (5/24) | 0.000 | 43.400 | 46.11 | 0.527 |
| $D_{0.30}^{C}$ | 33.3% (9/27) | 0.000 | 39.778 | 43.97 | 0.445 |
| $D_{0.50}^{C}$ | 88.9% (24/27) | 0.000 | 36.583 | 41.88 | 0.419 |
| $D_{0.75}^{C}$ | 96.3% (26/27) | 0.000 | 30.923 | 39.46 | 0.378 |
| $D^{M}_{30/30/40}$ | 96.3% (26/27) | 0.000 | 42.308 | 38.24 | 0.439 |
Las posiciones iniciales perturbadas acentúan la dificultad de generalización de $D^{A}$, que completa 2 de 26 ejecuciones. En DAgger, las proporciones de 30–75 % superan claramente a $D_{0.15}^{B}$ y la mayor tasa de éxito corresponde a $D_{0.75}^{B}$, con 91.3 %. Sin embargo, esta configuración también registra el mayor número de invasiones de carril del test. Esto sugiere una mayor capacidad de finalización, aunque con menor estabilidad lateral.
Noise Injection también mejora con proporciones altas. $D_{0.75}^{C}$ y $D^{M}{30/30/40}$ alcanzan 96.3 % de éxito, pero $D{0.75}^{C}$ presenta menos invasiones y menor desviación. En esta evaluación, $D_{0.75}^{C}$ ofrece el mejor compromiso entre generalización, recuperación inicial y precisión de trayectoria; la velocidad se interpreta solo como un indicador complementario.
Test 2 – Diferentes puntos de inicio
| Modelo | Successful Runs | Collisions | Lane Invasions | Speed (km/h) | Dev Mean (m) |
|---|---|---|---|---|---|
| $D^{A}$ | 33.3% (10/30) | 0.000 | 27.100 | 51.96 | 0.486 |
| $D_{0.15}^{B}$ | 39.1% (9/23) | 0.000 | 32.333 | 48.82 | 0.452 |
| $D_{0.30}^{B}$ | 10.0% (3/30) | 0.000 | 40.667 | 29.36 | 0.432 |
| $D_{0.50}^{B}$ | 42.9% (12/28) | 0.000 | 28.917 | 41.07 | 0.387 |
| $D_{0.75}^{B}$ | 30.0% (9/30) | 0.000 | 60.111 | 35.42 | 0.460 |
| $D_{0.15}^{C}$ | 38.1% (8/21) | 0.000 | 37.625 | 47.41 | 0.477 |
| $D_{0.30}^{C}$ | 20.8% (5/24) | 0.000 | 34.200 | 43.47 | 0.390 |
| $D_{0.50}^{C}$ | 53.3% (16/30) | 0.000 | 31.812 | 42.39 | 0.401 |
| $D_{0.75}^{C}$ | 32.1% (9/28) | 0.000 | 29.556 | 39.15 | 0.361 |
El Test 2 es el escenario más difícil de csonthomisi: ninguna configuración supera 53.3 % de éxito. $D_{0.50}^{C}$ obtiene la mayor tasa de finalización, seguida por $D_{0.50}^{B}$ con 42.9 %. Las mezclas de 50 % presentan así el comportamiento más consistente dentro de cada estrategia, aunque la diferencia entre ambas es moderada y no permite establecer una ventaja general para Noise Injection.
Entre los episodios exitosos, $D_{0.50}^{B}$ registra menos invasiones y una desviación ligeramente menor que $D_{0.50}^{C}$. $D_{0.75}^{C}$ alcanza la menor desviación global, pero solo completa 32.1 % de las ejecuciones; por ello, su precisión lateral no debe interpretarse como un mejor desempeño total. Los resultados sugieren que cambiar el sector de inicio sigue siendo un reto importante para todas las políticas.
Test 3 – Diferentes velocidades iniciales
| Modelo | Successful Runs | Collisions | Lane Invasions | Speed (km/h) | Dev Mean (m) |
|---|---|---|---|---|---|
| $D^{A}$ | 16.7% (4/24) | 0.000 | 26.000 | 48.16 | 0.500 |
| $D_{0.15}^{B}$ | 70.8% (17/24) | 0.000 | 18.412 | 43.42 | 0.306 |
| $D_{0.30}^{B}$ | 91.7% (22/24) | 0.000 | 34.091 | 27.70 | 0.360 |
| $D_{0.50}^{B}$ | 87.0% (20/23) | 0.000 | 25.500 | 39.98 | 0.378 |
| $D_{0.75}^{B}$ | 73.9% (17/23) | 0.000 | 44.294 | 30.90 | 0.478 |
| $D_{0.15}^{C}$ | 42.1% (8/19) | 0.000 | 32.375 | 44.73 | 0.498 |
| $D_{0.30}^{C}$ | 61.1% (11/18) | 0.000 | 31.727 | 41.96 | 0.442 |
| $D_{0.50}^{C}$ | 82.6% (19/23) | 0.000 | 26.211 | 44.56 | 0.432 |
| $D_{0.75}^{C}$ | 95.8% (23/24) | 0.000 | 28.826 | 41.15 | 0.378 |
Los cambios en la velocidad inicial reducen la tasa de éxito de $D^{A}$ a 16.7 %, lo que sugiere dificultades para transferir la política base a estados dinámicos no vistos en este mapa. DAgger mejora claramente la finalización y alcanza su mejor resultado con $D_{0.30}^{B}$ (91.7 %); al aumentar la proporción a 50 % y 75 %, la tasa de éxito disminuye y, en 75 %, también empeoran las invasiones y la desviación.
En Noise Injection se observa la tendencia opuesta: la tasa de éxito aumenta con la proporción hasta llegar a 95.8 % con $D_{0.75}^{C}$. Esta configuración mantiene valores intermedios de invasiones y desviación, mientras que algunas mezclas con menor error, como $D_{0.15}^{B}$, completan menos episodios. Los resultados sugieren que $D_{0.75}^{C}$ ofrece el mejor compromiso global para generalizar frente a variaciones del estado dinámico inicial.
Test 4 – Perturbación online
| Modelo | Successful Runs | Collisions | Lane Invasions | Speed (km/h) | Dev Mean (m) |
|---|---|---|---|---|---|
| $D_{0.15}^{B}$ | 65.5% (19/29) | 0.000 | 38.632 | 42.63 | 0.377 |
| $D_{0.30}^{B}$ | 76.7% (23/30) | 0.000 | 52.609 | 27.82 | 0.450 |
| $D_{0.50}^{B}$ | 96.6% (28/29) | 0.000 | 37.500 | 37.49 | 0.395 |
| $D_{0.15}^{C}$ | 33.3% (10/30) | 0.000 | 49.300 | 44.31 | 0.516 |
| $D_{0.30}^{C}$ | 31.0% (9/29) | 0.000 | 50.667 | 42.12 | 0.441 |
| $D_{0.50}^{C}$ | 79.3% (23/29) | 0.000 | 39.435 | 40.32 | 0.421 |
En perturbación online, DAgger mantiene una mayor tasa de éxito que Noise Injection para las proporciones comparables. $D_{0.50}^{B}$ alcanza 96.6 % de finalización, frente a 79.3 % de $D_{0.50}^{C}$, y además presenta valores ligeramente menores de invasiones y desviación. Entre las configuraciones disponibles, $D_{0.50}^{B}$ ofrece el mejor compromiso para recuperarse de perturbaciones recurrentes en el mapa no visto.
Las proporciones de 15–30 % de Noise Injection muestran una degradación clara, con tasas de éxito de 33.3 % y 31.0 % y un número elevado de invasiones. No se registran colisiones, algo coherente con un escenario sin obstáculos, por lo que la comparación depende principalmente de la finalización y del seguimiento lateral.
Observaciones generales
Los cinco tests muestran que csonthomisi exige una capacidad de transferencia que $D^{A}$ no mantiene de forma consistente. DAgger favorece la recuperación, especialmente con proporciones de 30–50 %, y $D_{0.50}^{B}$ destaca bajo perturbación online. Su principal limitación es el aumento de invasiones de carril en varias configuraciones, particularmente cuando DAgger alcanza 75 %.
Noise Injection presenta un comportamiento más dependiente de la proporción y del test. $D_{0.75}^{C}$ obtiene tasas de éxito altas en los Tests 0, 1 y 3, con un seguimiento lateral competitivo, mientras que $D_{0.50}^{C}$ lidera el Test 2. Magic Mix alcanza las mejores tasas de finalización en los Tests 0 y 1, pero no dispone de resultados en los Tests 2–4 y muestra menor precisión lateral que $D_{0.75}^{C}$ en las comparaciones disponibles. En conjunto, los resultados sugieren que DAgger favorece la recuperación ante perturbaciones recurrentes y que Noise Injection en proporciones altas puede favorecer la transferencia y la precisión, aunque ninguna estrategia domina todos los escenarios.
4. Gráficos
5. Conclusiones generales
-
Burbuja ($D^{A}$) mantiene un desempeño sólido en el caso canónico de Town11, pero su tasa de éxito disminuye al cambiar la posición o la velocidad inicial y llega a 0/30 bajo perturbación online. En csonthomisi también presenta tasas de finalización bajas, lo que sugiere una capacidad limitada para transferirse a geometrías y condiciones alejadas del dominio nominal.
-
DAgger ($D_{\alpha}^{B}$) favorece la recuperación y alcanza tasas de éxito altas en los escenarios exigentes de Town11. En csonthomisi, $D_{0.50}^{B}$ destaca bajo perturbación online. Sin embargo, esta mejora suele estar acompañada por más invasiones de carril y mayor desviación, especialmente con proporciones elevadas.
-
Noise Injection ($D_{\alpha}^{C}$) presenta el mejor compromiso entre finalización y precisión en Town11 con $D_{0.50}^{C}$. En csonthomisi, $D_{0.75}^{C}$ obtiene resultados competitivos en los Tests 0, 1 y 3, pero su comportamiento no es uniforme en todos los escenarios y DAgger conserva una ventaja en el Test 4.
-
**Magic Mix ($D^{M}{30/30/40}$)** alcanza tasas de éxito altas en los Tests 0 y 1 de csonthomisi, aunque con menor precisión lateral que $D{0.75}^{C}$ en esas comparaciones. Al no disponer de resultados para los Tests 2–4, todavía no es posible establecer si ofrece un equilibrio consistente entre ambas estrategias.
En conjunto, los resultados permiten mantener, como interpretación preliminar, dos componentes complementarias de la robustez:
\[\boxed{ \text{Robustez Local} \quad+\quad \text{Robustez de Recuperación} }\]donde:
- La robustez local está asociada con la capacidad de la política para tolerar pequeñas desviaciones alrededor de la distribución de entrenamiento.
- La robustez de recuperación está asociada con la capacidad de retornar a estados seguros cuando el vehículo alcanza configuraciones significativamente fuera de distribución.
DAgger parece favorecer principalmente la segunda componente, mientras que Noise Injection puede mejorar la precisión y la estabilidad local en proporciones adecuadas. No obstante, el comportamiento depende del mapa, del tipo de perturbación y de la composición del dataset, por lo que esta separación no constituye una demostración definitiva ni implica que una estrategia sea superior en todos los escenarios.