16 minute read

Se actualizó Week 102 con nuevas métricas y cambios en el orden de las tablas.

1. Objetivo

Evaluar si las tendencias observadas previamente en Town02 se mantienen al trasladar los tests de robustez a Town11, un entorno con mayor densidad de curvas. El análisis considera el caso canónico, las variaciones en la posición y la velocidad inicial, y las perturbaciones aplicadas durante la inferencia.

Además, se estudia la generalización de las políticas en el mapa comunitario csonthomisi, cuya geometría no fue utilizada durante el entrenamiento. Ambos experimentos se analizan de forma independiente para distinguir la robustez dentro de un mapa conocido de la transferencia hacia un escenario nuevo.


2. Experimento 1 — Evaluación en Town11

2.1 Escenario de evaluación

Se seleccionó un recorrido corto de aproximadamente 1.5 km, con mayor densidad de curvas que el utilizado en Town02.

Town11
Recorrido corto utilizado para la evaluación de robustez en Town11.

2.2 Configuración experimental

Respecto al Test 1 original, se introdujeron dos modificaciones en las condiciones iniciales:

  1. Cambio de escenario: Town02 → Town11.
  2. Incremento de la perturbación angular inicial en 15°, pasando de ±15° a ±30° respecto a la orientación nominal de la vía.

Se evaluaron 15 condiciones iniciales, resultado de combinar cinco desplazamientos laterales con tres orientaciones iniciales.

Caso Posición lateral Offset (m) X (m) Y (m) Z (m) Yaw (°)
1 Duro Izquierda +4.80 4802.80 -5679.508 100.175 98.801
2 Duro Izquierda +4.80 4802.80 -5679.508 100.175 128.801
3 Duro Izquierda +4.80 4802.80 -5679.508 100.175 158.801
4 Suave Izquierda +2.40 4800.40 -5679.508 100.175 98.801
5 Suave Izquierda +2.40 4800.40 -5679.508 100.175 128.801
6 Suave Izquierda +2.40 4800.40 -5679.508 100.175 158.801
7 Centrado 0.00 4798.00 -5679.508 100.175 98.801
8 Centrado 0.00 4798.00 -5679.508 100.175 128.801
9 Centrado 0.00 4798.00 -5679.508 100.175 158.801
10 Suave Derecha −2.40 4795.60 -5679.508 100.175 98.801
11 Suave Derecha −2.40 4795.60 -5679.508 100.175 128.801
12 Suave Derecha −2.40 4795.60 -5679.508 100.175 158.801
13 Duro Derecha −4.80 4793.20 -5679.508 100.175 98.801
14 Duro Derecha −4.80 4793.20 -5679.508 100.175 128.801
15 Duro Derecha −4.80 4793.20 -5679.508 100.175 158.801
car_rotation
Orientaciones iniciales utilizadas. La perturbación angular se incrementó de ±15° a ±30° respecto al Test 1 original.

2.3 Resultados

Nota metodológica. Salvo Successful Runs, las métricas se calculan únicamente sobre los episodios exitosos. Por esta razón, las colisiones, invasiones de carril, velocidad y desviación deben interpretarse junto con la tasa de finalización de cada modelo.

Modelo Successful Runs Collisions Lane Inv. Speed (km/h) Mean Lateral Error (m)
Burbuja 28/30 (93.3%) 0.00 4.93 76.78 0.283
DAgger 50% 30/30 (100%) 0.00 26.07 61.10 0.427
Noise 50% 30/30 (100%) 0.00 6.93 65.95 0.199

Test 0 – Caso canónico

Modelo Successful Runs Collisions Lane Invasions Speed (km/h) Dev Mean (m)
$D^{A}$ 100.0% (30/30) 0.000 8.233 71.72 0.361
$D_{0.15}^{B}$ 100.0% (30/30) 0.000 12.300 66.70 0.356
$D_{0.30}^{B}$ 100.0% (30/30) 0.000 21.367 72.12 0.429
$D_{0.50}^{B}$ 96.7% (29/30) 0.000 24.621 62.33 0.409
$D_{0.75}^{B}$ 100.0% (29/29) 0.000 33.276 65.98 0.523
$D_{0.15}^{C}$ 100.0% (30/30) 0.000 11.933 63.37 0.341
$D_{0.30}^{C}$ 96.7% (29/30) 0.000 12.345 67.40 0.312
$D_{0.50}^{C}$ 100.0% (30/30) 0.000 5.767 63.99 0.231
$D_{0.75}^{C}$ 100.0% (30/30) 0.000 15.400 54.12 0.277

En el caso canónico, casi todas las configuraciones completan la totalidad de los recorridos y no se registran colisiones. En DAgger, las invasiones de carril crecen conforme aumenta la proporción de datos perturbados, mientras que las mezclas más altas mantienen una desviación elevada sin aportar una mejora equivalente en la tasa de éxito.

Noise Injection mantiene tasas de finalización altas y un seguimiento lateral más preciso. En particular, $D_{0.50}^{C}$ presenta el mejor compromiso del test, con 100 % de éxito, 5.767 invasiones de carril y una desviación media de 0.231 m. El aumento hasta 75 % conserva la tasa de éxito, pero no mejora estas métricas y reduce la velocidad media, lo que sugiere que una mayor proporción de datos perturbados no aporta beneficios adicionales en condiciones nominales.

Test 1 – Diferentes posiciones de inicio

Modelo Successful Runs Collisions Lane Invasions Speed (km/h) Dev Mean (m)
$D^{A}$ 93.3% (28/30) 0.000 4.929 76.78 0.289
$D_{0.30}^{B}$ 100.0% (30/30) 0.000 27.067 61.02 0.427
$D_{0.50}^{B}$ 100.0% (30/30) 0.000 26.067 61.10 0.415
$D_{0.75}^{B}$ 100.0% (30/30) 0.000 34.300 62.06 0.546
$D_{0.30}^{C}$ 100.0% (30/30) 0.000 13.567 66.89 0.321
$D_{0.50}^{C}$ 100.0% (30/30) 0.000 7.172 65.95 0.228
$D_{0.75}^{C}$ 93.1% (27/29) 0.000 15.481 55.66 0.299

Frente a las posiciones y orientaciones iniciales perturbadas, $D^{A}$ reduce su tasa de éxito a 93.3 %, aunque conserva pocas invasiones de carril y la mayor velocidad media. Las configuraciones DAgger evaluadas completan todas las ejecuciones, lo que sugiere una mayor capacidad de recuperación, pero presentan entre 26.067 y 34.300 invasiones y una desviación superior a la de Burbuja.

Noise Injection ofrece un mejor compromiso entre recuperación y precisión. $D_{0.30}^{C}$ y $D_{0.50}^{C}$ alcanzan 100 % de éxito, mientras que $D_{0.50}^{C}$ reduce las invasiones a 7.172 y obtiene una desviación de 0.228 m. Al aumentar la proporción a 75 %, la tasa de éxito cae a 93.1 %, por lo que la mejora no es monotónica.

Test 2 – Diferentes sectores de inicio

Pendiente de ejecución. En Town11, al tratarse de una trayectoria abierta, el Test 2 utilizará tres posiciones iniciales diferentes y recorridos de igual longitud (~700 m), con 10 ejecuciones por posición y por modelo, para un total de 30 episodios por configuración.

Test 3 – Diferentes velocidades iniciales

Modelo Successful Runs Collisions Lane Invasions Speed (km/h) Dev Mean (m)
$D^{A}$ 64.3% (18/28) 0.000 7.278 75.54 0.314
$D_{0.15}^{B}$ 85.7% (24/28) 0.000 14.333 67.87 0.338
$D_{0.30}^{B}$ 96.4% (27/28) 0.000 23.593 74.95 0.474
$D_{0.50}^{B}$ 100.0% (28/28) 0.000 28.250 63.59 0.425
$D_{0.75}^{B}$ 96.4% (27/28) 0.000 33.667 65.82 0.520
$D_{0.15}^{C}$ 77.8% (21/27) 0.000 12.238 65.97 0.317
$D_{0.30}^{C}$ 57.1% (16/28) 0.000 13.625 69.04 0.296
$D_{0.50}^{C}$ 82.1% (23/28) 0.000 6.957 66.78 0.222
$D_{0.75}^{C}$ 59.3% (16/27) 0.000 17.000 56.52 0.292

Las distintas velocidades iniciales reducen el éxito de $D^{A}$ a 64.3 %. DAgger mejora progresivamente la tasa de finalización hasta $D_{0.50}^{B}$, que completa 28/28 ejecuciones; sin embargo, esta mejora coincide con más invasiones de carril y mayor desviación lateral. Con 75 % de DAgger, la tasa de éxito deja de aumentar y las métricas laterales vuelven a degradarse.

Noise Injection muestra tasas de éxito menores que las mejores configuraciones DAgger, pero mayor precisión en los episodios completados. $D_{0.50}^{C}$ presenta el mejor seguimiento lateral, con 6.957 invasiones y 0.222 m de desviación, aunque finaliza 82.1 % de las ejecuciones. Por tanto, el test muestra un compromiso entre la capacidad de completar el recorrido y la precisión de trayectoria; una menor desviación entre episodios exitosos no implica por sí sola una robustez global superior.

Test 4 – Perturbación online

Modelo Successful Runs Collisions Lane Invasions Speed (km/h) Dev Mean (m)
$D^{A}$ 0.0% (0/30)
$D_{0.15}^{B}$ 83.3% (25/30) 0.000 29.080 46.91 0.365
$D_{0.30}^{B}$ 90.0% (27/30) 0.000 28.778 57.46 0.434
$D_{0.50}^{B}$ 96.7% (29/30) 0.000 31.069 54.32 0.426
$D_{0.75}^{B}$ 73.3% (22/30) 0.000 47.500 57.24 0.506
$D_{0.15}^{C}$ 0.0% (0/30)
$D_{0.30}^{C}$ 70.0% (21/30) 0.000 22.143 61.20 0.328
$D_{0.50}^{C}$ 100.0% (30/30) 0.000 19.167 57.46 0.228
$D_{0.75}^{C}$ 73.3% (22/30) 0.000 25.409 50.94 0.285

La perturbación online resulta especialmente exigente para las configuraciones sin suficiente capacidad de recuperación: $D^{A}$ y $D_{0.15}^{C}$ no completan ninguna de las 30 ejecuciones. Dentro de DAgger, $D_{0.50}^{B}$ alcanza la mayor tasa de éxito (96.7 %), mientras que aumentar la mezcla a 75 % produce una degradación en finalización, invasiones de carril y desviación.

$D_{0.50}^{C}$ presenta el mejor compromiso global del test: completa las 30 ejecuciones y obtiene menos invasiones de carril y menor desviación que las configuraciones DAgger. Las proporciones de 30 % y 75 % de Noise Injection mantienen métricas laterales relativamente bajas entre los episodios exitosos, pero solo alcanzan 70.0 % y 73.3 % de éxito. No se registran colisiones en ninguna de las configuraciones que completan episodios.

2.4 Discusión general de Town11

En Town11, $D^{A}$ conserva un desempeño sólido en el caso canónico, pero pierde capacidad de finalización ante cambios en la posición, la velocidad inicial y, especialmente, bajo perturbación online. Las configuraciones DAgger mejoran la recuperación y alcanzan las mayores tasas de éxito en varios escenarios exigentes, aunque este comportamiento suele estar acompañado por más invasiones de carril y mayor desviación.

Noise Injection, particularmente $D_{0.50}^{C}$, presenta el mejor compromiso entre robustez y precisión lateral: mantiene 100 % de éxito en los Tests 0, 1 y 4, y obtiene las menores desviaciones en los cuatro tests ejecutados. No obstante, en el Test 3 su tasa de finalización es inferior a la de varias mezclas DAgger. En conjunto, los resultados sugieren que DAgger favorece la recuperación, mientras que una proporción intermedia de Noise Injection combina mejor la finalización con un seguimiento preciso. El Test 2 permanece pendiente y no se incluye en esta interpretación.


3. Experimento 2 — Generalización en el mapa csonthomisi

3.1 Motivación

Evaluar la capacidad de generalización de las políticas aprendidas en un escenario completamente ajeno a los mapas oficiales distribuidos con CARLA, con el fin de aislar la capacidad de transferencia del modelo frente a una geometría vial no vista durante el entrenamiento.

3.2 Escenario de evaluación

Mapa comunitario csonthomisi
Mapa comunitario csonthomisi.

Se utilizó el mapa comunitario csonthomisi, publicado originalmente con el nombre Example_2 en el repositorio CARLA_Custom_Maps. El escenario cuenta con una red OpenDRIVE de 452 waypoints y dos puntos de aparición.

Fuente y autoría. El mapa fue creado y compartido por csonthomisi, desarrollador de la comunidad de CARLA. Su perfil público de GitHub incluye proyectos relacionados con mapas personalizados para CARLA, desarrollo sobre el simulador y modelado vehicular. El recurso utilizado fue tomado del repositorio csonthomisi/CARLA_Custom_Maps, donde aparece publicado originalmente como Example_2.

Características del circuito, en contraste con Town04:

  • Un único carril.
  • Superficie completamente plana.
  • Sin obstáculos ni elementos generadores de colisiones.
  • Delimitado exclusivamente por líneas continuas.
  • Geometría con forma aproximada de la letra “C”.

Estas características permiten centrar la evaluación en la capacidad de seguimiento de carril y recuperación de trayectoria, minimizando la influencia de otros factores del entorno (intersecciones, tráfico, elevación, obstáculos).

3.3 Configuración experimental

Debido a las características del circuito, el protocolo se adaptó respecto al Test 1: en lugar de quince posiciones iniciales sobre múltiples carriles, se definieron nueve condiciones iniciales, combinando tres posiciones longitudinales con tres orientaciones iniciales por posición.

Tomando como orientación nominal del carril 95.11°:

Posición angular Orientación
Izquierda 65.11°
Centro 95.11°
Derecha 125.11°

Cada una de las nueve condiciones iniciales se repitió múltiples veces por modelo, siguiendo el mismo procedimiento de los experimentos anteriores.

Justificación: este experimento no busca aumentar la dificultad del entorno, sino evaluar la capacidad de transferencia de las políticas a un mapa completamente diferente al de entrenamiento. Al eliminar intersecciones, tráfico, cambios de elevación y obstáculos, las diferencias entre modelos pueden atribuirse principalmente a su capacidad de mantener la trayectoria y recuperarse de errores de orientación inicial en una geometría no vista previamente.

3.4 Resultados

Test 0 – Caso canónico

Modelo Successful Runs Collisions Lane Invasions Speed (km/h) Dev Mean (m)
$D^{A}$ 0.0% (0/24)
$D_{0.15}^{B}$ 31.8% (7/22) 0.000 31.714 45.62 0.361
$D_{0.30}^{B}$ 84.0% (21/25) 0.000 42.619 29.28 0.424
$D_{0.50}^{B}$ 84.0% (21/25) 0.000 32.571 40.37 0.400
$D_{0.75}^{B}$ 80.0% (20/25) 0.000 57.000 34.55 0.459
$D_{0.15}^{C}$ 29.2% (7/24) 0.000 41.143 48.09 0.509
$D_{0.30}^{C}$ 20.0% (5/25) 0.000 40.200 43.99 0.459
$D_{0.50}^{C}$ 84.0% (21/25) 0.000 32.571 43.12 0.419
$D_{0.75}^{C}$ 95.8% (23/24) 0.000 29.391 39.73 0.364
$D^{M}_{30/30/40}$ 96.0% (24/25) 0.000 38.833 39.32 0.436

El caso canónico ya representa una dificultad importante de transferencia: $D^{A}$ no completa ninguna ejecución y las mezclas con 15 % de datos perturbados mantienen tasas de éxito cercanas al 30 %. DAgger mejora al utilizar proporciones de 30–50 %, ambas con 84.0 % de éxito, mientras que 75 % incrementa notablemente las invasiones de carril y no mejora la finalización.

En Noise Injection se observa una diferencia marcada entre proporciones: 15–30 % ofrecen poca capacidad de generalización, mientras que $D_{0.75}^{C}$ alcanza 95.8 % de éxito y presenta menos invasiones que las configuraciones DAgger de alto desempeño. $D^{M}{30/30/40}$ obtiene la mayor tasa de éxito, con 96.0 %, aunque su desviación e invasiones son superiores a las de $D{0.75}^{C}$. Por tanto, Magic Mix destaca en finalización y Noise Injection 75 % presenta el mejor compromiso lateral entre las configuraciones con mayor éxito.

Test 1 – Diferentes posiciones de inicio

Modelo Successful Runs Collisions Lane Invasions Speed (km/h) Dev Mean (m)
$D^{A}$ 7.7% (2/26) 0.000 36.000 52.31 0.515
$D_{0.15}^{B}$ 26.9% (7/26) 0.000 32.857 45.56 0.347
$D_{0.30}^{B}$ 81.5% (22/27) 0.000 42.955 28.32 0.437
$D_{0.50}^{B}$ 77.8% (21/27) 0.000 37.143 40.50 0.403
$D_{0.75}^{B}$ 91.3% (21/23) 0.000 62.095 35.23 0.455
$D_{0.15}^{C}$ 20.8% (5/24) 0.000 43.400 46.11 0.527
$D_{0.30}^{C}$ 33.3% (9/27) 0.000 39.778 43.97 0.445
$D_{0.50}^{C}$ 88.9% (24/27) 0.000 36.583 41.88 0.419
$D_{0.75}^{C}$ 96.3% (26/27) 0.000 30.923 39.46 0.378
$D^{M}_{30/30/40}$ 96.3% (26/27) 0.000 42.308 38.24 0.439

Las posiciones iniciales perturbadas acentúan la dificultad de generalización de $D^{A}$, que completa 2 de 26 ejecuciones. En DAgger, las proporciones de 30–75 % superan claramente a $D_{0.15}^{B}$ y la mayor tasa de éxito corresponde a $D_{0.75}^{B}$, con 91.3 %. Sin embargo, esta configuración también registra el mayor número de invasiones de carril del test. Esto sugiere una mayor capacidad de finalización, aunque con menor estabilidad lateral.

Noise Injection también mejora con proporciones altas. $D_{0.75}^{C}$ y $D^{M}{30/30/40}$ alcanzan 96.3 % de éxito, pero $D{0.75}^{C}$ presenta menos invasiones y menor desviación. En esta evaluación, $D_{0.75}^{C}$ ofrece el mejor compromiso entre generalización, recuperación inicial y precisión de trayectoria; la velocidad se interpreta solo como un indicador complementario.

Test 2 – Diferentes puntos de inicio

Modelo Successful Runs Collisions Lane Invasions Speed (km/h) Dev Mean (m)
$D^{A}$ 33.3% (10/30) 0.000 27.100 51.96 0.486
$D_{0.15}^{B}$ 39.1% (9/23) 0.000 32.333 48.82 0.452
$D_{0.30}^{B}$ 10.0% (3/30) 0.000 40.667 29.36 0.432
$D_{0.50}^{B}$ 42.9% (12/28) 0.000 28.917 41.07 0.387
$D_{0.75}^{B}$ 30.0% (9/30) 0.000 60.111 35.42 0.460
$D_{0.15}^{C}$ 38.1% (8/21) 0.000 37.625 47.41 0.477
$D_{0.30}^{C}$ 20.8% (5/24) 0.000 34.200 43.47 0.390
$D_{0.50}^{C}$ 53.3% (16/30) 0.000 31.812 42.39 0.401
$D_{0.75}^{C}$ 32.1% (9/28) 0.000 29.556 39.15 0.361

El Test 2 es el escenario más difícil de csonthomisi: ninguna configuración supera 53.3 % de éxito. $D_{0.50}^{C}$ obtiene la mayor tasa de finalización, seguida por $D_{0.50}^{B}$ con 42.9 %. Las mezclas de 50 % presentan así el comportamiento más consistente dentro de cada estrategia, aunque la diferencia entre ambas es moderada y no permite establecer una ventaja general para Noise Injection.

Entre los episodios exitosos, $D_{0.50}^{B}$ registra menos invasiones y una desviación ligeramente menor que $D_{0.50}^{C}$. $D_{0.75}^{C}$ alcanza la menor desviación global, pero solo completa 32.1 % de las ejecuciones; por ello, su precisión lateral no debe interpretarse como un mejor desempeño total. Los resultados sugieren que cambiar el sector de inicio sigue siendo un reto importante para todas las políticas.

Test 3 – Diferentes velocidades iniciales

Modelo Successful Runs Collisions Lane Invasions Speed (km/h) Dev Mean (m)
$D^{A}$ 16.7% (4/24) 0.000 26.000 48.16 0.500
$D_{0.15}^{B}$ 70.8% (17/24) 0.000 18.412 43.42 0.306
$D_{0.30}^{B}$ 91.7% (22/24) 0.000 34.091 27.70 0.360
$D_{0.50}^{B}$ 87.0% (20/23) 0.000 25.500 39.98 0.378
$D_{0.75}^{B}$ 73.9% (17/23) 0.000 44.294 30.90 0.478
$D_{0.15}^{C}$ 42.1% (8/19) 0.000 32.375 44.73 0.498
$D_{0.30}^{C}$ 61.1% (11/18) 0.000 31.727 41.96 0.442
$D_{0.50}^{C}$ 82.6% (19/23) 0.000 26.211 44.56 0.432
$D_{0.75}^{C}$ 95.8% (23/24) 0.000 28.826 41.15 0.378

Los cambios en la velocidad inicial reducen la tasa de éxito de $D^{A}$ a 16.7 %, lo que sugiere dificultades para transferir la política base a estados dinámicos no vistos en este mapa. DAgger mejora claramente la finalización y alcanza su mejor resultado con $D_{0.30}^{B}$ (91.7 %); al aumentar la proporción a 50 % y 75 %, la tasa de éxito disminuye y, en 75 %, también empeoran las invasiones y la desviación.

En Noise Injection se observa la tendencia opuesta: la tasa de éxito aumenta con la proporción hasta llegar a 95.8 % con $D_{0.75}^{C}$. Esta configuración mantiene valores intermedios de invasiones y desviación, mientras que algunas mezclas con menor error, como $D_{0.15}^{B}$, completan menos episodios. Los resultados sugieren que $D_{0.75}^{C}$ ofrece el mejor compromiso global para generalizar frente a variaciones del estado dinámico inicial.

Test 4 – Perturbación online

Modelo Successful Runs Collisions Lane Invasions Speed (km/h) Dev Mean (m)
$D_{0.15}^{B}$ 65.5% (19/29) 0.000 38.632 42.63 0.377
$D_{0.30}^{B}$ 76.7% (23/30) 0.000 52.609 27.82 0.450
$D_{0.50}^{B}$ 96.6% (28/29) 0.000 37.500 37.49 0.395
$D_{0.15}^{C}$ 33.3% (10/30) 0.000 49.300 44.31 0.516
$D_{0.30}^{C}$ 31.0% (9/29) 0.000 50.667 42.12 0.441
$D_{0.50}^{C}$ 79.3% (23/29) 0.000 39.435 40.32 0.421

En perturbación online, DAgger mantiene una mayor tasa de éxito que Noise Injection para las proporciones comparables. $D_{0.50}^{B}$ alcanza 96.6 % de finalización, frente a 79.3 % de $D_{0.50}^{C}$, y además presenta valores ligeramente menores de invasiones y desviación. Entre las configuraciones disponibles, $D_{0.50}^{B}$ ofrece el mejor compromiso para recuperarse de perturbaciones recurrentes en el mapa no visto.

Las proporciones de 15–30 % de Noise Injection muestran una degradación clara, con tasas de éxito de 33.3 % y 31.0 % y un número elevado de invasiones. No se registran colisiones, algo coherente con un escenario sin obstáculos, por lo que la comparación depende principalmente de la finalización y del seguimiento lateral.

Observaciones generales

Los cinco tests muestran que csonthomisi exige una capacidad de transferencia que $D^{A}$ no mantiene de forma consistente. DAgger favorece la recuperación, especialmente con proporciones de 30–50 %, y $D_{0.50}^{B}$ destaca bajo perturbación online. Su principal limitación es el aumento de invasiones de carril en varias configuraciones, particularmente cuando DAgger alcanza 75 %.

Noise Injection presenta un comportamiento más dependiente de la proporción y del test. $D_{0.75}^{C}$ obtiene tasas de éxito altas en los Tests 0, 1 y 3, con un seguimiento lateral competitivo, mientras que $D_{0.50}^{C}$ lidera el Test 2. Magic Mix alcanza las mejores tasas de finalización en los Tests 0 y 1, pero no dispone de resultados en los Tests 2–4 y muestra menor precisión lateral que $D_{0.75}^{C}$ en las comparaciones disponibles. En conjunto, los resultados sugieren que DAgger favorece la recuperación ante perturbaciones recurrentes y que Noise Injection en proporciones altas puede favorecer la transferencia y la precisión, aunque ninguna estrategia domina todos los escenarios.


4. Gráficos

Resultados Test 4 en Town02
Curvas de desempeño del Test 4 en Town02. Noise Injection alcanza su mayor tasa de éxito con una proporción de 50 %, mientras que DAgger muestra una degradación al utilizar proporciones elevadas.
Resultados Test 4 en Town11
Curvas de desempeño del Test 4 en Town11. $D^{A}$ no completa ninguna ejecución y las mezclas intermedias mejoran la recuperación. $D_{0.50}^{C}$ alcanza 100 % de éxito y el menor error lateral.
Resultados Test 4 en el mapa comunitario csonthomisi
Curvas de desempeño del Test 4 en el mapa comunitario csonthomisi. Entre las configuraciones evaluadas, $D_{0.50}^{B}$ presenta la mayor tasa de éxito, con 96.6 %, y supera a $D_{0.50}^{C}$ en finalización y precisión lateral.

5. Conclusiones generales

  • Burbuja ($D^{A}$) mantiene un desempeño sólido en el caso canónico de Town11, pero su tasa de éxito disminuye al cambiar la posición o la velocidad inicial y llega a 0/30 bajo perturbación online. En csonthomisi también presenta tasas de finalización bajas, lo que sugiere una capacidad limitada para transferirse a geometrías y condiciones alejadas del dominio nominal.

  • DAgger ($D_{\alpha}^{B}$) favorece la recuperación y alcanza tasas de éxito altas en los escenarios exigentes de Town11. En csonthomisi, $D_{0.50}^{B}$ destaca bajo perturbación online. Sin embargo, esta mejora suele estar acompañada por más invasiones de carril y mayor desviación, especialmente con proporciones elevadas.

  • Noise Injection ($D_{\alpha}^{C}$) presenta el mejor compromiso entre finalización y precisión en Town11 con $D_{0.50}^{C}$. En csonthomisi, $D_{0.75}^{C}$ obtiene resultados competitivos en los Tests 0, 1 y 3, pero su comportamiento no es uniforme en todos los escenarios y DAgger conserva una ventaja en el Test 4.

  • **Magic Mix ($D^{M}{30/30/40}$)** alcanza tasas de éxito altas en los Tests 0 y 1 de csonthomisi, aunque con menor precisión lateral que $D{0.75}^{C}$ en esas comparaciones. Al no disponer de resultados para los Tests 2–4, todavía no es posible establecer si ofrece un equilibrio consistente entre ambas estrategias.

En conjunto, los resultados permiten mantener, como interpretación preliminar, dos componentes complementarias de la robustez:

\[\boxed{ \text{Robustez Local} \quad+\quad \text{Robustez de Recuperación} }\]

donde:

  • La robustez local está asociada con la capacidad de la política para tolerar pequeñas desviaciones alrededor de la distribución de entrenamiento.
  • La robustez de recuperación está asociada con la capacidad de retornar a estados seguros cuando el vehículo alcanza configuraciones significativamente fuera de distribución.

DAgger parece favorecer principalmente la segunda componente, mientras que Noise Injection puede mejorar la precisión y la estabilidad local en proporciones adecuadas. No obstante, el comportamiento depende del mapa, del tipo de perturbación y de la composición del dataset, por lo que esta separación no constituye una demostración definitiva ni implica que una estrategia sea superior en todos los escenarios.