{"id":"W4416749558","doi":"10.1109/iros60139.2025.11247054","title":"IGDrivSim: A Benchmark for the Imitation Gap in Autonomous Driving","year":2025,"lang":"","type":"article","venue":"","topic":"Autonomous Vehicle Technology and Safety","field":"Engineering","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute","funders":"","keywords":"Imitation; Benchmark (surveying); Reinforcement learning; Perception; Autonomous agent; Key (lock)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0007391103,0.000322321,0.0003649193,0.0003534128,0.0003551317,0.00006303836,0.0005221179,0.0005253131,0.0002107644],"category_scores_gemma":[0.0002451477,0.0002804916,0.0001662571,0.0007614514,0.0001539002,0.0001850918,0.0001385993,0.0006179904,0.000033317],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003921758,"about_ca_system_score_gemma":0.0001963147,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00007945474,"about_ca_topic_score_gemma":0.001014086,"domain_scores_codex":[0.9980981,0.00004238879,0.0007141029,0.0004183225,0.00008653189,0.0006405981],"domain_scores_gemma":[0.9979155,0.001341705,0.00007446203,0.0005729476,0.00005798239,0.0000374081],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006252201,0.0001420057,0.01213933,0.000303553,0.0003979252,0.000007012859,0.001364248,0.09855893,0.000811387,0.493458,0.003421494,0.3893336],"study_design_scores_gemma":[0.00112913,0.000062739,0.05522618,0.0001600791,0.0001170077,0.000002715829,0.0009714259,0.896393,0.001539293,0.02258239,0.02144192,0.0003740782],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1053263,0.005676153,0.775048,0.01748794,0.0027441,0.003346288,0.00001828092,0.001151105,0.08920184],"genre_scores_gemma":[0.9921224,0.0003780327,0.003653276,0.0002980885,0.00005357866,0.00033045,0.000007981593,0.00003158772,0.003124572],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8867961,"threshold_uncertainty_score":0.9999647,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01094145665281806,"score_gpt":0.248265836623078,"score_spread":0.2373243799702599,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}