{"id":"W4416749558","doi":"10.1109/iros60139.2025.11247054","title":"IGDrivSim: A Benchmark for the Imitation Gap in Autonomous Driving","year":2025,"lang":"","type":"article","venue":"","topic":"Autonomous Vehicle Technology and Safety","field":"Engineering","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute","funders":"","keywords":"Imitation; Benchmark (surveying); Reinforcement learning; Perception; Autonomous agent; Key (lock)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001678408,0.001702728,0.0006190042,0.0008982213,0.0004744425,0.0007527314,0.003065354,0.001515505,0.00207555],"category_scores_gemma":[0.005990128,0.0004550692,0.0006606162,0.0008825004,0.0007340274,0.0008655549,0.001067621,0.001416777,0.0006934858],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001133816,"about_ca_system_score_gemma":0.001785053,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02736905,"about_ca_topic_score_gemma":0.02480303,"domain_scores_codex":[0.9991108,0.0002650622,0.00008813883,0.0001457889,0.0002662847,0.0001239445],"domain_scores_gemma":[0.9973198,0.001336419,0.0001708571,0.0003455692,0.0005893224,0.0002381162],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0005578244,0.0005195435,0.006462832,0.0006147845,0.0001488577,0.0001723571,0.0001563985,0.9299053,0.004166,0.004870176,0.01923438,0.03319151],"study_design_scores_gemma":[0.000113985,0.0002786809,0.001498773,0.00003455782,0.00001809882,0.00003470313,0.00004221895,0.9834061,0.005920059,0.002459075,0.006171573,0.0000221618],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7210408,0.002485587,0.1687156,0.001340812,0.0006348754,0.0008137809,0.02779877,0.04056669,0.03660309],"genre_scores_gemma":[0.8501333,0.0005294842,0.1188623,0.0001901545,0.00002268614,0.000572582,0.02534547,0.001481995,0.002861974],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02736905,"threshold_uncertainty_score":0.05441952,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01094145665281806,"score_gpt":0.248265836623078,"score_spread":0.2373243799702599,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}