{"id":"W7085121138","doi":"10.1109/raiic65850.2025.11170191","title":"Application of Vision-Language Models to Pedestrian Behavior Prediction and Scene Understanding in Autonomous Driving","year":2025,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Pedestrian; Metric (unit); Perception; Trajectory; Key (lock); Advanced driver assistance systems","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007085786,0.0009654629,0.0005966247,0.0006091975,0.000428699,0.0007412728,0.001088744,0.000940882,0.0009285822],"category_scores_gemma":[0.002603928,0.0004360944,0.000744002,0.0004098442,0.0004184591,0.001754322,0.000909254,0.001848557,0.0003407943],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009430472,"about_ca_system_score_gemma":0.001105573,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02311078,"about_ca_topic_score_gemma":0.02438466,"domain_scores_codex":[0.9997204,0.00007430041,0.00001060963,0.0001050729,0.00004314218,0.00004643167],"domain_scores_gemma":[0.999279,0.0003844717,0.00005315715,0.00008713405,0.0001496472,0.00004673566],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002249261,0.0003503004,0.002676668,0.00006227375,0.0001322955,0.0001189648,0.0001803252,0.7856436,0.01040033,0.002518843,0.002278938,0.1954124],"study_design_scores_gemma":[0.000003101401,0.00001917658,0.0001882859,0.000002225215,0.000006694754,0.000006469456,0.00001445627,0.9965083,0.001563683,0.001550736,0.0001322316,0.000004639408],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3541591,0.0008817674,0.6348575,0.001030831,0.0001539562,0.00008665167,0.0004594959,0.005215802,0.003154891],"genre_scores_gemma":[0.9421063,0.0001426812,0.05571025,0.0001693388,0.00002716227,0.00003892352,0.0004755218,0.00007865468,0.001251096],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02311078,"threshold_uncertainty_score":0.0459525,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01962526538052656,"score_gpt":0.3073331807172857,"score_spread":0.2877079153367591,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}