{"id":"W4415757169","doi":"10.2139/ssrn.5688858","title":"Transit Pulse: Advancing Public Transit Social Media Analysis with Large Language Models","year":2025,"lang":"","type":"preprint","venue":"SSRN Electronic Journal","topic":"Human Mobility and Location-Based Analysis","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Public transport; Social media; Analytics; Pipeline (software); Topic model; Transit (satellite); Big data; Action (physics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts","research_integrity","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.01538547,0.001067957,0.002281147,0.00218976,0.004933405,0.0009699385,0.002256816,0.001095674,0.002329354],"category_scores_gemma":[0.0002388447,0.00102985,0.002825748,0.006647471,0.0006546394,0.001104266,0.0001282797,0.01045598,0.00002232135],"about_ca_system_candidate":true,"about_ca_system_consensus":true,"about_ca_system_score_codex":0.006152407,"about_ca_system_score_gemma":0.03256571,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.007385332,"about_ca_topic_score_gemma":0.7939476,"domain_scores_codex":[0.9834962,0.002478368,0.001828283,0.00166839,0.002605763,0.007923013],"domain_scores_gemma":[0.9955947,0.0005988593,0.001135359,0.0008134456,0.001190291,0.0006672805],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.0006382822,0.00190296,0.00128453,0.0003364921,0.04239636,0.00005084562,0.3721306,0.1354675,0.00004262483,0.2580636,0.00004829565,0.1876378],"study_design_scores_gemma":[0.004664732,0.0003749937,0.0007079525,0.0003635906,0.04007949,0.00003352931,0.6323285,0.09345517,0.00003035893,0.2222208,0.002320303,0.003420559],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08078255,0.009264915,0.8912736,0.01193671,0.0003709888,0.0007605086,0.0003323927,0.0001595447,0.005118824],"genre_scores_gemma":[0.984107,0.01072493,0.000122594,0.0002738327,0.001484451,0.00006314374,0.0003700807,0.00005815073,0.002795833],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9033244,"threshold_uncertainty_score":0.9992246,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01181682854351028,"score_gpt":0.2773954569491393,"score_spread":0.265578628405629,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}