{"id":"W4416118802","doi":"10.48550/arxiv.2504.05227","title":"A Reality Check of Vision-Language Pre-training in Radiology: Have We Progressed Using Text?","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; Compute Canada","keywords":"Popularity; Feature (linguistics); Reality check; Check-in; Noise (video); Visualization","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01753196,0.002758156,0.001515831,0.001096661,0.001860238,0.003881264,0.003299129,0.004555731,0.009380765],"category_scores_gemma":[0.07036319,0.0007769106,0.001237821,0.001007951,0.002957682,0.01343436,0.003795113,0.008049943,0.005830188],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001747712,"about_ca_system_score_gemma":0.00222101,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006686362,"about_ca_topic_score_gemma":0.009324841,"domain_scores_codex":[0.9912332,0.004757914,0.0003630811,0.002257752,0.0009306592,0.0004573527],"domain_scores_gemma":[0.968386,0.02027032,0.0009620422,0.006107906,0.003307924,0.0009656877],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.004332003,0.001858128,0.01364264,0.002725912,0.0005239662,0.0004731202,0.00118607,0.08045626,0.01537546,0.02245566,0.06734724,0.7896236],"study_design_scores_gemma":[0.0006126585,0.003167905,0.01056085,0.00165476,0.0003533642,0.0009348638,0.001990638,0.7337974,0.05124371,0.1330048,0.06239153,0.0002874174],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3023341,0.03525336,0.5547174,0.04147291,0.005315945,0.0007919144,0.005468792,0.01388906,0.04075652],"genre_scores_gemma":[0.7248631,0.003734023,0.2414656,0.00633259,0.00127442,0.0003999385,0.009412276,0.001588534,0.01092955],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01753196,"threshold_uncertainty_score":0.09271896,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06354629236181726,"score_gpt":0.3889836129961712,"score_spread":0.325437320634354,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}