{"id":"W4415524633","doi":"10.1109/mlsp62443.2025.11204323","title":"Learning or Cheating? Assessing Data Contamination in Large Vision-Language Models","year":2025,"lang":"","type":"article","venue":"","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University","funders":"Natural Sciences and Engineering Research Council of Canada; Canada Foundation for Innovation","keywords":"Overfitting; Generalization; Question answering; Image (mathematics); Chart; Data modeling; Visual reasoning","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.02426097,0.001677231,0.001348994,0.001389066,0.0008418903,0.00231529,0.002924669,0.002456246,0.001108054],"category_scores_gemma":[0.134373,0.000677332,0.001251436,0.001004313,0.00332668,0.004731896,0.004761925,0.004183745,0.0006610898],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001976436,"about_ca_system_score_gemma":0.001893214,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004659876,"about_ca_topic_score_gemma":0.003723253,"domain_scores_codex":[0.9823666,0.01010405,0.0008854925,0.002817482,0.003226554,0.0005999235],"domain_scores_gemma":[0.9048331,0.06723178,0.005465012,0.01690828,0.004359812,0.001202058],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"observational","study_design_scores_codex":[0.001684115,0.0004831853,0.04390953,0.0007771627,0.0008620694,0.0004318269,0.0009543038,0.7689501,0.01033603,0.01022013,0.01021204,0.1511796],"study_design_scores_gemma":[0.00005934581,0.000340112,0.003607298,0.0000791826,0.00005430683,0.0001453781,0.0001551647,0.9664599,0.01183717,0.01548481,0.00173759,0.00003974828],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4735512,0.002466406,0.5038311,0.003426179,0.0003432703,0.0004662883,0.001963396,0.01011328,0.003838706],"genre_scores_gemma":[0.9247719,0.0002074196,0.07064708,0.0007113248,0.00006216029,0.0001836399,0.002349845,0.0003968229,0.0006697842],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9757391,"threshold_uncertainty_score":0.1283058,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03124462337557485,"score_gpt":0.3751709889710368,"score_spread":0.343926365595462,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}