{"id":"W4415524633","doi":"10.1109/mlsp62443.2025.11204323","title":"Learning or Cheating? Assessing Data Contamination in Large Vision-Language Models","year":2025,"lang":"","type":"article","venue":"","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University","funders":"Natural Sciences and Engineering Research Council of Canada; Canada Foundation for Innovation","keywords":"Overfitting; Generalization; Question answering; Image (mathematics); Chart; Data modeling; Visual reasoning","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.005194466,0.0004846749,0.000663373,0.0007910095,0.0008444542,0.001702076,0.003388454,0.0003434983,0.0003557723],"category_scores_gemma":[0.003749217,0.000459117,0.00007195873,0.002715981,0.00009666503,0.007551095,0.006440531,0.001891183,0.00002939888],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003829966,"about_ca_system_score_gemma":0.000895459,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005531497,"about_ca_topic_score_gemma":0.0004743025,"domain_scores_codex":[0.994029,0.001258236,0.001141284,0.001819194,0.0007547226,0.0009975045],"domain_scores_gemma":[0.9957578,0.001488844,0.0004520167,0.001989518,0.000193772,0.0001180772],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007629266,0.0004517699,0.01129966,0.0002862716,0.00006560929,0.0002515964,0.01196556,0.3934648,0.000298847,0.04819624,0.0003296257,0.5333137],"study_design_scores_gemma":[0.002008288,0.0000944663,0.004655928,0.001100275,0.00003486375,0.000007333686,0.005734065,0.984648,0.00005758496,0.0006532868,0.0005333178,0.0004725665],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02163884,0.0006196306,0.9495224,0.001221657,0.001162897,0.0004677848,0.000004502308,0.0002733364,0.02508892],"genre_scores_gemma":[0.9313876,0.00007937361,0.05770709,0.000511926,0.0001347974,0.000009992311,0.00007442285,0.00003379173,0.01006099],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9097488,"threshold_uncertainty_score":0.9997861,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03124462337557485,"score_gpt":0.3751709889710368,"score_spread":0.343926365595462,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}