{"id":"W4416125918","doi":"10.48550/arxiv.2504.04221","title":"Evaluating Graphical Perception with Multimodal LLMs","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Data Visualization and Analytics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Task (project management); Perception; Task analysis; Multimodality; Graphical display","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004349307,0.0002460064,0.0002612286,0.0002070703,0.0001506172,0.0002266266,0.001108327,0.0001966704,0.00005370822],"category_scores_gemma":[0.0001151469,0.000211053,0.0001043492,0.0004532975,0.00006968335,0.0002317509,0.001312142,0.000499016,0.00008958327],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00005905144,"about_ca_system_score_gemma":0.0002631111,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00007228154,"about_ca_topic_score_gemma":0.00002163986,"domain_scores_codex":[0.9980523,0.0001425281,0.0003183291,0.0007733599,0.0004666435,0.0002468259],"domain_scores_gemma":[0.9984318,0.00006248178,0.0001723552,0.0009968752,0.0002389565,0.00009751698],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004485347,0.0006870592,0.8739942,0.0006546325,0.0003632992,0.00005481963,0.00346665,0.0203225,0.001387439,0.03185058,0.003115465,0.06405848],"study_design_scores_gemma":[0.0004081818,0.00008626573,0.1708618,0.0002914474,0.0000551929,0.00000374136,0.00005777726,0.8264707,0.00007544902,0.0006794123,0.0006304887,0.000379496],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4155171,0.00002256295,0.5819119,0.0007552922,0.0004359043,0.0002158244,0.00002098078,0.0002713727,0.0008491505],"genre_scores_gemma":[0.9465704,0.0000501364,0.05074279,0.001031049,0.0001543715,0.00003124016,0.0002111473,0.000013925,0.001194933],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8061482,"threshold_uncertainty_score":0.8606493,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09317410924726038,"score_gpt":0.3894718387441124,"score_spread":0.296297729496852,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}