{"id":"W4393159294","doi":"10.1609/aaai.v38i5.28212","title":"Improving Automatic VQA Evaluation Using Large Language Models","year":2024,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Occupational Health and Safety Research","field":"Health Professions","cited_by":32,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; Université de Montréal; Mila - Quebec Artificial Intelligence Institute","funders":"Canadian Institute for Advanced Research; Samsung; Nvidia","keywords":"Computer science; Natural language processing; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.003248621,0.0001665789,0.0002248865,0.0002013796,0.0006778339,0.00006743554,0.0004772775,0.0001545421,0.001006793],"category_scores_gemma":[0.001226136,0.0001193162,0.0000933792,0.000638702,0.00009983339,0.0003861084,0.000205065,0.0007574243,0.0003068731],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002859678,"about_ca_system_score_gemma":0.00114084,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003206124,"about_ca_topic_score_gemma":0.00004855705,"domain_scores_codex":[0.9972307,0.0001115255,0.0007559457,0.0003695711,0.0009531818,0.0005790484],"domain_scores_gemma":[0.9979329,0.0004532902,0.0002483779,0.0001864666,0.001056621,0.0001223981],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001260643,0.0001041395,0.0004218668,0.001836003,0.00002163727,7.319207e-7,0.008292688,0.0001937617,0.02731912,0.6284743,0.0001953628,0.3330143],"study_design_scores_gemma":[0.00003606435,0.00006308596,0.0002422791,0.001137947,0.00002686616,9.23522e-7,0.003961895,0.9189239,0.007582512,0.06788062,0.00003194984,0.0001119984],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9587492,0.0003287779,0.008535285,0.002533235,0.00138427,0.00278685,0.00006042613,0.0001944442,0.02542751],"genre_scores_gemma":[0.9982104,0.00002448161,0.0008376829,0.0001754979,0.0002372235,0.0001547824,0.000004046527,0.0000239486,0.0003319846],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9187301,"threshold_uncertainty_score":0.9999064,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2970278731212292,"score_gpt":0.5141273970227914,"score_spread":0.2170995239015622,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}