{"id":"W4393159294","doi":"10.1609/aaai.v38i5.28212","title":"Improving Automatic VQA Evaluation Using Large Language Models","year":2024,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Occupational Health and Safety Research","field":"Health Professions","cited_by":32,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; Université de Montréal; Mila - Quebec Artificial Intelligence Institute","funders":"Canadian Institute for Advanced Research; Samsung; Nvidia","keywords":"Computer science; Natural language processing; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02027144,0.002040615,0.001519905,0.002969728,0.0011184,0.004238503,0.002933297,0.002368211,0.005767157],"category_scores_gemma":[0.09513358,0.0006724881,0.001523669,0.001283449,0.0009238322,0.005589978,0.003960786,0.002897603,0.003112664],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002304432,"about_ca_system_score_gemma":0.00260129,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01156299,"about_ca_topic_score_gemma":0.01360586,"domain_scores_codex":[0.9622639,0.02496739,0.002262258,0.003517882,0.006178861,0.0008096604],"domain_scores_gemma":[0.9164088,0.05476924,0.00237869,0.007637437,0.01748477,0.001321073],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001606792,0.001161618,0.02088782,0.001726941,0.0005718581,0.0003845936,0.002814199,0.09959503,0.04401242,0.01028898,0.08190804,0.7350417],"study_design_scores_gemma":[0.0002374354,0.0005377525,0.005057732,0.0001482815,0.00009792511,0.0001928042,0.000601669,0.9459836,0.0222858,0.009865707,0.01484785,0.0001435088],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.2504812,0.005060061,0.6399953,0.002603545,0.00112952,0.001221059,0.004686307,0.08070717,0.01411577],"genre_scores_gemma":[0.7751011,0.0003406053,0.2075103,0.001028388,0.0002137018,0.0005960123,0.008974481,0.002280897,0.003954504],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.02027144,"threshold_uncertainty_score":0.1072069,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2970278731212292,"score_gpt":0.5141273970227914,"score_spread":0.2170995239015622,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}