{"id":"W4389518385","doi":"10.18653/v1/2023.arabicnlp-1.1","title":"Violet: A Vision-Language Model for Arabic Image Captioning with Gemini Decoder","year":2023,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"Alliance de recherche numérique du Canada; Social Sciences and Humanities Research Council of Canada; Natural Sciences and Engineering Research Council of Canada; Canada Research Chairs","keywords":"Closed captioning; Computer science; Fluency; Natural language processing; Artificial intelligence; Arabic; Language model; Encoder; Image (mathematics); Generative model; Speech recognition; Generative grammar; Linguistics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001068082,0.001670402,0.000817761,0.0009789374,0.000523939,0.001315661,0.002664226,0.001444159,0.007935103],"category_scores_gemma":[0.002710794,0.0006022694,0.001017967,0.0006250249,0.0006331254,0.002024638,0.001398661,0.00252678,0.006738275],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001639308,"about_ca_system_score_gemma":0.001399083,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01149094,"about_ca_topic_score_gemma":0.02307171,"domain_scores_codex":[0.9996062,0.00008325579,0.00002372837,0.0001499582,0.00008508046,0.00005183761],"domain_scores_gemma":[0.9993098,0.0002626685,0.00004092313,0.0001032526,0.0002278168,0.00005553531],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00080433,0.0004058643,0.001944738,0.0005379551,0.0001940532,0.0003868874,0.0003550864,0.2598088,0.02474299,0.02206731,0.09563872,0.5931132],"study_design_scores_gemma":[0.00003065506,0.00005683928,0.000158277,0.00001847703,0.00002179578,0.0000873145,0.00002755444,0.9776766,0.00841792,0.005891034,0.007589601,0.00002399368],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03162333,0.002127163,0.8736473,0.001390772,0.0006857475,0.000453057,0.005398099,0.06929446,0.01537997],"genre_scores_gemma":[0.4019569,0.0009891656,0.5398353,0.00161093,0.0003255779,0.0007358083,0.01656864,0.002797885,0.03517985],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01149094,"threshold_uncertainty_score":0.02654558,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01223930283923168,"score_gpt":0.3186121580308731,"score_spread":0.3063728551916414,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}