{"id":"W4404782170","doi":"10.18653/v1/2024.findings-emnlp.941","title":"Gazelle: An Instruction Dataset for Arabic Writing Assistance","year":2024,"lang":"en","type":"article","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Social Sciences and Humanities Research Council of Canada; Natural Sciences and Engineering Research Council of Canada; Canada Research Chairs","keywords":"Arabic; Computer science; Natural language processing; Artificial intelligence; Linguistics; Philosophy","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005748105,0.001572813,0.000500328,0.002601111,0.001001924,0.0009379637,0.001655438,0.00162573,0.01661426],"category_scores_gemma":[0.004750112,0.0002314338,0.000619075,0.002098795,0.0005188049,0.001410389,0.001980902,0.00146653,0.02374924],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009101345,"about_ca_system_score_gemma":0.001516812,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01644379,"about_ca_topic_score_gemma":0.04019892,"domain_scores_codex":[0.9992361,0.0001597321,0.0001204037,0.0001915545,0.0002256439,0.0000665601],"domain_scores_gemma":[0.9982368,0.0004262556,0.0001190695,0.0004317022,0.0006411529,0.0001449578],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0004125908,0.0003838548,0.005945729,0.001180688,0.00005756443,0.0005335331,0.0007785686,0.002539202,0.005681495,0.001478249,0.8492007,0.1318079],"study_design_scores_gemma":[0.0002491655,0.000259591,0.01937824,0.0003159043,0.0000482579,0.0006490322,0.001640304,0.01943168,0.01084163,0.002880433,0.9441721,0.0001336643],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.07907641,0.001895957,0.01170267,0.001914995,0.000653213,0.0008757761,0.8342808,0.04156563,0.02803456],"genre_scores_gemma":[0.04630038,0.0003713471,0.01894675,0.0003186628,0.00005921482,0.0008144707,0.9230427,0.0006229667,0.009523579],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.01661426,"threshold_uncertainty_score":0.05558026,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02053628075947235,"score_gpt":0.3210352963144014,"score_spread":0.300499015554929,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}