{"id":"W4416035516","doi":"10.18653/v1/2025.emnlp-main.1525","title":"Lemmatization as a Classification Task: Results from Arabic across Multiple Genres","year":2025,"lang":"","type":"article","venue":"","topic":"Second Language Acquisition and Learning","field":"Psychology","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"York University; New York University Abu Dhabi","keywords":"Lemmatisation; Arabic; Training set; Set (abstract data type); Feature (linguistics)","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003349997,0.003771705,0.0016165,0.003030548,0.001998326,0.003740245,0.001257518,0.002885001,0.01287989],"category_scores_gemma":[0.01899907,0.0003018636,0.002020913,0.002694441,0.001520815,0.005379396,0.003259158,0.004320613,0.01951941],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001271041,"about_ca_system_score_gemma":0.001046932,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00618421,"about_ca_topic_score_gemma":0.006786775,"domain_scores_codex":[0.9959326,0.001763537,0.0004341334,0.0009557947,0.0005996809,0.0003142521],"domain_scores_gemma":[0.983052,0.01104248,0.0005902993,0.002573506,0.001777514,0.0009641818],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0046115,0.002358197,0.04542386,0.002970455,0.0008781084,0.001787336,0.003284146,0.01952848,0.02476008,0.00311478,0.1849823,0.7063008],"study_design_scores_gemma":[0.001185763,0.002919571,0.159139,0.001624794,0.001342484,0.003676499,0.02369561,0.42324,0.07886571,0.04405904,0.2595986,0.0006529777],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7845528,0.01441572,0.04535221,0.005233574,0.003163861,0.0006724282,0.02858705,0.02759276,0.0904296],"genre_scores_gemma":[0.796885,0.002549459,0.05263991,0.001785138,0.0008157984,0.0004218296,0.1195707,0.002634826,0.02269721],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01287989,"threshold_uncertainty_score":0.04308748,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03021961230895533,"score_gpt":0.3677307304812117,"score_spread":0.3375111181722564,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}