{"id":"W4415428125","doi":"10.3233/faia251331","title":"ALF: A Fine-Grained French Analogical Dataset for Evaluating Lexical Knowledge of Large Language Models","year":2025,"lang":"","type":"book-chapter","venue":"Frontiers in artificial intelligence and applications","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal","funders":"","keywords":"Fluency; Lexical item; Lexicographical order; Key (lock); Vocabulary; Computational linguistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00193518,0.00186658,0.0007092468,0.003143976,0.0009386918,0.001798724,0.002147284,0.002358094,0.008822985],"category_scores_gemma":[0.01135919,0.0003306876,0.001519652,0.002467907,0.0006349728,0.001890321,0.001288202,0.001283352,0.004300178],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00158359,"about_ca_system_score_gemma":0.001080511,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02842335,"about_ca_topic_score_gemma":0.04682894,"domain_scores_codex":[0.9982423,0.0006879481,0.0001527728,0.00047091,0.0003499109,0.00009628515],"domain_scores_gemma":[0.9954176,0.002718149,0.0001653688,0.0009912148,0.0005129859,0.0001946941],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00177175,0.001330078,0.02938157,0.003490874,0.001081379,0.001591966,0.000695419,0.08501699,0.009320603,0.01471055,0.4943448,0.357264],"study_design_scores_gemma":[0.001301292,0.0012732,0.04413777,0.0003636311,0.0003120957,0.002219245,0.001001054,0.5939105,0.01341638,0.03077057,0.3110087,0.0002855883],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"empirical","genre_gemma":"dataset","genre_scores_codex":[0.4150492,0.01164896,0.09103443,0.002554417,0.0009647503,0.001234141,0.3910289,0.04779035,0.03869478],"genre_scores_gemma":[0.2896691,0.0009089584,0.07821795,0.0007675692,0.00017948,0.0006951228,0.6232417,0.001019033,0.005301061],"genre_candidate":"dataset","genre_consensus":null,"teacher_disagreement_score":0.02842335,"threshold_uncertainty_score":0.05651581,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07860967414722973,"score_gpt":0.3867682798869631,"score_spread":0.3081586057397334,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}