{"id":"W7094976913","doi":"","title":"ALF : Un jeu de données d'analogies françaises à grain fin pour l'évaluation de la connaissance lexicale des grands modèles de langue","year":2025,"lang":"fr","type":"article","venue":"HAL (Le Centre pour la Communication Scientifique Directe)","topic":"Qualitative Comparative Analysis Research","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal","funders":"","keywords":"Context (archaeology); Focus (optics); Pragmatics; Denotation (semiotics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03944229,0.001117562,0.001032266,0.01161998,0.004146953,0.006066929,0.001641985,0.001456103,0.01247855],"category_scores_gemma":[0.1822022,0.001031597,0.001738074,0.0108059,0.003529803,0.008992463,0.006100068,0.002326246,0.001018531],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.006715753,"about_ca_system_score_gemma":0.006099755,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.06143543,"about_ca_topic_score_gemma":0.08276932,"domain_scores_codex":[0.9615791,0.02541592,0.004219534,0.001771832,0.006435681,0.0005779653],"domain_scores_gemma":[0.7558374,0.2080274,0.003901364,0.01110783,0.02025458,0.0008714186],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001849885,0.0007113159,0.046728,0.007866438,0.001392887,0.001277165,0.4557281,0.004287375,0.007080729,0.04630353,0.04225753,0.3845171],"study_design_scores_gemma":[0.000983411,0.001137852,0.1161102,0.008130511,0.001918102,0.002493518,0.4480349,0.01240039,0.008313103,0.04375009,0.355901,0.000826828],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8204497,0.005716057,0.08615894,0.004076627,0.0006232078,0.002837075,0.02351225,0.001121174,0.05550509],"genre_scores_gemma":[0.85882,0.0019106,0.107028,0.000551275,0.00008704753,0.006900446,0.01349696,0.0009712534,0.01023446],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.06143543,"threshold_uncertainty_score":0.2085932,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.075285955257089,"score_gpt":0.3647547896709896,"score_spread":0.2894688344139006,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}