{"id":"W4211222398","doi":"10.1037/cep0000271","title":"Determining the importance of frequency and contextual diversity in the lexical organization of multiword expressions.","year":2022,"lang":"en","type":"article","venue":"Canadian Journal of Experimental Psychology/Revue canadienne de psychologie expérimentale","topic":"Linguistics, Language Diversity, and Identity","field":"Arts and Humanities","cited_by":16,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Word lists by frequency; Lexical item; Linguistics; Natural language processing; Lexicon; Computer science; Diversity (politics); Context (archaeology); Psychology; Operationalization; Consistency (knowledge bases); Word (group theory); Artificial intelligence; Sentence; Sociology","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003506401,0.0003004977,0.0003332909,0.00344737,0.0006035949,0.002183352,0.0004530892,0.0005065558,0.001993428],"category_scores_gemma":[0.03294683,0.000329885,0.0003754534,0.002430017,0.001787684,0.003701347,0.002335808,0.0006716432,0.000255282],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006448805,"about_ca_system_score_gemma":0.0005383624,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002148624,"about_ca_topic_score_gemma":0.004646997,"domain_scores_codex":[0.9979181,0.0006839634,0.000245877,0.0005694417,0.0004742547,0.0001083259],"domain_scores_gemma":[0.973356,0.01737744,0.005277695,0.001679315,0.001847695,0.0004619107],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0007397422,0.0001136917,0.7588721,0.001273584,0.0004981951,0.0005497193,0.02469884,0.001358807,0.04498694,0.009924229,0.0008363904,0.1561478],"study_design_scores_gemma":[0.00001234451,0.00009274782,0.9804404,0.0001100153,0.0000753869,0.0003717591,0.004495281,0.003623052,0.002469154,0.006752205,0.001511405,0.00004615918],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9787936,0.0007869602,0.01166692,0.0001461161,0.00002046632,0.00009279057,0.0005215741,0.00002281503,0.007948702],"genre_scores_gemma":[0.9948396,0.0001401906,0.00448162,0.00002806796,0.000009845445,0.00008911068,0.0002180851,0.0000156152,0.0001778411],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.003506401,"threshold_uncertainty_score":0.0185439,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06765920548252147,"score_gpt":0.2858121736012857,"score_spread":0.2181529681187642,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}