{"id":"W2955002705","doi":"10.3758/s13428-019-01282-6","title":"LADEC: The Large Database of English Compounds","year":2019,"lang":"en","type":"article","venue":"Behavior Research Methods","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":60,"is_retracted":false,"has_abstract":true,"ca_institutions":"McMaster University; University of Alberta","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Bigram; Lexicon; Computer science; Natural language processing; Lexical database; Morpheme; Compound; WordNet; Parsing; Database; Artificial intelligence; Linguistics; Information retrieval; Trigram","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001142981,0.001364548,0.001281447,0.006495435,0.001166285,0.002411442,0.002374571,0.001551663,0.03525072],"category_scores_gemma":[0.007211194,0.0007201092,0.0006873272,0.006857741,0.0005815396,0.005956205,0.002584151,0.001058705,0.02419136],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001126856,"about_ca_system_score_gemma":0.001859426,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007225091,"about_ca_topic_score_gemma":0.01356954,"domain_scores_codex":[0.998579,0.0002574113,0.0003685938,0.0003372036,0.0003713558,0.00008639375],"domain_scores_gemma":[0.995672,0.001478225,0.000414208,0.000840749,0.001226504,0.0003683034],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.002400892,0.000620743,0.01738151,0.01521047,0.0002875762,0.002859334,0.002972913,0.001639668,0.0190331,0.01265909,0.6871895,0.2377453],"study_design_scores_gemma":[0.0003376179,0.0001525401,0.02274178,0.0005054148,0.0001046933,0.0009402714,0.00137002,0.001522824,0.004826951,0.002827835,0.9645225,0.0001474561],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.06240235,0.004343545,0.004904768,0.0004611956,0.0001932975,0.0005077796,0.9013035,0.003828419,0.02205507],"genre_scores_gemma":[0.05074522,0.001635215,0.01714166,0.0002584519,0.00008072895,0.0009507276,0.9231363,0.0007269762,0.005324711],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.03525072,"threshold_uncertainty_score":0.1179254,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1568235960596101,"score_gpt":0.5424968809298324,"score_spread":0.3856732848702222,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}