{"id":"W2332964166","doi":"10.1515/cllt-2013-0014","title":"Topic marking in a Shanghainese corpus: from observation to prediction","year":2013,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Linguistic Variation and Morphology","field":"Social Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Polytomous Rasch model; Computer science; Natural language processing; Logistic regression; Artificial intelligence; Multivariate statistics; Selection (genetic algorithm); Computational linguistics; Machine learning; Statistics; Item response theory; Mathematics; Psychometrics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002981134,0.0003160675,0.0004077507,0.001757078,0.0005792803,0.001543711,0.0003548808,0.0003649268,0.002069499],"category_scores_gemma":[0.01657699,0.0003300281,0.0002589127,0.003086756,0.0007993223,0.001272693,0.001152458,0.0008349832,0.0007104019],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006143408,"about_ca_system_score_gemma":0.0004621311,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0126662,"about_ca_topic_score_gemma":0.0186706,"domain_scores_codex":[0.9989229,0.0005457941,0.00006944052,0.0002894616,0.0001152225,0.00005714969],"domain_scores_gemma":[0.9782601,0.01765276,0.001134047,0.001436797,0.001272186,0.0002441989],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001115658,0.0001935821,0.7189896,0.0009259523,0.0002925265,0.001306379,0.02614556,0.01261129,0.02175098,0.01017627,0.01649873,0.1899934],"study_design_scores_gemma":[0.00006530641,0.0001063766,0.8568745,0.0001713756,0.0001337592,0.0004776815,0.00676098,0.09567187,0.006215207,0.007315499,0.02607469,0.0001328182],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9769245,0.0007023466,0.01394005,0.0003738598,0.0000487387,0.00003846947,0.004458107,0.0002632238,0.0032506],"genre_scores_gemma":[0.9877334,0.0001810151,0.006000651,0.0000251163,0.00003021513,0.00005087616,0.005073594,0.00008393982,0.0008211443],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0126662,"threshold_uncertainty_score":0.02518493,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02289286924627669,"score_gpt":0.2744754931635357,"score_spread":0.251582623917259,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}