{"id":"W1978265849","doi":"10.1108/00220410610688750","title":"Aggregation consistency and frequency of Chinese words and characters","year":2006,"lang":"en","type":"article","venue":"Journal of Documentation","topic":"Advanced Text Analysis Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal","funders":"","keywords":"Zipf's law; Consistency (knowledge bases); Syllable; Romanization; Vernacular; Distribution (mathematics); Frequency distribution; Set (abstract data type); Mathematics; Computer science; Econometrics; Natural language processing; Data set; Statistics; Linguistics; Artificial intelligence; Speech recognition","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008071297,0.0002746798,0.0006870587,0.008721721,0.0009123872,0.002167905,0.0007415465,0.0003041133,0.002552629],"category_scores_gemma":[0.06202018,0.0001924057,0.0006233651,0.01545505,0.001515908,0.001687407,0.001531154,0.0003649883,0.0003927718],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001307888,"about_ca_system_score_gemma":0.0007549166,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0040358,"about_ca_topic_score_gemma":0.002833572,"domain_scores_codex":[0.9846631,0.003506273,0.003028985,0.00260495,0.005752502,0.0004441757],"domain_scores_gemma":[0.9360713,0.03213549,0.01391756,0.009441185,0.008006214,0.0004282031],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0003321465,0.00005424015,0.8967346,0.0005509155,0.0004557681,0.0003173384,0.005644399,0.002113001,0.003043375,0.004676047,0.0009789879,0.0850992],"study_design_scores_gemma":[0.00001183537,0.0001054611,0.9824869,0.00007774704,0.0001220161,0.0003520813,0.002001359,0.006175267,0.002373625,0.00371419,0.002533098,0.00004640788],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9846321,0.0002897828,0.007835521,0.00009279475,0.00002643316,0.00008306446,0.001620112,0.0001000914,0.005319995],"genre_scores_gemma":[0.9965222,0.0000588211,0.001947978,0.00001484947,0.00001820006,0.00007265058,0.001123253,0.00001490903,0.0002272125],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.008721721,"threshold_uncertainty_score":0.04268563,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.004694726306288027,"score_gpt":0.2702126740971309,"score_spread":0.2655179477908429,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}