{"id":"W2159249756","doi":"10.1109/icdm.2001.989536","title":"Subject classification in the Oxford English Dictionary","year":2002,"lang":"en","type":"article","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":13,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"Mitacs","keywords":"Computer science; Subject (documents); Artificial intelligence; Probabilistic logic; Natural language processing; Weighting; Term (time); Naive Bayes classifier; Hierarchy; Word (group theory); Information retrieval; Linguistics; Support vector machine","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002267287,0.00005245035,0.0000404452,0.00007174106,0.00005609649,0.0001089732,0.0007519349,0.00003749298,0.00003110795],"category_scores_gemma":[0.00006805927,0.00003238862,0.00001866264,0.0004481593,0.00001766821,0.0004587807,0.00005402504,0.0001352799,0.00001037825],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00002466554,"about_ca_system_score_gemma":0.00000547943,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001138688,"about_ca_topic_score_gemma":0.000008960752,"domain_scores_codex":[0.9994255,0.00005100822,0.00009805136,0.0001579138,0.0001615863,0.0001059355],"domain_scores_gemma":[0.999526,0.00007283221,0.0000277729,0.0003196547,0.00004145884,0.00001224022],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000001875438,0.0001504319,0.004145338,0.00001005975,0.00000299604,0.00001994096,0.007210126,0.000001565958,0.0007110991,0.7298396,0.02376949,0.2341374],"study_design_scores_gemma":[0.0008600338,0.0003190384,0.06279261,0.00009762785,0.0000109308,0.0001677847,0.00135395,0.4666812,0.01238666,0.2847383,0.1694586,0.001133279],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0140915,0.002907243,0.8252945,0.01105169,0.0004308974,0.0004165322,7.982999e-7,0.002420123,0.1433867],"genre_scores_gemma":[0.899776,0.00003263741,0.09901851,0.0007771443,0.00005187747,0.00002050394,8.270857e-7,0.000002387266,0.0003201024],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8856845,"threshold_uncertainty_score":0.1397295,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02662954429509814,"score_gpt":0.2525118843802993,"score_spread":0.2258823400852012,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}