{"id":"W3029422798","doi":"","title":"Multi-class Multilingual Classification of Wikipedia Articles Using Extended Named Entity Tag Set","year":2019,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Categorization; Set (abstract data type); Structuring; Natural language processing; Text categorization; Class (philosophy); Artificial intelligence; German; Information retrieval; Named entity; Linguistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002837964,0.001382215,0.001178338,0.0101842,0.001508661,0.002819166,0.001184534,0.001418752,0.002141834],"category_scores_gemma":[0.006332737,0.0003233939,0.001869935,0.005428861,0.0004060957,0.003045803,0.001984888,0.001451991,0.003080396],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008740887,"about_ca_system_score_gemma":0.001483878,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006266492,"about_ca_topic_score_gemma":0.01144962,"domain_scores_codex":[0.9975554,0.0005902887,0.0003040662,0.0007612456,0.0004695792,0.0003193437],"domain_scores_gemma":[0.9936998,0.003101236,0.0004520415,0.0005450082,0.001852247,0.0003496705],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003017676,0.00230041,0.0954522,0.001277274,0.001618168,0.002046669,0.001397956,0.02080498,0.03262812,0.003965487,0.05099877,0.7844922],"study_design_scores_gemma":[0.0001292129,0.0004985664,0.06469949,0.0002716888,0.001361462,0.001389262,0.002258907,0.8561798,0.02978007,0.01250252,0.03070146,0.0002275587],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.6105973,0.008643776,0.3252208,0.001562499,0.002338468,0.0006867387,0.02819711,0.008636776,0.01411663],"genre_scores_gemma":[0.8396819,0.001184016,0.1042086,0.0002168441,0.000984824,0.0003923097,0.04320196,0.0005688253,0.009560631],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.0101842,"threshold_uncertainty_score":0.01500881,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1362531364585823,"score_gpt":0.228238631476107,"score_spread":0.0919854950175247,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}