{"id":"W2128133607","doi":"","title":"Semi-supervised Document Classification with a Mislabeling Error Model","year":2009,"lang":"en","type":"article","venue":"NPARC","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":true,"ca_institutions":"National Research Council Canada","funders":"","keywords":"Probabilistic latent semantic analysis; Computer science; Artificial intelligence; Extension (predicate logic); Probabilistic logic; Machine learning; Set (abstract data type); Multiclass classification; Topic model; Document classification; Pattern recognition (psychology); Supervised learning; Data mining; Support vector machine; Artificial neural network","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01009825,0.0009405884,0.002151563,0.001701246,0.0009686743,0.002069078,0.003391063,0.00219867,0.001079701],"category_scores_gemma":[0.02087581,0.0007002385,0.001220043,0.001922522,0.001992273,0.003907328,0.001650659,0.003112118,0.000879602],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001445475,"about_ca_system_score_gemma":0.001400849,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0015984,"about_ca_topic_score_gemma":0.002051048,"domain_scores_codex":[0.9906794,0.004926066,0.0005066583,0.001657033,0.001988114,0.0002427913],"domain_scores_gemma":[0.9587018,0.02449038,0.003970778,0.007777976,0.004659603,0.0003995154],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008783285,0.000709913,0.01143343,0.0004853903,0.0004931672,0.0002746798,0.0006597488,0.471712,0.008337335,0.02690868,0.007340147,0.4707672],"study_design_scores_gemma":[0.00001173764,0.00003758287,0.0004366527,0.00001005382,0.00001835501,0.00006363943,0.00001448242,0.9906948,0.001883363,0.006361332,0.0004540043,0.00001398646],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02784203,0.0002255896,0.9702728,0.0002956364,0.00005847857,0.00006599593,0.0001134028,0.0005930137,0.0005330304],"genre_scores_gemma":[0.5977376,0.0001989523,0.3969062,0.0002576559,0.0002861549,0.0002837364,0.0006682972,0.0001521341,0.003509233],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01009825,"threshold_uncertainty_score":0.05340528,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03335914134963362,"score_gpt":0.2681762081773369,"score_spread":0.2348170668277033,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}