{"id":"W4393212490","doi":"10.48550/arxiv.2403.15567","title":"Do not trust what you trust: Miscalibration in Semi-supervised Learning","year":2024,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; Compute Canada","keywords":"Psychology; Knowledge management; Computer science; Artificial intelligence","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03048223,0.001638447,0.002157969,0.002071592,0.002302544,0.003839039,0.004502131,0.003804388,0.001244315],"category_scores_gemma":[0.1182105,0.001297765,0.000889281,0.002172802,0.006522851,0.007801736,0.005343378,0.005886898,0.000732457],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002573851,"about_ca_system_score_gemma":0.002281309,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003793973,"about_ca_topic_score_gemma":0.004548467,"domain_scores_codex":[0.9646642,0.02104928,0.001682298,0.006210694,0.00557117,0.0008224416],"domain_scores_gemma":[0.8370919,0.1129685,0.01416367,0.02531799,0.00878136,0.00167656],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002110502,0.0003684622,0.03546475,0.001276226,0.0009608291,0.001080538,0.006371625,0.3997951,0.008601395,0.08842072,0.01572426,0.4398257],"study_design_scores_gemma":[0.00006141674,0.0001428657,0.00278425,0.000170729,0.00007650765,0.0003883986,0.0003431655,0.8656517,0.007537099,0.1183871,0.004367777,0.00008913042],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08872207,0.001704052,0.9010258,0.003030035,0.0001590284,0.000149317,0.000282042,0.001800495,0.003127061],"genre_scores_gemma":[0.8669119,0.000390061,0.1283058,0.001221013,0.00029322,0.0002004493,0.0005038521,0.0003690224,0.001804655],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.03048223,"threshold_uncertainty_score":0.1612073,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06709897106881242,"score_gpt":0.1951836255907838,"score_spread":0.1280846545219714,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}