{"id":"W4400584230","doi":"10.1002/cjs.11815","title":"Robust estimation of loss‐based measures of model performance under covariate shift","year":2024,"lang":"en","type":"article","venue":"Canadian Journal of Statistics","topic":"Statistical Methods and Inference","field":"Mathematics","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Institute of General Medical Sciences; National Institutes of Health; National Cancer Institute; National Heart, Lung, and Blood Institute; U.S. National Library of Medicine; Patient-Centered Outcomes Research Institute","keywords":"Covariate; Statistics; Estimation; Econometrics; Computer science; Mathematics; Engineering","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[{"model":"gpt","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"},{"model":"grok","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"},{"model":"opus","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0345754,0.002070765,0.002148139,0.002317961,0.0006242846,0.002321597,0.003665122,0.002189434,0.001969162],"category_scores_gemma":[0.161993,0.0009776992,0.001870118,0.001728387,0.002694074,0.003510874,0.004008288,0.003800609,0.0006091836],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001810751,"about_ca_system_score_gemma":0.002238816,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003083139,"about_ca_topic_score_gemma":0.001631639,"domain_scores_codex":[0.9883527,0.007597913,0.0005694648,0.001405684,0.001723743,0.0003505973],"domain_scores_gemma":[0.8997262,0.07778784,0.007571289,0.01051871,0.003780835,0.0006150699],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002429694,0.0001634566,0.01011936,0.0003010108,0.000835733,0.0001405544,0.0002041753,0.8722744,0.00170426,0.04072842,0.001958445,0.07132722],"study_design_scores_gemma":[0.00003241323,0.0001220784,0.001952641,0.00004831856,0.00005862167,0.00006281581,0.0000269041,0.9619821,0.001185313,0.03371409,0.0007732245,0.00004149488],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01017901,0.0002881356,0.9884594,0.0001914174,0.0000270071,0.00006518703,0.0001577738,0.000300552,0.0003314786],"genre_scores_gemma":[0.5640793,0.0009966703,0.4275681,0.0005191301,0.0002962446,0.001132056,0.002630655,0.0005288717,0.002248874],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.0345754,"threshold_uncertainty_score":0,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2748110263819734,"score_gpt":0.3443083888726723,"score_spread":0.06949736249069888,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}