{"id":"W4318067345","doi":"10.1002/sim.9665","title":"Measuring the performance of prediction models to personalize treatment choice","year":2023,"lang":"en","type":"article","venue":"Statistics in Medicine","topic":"Advanced Causal Inference Techniques","field":"Mathematics","cited_by":43,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Medical Research Council; Medical Research Council Canada; ZonMw; European Commission; Schweizerischer Nationalfonds zur Förderung der Wissenschaftlichen Forschung; National Science Foundation","keywords":"Computer science; Covariate; Calibration; Machine learning; Baseline (sea); Outcome (game theory); Range (aeronautics); Artificial intelligence; Predictive modelling; Data mining; Statistics; Mathematics","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[{"model":"gpt","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"},{"model":"grok","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"},{"model":"opus","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1172135,0.002798102,0.002224666,0.004157509,0.000975647,0.003926649,0.002051204,0.00397296,0.002022962],"category_scores_gemma":[0.3105517,0.001091307,0.002051766,0.003575152,0.002664518,0.005325965,0.003248508,0.005076789,0.0006948784],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002062385,"about_ca_system_score_gemma":0.002880867,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003722382,"about_ca_topic_score_gemma":0.00290911,"domain_scores_codex":[0.9441991,0.04468966,0.002082424,0.003967615,0.004325046,0.0007361512],"domain_scores_gemma":[0.527194,0.4289744,0.0148815,0.02306686,0.004502642,0.001380632],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001234584,0.0004839844,0.1132262,0.0005586804,0.002710707,0.00009496439,0.0007165562,0.6942672,0.0007915617,0.03655876,0.005219519,0.1441374],"study_design_scores_gemma":[0.0001051701,0.000343556,0.01152827,0.0001815467,0.0002456753,0.0001143492,0.0001169612,0.9287987,0.001396669,0.05561563,0.001463636,0.00008979304],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1350998,0.00373968,0.8467054,0.005733678,0.000248473,0.0004245713,0.001679217,0.001172644,0.005196492],"genre_scores_gemma":[0.7779202,0.001057185,0.2168059,0.0009108179,0.0002926365,0.0004002265,0.001732338,0.0001894263,0.0006911443],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.1172135,"threshold_uncertainty_score":0,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2535139144086483,"score_gpt":0.4251422307621626,"score_spread":0.1716283163535143,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}