{"id":"W3130655324","doi":"10.3171/2020.8.spine20963","title":"Utility of prediction model score: a proposed tool to standardize the performance and generalizability of clinical predictive models based on systematic review","year":2021,"lang":"en","type":"review","venue":"Journal of Neurosurgery Spine","topic":"Management of metastatic bone disease","field":"Medicine","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto; St. Michael's Hospital","funders":"","keywords":"Medicine; Generalizability theory; Predictive modelling; Discriminative model; External validity; Artificial intelligence; Machine learning; Computer science; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3245553,0.003603874,0.008682238,0.05144989,0.001532688,0.007783706,0.004408098,0.002486896,0.003307518],"category_scores_gemma":[0.6108453,0.001396974,0.01994965,0.03307604,0.003597428,0.009181106,0.007043449,0.002497502,0.000578284],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004125077,"about_ca_system_score_gemma":0.008587804,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003091893,"about_ca_topic_score_gemma":0.005972251,"domain_scores_codex":[0.7192564,0.1576149,0.06563431,0.01488579,0.04094833,0.00166024],"domain_scores_gemma":[0.3667977,0.5182015,0.04917791,0.02709892,0.03709027,0.001633809],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"systematic_review","study_design_scores_codex":[0.002939815,0.0002134837,0.3173168,0.1843356,0.1393519,0.0006981654,0.00216785,0.01731866,0.001042027,0.01126684,0.01498994,0.3083589],"study_design_scores_gemma":[0.00494068,0.004348864,0.2107955,0.1364588,0.3098536,0.003726569,0.002678536,0.1707895,0.003481491,0.1111203,0.04050823,0.001298064],"study_design_candidate":"systematic_review","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"review","genre_scores_codex":[0.1110504,0.272402,0.517811,0.01258502,0.002427456,0.03451355,0.02799093,0.00495351,0.01626602],"genre_scores_gemma":[0.7354161,0.01813673,0.2186403,0.001913368,0.000619463,0.01768019,0.006883806,0.0003231784,0.0003868513],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.6754447,"threshold_uncertainty_score":0.8329436,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1246144456328913,"score_gpt":0.3862163312563405,"score_spread":0.2616018856234492,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}