{"id":"W7117253960","doi":"10.6000/1929-6029.2025.14.75","title":"Dataset-Specific Bootstrap-Stability Weighting for Calibrated and Clinically Useful Ensemble Prediction in Medical Diagnosis","year":2025,"lang":"en","type":"article","venue":"International Journal of Statistics in Medical Research","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Weighting; Calibration; Medical diagnosis; Random forest; Resampling; Decision tree; Complement (music); Probabilistic logic","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00737721,0.0006893803,0.0007155925,0.001162233,0.0003660386,0.0007498884,0.0008186619,0.0007563842,0.0008365111],"category_scores_gemma":[0.01941109,0.0002624054,0.0005245861,0.0005702195,0.0004726046,0.0008907901,0.001240188,0.0009574161,0.0002772332],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006907169,"about_ca_system_score_gemma":0.00082307,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001554414,"about_ca_topic_score_gemma":0.002048499,"domain_scores_codex":[0.998195,0.001021052,0.00009362464,0.0003246871,0.0002909161,0.00007473397],"domain_scores_gemma":[0.9945498,0.00328815,0.0005522955,0.0006222774,0.0008266864,0.00016081],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006757203,0.0002628545,0.04027123,0.0001687424,0.0003466859,0.0001269731,0.0002404998,0.5016701,0.01709055,0.003817027,0.002517516,0.4328121],"study_design_scores_gemma":[0.00002057589,0.0001459346,0.004824729,0.00002503296,0.00004626371,0.00007418401,0.00002053654,0.9835579,0.006816217,0.003890967,0.0005590345,0.0000185946],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.22328,0.0006925109,0.7730491,0.0003438579,0.00003648164,0.0001351249,0.0001670759,0.001191375,0.001104531],"genre_scores_gemma":[0.8793368,0.00009362954,0.1198069,0.00008855187,0.00003286687,0.00009927672,0.0002375278,0.00007495315,0.0002294872],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.00737721,"threshold_uncertainty_score":0.03901488,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1355572804016163,"score_gpt":0.5023661450127471,"score_spread":0.3668088646111308,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}