{"id":"W4415709876","doi":"10.1371/journal.pcbi.1013624","title":"Nine quick tips for trustworthy machine learning in the biomedical sciences","year":2025,"lang":"en","type":"article","venue":"PLoS Computational Biology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"Ministero dell'Università e della Ricerca","keywords":"Trustworthiness; Pipeline (software); Software deployment; Learning curve; Open research; Open science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005486791,0.00005937998,0.0001296032,0.0001909435,0.0001862168,0.000009298861,0.00009423854,0.00006953023,0.00005367466],"category_scores_gemma":[0.0006921465,0.00003914518,0.00003280269,0.0004172957,0.0002325074,0.00002032057,0.00001454947,0.0001640348,0.00001539055],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003406284,"about_ca_system_score_gemma":0.0003318255,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001361386,"about_ca_topic_score_gemma":0.00003970423,"domain_scores_codex":[0.9991951,0.0001016098,0.0002641832,0.0001772087,0.00009522997,0.0001666947],"domain_scores_gemma":[0.9983352,0.001447395,0.00004399155,0.00004930898,0.00009673937,0.00002740409],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004206093,0.000972992,0.6517226,0.0002299326,0.00008415231,0.00000504655,0.002556715,0.003321686,0.0007297684,0.1364572,0.006015104,0.1974842],"study_design_scores_gemma":[0.0006307662,0.002912819,0.0603077,0.0002464896,0.00008495709,0.00006337075,0.002819821,0.6440088,0.0007789767,0.202442,0.08544743,0.0002569094],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.869431,0.0008076627,0.02625915,0.1007631,0.0004966353,0.000740969,0.00001264731,0.00005094839,0.00143795],"genre_scores_gemma":[0.9926016,0.00001638493,0.003123079,0.003556169,0.0001845747,0.00006762086,0.0003144924,0.000002736453,0.000133387],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.640687,"threshold_uncertainty_score":0.1596294,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1733115763309579,"score_gpt":0.4585847963718956,"score_spread":0.2852732200409378,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}