{"id":"W4387140562","doi":"10.3390/s23198122","title":"Towards Building a Trustworthy Deep Learning Framework for Medical Image Analysis","year":2023,"lang":"en","type":"article","venue":"Sensors","topic":"COVID-19 diagnosis using AI","field":"Medicine","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; National Research Council Canada; University of Waterloo","funders":"National Research Council Canada; University of Waterloo","keywords":"Deep learning; Computer science; Benchmark (surveying); Artificial intelligence; Machine learning; Visualization; Trustworthiness; Data science; Computer security","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0009680357,0.0001961674,0.0005879726,0.0006967809,0.0001820376,0.00004602841,0.0001426145,0.000271498,0.0005533949],"category_scores_gemma":[0.01152929,0.0001841527,0.0004893681,0.002663934,0.00009728587,0.00003843626,0.00008929777,0.0005442443,0.0001293223],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001348011,"about_ca_system_score_gemma":0.0001440987,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001197136,"about_ca_topic_score_gemma":0.00003282859,"domain_scores_codex":[0.9977961,0.00008983038,0.0003515103,0.0004948701,0.0007269634,0.0005407946],"domain_scores_gemma":[0.9973674,0.001681098,0.00009798646,0.0003691321,0.0001412581,0.0003431729],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001613159,0.001036166,0.2234574,0.002593236,0.01399503,0.005446825,0.01739926,0.1011754,0.004345427,0.01342332,0.04230096,0.5732138],"study_design_scores_gemma":[0.002503967,0.0004183175,0.06819829,0.0006737709,0.004532069,0.0000418435,0.001464438,0.745204,0.002433286,0.00305405,0.1707381,0.0007378257],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9046701,0.0001173731,0.03958232,0.05388449,0.0003069221,0.0003923282,0.000007324865,0.0008587296,0.0001804638],"genre_scores_gemma":[0.9446554,0.0002043185,0.04553773,0.007825767,0.0008728474,0.00007936185,0.00008548363,0.0001007476,0.0006383806],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.6440287,"threshold_uncertainty_score":0.996797,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02300223375220457,"score_gpt":0.3671497307515774,"score_spread":0.3441474969993729,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}