{"id":"W4387140562","doi":"10.3390/s23198122","title":"Towards Building a Trustworthy Deep Learning Framework for Medical Image Analysis","year":2023,"lang":"en","type":"article","venue":"Sensors","topic":"COVID-19 diagnosis using AI","field":"Medicine","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; National Research Council Canada; University of Waterloo","funders":"National Research Council Canada; University of Waterloo","keywords":"Deep learning; Computer science; Benchmark (surveying); Artificial intelligence; Machine learning; Visualization; Trustworthiness; Data science; Computer security","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00626494,0.0008855543,0.00108129,0.001184279,0.0004599581,0.002063792,0.002324655,0.002006775,0.0012334],"category_scores_gemma":[0.01372519,0.0007347287,0.001179303,0.0005411578,0.00183073,0.002277682,0.003293703,0.003469498,0.0006773539],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001576725,"about_ca_system_score_gemma":0.00253425,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004649828,"about_ca_topic_score_gemma":0.005622091,"domain_scores_codex":[0.99794,0.0007703282,0.0001209626,0.0003706509,0.0006738165,0.0001242109],"domain_scores_gemma":[0.9955832,0.002047502,0.0005073901,0.0005808639,0.001036462,0.0002445343],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003012324,0.0001622997,0.004437786,0.0001968543,0.0002556301,0.0002170156,0.0002616773,0.7465472,0.01073011,0.04902299,0.005397031,0.1824701],"study_design_scores_gemma":[0.000006266271,0.0000201815,0.00008420533,0.00001166042,0.000007993935,0.00002239418,0.000006355639,0.9891751,0.001055115,0.009078527,0.0005274648,0.00000462848],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.004213667,0.0002647836,0.9940303,0.0005567018,0.00001993015,0.00003616505,0.00004821415,0.0005161277,0.0003140586],"genre_scores_gemma":[0.3199111,0.0007603954,0.6749458,0.00106786,0.0001668259,0.0002597034,0.0005005146,0.0002943375,0.002093398],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.00626494,"threshold_uncertainty_score":0.03313255,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02300223375220457,"score_gpt":0.3671497307515774,"score_spread":0.3441474969993729,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}