{"id":"W4391220613","doi":"10.2196/53378","title":"A Machine Learning Approach with Human-AI Collaboration for Automated Classification of Patient Safety Event Reports: Algorithm Development and Validation Study","year":2024,"lang":"en","type":"article","venue":"JMIR Human Factors","topic":"Patient Safety and Medication Errors","field":"Health Professions","cited_by":21,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"Agency for Healthcare Research and Quality","keywords":"Computer science; Artificial intelligence; Machine learning; Classifier (UML); Confusion matrix; Confusion; Natural language processing","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007677405,0.0001929346,0.0002699592,0.000277104,0.001000978,0.00001025306,0.0000598938,0.0001331896,0.00003475172],"category_scores_gemma":[0.00007389911,0.0001499145,0.00003046976,0.0003995491,0.00004692145,0.0002292363,0.0000384107,0.0003176578,0.000002465219],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003259704,"about_ca_system_score_gemma":0.0003371123,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00003440735,"about_ca_topic_score_gemma":0.00005748291,"domain_scores_codex":[0.9975463,0.0003161097,0.001026824,0.0004266145,0.0004572818,0.0002268993],"domain_scores_gemma":[0.998544,0.0001206504,0.000692539,0.0002074186,0.0003348226,0.0001005938],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"observational","study_design_scores_codex":[0.0002800787,0.002766752,0.4596741,0.002808725,0.000615883,0.000009243506,0.5121931,0.002625026,0.003251823,0.002703562,0.001408545,0.01166316],"study_design_scores_gemma":[0.002945076,0.002501978,0.7783809,0.001011983,0.0002284986,0.0000038834,0.09779745,0.04515253,0.00107493,0.0001234499,0.07006503,0.0007143175],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9786848,0.00004648053,0.01568533,0.0001185581,0.0002098588,0.004542309,0.00003579652,0.0004308828,0.0002459184],"genre_scores_gemma":[0.9942698,0.000002401263,0.001304791,0.00002021086,0.0000328006,0.001361933,0.002523672,0.00003318013,0.0004512066],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4143957,"threshold_uncertainty_score":0.7698815,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06328858342681644,"score_gpt":0.4205311001836615,"score_spread":0.3572425167568451,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}