{"id":"W2989894618","doi":"10.1101/19012518","title":"Labelling chest x-ray reports using an open-source NLP and ML tool for text data binary classification","year":2019,"lang":"en","type":"preprint","venue":"medRxiv","topic":"COVID-19 diagnosis using AI","field":"Medicine","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"St. Michael's Hospital; University of Toronto","funders":"University of Toronto","keywords":"Artificial intelligence; Python (programming language); Medicine; Natural language processing; Computer science; Machine learning; Radiology; Generalizability theory; Chest radiograph; Radiography; Programming language","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.002718029,0.0004270229,0.000832509,0.0002504369,0.0001989021,0.0004226149,0.0008614317,0.0004642893,0.00004162048],"category_scores_gemma":[0.001626345,0.000424343,0.0000689443,0.0001886024,0.0001114246,0.0004663931,0.002652298,0.0006323656,0.00001109459],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002091353,"about_ca_system_score_gemma":0.0008163084,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003854152,"about_ca_topic_score_gemma":0.00001977263,"domain_scores_codex":[0.9962251,0.0001405545,0.0008433883,0.001996831,0.0004069127,0.0003871905],"domain_scores_gemma":[0.9937161,0.0005296149,0.0007802264,0.004510672,0.0002599324,0.0002034757],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007996575,0.003314436,0.7134227,0.0131053,0.0007816897,0.000639768,0.002612891,0.01397536,0.1822249,0.0000722783,0.02617341,0.04287758],"study_design_scores_gemma":[0.002030184,0.0004459511,0.2013312,0.004678674,0.001536167,0.0002314858,0.0002857997,0.4271756,0.001475465,0.000183723,0.3593545,0.001271317],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9738935,0.0007352841,0.01329525,0.007234911,0.001016914,0.003498033,0.00009095293,0.0001841089,0.00005102258],"genre_scores_gemma":[0.9655399,0.0002573252,0.02707662,0.003147366,0.0007503623,0.0001585472,0.002245593,0.0002103142,0.0006139494],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5120915,"threshold_uncertainty_score":0.9998208,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.204527997033697,"score_gpt":0.3973192601566911,"score_spread":0.1927912631229941,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}