{"id":"W4387144848","doi":"10.2196/48996","title":"Automated Paper Screening for Clinical Reviews Using Large Language Models: Data Analysis Study","year":2023,"lang":"en","type":"article","venue":"Journal of Medical Internet Research","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":177,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto; University of Calgary","funders":"","keywords":"Computer science; Workflow; Machine learning; Python (programming language); Artificial intelligence; Natural language processing; Information retrieval; Data science; Data mining; Database; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1161201,0.001404968,0.002594622,0.006737723,0.001194192,0.003372384,0.003132107,0.001965692,0.002909615],"category_scores_gemma":[0.4257937,0.001019419,0.005645724,0.005947095,0.001302001,0.002471442,0.002780136,0.001865826,0.00139411],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002430154,"about_ca_system_score_gemma":0.006006157,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003305635,"about_ca_topic_score_gemma":0.005592616,"domain_scores_codex":[0.80793,0.1439206,0.02128593,0.01424076,0.01171428,0.0009083821],"domain_scores_gemma":[0.2685179,0.6415907,0.04316279,0.0241674,0.02143389,0.001127185],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.01913152,0.004811009,0.4806841,0.03518407,0.01984899,0.002651581,0.00916566,0.04147758,0.005073642,0.003368654,0.02781273,0.3507904],"study_design_scores_gemma":[0.01032142,0.009115619,0.3986384,0.007534011,0.01903219,0.006338839,0.005692879,0.4716382,0.01750455,0.01634504,0.03670898,0.001129872],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.755451,0.01374148,0.1860833,0.002394531,0.0003238058,0.01565601,0.02081027,0.003113229,0.002426336],"genre_scores_gemma":[0.845069,0.00109655,0.1280913,0.0008688457,0.0001959006,0.0127917,0.01105787,0.000240547,0.0005882427],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8838799,"threshold_uncertainty_score":0.6141092,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.9651539480355735,"score_gpt":0.7553193395729202,"score_spread":0.2098346084626533,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}