{"id":"W4390970405","doi":"10.1371/journal.pdig.0000417","title":"Peer review of GPT-4 technical report and systems card","year":2024,"lang":"en","type":"article","venue":"PLOS Digital Health","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":96,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"National Institute on Minority Health and Health Disparities; National Institute of Biomedical Imaging and Bioengineering; Fogarty International Center; Gordon and Betty Moore Foundation; National Heart, Lung, and Blood Institute; Radiological Society of North America; National Institutes of Health; National Science Foundation","keywords":"Transparency (behavior); CLARITY; Intellectual property; Accountability; Health care; Harm; Business; Public relations; Political science; Computer science; Computer security","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1853608,0.001556486,0.002184132,0.01247314,0.007275964,0.02984611,0.009914058,0.01330059,0.1055908],"category_scores_gemma":[0.5297117,0.001629009,0.003379758,0.007726799,0.01047044,0.01622584,0.01428256,0.01190258,0.1226508],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01275859,"about_ca_system_score_gemma":0.07892793,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006577718,"about_ca_topic_score_gemma":0.004424268,"domain_scores_codex":[0.6689294,0.08256107,0.02488775,0.01196839,0.2006346,0.0110188],"domain_scores_gemma":[0.2881905,0.07496737,0.01949699,0.07858218,0.521654,0.01710903],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00005608356,0.00004358297,0.0003230776,0.0009560396,0.00002479269,0.0002031465,0.0008641686,0.0002484611,0.0006132118,0.01547472,0.9137741,0.06741858],"study_design_scores_gemma":[0.00001968211,0.0000327632,0.0003623457,0.0009898412,0.00001097809,0.00008665822,0.0003359348,0.0003299431,0.0006299517,0.003910746,0.993246,0.00004521668],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"commentary","genre_gemma":"review","genre_scores_codex":[0.00330083,0.007450768,0.08902434,0.3256807,0.227867,0.01714095,0.008906009,0.01365045,0.3069789],"genre_scores_gemma":[0.06659326,0.01511963,0.09223771,0.06434542,0.05094349,0.01590152,0.02247067,0.02297921,0.6494091],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.8146392,"threshold_uncertainty_score":0.9802933,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2373284398045087,"score_gpt":0.4738384137552404,"score_spread":0.2365099739507317,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}