{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":4,"total_is_capped":false,"direct_labels_cover":0,"predictions_cover":4,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"5570edbb5698","filters":{"venue":"BMJ Digital Health & AI"}},"results":[{"id":"W4413252984","doi":"10.1136/bmjdhai-2025-000114","title":"Development and prospective evaluation of a machine learning model to predict serious cardiac outcomes among paediatric cardiac inpatients","year":2025,"lang":"en","type":"article","venue":"BMJ Digital Health & AI","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Canadian Patient Safety Institute; SickKids Foundation; Toronto General Hospital; Casey House; Institute for Clinical Evaluative Sciences; Hospital for Sick Children","funders":"","keywords":"Retrospective cohort study; Medicine; Receiver operating characteristic; Logistic regression; Prospective cohort study; Emergency medicine; Internal medicine","authors":[{"name":"Santiago Eduardo Arciniegas","is_ca":true},{"name":"Adam P. Yan","is_ca":true},{"name":"Adam Rapoport","is_ca":true},{"name":"Aamir Jeewa","is_ca":true},{"name":"Rugambwa Michael Muhame","is_ca":true},{"name":"Lin Guo","is_ca":true},{"name":"Agata Wolochacz","is_ca":true},{"name":"Karim Jessa","is_ca":true},{"name":"George Tomlinson","is_ca":true},{"name":"C Ferracci","is_ca":true},{"name":"Lillian Sung","is_ca":true},{"name":"Anne I. Dipchand","is_ca":true},{"name":"Kate Nelson","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02054444801677871,"gpt":0.3433876705748698,"spread":0.3228432225580911,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001870371,0.0002463546,0.0005595938,0.0003866013,0.0002735554,0.0001469428,0.0003324373,0.00008162929,7.05838e-7],"category_scores_gemma":[0.0007804842,0.000235125,0.00008322545,0.0008172971,0.00003283804,0.0005418481,0.0005655007,0.0003680826,0.0000055032],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005816164,"about_ca_system_score_gemma":0.001791286,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003456722,"about_ca_topic_score_gemma":0.00005735263,"domain_scores_codex":[0.9967848,0.000320985,0.0007626691,0.0006301279,0.001029275,0.0004721459],"domain_scores_gemma":[0.9983469,0.0001501772,0.0003068553,0.0004268402,0.0004893166,0.0002799037],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000012478,0.00002893258,0.7363907,0.0002361075,0.00003126877,3.11372e-7,0.002932993,0.01069268,2.115996e-7,0.0006066873,0.00009193121,0.2489757],"study_design_scores_gemma":[0.0003665341,0.0001669534,0.6410605,0.0001196763,0.00001096756,4.161953e-7,0.00005978875,0.3571169,0.000007213998,0.0004542295,0.0004780535,0.0001587193],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9684686,0.001272583,0.02196318,0.00216192,0.0005878588,0.004047449,0.00005653534,0.0002376459,0.001204208],"genre_scores_gemma":[0.9882661,0.00001865107,0.01059269,0.0004139369,0.00003176865,0.0003860596,0.00003226711,0.00001778619,0.0002407948],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3464243,"threshold_uncertainty_score":0.9588119,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4414189579","doi":"10.1136/bmjdhai-2025-000014","title":"Optimising large language models for clinical information extraction: a benchmarking study in the context of ulcerative colitis research","year":2025,"lang":"en","type":"article","venue":"BMJ Digital Health & AI","topic":"Biomedical Text Mining and Ontologies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"Clinical and Translational Science Institute, University of California, Los Angeles; Clinical and Translational Science Institute, University of California, San Francisco","keywords":"Benchmarking; Context (archaeology); Adaptation (eye); Oracle; Language model; Set (abstract data type); Predictive modelling; Colonoscopy","authors":[{"name":"R. Yim","is_ca":false},{"name":"Anna L. Silverman","is_ca":false},{"name":"Shan Wang","is_ca":true},{"name":"Vivek A. Rudrapatna","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1149706351165215,"gpt":0.5230203048782074,"spread":0.4080496697616859,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003135381,0.00006779822,0.0001727392,0.00008161768,0.0001251392,0.00006812927,0.0001553395,0.0001075576,0.000001242662],"category_scores_gemma":[0.0007589741,0.00005115116,0.00005446397,0.0001860279,0.0001006369,0.00002592824,0.00007804556,0.00019462,7.020527e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00002795718,"about_ca_system_score_gemma":0.0003760414,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00008527783,"about_ca_topic_score_gemma":0.0003649863,"domain_scores_codex":[0.9986291,0.0002508255,0.0005181264,0.0001560127,0.0001907834,0.0002551466],"domain_scores_gemma":[0.9991369,0.0003529517,0.0001056733,0.0001925436,0.0001730945,0.00003884273],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"qualitative","study_design_scores_codex":[0.001223497,0.0007079646,0.004263274,0.0002702049,0.00005901367,0.00000408344,0.009693703,0.00003465832,0.00001150035,0.002614143,0.02724208,0.9538759],"study_design_scores_gemma":[0.01490548,0.01626605,0.1199334,0.001157368,0.00003137571,0.00003709017,0.4740117,0.02635313,0.0005843525,0.003878626,0.3421566,0.0006847409],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9427738,0.001566821,0.03648613,0.00918843,0.0003821417,0.0040428,0.000298892,0.00002197452,0.00523907],"genre_scores_gemma":[0.9976831,0.00006859194,0.0004816547,0.001328257,0.0001058163,0.0001255873,0.0001238875,0.000003097287,0.00008002219],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9531912,"threshold_uncertainty_score":0.2085884,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W7105695419","doi":"10.1136/bmjdhai-2025-000134","title":"Retrospective evaluation of a machine learning model to facilitate pharmacogenetic testing","year":2025,"lang":"en","type":"article","venue":"BMJ Digital Health & AI","topic":"Pharmacogenetics and Drug Metabolism","field":"Pharmacology, Toxicology and Pharmaceutics","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Toronto General Hospital; Institute for Clinical Evaluative Sciences; Hospital for Sick Children","funders":"Hospital for Sick Children","keywords":"Pharmacogenetics; Logistic regression; Medical prescription; Epidemiology; Retrospective cohort study; Cohort; Gradient boosting","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.3195143293878861,"gpt":0.5259982311863415,"spread":0.2064839017984554,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.003017317,0.000297885,0.0005072621,0.0003310627,0.0003126476,0.000040478,0.0002888888,0.0001336885,0.0001228759],"category_scores_gemma":[0.0009700279,0.0003118229,0.0001184236,0.0008616209,0.0001001329,0.0001624995,0.0002037726,0.0007418166,0.00007085801],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002796669,"about_ca_system_score_gemma":0.001196506,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00004635716,"about_ca_topic_score_gemma":0.00001296551,"domain_scores_codex":[0.9968166,0.000584036,0.0008725676,0.0005194111,0.0005437449,0.0006635831],"domain_scores_gemma":[0.9979783,0.0002492027,0.0002853576,0.0002230092,0.0008392984,0.000424832],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004538317,0.0003466685,0.01837206,0.000294786,0.0002010498,0.000003917029,0.001614963,0.3080407,0.01646447,0.0006224075,0.00466164,0.6489235],"study_design_scores_gemma":[0.003041827,0.0002183802,0.003289289,0.00008353571,0.0002025003,0.0000065675,0.00006819222,0.9361272,0.007387252,0.005167822,0.04409519,0.0003122395],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9231189,0.01107543,0.006042405,0.008592243,0.001553739,0.004439671,0.001140405,0.0002349301,0.04380222],"genre_scores_gemma":[0.9899352,0.0001744937,0.0008103842,0.006916897,0.0001229351,0.0002188481,0.00005136677,0.00002864553,0.001741239],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.6486112,"threshold_uncertainty_score":0.9999334,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W7105645746","doi":"10.1136/bmjdhai-2025-000078","title":"“Trying to Do No Harm”: exploring clinician concerns towards the use of AI for risk prediction in psychiatry","year":2025,"lang":"en","type":"article","venue":"BMJ Digital Health & AI","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"Waypoint Centre for Mental Health Care; University of Toronto","funders":"","keywords":"Mental health; Thematic analysis; Focus group; Health care; Reflexivity; Quality (philosophy); MEDLINE; Mental health care","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.4641667768071848,"gpt":0.5330326401816575,"spread":0.0688658633744727,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006814775,0.0001197268,0.0003001526,0.0001822347,0.0001664496,0.00006381853,0.00009329868,0.00008447876,0.00001071087],"category_scores_gemma":[0.001468904,0.00009739971,0.00009733384,0.0004301325,0.00004456403,0.0004006755,0.00003235057,0.0003346767,0.00002704467],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002426706,"about_ca_system_score_gemma":0.001852576,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002683994,"about_ca_topic_score_gemma":0.0004960372,"domain_scores_codex":[0.9980487,0.00005546366,0.001070662,0.0002784165,0.000192283,0.000354491],"domain_scores_gemma":[0.9986128,0.0003653255,0.0001949155,0.0003360503,0.0003234231,0.0001674367],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0007419251,0.0001829526,0.3424937,0.0008288029,0.00002099812,4.109693e-7,0.003330765,0.0002294331,0.000002285673,0.001228202,0.03294595,0.6179945],"study_design_scores_gemma":[0.001191385,0.005873242,0.3591578,0.01075186,0.0001289612,0.00001223749,0.02402031,0.01563559,0.001003011,0.01451305,0.5671359,0.0005766504],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8753441,0.0005270722,0.0075027,0.1038518,0.007343113,0.00452057,0.0002552373,0.00007538604,0.0005800753],"genre_scores_gemma":[0.9830016,0.0002166489,0.0008628783,0.01379338,0.001163474,0.0005021704,0.00004215009,0.00001837745,0.0003993303],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.6174179,"threshold_uncertainty_score":0.4057414,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}