{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":4,"total_is_capped":false,"direct_labels_cover":0,"predictions_cover":4,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"5570edbb5698","filters":{"venue":"BMJ Digital Health & AI"}},"results":[{"id":"W4413252984","doi":"10.1136/bmjdhai-2025-000114","title":"Development and prospective evaluation of a machine learning model to predict serious cardiac outcomes among paediatric cardiac inpatients","year":2025,"lang":"en","type":"article","venue":"BMJ Digital Health & AI","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Canadian Patient Safety Institute; SickKids Foundation; Toronto General Hospital; Casey House; Institute for Clinical Evaluative Sciences; Hospital for Sick Children","funders":"","keywords":"Retrospective cohort study; Medicine; Receiver operating characteristic; Logistic regression; Prospective cohort study; Emergency medicine; Internal medicine","authors":[{"name":"Santiago Eduardo Arciniegas","is_ca":true},{"name":"Adam P. Yan","is_ca":true},{"name":"Adam Rapoport","is_ca":true},{"name":"Aamir Jeewa","is_ca":true},{"name":"Rugambwa Michael Muhame","is_ca":true},{"name":"Lin Guo","is_ca":true},{"name":"Agata Wolochacz","is_ca":true},{"name":"Karim Jessa","is_ca":true},{"name":"George Tomlinson","is_ca":true},{"name":"C Ferracci","is_ca":true},{"name":"Lillian Sung","is_ca":true},{"name":"Anne I. Dipchand","is_ca":true},{"name":"Kate Nelson","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02054444801677871,"gpt":0.3433876705748698,"spread":0.3228432225580911,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006446878,0.001075778,0.0008507327,0.001058399,0.0003286921,0.001134546,0.001424697,0.0009125407,0.001644332],"category_scores_gemma":[0.01002087,0.0004196037,0.00101306,0.0005514685,0.0002216487,0.0006442266,0.0008560414,0.001512346,0.0006081031],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001092394,"about_ca_system_score_gemma":0.001778475,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009499257,"about_ca_topic_score_gemma":0.007196816,"domain_scores_codex":[0.9988403,0.000583039,0.00008973804,0.00027171,0.0001179746,0.00009717683],"domain_scores_gemma":[0.9948511,0.003668464,0.0002917177,0.0001904488,0.0007874389,0.0002108656],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001148525,0.001391439,0.2589507,0.0001799007,0.00063467,0.000310557,0.0001991809,0.6210732,0.001377025,0.0007614069,0.006400057,0.1075736],"study_design_scores_gemma":[0.00004080916,0.0002537858,0.007118123,0.00002665227,0.00004320463,0.00003969314,0.00003485513,0.9913588,0.0004305403,0.0003344597,0.000309148,0.00001012481],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8826578,0.0008329793,0.1077011,0.002161345,0.0001744636,0.0004904399,0.003260843,0.001096462,0.001624644],"genre_scores_gemma":[0.9419789,0.0002306388,0.05126369,0.0003110652,0.00007511943,0.0004184852,0.004437314,0.00004736919,0.001237408],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.009499257,"threshold_uncertainty_score":0.03409481,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4414189579","doi":"10.1136/bmjdhai-2025-000014","title":"Optimising large language models for clinical information extraction: a benchmarking study in the context of ulcerative colitis research","year":2025,"lang":"en","type":"article","venue":"BMJ Digital Health & AI","topic":"Biomedical Text Mining and Ontologies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"Clinical and Translational Science Institute, University of California, Los Angeles; Clinical and Translational Science Institute, University of California, San Francisco","keywords":"Benchmarking; Context (archaeology); Adaptation (eye); Oracle; Language model; Set (abstract data type); Predictive modelling; Colonoscopy","authors":[{"name":"R. Yim","is_ca":false},{"name":"Anna L. Silverman","is_ca":false},{"name":"Shan Wang","is_ca":true},{"name":"Vivek A. Rudrapatna","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1149706351165215,"gpt":0.5230203048782074,"spread":0.4080496697616859,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01933746,0.001641262,0.0008698837,0.00171419,0.0005075546,0.002025023,0.002256734,0.001649255,0.002071202],"category_scores_gemma":[0.06170137,0.0007287963,0.001675796,0.002000408,0.0008421748,0.003231189,0.001940519,0.002243378,0.001107178],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002321859,"about_ca_system_score_gemma":0.002025967,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01207981,"about_ca_topic_score_gemma":0.01277549,"domain_scores_codex":[0.9874959,0.009346471,0.0007720692,0.001550165,0.0006260784,0.0002092643],"domain_scores_gemma":[0.9216779,0.06996682,0.001141272,0.003795288,0.002983576,0.0004351848],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002823057,0.001226999,0.02448993,0.002419522,0.001124247,0.0007399291,0.001728066,0.5579401,0.005996359,0.002992375,0.01683334,0.381686],"study_design_scores_gemma":[0.0003690925,0.000635031,0.005395252,0.0001491724,0.0003079748,0.0002538403,0.0004409589,0.976561,0.00591034,0.004334175,0.005552892,0.00009026466],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6816127,0.005819432,0.2755574,0.003322324,0.000408588,0.001193441,0.007375512,0.01981895,0.0048918],"genre_scores_gemma":[0.771923,0.0009569341,0.2078477,0.0005901522,0.0001064467,0.000671251,0.01540913,0.0009125505,0.001582864],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9806625,"threshold_uncertainty_score":0.1022675,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W7105695419","doi":"10.1136/bmjdhai-2025-000134","title":"Retrospective evaluation of a machine learning model to facilitate pharmacogenetic testing","year":2025,"lang":"en","type":"article","venue":"BMJ Digital Health & AI","topic":"Pharmacogenetics and Drug Metabolism","field":"Pharmacology, Toxicology and Pharmaceutics","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Toronto General Hospital; Institute for Clinical Evaluative Sciences; Hospital for Sick Children","funders":"Hospital for Sick Children","keywords":"Pharmacogenetics; Logistic regression; Medical prescription; Epidemiology; Retrospective cohort study; Cohort; Gradient boosting","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.3195143293878861,"gpt":0.5259982311863415,"spread":0.2064839017984554,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01155047,0.001085383,0.0008536279,0.001213893,0.0003214807,0.001569667,0.001169325,0.0009429645,0.001714491],"category_scores_gemma":[0.02480706,0.0005179086,0.000965496,0.0007151265,0.0003985496,0.001078783,0.0009017152,0.001307303,0.0006782897],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001021221,"about_ca_system_score_gemma":0.00125393,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008522661,"about_ca_topic_score_gemma":0.004628108,"domain_scores_codex":[0.9974602,0.001415024,0.0002314272,0.0004901859,0.0002686555,0.0001344815],"domain_scores_gemma":[0.9864031,0.00992786,0.0009811298,0.0007720562,0.001752733,0.0001629966],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"observational","study_design_scores_codex":[0.0005919615,0.0002256459,0.1091787,0.0001261978,0.0003165953,0.0002942417,0.0001418954,0.8104613,0.001456026,0.002941646,0.002542356,0.07172356],"study_design_scores_gemma":[0.00001072359,0.00008206791,0.00311261,0.00002039834,0.00002492844,0.00006352697,0.00001439454,0.9949805,0.0004657035,0.0007221044,0.0004936495,0.000009354327],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3750523,0.001199893,0.6145654,0.001585803,0.0001745382,0.0003584093,0.002293455,0.001896034,0.002874231],"genre_scores_gemma":[0.9052494,0.0003182569,0.09027218,0.0002211422,0.00008834068,0.0002543739,0.00232434,0.00007009007,0.001201872],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01155047,"threshold_uncertainty_score":0.06108546,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W7105645746","doi":"10.1136/bmjdhai-2025-000078","title":"“Trying to Do No Harm”: exploring clinician concerns towards the use of AI for risk prediction in psychiatry","year":2025,"lang":"en","type":"article","venue":"BMJ Digital Health & AI","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"Waypoint Centre for Mental Health Care; University of Toronto","funders":"","keywords":"Mental health; Thematic analysis; Focus group; Health care; Reflexivity; Quality (philosophy); MEDLINE; Mental health care","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.4641667768071848,"gpt":0.5330326401816575,"spread":0.0688658633744727,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05460487,0.0006056715,0.0008419232,0.00135643,0.009292783,0.006489226,0.002732962,0.004252408,0.002342864],"category_scores_gemma":[0.1270017,0.00110626,0.0006410702,0.0009372825,0.01778117,0.006798801,0.008234088,0.006945532,0.0004722967],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.009662748,"about_ca_system_score_gemma":0.01366439,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01107857,"about_ca_topic_score_gemma":0.01196859,"domain_scores_codex":[0.9334252,0.05567041,0.001907019,0.001670425,0.004586824,0.002740221],"domain_scores_gemma":[0.8202993,0.1453068,0.01098815,0.002851838,0.01167393,0.00887993],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.00003035086,0.00002775511,0.003315739,0.0002661421,0.000009165697,0.0005326624,0.989683,0.00003571959,0.0004323635,0.000900215,0.0009031727,0.003863631],"study_design_scores_gemma":[0.00000974033,0.00007514999,0.001243881,0.0003767996,0.000008902458,0.0005346243,0.9904951,0.0001386113,0.0002232334,0.0006505576,0.00621808,0.00002538903],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9402299,0.002085634,0.007143344,0.04465974,0.0003152246,0.0003303631,0.0001068032,0.00005021761,0.005078793],"genre_scores_gemma":[0.9847452,0.00144884,0.003036251,0.009245651,0.00006449726,0.0002864428,0.00003068651,0.00003597617,0.001106502],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05460487,"threshold_uncertainty_score":0.2887816,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}