{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":20,"total_is_capped":false,"direct_labels_cover":1,"predictions_cover":20,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"7b0a4d4a1a0a","filters":{"venue":"Health Services and Outcomes Research Methodology"}},"results":[{"id":"W1529736910","doi":"10.1023/a:1024260023851","title":"A Comparison of Statistical Modeling Strategies for Analyzing Length of Stay after CABG Surgery","year":2002,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Hemodynamic Monitoring and Therapy","field":"Medicine","cited_by":138,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto; Sunnybrook Health Science Centre; Institute for Clinical Evaluative Sciences","funders":"Canadian Institutes of Health Research; Canada Research Chairs; Ontario Ministry of Health and Long-Term Care","keywords":"Negative binomial distribution; Generalized linear model; Poisson regression; Statistics; Mathematics; Poisson distribution; Linear regression; Regression analysis; Log-linear model; Linear model; Proportional hazards model; Consistency (knowledge bases); Quasi-likelihood; Statistical model; Parametric statistics; Regression; Simple linear regression; Medicine; Population","authors":[{"name":"Peter C. Austin","is_ca":true},{"name":"Deanna M. Rothwell","is_ca":true},{"name":"Jack V. Tu","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5064902954872634,"gpt":0.5967557162960009,"spread":0.09026542080873745,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005328031,0.0001196629,0.001171533,0.0003407071,0.00009503416,0.00001116853,0.00007360307,0.0001127767,0.00005369807],"category_scores_gemma":[0.0002045386,0.00009182958,0.00008651608,0.0001897655,0.0001254453,0.00005262016,0.00004258352,0.0002968383,6.533194e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000038515,"about_ca_system_score_gemma":0.0001608669,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002658377,"about_ca_topic_score_gemma":0.0002946218,"domain_scores_codex":[0.9969489,0.001215575,0.0007206731,0.0002600187,0.0003215496,0.0005332844],"domain_scores_gemma":[0.992056,0.00705264,0.0001380151,0.0002377461,0.0003027132,0.0002128955],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001524158,0.0003695403,0.8571651,0.01608675,0.0003264367,0.000009769702,0.0155153,0.0003254642,0.0003989599,0.003317483,0.00004813078,0.1049129],"study_design_scores_gemma":[0.002904519,0.002412368,0.147607,0.0009801269,0.00008991437,0.00001832158,0.02829754,0.8094555,0.000293375,0.006916845,0.0007419435,0.0002825716],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9154186,0.004941154,0.07801518,0.001023649,0.0001074203,0.0004051036,0.0000432327,0.00001409841,0.00003154843],"genre_scores_gemma":[0.9256397,0.001348135,0.07271655,0.0001335759,0.00005776661,0.00003723476,0.00001224943,0.00001675513,0.00003807268],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.80913,"threshold_uncertainty_score":0.4018689,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2045908763","doi":"10.1007/s10742-014-0117-x","title":"Using instrumental variables to estimate a Cox’s proportional hazards regression subject to additive confounding","year":2014,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Healthcare Policy and Management","field":"Economics, Econometrics and Finance","cited_by":66,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Institute for Clinical Evaluative Sciences","funders":"National Cancer Institute; National Center for Advancing Translational Sciences; National Institute of Mental Health; National Institutes of Health","keywords":"Confounding; Proportional hazards model; Instrumental variable; Statistics; Regression analysis; Regression; Econometrics; Mathematics","authors":[{"name":"Todd A. MacKenzie","is_ca":false},{"name":"Tor D. Tosteson","is_ca":false},{"name":"Nancy E. Morden","is_ca":false},{"name":"Thérèse A. Stukel","is_ca":true},{"name":"A. James O’Malley","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3917987631171452,"gpt":0.5536682860750683,"spread":0.1618695229579231,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0138811,0.0001993676,0.0007899991,0.0008358533,0.0006580197,0.0001047254,0.0002668857,0.0001257913,0.0001467189],"category_scores_gemma":[0.0007488038,0.0001850016,0.0000556318,0.0005009595,0.00007504312,0.0001594634,0.0004887809,0.0003225904,0.0001124519],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003634199,"about_ca_system_score_gemma":0.0001664216,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.03683649,"about_ca_topic_score_gemma":0.003551687,"domain_scores_codex":[0.9961506,0.001116914,0.0008189542,0.0006828262,0.0001707374,0.001059947],"domain_scores_gemma":[0.9975238,0.001105418,0.0002608112,0.0003201568,0.0001155254,0.0006743053],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002522141,0.00008854626,0.07786355,0.00182109,0.00009023385,0.000007714372,0.007247387,0.0001749109,0.00005724519,0.8506163,0.0003908632,0.06138995],"study_design_scores_gemma":[0.002004866,0.00202782,0.4018474,0.0007780541,0.00001021032,0.00004695287,0.004136922,0.02348503,0.0001206726,0.09584378,0.4688813,0.0008169815],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8113007,0.0007517257,0.1029437,0.07427168,0.001547468,0.00312844,0.0004179214,0.0001153784,0.005522969],"genre_scores_gemma":[0.7344385,0.0002581862,0.2445001,0.01968867,0.0002925936,0.0001960627,0.00005175957,0.00004737134,0.0005267453],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7547725,"threshold_uncertainty_score":0.9695773,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2068564314","doi":"10.1007/s10742-014-0124-y","title":"A data-adaptive strategy for inverse weighted estimation of causal effects","year":2014,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Advanced Causal Inference Techniques","field":"Mathematics","cited_by":18,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"National Institute on Drug Abuse; National Institutes of Health; National Science Foundation","keywords":"Causal inference; Propensity score matching; Observational study; Nonparametric statistics; Covariate; Estimator; Confounding; Inverse probability; Econometrics; Statistics; Average treatment effect; Logistic regression; Consistency (knowledge bases); Randomized experiment; Marginal structural model; Computer science; Mathematics; Artificial intelligence; Posterior probability; Bayesian probability","authors":[{"name":"Yeying Zhu","is_ca":true},{"name":"Debashis Ghosh","is_ca":false},{"name":"Nandita Mitra","is_ca":false},{"name":"Bhramar Mukherjee","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6899585491834566,"gpt":0.6385585072369091,"spread":0.05140004194654746,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01207309,0.0001693022,0.0007934681,0.0002614052,0.000174202,0.00001730508,0.0004184131,0.000166629,0.00001140571],"category_scores_gemma":[0.002247735,0.000131575,0.00003735281,0.0002292818,0.0001943873,0.0002320499,0.0003533105,0.0003184859,0.000002158368],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00005434798,"about_ca_system_score_gemma":0.0001454488,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00100583,"about_ca_topic_score_gemma":0.001913715,"domain_scores_codex":[0.9946097,0.003538524,0.0005363676,0.0004308694,0.0003106097,0.0005739038],"domain_scores_gemma":[0.971457,0.02704092,0.000304824,0.0006953468,0.0003167673,0.000185168],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0004499121,0.0001602692,0.001237978,0.01458993,0.0001350565,0.000003059875,0.002747203,0.00004303477,0.0005434526,0.8067031,0.000612516,0.1727745],"study_design_scores_gemma":[0.0007272452,0.001646878,0.002102067,0.000173752,0.0000222464,0.000005054762,0.0008247179,0.0983908,0.000942621,0.89455,0.0004856839,0.0001289611],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.06253128,0.0002003965,0.9339781,0.0009783104,0.00009082945,0.001829265,0.0001114673,0.0001208398,0.0001594534],"genre_scores_gemma":[0.1123782,0.0001452133,0.8866697,0.0004772171,0.00004062065,0.000137078,0.00006886807,0.00002731138,0.00005580023],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.1726455,"threshold_uncertainty_score":0.5365474,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W23346058","doi":"10.1023/a:1011424117583","title":"Considerations for Measuring Functioning of the Elderly: IRM Dimensionality and Scaling Analysis","year":2001,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Health disparities and outcomes","field":"Social Sciences","cited_by":16,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa","funders":"","keywords":"Rasch model; Activities of daily living; Item response theory; International Classification of Functioning, Disability and Health; Scale (ratio); Gerontology; Psychology; Statistics; Psychometrics; Medicine; Mathematics; Clinical psychology; Physical therapy; Geography; Rehabilitation","authors":[{"name":"Krista Breithaupt","is_ca":false},{"name":"Ian McDowell","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.4965065371157216,"gpt":0.5636000211075388,"spread":0.06709348399181725,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["sts"],"consensus_categories":[],"category_scores_codex":[0.01738065,0.00009178861,0.0005185519,0.0002196215,0.002941625,0.00006743985,0.0001252694,0.0001128524,0.00006450679],"category_scores_gemma":[0.001951197,0.00006512982,0.0001133242,0.0006428678,0.0003819689,0.0001096724,0.0001339498,0.0002375011,3.420074e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00007392171,"about_ca_system_score_gemma":0.0004177186,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.06891163,"about_ca_topic_score_gemma":0.1095414,"domain_scores_codex":[0.9939783,0.004139349,0.0004721337,0.000288993,0.0004453897,0.0006758225],"domain_scores_gemma":[0.984181,0.01478395,0.0001645296,0.0002103183,0.0003847067,0.0002754208],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0000447626,0.00002419099,0.9079279,0.0008354551,0.000153539,5.788647e-7,0.01528355,0.00006387931,0.000006500177,0.06527846,0.00004594742,0.01033519],"study_design_scores_gemma":[0.0003723913,0.0000656701,0.9411949,0.00006655924,0.00005859563,0.000002432733,0.02910613,0.0005209337,0.000006693669,0.01938418,0.009139861,0.00008165157],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9052888,0.003074962,0.002822339,0.08697674,0.0003867014,0.0009357422,0.0000249928,0.0000277085,0.0004620882],"genre_scores_gemma":[0.9766403,0.001875276,0.01571156,0.005311876,0.0001001665,0.00005006111,0.000003302933,0.000008371706,0.0002991142],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.08166486,"threshold_uncertainty_score":0.9983564,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1983766924","doi":"10.1007/s10742-008-0030-2","title":"Signal-to-noise ratio (SNR) as a measure of reproducibility: design, estimation, and application","year":2008,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Image and Signal Denoising Methods","field":"Computer Science","cited_by":16,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Western University","funders":"","keywords":"Reproducibility; Measure (data warehouse); Statistics; Estimation; Signal-to-noise ratio (imaging); Computer science; Noise (video); Mathematics; Artificial intelligence; Data mining; Engineering","authors":[{"name":"Naser Elkum","is_ca":false},{"name":"Mohamed M. Shoukri","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2905204980326063,"gpt":0.5046460894679036,"spread":0.2141255914352972,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03421295,0.0001637914,0.0006063781,0.0004133247,0.0005455625,0.00005972798,0.0005440839,0.0001117182,0.000006320624],"category_scores_gemma":[0.001539929,0.0001355882,0.00004099989,0.0008874191,0.0002083338,0.00031157,0.000421429,0.0002961079,0.00001194479],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004447379,"about_ca_system_score_gemma":0.000412111,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002252077,"about_ca_topic_score_gemma":0.00005810237,"domain_scores_codex":[0.9891776,0.007940094,0.0006105418,0.001143077,0.000596304,0.0005324259],"domain_scores_gemma":[0.9926585,0.00485952,0.0001912286,0.001287083,0.0006518524,0.0003518315],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0005116983,0.0001884203,0.01738534,0.002022989,0.00007418134,0.00002819157,0.0399113,0.001045872,0.02305576,0.01519215,0.0002668973,0.9003172],"study_design_scores_gemma":[0.003885,0.004290403,0.4035367,0.0003731346,0.00003267207,0.0007255878,0.001685551,0.3485378,0.04076526,0.1921308,0.003076544,0.0009604841],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.03195833,0.001798293,0.955934,0.009159694,0.00006281195,0.0009753793,0.000001624153,0.00005283755,0.00005699882],"genre_scores_gemma":[0.1758187,0.0003643677,0.8207582,0.002803691,0.00003334153,0.00007810327,0.000002283726,0.00001186315,0.0001294719],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.8993567,"threshold_uncertainty_score":0.994481,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2889374799","doi":"10.1007/s10742-018-0187-2","title":"Causal inference for multi-level treatments with machine-learned propensity scores","year":2018,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Advanced Causal Inference Techniques","field":"Mathematics","cited_by":11,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Propensity score matching; Causal inference; Inverse probability; Inverse probability weighting; Multinomial logistic regression; Statistics; Econometrics; Observational study; Logistic regression; Matching (statistics); Computer science; Estimator; Bayesian probability; Average treatment effect; Mathematics; Posterior probability","authors":[{"name":"Lin Lin","is_ca":true},{"name":"Yeying Zhu","is_ca":true},{"name":"Liang Chen","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.8430232517073458,"gpt":0.6674423948286655,"spread":0.1755808568786803,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005621462,0.0002942577,0.0008783351,0.0002641275,0.0006323202,0.00005721104,0.0003636533,0.0001775113,0.00004357658],"category_scores_gemma":[0.00131675,0.0001885534,0.00004765381,0.0002889439,0.0005269377,0.0002044549,0.0003460993,0.0004297477,0.00001009565],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001254823,"about_ca_system_score_gemma":0.0002785505,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003774063,"about_ca_topic_score_gemma":0.01859849,"domain_scores_codex":[0.9953952,0.002075368,0.000472133,0.0006361449,0.0003876116,0.0010335],"domain_scores_gemma":[0.9914651,0.006629449,0.0002450328,0.0005621676,0.0007680294,0.0003302128],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.004189607,0.001126212,0.5187446,0.009331476,0.000660153,0.00004884437,0.01941684,0.000001961196,0.001651558,0.2019294,0.0003909638,0.2425083],"study_design_scores_gemma":[0.007504054,0.01506607,0.442385,0.0009237215,0.0001009874,0.00009487037,0.003307456,0.005002962,0.006534934,0.5151777,0.002826011,0.001076296],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.3847398,0.0004149927,0.6055456,0.003686566,0.0001468718,0.004697043,0.0001660496,0.0004001954,0.0002028013],"genre_scores_gemma":[0.1282996,0.000332743,0.8690109,0.001086206,0.00006530526,0.0003559009,0.0000207615,0.00004992427,0.0007786038],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.3132483,"threshold_uncertainty_score":0.9993095,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2064626421","doi":"10.1007/s10742-009-0044-4","title":"Deriving a mental health outcome measure using the pooled index: an application to psychiatric consumer–survivors in different housing types","year":2009,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Schizophrenia research and treatment","field":"Medicine","cited_by":8,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"York University; St. Michael's Hospital; Western University","funders":"","keywords":"Quality of life (healthcare); Index (typography); Mental health; Medicine; Gerontology; Activities of daily living; Psychiatry; Demography; Psychology; Nursing","authors":[{"name":"Mark Speechley","is_ca":true},{"name":"Cheryl Forchuk","is_ca":true},{"name":"Jeffrey S. Hoch","is_ca":true},{"name":"Elsabeth Jensen","is_ca":true},{"name":"Jennifer Wagg","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2128823355536524,"gpt":0.5300256492860057,"spread":0.3171433137323533,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007212275,0.0002720412,0.0009280809,0.0007955939,0.000713871,0.00006958209,0.0002583253,0.0001260059,0.0000130883],"category_scores_gemma":[0.0001549984,0.0001656383,0.00008099919,0.0009426677,0.00009104445,0.00009653733,0.0001468792,0.0007449256,0.000005781778],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005315162,"about_ca_system_score_gemma":0.0005557418,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.02010652,"about_ca_topic_score_gemma":0.05931881,"domain_scores_codex":[0.9925497,0.004096304,0.000700246,0.0006313865,0.000809785,0.001212606],"domain_scores_gemma":[0.9973222,0.0009214302,0.0001606385,0.0005684294,0.0001492211,0.0008781019],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002364501,0.000353801,0.8430361,0.0004844147,0.00006830022,0.00001051482,0.003209081,0.0000300064,0.0002133435,0.0005547486,0.000008022964,0.1496672],"study_design_scores_gemma":[0.002540555,0.001388642,0.986886,0.0001345914,0.00001585063,0.00005444566,0.003374433,0.003998725,0.00001871622,0.001266788,0.0001885175,0.0001326828],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9232471,0.004342807,0.002678658,0.06695397,0.0001138993,0.00259021,0.00001102732,0.00004628654,0.00001604449],"genre_scores_gemma":[0.964012,0.0007089886,0.0268404,0.008195306,0.0001055797,0.00007190231,0.00002578429,0.00002749008,0.00001252815],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1495345,"threshold_uncertainty_score":0.9864187,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4388795592","doi":"10.1007/s10742-023-00317-y","title":"Propensity score weighting with survey weighted data when outcomes are binary: a simulation study","year":2023,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Advanced Causal Inference Techniques","field":"Mathematics","cited_by":6,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"London Health Sciences Centre","funders":"National Cancer Institute; National Institute on Aging; National Cancer Center","keywords":"Propensity score matching; Weighting; Statistics; Observational study; Average treatment effect; Population; Mathematics; Econometrics; Medicine","authors":[{"name":"Yang Chen","is_ca":false},{"name":"Meaghan S. Cuerden","is_ca":true},{"name":"Wei Zhang","is_ca":false},{"name":"Melissa Aldridge","is_ca":false},{"name":"Lihua Li","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.8783707654311809,"gpt":0.649225151849151,"spread":0.2291456135820299,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03075556,0.0003532182,0.001375699,0.0006305596,0.0007362805,0.0001132979,0.0009581147,0.0001745418,0.00003657358],"category_scores_gemma":[0.00311548,0.0002312158,0.00003417068,0.001171438,0.0002026573,0.0005448652,0.002005843,0.0008294331,0.00001883503],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001104343,"about_ca_system_score_gemma":0.0002148707,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.008103124,"about_ca_topic_score_gemma":0.03883896,"domain_scores_codex":[0.9853398,0.01071077,0.0007966238,0.001059623,0.0009453862,0.001147793],"domain_scores_gemma":[0.9716147,0.02513446,0.0004808382,0.001710261,0.000752198,0.0003075354],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002310938,0.0001936354,0.9899134,0.0009765436,0.0001072106,0.0000536236,0.003695408,0.0000194891,0.000008467272,0.0007462429,0.0001604487,0.003894442],"study_design_scores_gemma":[0.00080469,0.0008476855,0.9471942,0.0001834117,0.00001601328,0.000004570345,0.004788575,0.007756207,0.000008860022,0.03791149,0.000235428,0.0002489288],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9862556,0.0001331862,0.007119654,0.002682143,0.0000860136,0.002937081,0.0001178536,0.0006323727,0.00003611216],"genre_scores_gemma":[0.8532541,0.0002573722,0.1447071,0.0007646666,0.00005609613,0.000170523,0.0002788073,0.0001040721,0.0004072775],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1375874,"threshold_uncertainty_score":0.998502,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2343900495","doi":"10.1007/s10742-016-0147-7","title":"The study of service use among homeless persons with mental illness: a methodological review","year":2016,"lang":"en","type":"review","venue":"Health Services and Outcomes Research Methodology","topic":"Homelessness and Social Issues","field":"Health Professions","cited_by":6,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa","funders":"","keywords":"PsycINFO; Mental illness; Observational study; Mental health; Receipt; Service (business); Type of service; Medicine; Health services research; Population; MEDLINE; Psychology; Psychiatry; Public health; Nursing; Gerontology; Environmental health; Business","authors":[{"name":"Nick Kerman","is_ca":true},{"name":"John Sylvestre","is_ca":true},{"name":"Alexia Polillo","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6729901541732592,"gpt":0.6682930787085176,"spread":0.004697075464741629,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","metaepi_narrow","sts","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.04824894,0.0008039412,0.009578667,0.000428088,0.004178304,0.00005990515,0.001470503,0.0008539144,0.0001659541],"category_scores_gemma":[0.001319228,0.0003457725,0.0003500768,0.001570594,0.0006737562,0.0002241103,0.001515365,0.003052793,0.00003877103],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003307041,"about_ca_system_score_gemma":0.001373807,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.03184284,"about_ca_topic_score_gemma":0.1224506,"domain_scores_codex":[0.8822234,0.1109825,0.002465895,0.001103702,0.001195518,0.002029007],"domain_scores_gemma":[0.9159088,0.0791556,0.00199217,0.001313229,0.0009994482,0.0006307288],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001210553,0.0001758087,0.01151858,0.2645421,0.000582044,0.00001804906,0.04883154,1.822342e-8,3.474655e-8,0.0006463469,0.00005747774,0.6735069],"study_design_scores_gemma":[0.0009696603,0.0008519067,0.007224878,0.08340751,0.0003091863,0.000003508861,0.2530164,0.000001108057,1.894204e-8,0.0001160952,0.653688,0.0004118237],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.006039022,0.9797172,0.00003367764,0.002159322,0.0005282973,0.01118866,0.0001917319,0.00006785675,0.00007426388],"genre_scores_gemma":[0.000221558,0.9936813,0.001150404,0.001060073,0.0002055425,0.002978355,0.00004682607,0.0001227923,0.0005331976],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.6730951,"threshold_uncertainty_score":0.9998994,"prediction_status":"machine_predicted_unvalidated"},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"not_applicable","genre":"review","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"design_other","genre":"review","about_ca_system":false,"about_ca_topic":false,"confidence":"low"}],"label_agreement":"split"},{"id":"W2030246929","doi":"10.1007/s10742-009-0048-0","title":"Comparison of cluster detection using patients and events of medically treated self-inflicted injuries in Alberta, Canada","year":2009,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Data-Driven Disease Surveillance","field":"Medicine","cited_by":5,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"University of Alberta","funders":"","keywords":"Context (archaeology); Cluster analysis; Epidemiology; Psychological intervention; Cluster (spacecraft); Medicine; Public health; Health care; Health services research; Population; Intervention (counseling); Medical emergency; Demography; Environmental health; Geography; Computer science; Nursing; Pathology","authors":[{"name":"Rhonda J. Rosychuk","is_ca":true},{"name":"Ian Colman","is_ca":true},{"name":"Brian H. Rowe","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1196953394729653,"gpt":0.5064610241919099,"spread":0.3867656847189446,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002062991,0.000122843,0.0009089145,0.0002963888,0.00007173197,0.000003392808,0.0000913472,0.0001056551,0.000009948463],"category_scores_gemma":[0.0005007613,0.00009863122,0.00002478248,0.0003832938,0.0000834039,0.00005907895,0.00009188506,0.0002598058,1.698367e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001470308,"about_ca_system_score_gemma":0.0004628969,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.6901561,"about_ca_topic_score_gemma":0.7603893,"domain_scores_codex":[0.9960088,0.002129392,0.0007111821,0.0002634215,0.0004841002,0.0004031214],"domain_scores_gemma":[0.9972158,0.001749456,0.0002455443,0.0002083855,0.0002954748,0.000285303],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000718153,0.0001717216,0.9831519,0.001392204,0.00004126264,0.000001642344,0.00146244,0.000003657666,0.0001561448,0.000007044273,0.00001016663,0.01288371],"study_design_scores_gemma":[0.002022066,0.0007440879,0.9933478,0.0001729168,0.00001553574,0.000002388463,0.0004292638,0.002639034,0.0002803139,0.00005060405,0.0002375039,0.00005843835],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9975165,0.0003710874,0.00002831154,0.001411485,0.00004912225,0.0005554573,0.00003558631,0.000008740404,0.00002376281],"genre_scores_gemma":[0.9944012,0.0001841015,0.00429192,0.001035875,0.0000104089,0.000004881219,0.0000520057,0.000008574868,0.0000110065],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07023321,"threshold_uncertainty_score":0.4022065,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2317982607","doi":"10.1007/s10742-013-0112-7","title":"A comparison of statistical models for analyzing episodes-of-care costs for chronic obstructive pulmonary disease exacerbations","year":2013,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Chronic Disease Management Strategies","field":"Medicine","cited_by":4,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Saskatchewan Health Quality Council; University of Saskatchewan; University of Manitoba","funders":"Ministry of Health, Saskatchewan; University of Saskatchewan","keywords":"Ordinary least squares; Heteroscedasticity; Statistics; Poisson regression; Medicine; Generalized linear model; Regression analysis; Regression; Econometrics; Health administration; Linear regression; Mathematics; Public health; Population; Environmental health","authors":[{"name":"John Paul Kuwornu","is_ca":true},{"name":"Lisa M. Lix","is_ca":true},{"name":"Jacqueline Quail","is_ca":true},{"name":"Eric W. Wang","is_ca":true},{"name":"Meriç Osman","is_ca":true},{"name":"Gary Teare","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3286456677312481,"gpt":0.5718448853666004,"spread":0.2431992176353523,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001499666,0.0001594066,0.0009419826,0.000326979,0.0002033365,0.00001976334,0.0001558639,0.00007485342,0.00007275429],"category_scores_gemma":[0.0003446075,0.0001325655,0.0001218117,0.0002245909,0.0002924732,0.0001628607,0.0001494707,0.0001785341,0.000001193803],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002827873,"about_ca_system_score_gemma":0.0006384309,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001713583,"about_ca_topic_score_gemma":0.0003651162,"domain_scores_codex":[0.9972304,0.0007798824,0.0006489414,0.00040454,0.0003222671,0.0006140381],"domain_scores_gemma":[0.992174,0.006125361,0.0002214464,0.000343547,0.0007258618,0.0004097408],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.003637712,0.0007647288,0.3483866,0.1533512,0.0007359836,0.000006539514,0.007465434,0.001882291,0.0002549371,0.2271685,0.00067413,0.2556719],"study_design_scores_gemma":[0.002815894,0.00187135,0.6755195,0.0005873161,0.0002496141,0.000001727617,0.02757507,0.2340462,0.00004564132,0.05657423,0.0005253892,0.0001880121],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3720829,0.04608519,0.5442614,0.01431507,0.0003708692,0.01990218,0.001923641,0.0001014382,0.0009572799],"genre_scores_gemma":[0.8968987,0.0005029119,0.1010863,0.0001598638,0.00006089206,0.000793513,0.0003816822,0.00002610262,0.00009004978],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.5248157,"threshold_uncertainty_score":0.5405866,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2080992413","doi":"10.1007/s10742-006-0010-3","title":"Methods for studying adverse events on surgical wait lists","year":2006,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Health Systems, Economic Evaluations, Quality of Life","field":"Economics, Econometrics and Finance","cited_by":4,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Royal Columbian Hospital; Vancouver General Hospital; University of British Columbia","funders":"","keywords":"Medicine; Population; Event (particle physics); Adverse effect; Incidence (geometry); Disease; Angina; Cumulative incidence; Unstable angina; Emergency medicine; Medical emergency; Intensive care medicine; Surgery; Myocardial infarction; Internal medicine","authors":[{"name":"Boris Sobolev","is_ca":true},{"name":"Lisa Kuramoto","is_ca":true},{"name":"Adrian R. Levy","is_ca":true},{"name":"Robert Hayden","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7943857756584719,"gpt":0.6733009975553546,"spread":0.1210847781031174,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.1432926,0.000266065,0.001875851,0.0007672608,0.0007868754,0.00003918733,0.0004141108,0.0002667654,0.0001533052],"category_scores_gemma":[0.002271775,0.0002739055,0.0001910497,0.0003284602,0.0001126386,0.0002298902,0.000190597,0.0004745895,0.0002319509],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004904825,"about_ca_system_score_gemma":0.0001937235,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009936787,"about_ca_topic_score_gemma":0.001048031,"domain_scores_codex":[0.984136,0.009743095,0.003606393,0.001009472,0.0001963173,0.001308719],"domain_scores_gemma":[0.9673687,0.03023028,0.001221669,0.0006037546,0.0001681082,0.0004075571],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0003516386,0.0003832855,0.5695206,0.005711784,0.0001640498,0.000005147736,0.004618427,0.0001759817,0.000003244303,0.4046712,0.002946617,0.011448],"study_design_scores_gemma":[0.003596292,0.0008214031,0.5878602,0.0001744272,0.000005835042,0.00001606511,0.003795082,0.004805219,0.00000532383,0.154622,0.2438443,0.0004538863],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.7302696,0.01646524,0.05386355,0.1851244,0.002732511,0.007280075,0.0006695148,0.0002082089,0.003386932],"genre_scores_gemma":[0.1594285,0.001614952,0.7903522,0.04152843,0.001476884,0.001299052,0.0001920197,0.000156742,0.003951227],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.7364886,"threshold_uncertainty_score":0.9999713,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W213901707","doi":"10.1023/a:1025818432525","title":"Imputing a Binary Variable from Donor to Recipient Dataset when Recipient Dataset Holds Restricted Information on the Variable","year":2002,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Statistical Methods and Bayesian Inference","field":"Mathematics","cited_by":2,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Statistics Canada; Health Canada","funders":"Health Canada","keywords":"Variable (mathematics); Imputation (statistics); Logistic regression; Computer science; Data mining; Population; Regression; Statistics; Econometrics; Mathematics; Missing data; Machine learning; Medicine","authors":[{"name":"Kisalaya Basu","is_ca":true},{"name":"Vishnu Kapur","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3935089949768288,"gpt":0.5154611245270454,"spread":0.1219521295502166,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.01368477,0.0002904038,0.0007540003,0.0003762448,0.0008823853,0.0002397468,0.0007849345,0.0002100618,0.001385767],"category_scores_gemma":[0.007180935,0.0001879709,0.00003385525,0.0007917198,0.000121106,0.0002972689,0.0008977838,0.0008888234,0.0001516535],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000159335,"about_ca_system_score_gemma":0.0001201162,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01159062,"about_ca_topic_score_gemma":0.0002231188,"domain_scores_codex":[0.9891714,0.007310282,0.001023758,0.0005981111,0.0007568983,0.001139569],"domain_scores_gemma":[0.9580894,0.03962961,0.0003125106,0.001227612,0.0002150742,0.0005258568],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0006731323,0.0004323907,0.00216606,0.001717366,0.0001919243,0.00002302746,0.009511697,0.00002335467,0.00014918,0.4512564,0.4237971,0.1100583],"study_design_scores_gemma":[0.001268111,0.001662925,0.01283128,0.0005977517,0.00004927086,0.00001720174,0.00276644,0.01617369,0.00003287862,0.55083,0.4132833,0.000487103],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02645489,0.0005706969,0.8254024,0.06250036,0.001535072,0.005355773,0.07593651,0.0002160611,0.002028286],"genre_scores_gemma":[0.0004224777,0.000304686,0.9798235,0.01612088,0.0001296613,0.000165257,0.002948863,0.0000248596,0.00005986183],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.1544211,"threshold_uncertainty_score":0.9995271,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2009201840","doi":"10.1007/s10742-010-0063-1","title":"Surgery volume, quality of care and operative mortality in coronary artery bypass graft surgery: a re-examination using fixed-effects regression","year":2010,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Cardiac, Anesthesia and Surgical Outcomes","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Institute for Clinical Evaluative Sciences; University of Toronto","funders":"","keywords":"Medicine; Surgery; Cardiac surgery; Cardiothoracic surgery; Cardiology","authors":[{"name":"Amresh Hanchate","is_ca":false},{"name":"Thérèse A. Stukel","is_ca":true},{"name":"John D. Birkmeyer","is_ca":false},{"name":"Arlene S. Ash","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2719739405695955,"gpt":0.5480294033068087,"spread":0.2760554627372133,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02131961,0.0002418129,0.002422469,0.0006079141,0.0002199778,0.0000258635,0.00008338498,0.0003305434,0.00003194612],"category_scores_gemma":[0.002115639,0.0001771278,0.0002398438,0.0004785164,0.0003631926,0.0001670267,0.0001531993,0.0007770716,9.678225e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00008930894,"about_ca_system_score_gemma":0.0004199799,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007629409,"about_ca_topic_score_gemma":0.005928392,"domain_scores_codex":[0.9864179,0.01078256,0.0009418174,0.0005565331,0.0006480738,0.0006530882],"domain_scores_gemma":[0.9694353,0.02909025,0.0002692661,0.0004332849,0.0003815569,0.0003902798],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000420449,0.00007726157,0.9612472,0.00600051,0.00006834024,0.0001349776,0.003976349,6.858841e-7,0.0009370213,0.0002467747,0.00001050299,0.02687991],"study_design_scores_gemma":[0.0007713155,0.0001981897,0.9929265,0.0004113936,0.00002692653,0.00008692271,0.004562926,0.0002250515,0.0001820548,0.00006476416,0.0004032948,0.0001406644],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9937596,0.003035402,0.0000520051,0.001850314,0.0002857543,0.0008742724,0.00001492974,0.00002156433,0.0001061154],"genre_scores_gemma":[0.9927604,0.001707925,0.004397457,0.0008612943,0.00006748764,0.00004063787,0.0000633005,0.00002271494,0.00007885118],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03167928,"threshold_uncertainty_score":0.9989789,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4414588014","doi":"10.1007/s10742-025-00359-4","title":"Psychometric performance of EQ-5D-5L and SF-6Dv2 in cancer patients","year":2025,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Health Systems, Economic Evaluations, Quality of Life","field":"Economics, Econometrics and Finance","cited_by":1,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Centre Intégré Universitaire de Santé et de Services Sociaux du Centre-Sud-de-l'Île-de-Montréal; Université de Montréal","funders":"","keywords":"Intraclass correlation; Rank correlation; Receiver operating characteristic; Spearman's rank correlation coefficient; Correlation; Ceiling effect; Breast cancer; Convergent validity; Psychometrics","authors":[{"name":"Hosein Ameri","is_ca":true},{"name":"Thomas G. Poder","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7045539261009228,"gpt":0.5948502686643811,"spread":0.1097036574365418,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.04294701,0.0001717,0.001517517,0.00220562,0.0002336177,0.00003361655,0.0002990038,0.00019394,0.00009521717],"category_scores_gemma":[0.001662152,0.0001815737,0.00004876982,0.001213112,0.0001634272,0.00025595,0.0002122475,0.0004112473,0.00002682228],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000339773,"about_ca_system_score_gemma":0.000252994,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01863205,"about_ca_topic_score_gemma":0.004404045,"domain_scores_codex":[0.9932497,0.002186017,0.00301626,0.000638878,0.0001497485,0.0007594259],"domain_scores_gemma":[0.9928942,0.005405758,0.0009406272,0.000377106,0.0001644054,0.0002178694],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00005374088,0.00008620443,0.9774241,0.005341346,0.00003243783,9.013854e-8,0.002181327,0.00001198177,0.000001124689,0.00795009,0.0003660594,0.006551435],"study_design_scores_gemma":[0.001290862,0.0002559512,0.9827316,0.0002531336,0.00000187449,4.313125e-7,0.001103846,0.001706056,0.000002851877,0.00413694,0.008396975,0.0001194365],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9543833,0.0168275,0.0001030112,0.02660482,0.0004838464,0.0008667893,0.00009766086,0.00001202894,0.0006210638],"genre_scores_gemma":[0.9581671,0.01703909,0.006868991,0.01697734,0.00005994042,0.0002018306,0.00001611038,0.00002227727,0.0006472602],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.04128486,"threshold_uncertainty_score":0.9879029,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4401667657","doi":"10.1007/s10742-024-00335-4","title":"Deduplication methods for literature citations in systematic evidence reviews: practical insights to guide decision-making","year":2024,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Manitoba","funders":"","keywords":"Data deduplication; Computer science; Context (archaeology); Systematic review; Software; Data science; Management science; Data mining; Database; MEDLINE; Engineering","authors":[{"name":"Nicole Askin","is_ca":true},{"name":"George N. Okoli","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.9338542154844445,"gpt":0.7958391692124195,"spread":0.138015046272025,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","scholarly_communication"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.5746341,0.0003389647,0.005186418,0.002633406,0.0004124494,0.001944839,0.001413157,0.0002160315,0.0002282167],"category_scores_gemma":[0.3895076,0.0001614947,0.0007645596,0.006127535,0.000060884,0.0007054969,0.0004044663,0.0006013119,0.0004621519],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002143986,"about_ca_system_score_gemma":0.0004234812,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00009436159,"about_ca_topic_score_gemma":0.0009528278,"domain_scores_codex":[0.7580019,0.2170169,0.01683087,0.002852091,0.004141216,0.001156973],"domain_scores_gemma":[0.4113556,0.5789021,0.002231395,0.003779,0.00310485,0.0006270467],"domain_codex":null,"domain_gemma":"methods","domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001122539,0.00009383206,0.003719581,0.1715326,0.0002739391,0.00002691273,0.0531136,0.00008370357,0.0001569251,0.1014112,0.02277734,0.6466981],"study_design_scores_gemma":[0.000277674,0.0004964109,0.01655077,0.08368099,0.0002185129,0.0001425576,0.01378683,0.1072632,0.000006310028,0.3271273,0.4499357,0.0005137764],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001640835,0.1786929,0.7859985,0.02671077,0.0004751969,0.006365437,0.000007948747,0.00001238883,0.00009599533],"genre_scores_gemma":[0.005891031,0.005204247,0.9801933,0.00573009,0.00009535506,0.00191468,0.000005497917,0.00002296136,0.0009428876],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.6461844,"threshold_uncertainty_score":0.9990912,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3024135636","doi":"10.1007/s10742-023-00301-6","title":"Hierarchical causal variance decomposition for institution and provider comparisons in healthcare","year":2023,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Advanced Causal Inference Techniques","field":"Mathematics","cited_by":1,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Princess Margaret Cancer Centre; University Health Network; University of Toronto; Public Health Ontario","funders":"Natural Sciences and Engineering Research Council of Canada; Canadian Institutes of Health Research; Ontario Institute for Cancer Research","keywords":"Multinomial logistic regression; Multilevel model; Context (archaeology); Variance (accounting); Health administration; Health care; Variation (astronomy); Logistic regression; Medicine; Quality (philosophy); Statistics; Public health; Nursing; Mathematics; Geography","authors":[{"name":"Bo Chen","is_ca":true},{"name":"Kristen McAlpine","is_ca":true},{"name":"Keith A. Lawson","is_ca":true},{"name":"Antonio Finelli","is_ca":true},{"name":"Olli Saarela","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6102249160260278,"gpt":0.6500267204155956,"spread":0.03980180438956782,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008331794,0.0001570362,0.0006194185,0.0004778503,0.0003815352,0.00003655507,0.00014888,0.0001924053,0.000003250584],"category_scores_gemma":[0.00074998,0.0001355384,0.00002942856,0.0005015291,0.0002084869,0.0001754246,0.0002283932,0.0005901842,0.000002499424],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001375866,"about_ca_system_score_gemma":0.0001966633,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003088289,"about_ca_topic_score_gemma":0.008858535,"domain_scores_codex":[0.9955494,0.002394889,0.0005295997,0.0004613901,0.0002512178,0.0008135064],"domain_scores_gemma":[0.9896802,0.009559924,0.0001203615,0.0002388711,0.0001636182,0.0002370679],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0003518394,0.00009540848,0.08169141,0.008304004,0.00002443812,0.00001573935,0.003912481,0.00001215434,0.0002752971,0.8742744,0.0004675372,0.0305753],"study_design_scores_gemma":[0.0008602665,0.0006382045,0.1540555,0.0002820716,0.00000446109,0.00002134063,0.001259835,0.005927346,0.00008143209,0.834843,0.001858853,0.0001676315],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.4588878,0.001470227,0.4113875,0.121296,0.000349788,0.00568954,0.0001264665,0.000696508,0.00009617824],"genre_scores_gemma":[0.3432862,0.001514698,0.6519383,0.002293262,0.00007251219,0.0007255264,0.00005959253,0.00003465056,0.000075283],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.2405508,"threshold_uncertainty_score":0.5527096,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4405356853","doi":"10.1007/s10742-024-00339-0","title":"Correction: Deduplication methods for literature citations in systematic evidence reviews: practical insights to guide decision-making","year":2024,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Academic Writing and Publishing","field":"Arts and Humanities","cited_by":0,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Manitoba","funders":"","keywords":"Computer science; Management science; Data science; Data deduplication; Systematic review; Information retrieval; MEDLINE; Political science; Engineering; Database","authors":[{"name":"Nicole Askin","is_ca":true},{"name":"George N. Okoli","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.495383459484448,"gpt":0.6471978090623675,"spread":0.1518143495779195,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.03635711,0.0001608315,0.0006978848,0.0008495077,0.0006448525,0.0009440258,0.0002592652,0.0001514658,0.00004185737],"category_scores_gemma":[0.02365511,0.0001129961,0.00008410341,0.0005790152,0.00007074358,0.0008452836,0.0001384877,0.0008503373,0.0000212939],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001843917,"about_ca_system_score_gemma":0.0002560086,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0006239279,"about_ca_topic_score_gemma":0.002706748,"domain_scores_codex":[0.9903203,0.007325395,0.00102615,0.000544809,0.0002753985,0.0005079263],"domain_scores_gemma":[0.9052376,0.0936548,0.0001501704,0.0002836575,0.0004878108,0.0001859437],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001048549,0.00003672832,0.0002855762,0.1093316,0.0000472953,0.000008860248,0.336733,0.00001761648,0.00002177802,0.3036694,0.0279816,0.2217617],"study_design_scores_gemma":[0.0001663811,0.0003178236,0.0009341781,0.1111236,0.00003814604,0.00007040487,0.04674968,0.02169445,0.000002629918,0.05989163,0.758736,0.0002750864],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.00236374,0.3810584,0.5004173,0.1018748,0.00573195,0.006659184,0.00002286495,0.0002368786,0.001634905],"genre_scores_gemma":[0.01558296,0.01174415,0.9518688,0.01447095,0.001333021,0.002057524,0.00002315237,0.00005258458,0.002866851],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.7307544,"threshold_uncertainty_score":0.9922732,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3205253370","doi":"10.1007/s10742-021-00260-w","title":"Initial validation of the global assessment of severity of illness","year":2021,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Chronic Disease Management Strategies","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Western University; University of Waterloo","funders":"Canadian Institutes of Health Research; Ontario Ministry of Research, Innovation and Science","keywords":"Health administration; Medicine; Public health; Pathology","authors":[{"name":"Braden K. Tompke","is_ca":true},{"name":"Ashok Chaurasia","is_ca":true},{"name":"Christopher M. Perlman","is_ca":true},{"name":"Kathy N. Speechley","is_ca":true},{"name":"Mark A. Ferro","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3486768783784317,"gpt":0.6126938030420473,"spread":0.2640169246636156,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00363568,0.00007581925,0.0005489609,0.00007025542,0.00007371872,0.000005775813,0.0001391584,0.00006038273,0.0001341719],"category_scores_gemma":[0.0002244402,0.00005192144,0.00008153668,0.0004569236,0.0002461976,0.00004584351,0.0003846983,0.0001607196,2.401789e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00009091094,"about_ca_system_score_gemma":0.001095142,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002488659,"about_ca_topic_score_gemma":0.00050573,"domain_scores_codex":[0.9959893,0.002559399,0.0004617015,0.0001931358,0.0005440802,0.0002524411],"domain_scores_gemma":[0.9978943,0.0009641187,0.0002232718,0.0003804443,0.0004451534,0.0000926761],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002289409,0.0003498872,0.9219154,0.02304968,0.0002430304,0.00001084582,0.001512797,0.00002958158,0.0003474516,0.0367427,0.0000481999,0.01552151],"study_design_scores_gemma":[0.001050719,0.0001968014,0.9838759,0.0002154917,0.00004054166,0.000008191314,0.00765289,0.0001952035,0.001700845,0.004626076,0.0004001396,0.0000371489],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9884045,0.0006712477,0.0004879903,0.006738344,0.0001958062,0.0004707561,0.00005971091,0.000006406152,0.002965237],"genre_scores_gemma":[0.9911675,0.0004818352,0.007728718,0.0005041423,0.00002505912,0.000009805647,0.0000248618,0.000004875937,0.00005320555],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.06196058,"threshold_uncertainty_score":0.3762124,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1972735785","doi":"10.1007/s10742-013-0105-6","title":"Estimating variability for age-standardized hospital morbidity rates: a comparative study of automated methods for web-based atlas production using medical databases","year":2013,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Medical Coding and Health Information","field":"Health Professions","cited_by":0,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Public Health Agency of Canada; Western University; HIV Legal Network","funders":"Public Health Agency of Canada","keywords":"Statistics; Poisson distribution; Negative binomial distribution; Confidence interval; Overdispersion; Count data; Computer science; Mathematics; Econometrics","authors":[{"name":"Terry C. K. Lee","is_ca":true},{"name":"C. B. Dean","is_ca":true},{"name":"R Semenciw","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7566530610632348,"gpt":0.7132497391428269,"spread":0.04340332192040797,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","sts"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.08041589,0.0002460067,0.001554919,0.0003530504,0.002079414,0.00002152115,0.0002897325,0.0002893046,0.0001365582],"category_scores_gemma":[0.0203956,0.0001808522,0.0000819774,0.0004801443,0.0002723186,0.0002746871,0.000233885,0.0009697556,0.00000336433],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002862762,"about_ca_system_score_gemma":0.002398004,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01344396,"about_ca_topic_score_gemma":0.001198004,"domain_scores_codex":[0.9711629,0.02427627,0.002047991,0.0006057783,0.0007492678,0.001157824],"domain_scores_gemma":[0.9415323,0.05407218,0.001038069,0.0005482596,0.002103644,0.0007055472],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.007005067,0.004677065,0.3777961,0.2314837,0.0008994231,0.000004698187,0.2591092,0.001880938,0.001700233,0.002943876,0.01127719,0.1012225],"study_design_scores_gemma":[0.005441481,0.001859675,0.04559789,0.0007708765,0.00003651637,0.000001088841,0.02821358,0.9154513,0.00005194487,0.001366199,0.001034448,0.0001750248],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.6730769,0.00009391825,0.3093174,0.004947899,0.001143971,0.01115245,0.00009077708,0.0001619213,0.00001479567],"genre_scores_gemma":[0.2530867,0.00002018836,0.7432553,0.0009387776,0.000229305,0.002293264,0.000140263,0.0000220119,0.00001424843],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9135703,"threshold_uncertainty_score":0.9992197,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}