{"meta":{"query_hash":"7b0a4d4a1a0a","filters":{"venue":"Health Services and Outcomes Research Methodology"},"cohort_total":20,"direct_labels_cover":1,"predictions_cover":20,"exported":20,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/7b0a4d4a1a0a","api":"https://metacan.xera.ac/api/v1/cohort?venue=Health+Services+and+Outcomes+Research+Methodology"},"results":[{"id":"W1529736910","doi":"10.1023/a:1024260023851","title":"A Comparison of Statistical Modeling Strategies for Analyzing Length of Stay after CABG Surgery","year":2002,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Hemodynamic Monitoring and Therapy","field":"Medicine","cited_by":138,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto; Sunnybrook Health Science Centre; Institute for Clinical Evaluative Sciences","funders":"Canadian Institutes of Health Research; Canada Research Chairs; Ontario Ministry of Health and Long-Term Care","keywords":"Negative binomial distribution; Generalized linear model; Poisson regression; Statistics; Mathematics; Poisson distribution; Linear regression; Regression analysis; Log-linear model; Linear model; Proportional hazards model; Consistency (knowledge bases); Quasi-likelihood; Statistical model; Parametric statistics; Regression; Simple linear regression; Medicine; Population","score_opus":0.5064902954872634,"score_gpt":0.5967557162960009,"score_spread":0.09026542080873745,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1529736910","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9154186,0.0049411543,0.07801518,0.0010236491,0.00010742032,0.00040510358,0.000043232703,0.000014098409,0.00003154843],"genre_scores_gemma":[0.9256397,0.0013481346,0.07271655,0.00013357593,0.000057766607,0.000037234764,0.000012249427,0.000016755128,0.00003807268],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9969489,0.0012155748,0.00072067307,0.00026001869,0.00032154957,0.0005332844],"domain_scores_gemma":[0.992056,0.0070526404,0.00013801511,0.00023774614,0.00030271316,0.0002128955],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0053280313,0.000119662946,0.0011715333,0.0003407071,0.000095034164,0.000011168532,0.00007360307,0.00011277667,0.000053698073],"category_scores_gemma":[0.00020453859,0.00009182958,0.000086516084,0.00018976549,0.00012544532,0.00005262016,0.000042583517,0.0002968383,6.5331943e-7],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015241576,0.0003695403,0.8571651,0.016086746,0.00032643665,0.000009769702,0.015515297,0.00032546418,0.00039895994,0.0033174832,0.00004813078,0.10491294],"study_design_scores_gemma":[0.0029045187,0.0024123683,0.14760697,0.0009801269,0.00008991437,0.000018321582,0.028297544,0.8094555,0.000293375,0.0069168448,0.0007419435,0.00028257156],"about_ca_topic_score_codex":0.0026583772,"about_ca_topic_score_gemma":0.00029462177,"teacher_disagreement_score":0.80913,"about_ca_system_score_codex":0.000038514998,"about_ca_system_score_gemma":0.00016086694,"threshold_uncertainty_score":0.40186888},"labels":[],"label_agreement":null},{"id":"W1972735785","doi":"10.1007/s10742-013-0105-6","title":"Estimating variability for age-standardized hospital morbidity rates: a comparative study of automated methods for web-based atlas production using medical databases","year":2013,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Medical Coding and Health Information","field":"Health Professions","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Public Health Agency of Canada; Western University; HIV Legal Network","funders":"Public Health Agency of Canada","keywords":"Statistics; Poisson distribution; Negative binomial distribution; Confidence interval; Overdispersion; Count data; Computer science; Mathematics; Econometrics","score_opus":0.7566530610632348,"score_gpt":0.7132497391428269,"score_spread":0.04340332192040797,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1972735785","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.67307687,0.00009391825,0.3093174,0.0049478994,0.0011439708,0.011152452,0.00009077708,0.00016192126,0.000014795672],"genre_scores_gemma":[0.2530867,0.000020188363,0.74325526,0.0009387776,0.00022930498,0.0022932645,0.00014026299,0.000022011902,0.000014248426],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.97116286,0.024276273,0.0020479911,0.0006057783,0.00074926775,0.0011578241],"domain_scores_gemma":[0.9415323,0.054072175,0.0010380688,0.0005482596,0.002103644,0.00070554717],"candidate_categories":["metaresearch","sts"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.08041589,0.00024600668,0.0015549189,0.00035305036,0.002079414,0.00002152115,0.00028973247,0.00028930465,0.0001365582],"category_scores_gemma":[0.020395601,0.00018085216,0.0000819774,0.00048014426,0.00027231863,0.00027468713,0.00023388502,0.00096975564,0.0000033643303],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.007005067,0.004677065,0.37779605,0.23148373,0.0008994231,0.0000046981872,0.2591092,0.0018809376,0.0017002327,0.0029438757,0.011277192,0.10122251],"study_design_scores_gemma":[0.005441481,0.0018596752,0.045597892,0.0007708765,0.000036516365,0.0000010888414,0.028213575,0.9154513,0.00005194487,0.0013661989,0.0010344478,0.00017502482],"about_ca_topic_score_codex":0.013443963,"about_ca_topic_score_gemma":0.0011980039,"teacher_disagreement_score":0.91357034,"about_ca_system_score_codex":0.00028627625,"about_ca_system_score_gemma":0.0023980043,"threshold_uncertainty_score":0.9992197},"labels":[],"label_agreement":null},{"id":"W1983766924","doi":"10.1007/s10742-008-0030-2","title":"Signal-to-noise ratio (SNR) as a measure of reproducibility: design, estimation, and application","year":2008,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Image and Signal Denoising Methods","field":"Computer Science","cited_by":16,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Reproducibility; Measure (data warehouse); Statistics; Estimation; Signal-to-noise ratio (imaging); Computer science; Noise (video); Mathematics; Artificial intelligence; Data mining; Engineering","score_opus":0.2905204980326063,"score_gpt":0.5046460894679036,"score_spread":0.21412559143529725,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1983766924","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.031958327,0.0017982931,0.95593405,0.009159694,0.000062811945,0.0009753793,0.0000016241535,0.00005283755,0.000056998815],"genre_scores_gemma":[0.17581865,0.00036436768,0.8207582,0.0028036912,0.000033341526,0.00007810327,0.0000022837255,0.000011863152,0.0001294719],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9891776,0.007940094,0.0006105418,0.0011430766,0.000596304,0.0005324259],"domain_scores_gemma":[0.9926585,0.00485952,0.00019122861,0.0012870831,0.0006518524,0.0003518315],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03421295,0.00016379144,0.00060637813,0.0004133247,0.00054556254,0.000059727983,0.00054408394,0.00011171822,0.000006320624],"category_scores_gemma":[0.0015399293,0.00013558821,0.000040999887,0.0008874191,0.00020833382,0.00031156998,0.000421429,0.00029610793,0.000011944786],"study_design_candidate":"design_other","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005116983,0.0001884203,0.01738534,0.0020229889,0.00007418134,0.000028191575,0.0399113,0.0010458719,0.023055758,0.015192146,0.0002668973,0.9003172],"study_design_scores_gemma":[0.0038850002,0.0042904033,0.40353674,0.00037313456,0.000032672066,0.00072558783,0.0016855506,0.3485378,0.040765263,0.1921308,0.0030765438,0.0009604841],"about_ca_topic_score_codex":0.0022520772,"about_ca_topic_score_gemma":0.00005810237,"teacher_disagreement_score":0.8993567,"about_ca_system_score_codex":0.000044473793,"about_ca_system_score_gemma":0.00041211097,"threshold_uncertainty_score":0.994481},"labels":[],"label_agreement":null},{"id":"W2009201840","doi":"10.1007/s10742-010-0063-1","title":"Surgery volume, quality of care and operative mortality in coronary artery bypass graft surgery: a re-examination using fixed-effects regression","year":2010,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Cardiac, Anesthesia and Surgical Outcomes","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute for Clinical Evaluative Sciences; University of Toronto","funders":"","keywords":"Medicine; Surgery; Cardiac surgery; Cardiothoracic surgery; Cardiology","score_opus":0.27197394056959545,"score_gpt":0.5480294033068087,"score_spread":0.27605546273721326,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2009201840","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99375963,0.003035402,0.0000520051,0.0018503143,0.00028575433,0.0008742724,0.000014929741,0.00002156433,0.0001061154],"genre_scores_gemma":[0.99276036,0.001707925,0.0043974575,0.00086129433,0.00006748764,0.000040637868,0.000063300504,0.000022714943,0.00007885118],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.98641795,0.010782556,0.00094181736,0.00055653305,0.0006480738,0.0006530882],"domain_scores_gemma":[0.96943533,0.02909025,0.00026926608,0.00043328493,0.00038155686,0.00039027978],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.021319613,0.00024181286,0.0024224694,0.00060791406,0.00021997775,0.0000258635,0.000083384984,0.00033054344,0.00003194612],"category_scores_gemma":[0.0021156387,0.00017712782,0.00023984375,0.00047851645,0.00036319258,0.00016702665,0.00015319927,0.0007770716,9.678225e-7],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00042044895,0.00007726157,0.9612472,0.00600051,0.00006834024,0.00013497757,0.003976349,6.858841e-7,0.00093702134,0.0002467747,0.0000105029885,0.026879912],"study_design_scores_gemma":[0.0007713155,0.00019818966,0.9929265,0.00041139362,0.000026926531,0.00008692271,0.0045629255,0.00022505152,0.0001820548,0.000064764165,0.00040329483,0.00014066444],"about_ca_topic_score_codex":0.0076294085,"about_ca_topic_score_gemma":0.005928392,"teacher_disagreement_score":0.03167928,"about_ca_system_score_codex":0.00008930894,"about_ca_system_score_gemma":0.00041997994,"threshold_uncertainty_score":0.99897885},"labels":[],"label_agreement":null},{"id":"W2030246929","doi":"10.1007/s10742-009-0048-0","title":"Comparison of cluster detection using patients and events of medically treated self-inflicted injuries in Alberta, Canada","year":2009,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Data-Driven Disease Surveillance","field":"Medicine","cited_by":5,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Context (archaeology); Cluster analysis; Epidemiology; Psychological intervention; Cluster (spacecraft); Medicine; Public health; Health care; Health services research; Population; Intervention (counseling); Medical emergency; Demography; Environmental health; Geography; Computer science; Nursing; Pathology","score_opus":0.11969533947296526,"score_gpt":0.5064610241919099,"score_spread":0.38676568471894457,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2030246929","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99751645,0.00037108737,0.000028311535,0.0014114854,0.000049122253,0.00055545726,0.000035586312,0.000008740404,0.000023762812],"genre_scores_gemma":[0.9944012,0.00018410146,0.00429192,0.0010358747,0.000010408902,0.000004881219,0.0000520057,0.000008574868,0.000011006496],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99600875,0.002129392,0.00071118213,0.00026342153,0.0004841002,0.0004031214],"domain_scores_gemma":[0.9972158,0.001749456,0.00024554433,0.00020838554,0.00029547483,0.00028530296],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002062991,0.00012284305,0.0009089145,0.0002963888,0.00007173197,0.0000033928081,0.0000913472,0.0001056551,0.000009948463],"category_scores_gemma":[0.00050076126,0.00009863122,0.000024782485,0.00038329375,0.0000834039,0.00005907895,0.00009188506,0.00025980576,1.6983668e-7],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00071815297,0.00017172161,0.98315185,0.001392204,0.00004126264,0.000001642344,0.0014624402,0.0000036576657,0.00015614484,0.000007044273,0.000010166628,0.01288371],"study_design_scores_gemma":[0.0020220662,0.0007440879,0.9933478,0.00017291683,0.000015535736,0.0000023884634,0.00042926378,0.0026390336,0.0002803139,0.000050604045,0.00023750392,0.000058438345],"about_ca_topic_score_codex":0.6901561,"about_ca_topic_score_gemma":0.7603893,"teacher_disagreement_score":0.07023321,"about_ca_system_score_codex":0.00014703078,"about_ca_system_score_gemma":0.0004628969,"threshold_uncertainty_score":0.40220645},"labels":[],"label_agreement":null},{"id":"W2045908763","doi":"10.1007/s10742-014-0117-x","title":"Using instrumental variables to estimate a Cox’s proportional hazards regression subject to additive confounding","year":2014,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Healthcare Policy and Management","field":"Economics, Econometrics and Finance","cited_by":66,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute for Clinical Evaluative Sciences","funders":"National Cancer Institute; National Center for Advancing Translational Sciences; National Institute of Mental Health; National Institutes of Health","keywords":"Confounding; Proportional hazards model; Instrumental variable; Statistics; Regression analysis; Regression; Econometrics; Mathematics","score_opus":0.39179876311714523,"score_gpt":0.5536682860750683,"score_spread":0.16186952295792312,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2045908763","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8113007,0.00075172575,0.10294373,0.07427168,0.0015474675,0.0031284397,0.0004179214,0.00011537839,0.005522969],"genre_scores_gemma":[0.7344385,0.0002581862,0.24450012,0.01968867,0.0002925936,0.0001960627,0.000051759565,0.00004737134,0.0005267453],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9961506,0.0011169137,0.0008189542,0.00068282615,0.00017073739,0.0010599468],"domain_scores_gemma":[0.9975238,0.0011054183,0.0002608112,0.0003201568,0.00011552536,0.0006743053],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013881102,0.00019936764,0.00078999915,0.0008358533,0.0006580197,0.00010472537,0.00026688568,0.00012579127,0.00014671888],"category_scores_gemma":[0.0007488038,0.00018500163,0.0000556318,0.0005009595,0.00007504312,0.0001594634,0.0004887809,0.00032259044,0.00011245185],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002522141,0.00008854626,0.07786355,0.0018210902,0.00009023385,0.000007714372,0.007247387,0.00017491086,0.00005724519,0.8506163,0.0003908632,0.061389945],"study_design_scores_gemma":[0.0020048656,0.0020278196,0.4018474,0.0007780541,0.000010210318,0.000046952875,0.004136922,0.023485031,0.00012067263,0.09584378,0.4688813,0.0008169815],"about_ca_topic_score_codex":0.036836486,"about_ca_topic_score_gemma":0.003551687,"teacher_disagreement_score":0.75477254,"about_ca_system_score_codex":0.00036341985,"about_ca_system_score_gemma":0.00016642158,"threshold_uncertainty_score":0.9695773},"labels":[],"label_agreement":null},{"id":"W2064626421","doi":"10.1007/s10742-009-0044-4","title":"Deriving a mental health outcome measure using the pooled index: an application to psychiatric consumer–survivors in different housing types","year":2009,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Schizophrenia research and treatment","field":"Medicine","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University; St. Michael's Hospital; Western University","funders":"","keywords":"Quality of life (healthcare); Index (typography); Mental health; Medicine; Gerontology; Activities of daily living; Psychiatry; Demography; Psychology; Nursing","score_opus":0.2128823355536524,"score_gpt":0.5300256492860057,"score_spread":0.31714331373235327,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2064626421","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9232471,0.0043428065,0.0026786583,0.06695397,0.00011389925,0.0025902104,0.00001102732,0.00004628654,0.000016044494],"genre_scores_gemma":[0.964012,0.0007089886,0.026840404,0.008195306,0.00010557966,0.00007190231,0.000025784295,0.000027490085,0.000012528146],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99254966,0.004096304,0.00070024596,0.00063138653,0.00080978504,0.0012126064],"domain_scores_gemma":[0.9973222,0.00092143024,0.00016063846,0.0005684294,0.00014922112,0.0008781019],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007212275,0.00027204116,0.0009280809,0.0007955939,0.000713871,0.000069582085,0.00025832528,0.00012600594,0.000013088301],"category_scores_gemma":[0.00015499843,0.00016563825,0.00008099919,0.00094266766,0.00009104445,0.00009653733,0.00014687925,0.00074492564,0.000005781778],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0023645007,0.00035380104,0.84303606,0.00048441472,0.00006830022,0.00001051482,0.0032090815,0.000030006402,0.00021334348,0.00055474864,0.000008022964,0.14966722],"study_design_scores_gemma":[0.0025405553,0.0013886419,0.986886,0.00013459139,0.000015850632,0.000054445656,0.003374433,0.003998725,0.000018716224,0.0012667879,0.0001885175,0.00013268276],"about_ca_topic_score_codex":0.020106522,"about_ca_topic_score_gemma":0.05931881,"teacher_disagreement_score":0.14953454,"about_ca_system_score_codex":0.00053151615,"about_ca_system_score_gemma":0.00055574183,"threshold_uncertainty_score":0.98641866},"labels":[],"label_agreement":null},{"id":"W2068564314","doi":"10.1007/s10742-014-0124-y","title":"A data-adaptive strategy for inverse weighted estimation of causal effects","year":2014,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Advanced Causal Inference Techniques","field":"Mathematics","cited_by":18,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"National Institute on Drug Abuse; National Institutes of Health; National Science Foundation","keywords":"Causal inference; Propensity score matching; Observational study; Nonparametric statistics; Covariate; Estimator; Confounding; Inverse probability; Econometrics; Statistics; Average treatment effect; Logistic regression; Consistency (knowledge bases); Randomized experiment; Marginal structural model; Computer science; Mathematics; Artificial intelligence; Posterior probability; Bayesian probability","score_opus":0.6899585491834566,"score_gpt":0.6385585072369091,"score_spread":0.05140004194654746,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2068564314","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06253128,0.00020039649,0.93397814,0.0009783104,0.000090829446,0.0018292646,0.00011146731,0.00012083979,0.00015945335],"genre_scores_gemma":[0.11237817,0.00014521326,0.8866697,0.0004772171,0.000040620645,0.000137078,0.00006886807,0.000027311378,0.000055800232],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9946097,0.0035385243,0.0005363676,0.0004308694,0.00031060973,0.00057390385],"domain_scores_gemma":[0.971457,0.027040917,0.000304824,0.0006953468,0.0003167673,0.00018516797],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0120730875,0.00016930218,0.0007934681,0.00026140522,0.00017420198,0.000017305085,0.0004184131,0.00016662896,0.000011405712],"category_scores_gemma":[0.0022477347,0.00013157501,0.000037352813,0.0002292818,0.00019438734,0.00023204988,0.0003533105,0.00031848587,0.0000021583676],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00044991207,0.00016026924,0.001237978,0.014589926,0.00013505647,0.0000030598749,0.0027472025,0.00004303477,0.00054345257,0.8067031,0.000612516,0.1727745],"study_design_scores_gemma":[0.0007272452,0.0016468783,0.0021020668,0.000173752,0.000022246395,0.000005054762,0.0008247179,0.0983908,0.00094262103,0.89454997,0.00048568394,0.00012896108],"about_ca_topic_score_codex":0.0010058304,"about_ca_topic_score_gemma":0.0019137154,"teacher_disagreement_score":0.17264554,"about_ca_system_score_codex":0.000054347976,"about_ca_system_score_gemma":0.00014544875,"threshold_uncertainty_score":0.53654736},"labels":[],"label_agreement":null},{"id":"W2080992413","doi":"10.1007/s10742-006-0010-3","title":"Methods for studying adverse events on surgical wait lists","year":2006,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Health Systems, Economic Evaluations, Quality of Life","field":"Economics, Econometrics and Finance","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Royal Columbian Hospital; Vancouver General Hospital; University of British Columbia","funders":"","keywords":"Medicine; Population; Event (particle physics); Adverse effect; Incidence (geometry); Disease; Angina; Cumulative incidence; Unstable angina; Emergency medicine; Medical emergency; Intensive care medicine; Surgery; Myocardial infarction; Internal medicine","score_opus":0.7943857756584719,"score_gpt":0.6733009975553546,"score_spread":0.12108477810311735,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2080992413","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.73026955,0.016465245,0.05386355,0.1851244,0.0027325114,0.007280075,0.00066951476,0.0002082089,0.0033869322],"genre_scores_gemma":[0.15942854,0.0016149518,0.79035217,0.04152843,0.0014768844,0.0012990516,0.0001920197,0.00015674198,0.003951227],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.984136,0.009743095,0.0036063935,0.0010094718,0.00019631725,0.0013087194],"domain_scores_gemma":[0.96736866,0.030230276,0.0012216691,0.0006037546,0.00016810818,0.00040755715],"candidate_categories":["metaresearch","metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.14329262,0.000266065,0.0018758506,0.0007672608,0.0007868754,0.00003918733,0.00041411084,0.00026676545,0.00015330523],"category_scores_gemma":[0.0022717754,0.0002739055,0.00019104968,0.0003284602,0.00011263864,0.00022989018,0.00019059704,0.00047458953,0.00023195088],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00035163865,0.0003832855,0.5695206,0.0057117837,0.00016404981,0.0000051477364,0.004618427,0.00017598174,0.0000032443027,0.4046712,0.0029466166,0.0114480015],"study_design_scores_gemma":[0.0035962916,0.00082140305,0.58786017,0.00017442716,0.0000058350415,0.000016065109,0.003795082,0.0048052194,0.0000053238305,0.15462197,0.24384432,0.00045388634],"about_ca_topic_score_codex":0.009936787,"about_ca_topic_score_gemma":0.0010480308,"teacher_disagreement_score":0.73648864,"about_ca_system_score_codex":0.0004904825,"about_ca_system_score_gemma":0.00019372346,"threshold_uncertainty_score":0.99997133},"labels":[],"label_agreement":null},{"id":"W213901707","doi":"10.1023/a:1025818432525","title":"Imputing a Binary Variable from Donor to Recipient Dataset when Recipient Dataset Holds Restricted Information on the Variable","year":2002,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Statistical Methods and Bayesian Inference","field":"Mathematics","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Statistics Canada; Health Canada","funders":"Health Canada","keywords":"Variable (mathematics); Imputation (statistics); Logistic regression; Computer science; Data mining; Population; Regression; Statistics; Econometrics; Mathematics; Missing data; Machine learning; Medicine","score_opus":0.3935089949768288,"score_gpt":0.5154611245270454,"score_spread":0.12195212955021661,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W213901707","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.026454888,0.0005706969,0.8254024,0.06250036,0.0015350722,0.0053557735,0.07593651,0.00021606106,0.0020282858],"genre_scores_gemma":[0.00042247772,0.000304686,0.97982347,0.016120877,0.00012966132,0.00016525699,0.0029488625,0.000024859595,0.00005986183],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9891714,0.007310282,0.0010237581,0.00059811113,0.00075689825,0.0011395692],"domain_scores_gemma":[0.95808935,0.039629612,0.00031251065,0.0012276118,0.0002150742,0.0005258568],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.013684772,0.00029040378,0.00075400027,0.00037624483,0.0008823853,0.0002397468,0.0007849345,0.00021006177,0.001385767],"category_scores_gemma":[0.0071809352,0.00018797087,0.000033855253,0.0007917198,0.00012110601,0.00029726885,0.0008977838,0.0008888234,0.00015165351],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00067313225,0.0004323907,0.00216606,0.0017173656,0.0001919243,0.00002302746,0.009511697,0.00002335467,0.00014917998,0.4512564,0.42379713,0.11005834],"study_design_scores_gemma":[0.0012681108,0.0016629254,0.012831276,0.0005977517,0.00004927086,0.000017201743,0.0027664402,0.016173692,0.000032878623,0.55083,0.41328332,0.00048710298],"about_ca_topic_score_codex":0.0115906205,"about_ca_topic_score_gemma":0.00022311877,"teacher_disagreement_score":0.1544211,"about_ca_system_score_codex":0.000159335,"about_ca_system_score_gemma":0.00012011622,"threshold_uncertainty_score":0.9995271},"labels":[],"label_agreement":null},{"id":"W2317982607","doi":"10.1007/s10742-013-0112-7","title":"A comparison of statistical models for analyzing episodes-of-care costs for chronic obstructive pulmonary disease exacerbations","year":2013,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Chronic Disease Management Strategies","field":"Medicine","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Saskatchewan Health Quality Council; University of Saskatchewan; University of Manitoba","funders":"Ministry of Health, Saskatchewan; University of Saskatchewan","keywords":"Ordinary least squares; Heteroscedasticity; Statistics; Poisson regression; Medicine; Generalized linear model; Regression analysis; Regression; Econometrics; Health administration; Linear regression; Mathematics; Public health; Population; Environmental health","score_opus":0.3286456677312481,"score_gpt":0.5718448853666004,"score_spread":0.2431992176353523,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2317982607","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.37208292,0.04608519,0.5442614,0.014315071,0.00037086918,0.01990218,0.0019236407,0.00010143816,0.00095727993],"genre_scores_gemma":[0.8968987,0.0005029119,0.101086326,0.00015986378,0.00006089206,0.00079351297,0.00038168216,0.000026102618,0.000090049776],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99723035,0.00077988236,0.0006489414,0.00040453998,0.00032226712,0.00061403814],"domain_scores_gemma":[0.992174,0.0061253607,0.00022144637,0.00034354703,0.0007258618,0.00040974078],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014996664,0.00015940657,0.00094198255,0.00032697903,0.00020333655,0.000019763342,0.0001558639,0.00007485342,0.000072754294],"category_scores_gemma":[0.00034460748,0.00013256553,0.00012181169,0.00022459088,0.00029247318,0.00016286067,0.0001494707,0.00017853414,0.0000011938029],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.003637712,0.0007647288,0.3483866,0.15335119,0.0007359836,0.0000065395143,0.007465434,0.0018822906,0.00025493707,0.22716853,0.00067413,0.25567192],"study_design_scores_gemma":[0.002815894,0.0018713503,0.6755195,0.0005873161,0.00024961412,0.0000017276169,0.027575074,0.23404622,0.000045641318,0.05657423,0.0005253892,0.00018801213],"about_ca_topic_score_codex":0.0017135834,"about_ca_topic_score_gemma":0.00036511623,"teacher_disagreement_score":0.52481574,"about_ca_system_score_codex":0.00028278725,"about_ca_system_score_gemma":0.00063843094,"threshold_uncertainty_score":0.5405866},"labels":[],"label_agreement":null},{"id":"W23346058","doi":"10.1023/a:1011424117583","title":"Considerations for Measuring Functioning of the Elderly: IRM Dimensionality and Scaling Analysis","year":2001,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Health disparities and outcomes","field":"Social Sciences","cited_by":16,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Rasch model; Activities of daily living; Item response theory; International Classification of Functioning, Disability and Health; Scale (ratio); Gerontology; Psychology; Statistics; Psychometrics; Medicine; Mathematics; Clinical psychology; Physical therapy; Geography; Rehabilitation","score_opus":0.49650653711572157,"score_gpt":0.5636000211075388,"score_spread":0.06709348399181725,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W23346058","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.90528876,0.0030749624,0.0028223393,0.08697674,0.0003867014,0.00093574217,0.000024992803,0.000027708504,0.00046208815],"genre_scores_gemma":[0.9766403,0.001875276,0.015711563,0.005311876,0.00010016654,0.000050061106,0.0000033029326,0.000008371706,0.00029911424],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9939783,0.0041393493,0.0004721337,0.00028899297,0.00044538965,0.0006758225],"domain_scores_gemma":[0.98418105,0.0147839505,0.00016452961,0.0002103183,0.00038470668,0.00027542084],"candidate_categories":["sts"],"consensus_categories":[],"category_scores_codex":[0.017380647,0.00009178861,0.0005185519,0.00021962148,0.0029416247,0.00006743985,0.00012526945,0.000112852445,0.00006450679],"category_scores_gemma":[0.0019511973,0.00006512982,0.00011332416,0.00064286776,0.0003819689,0.000109672364,0.00013394981,0.00023750108,3.420074e-7],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000447626,0.000024190993,0.90792793,0.0008354551,0.00015353905,5.7886473e-7,0.0152835455,0.00006387931,0.0000065001773,0.065278456,0.000045947418,0.010335188],"study_design_scores_gemma":[0.0003723913,0.0000656701,0.9411949,0.00006655924,0.000058595626,0.0000024327326,0.029106135,0.0005209337,0.0000066936686,0.019384185,0.009139861,0.00008165157],"about_ca_topic_score_codex":0.068911634,"about_ca_topic_score_gemma":0.109541446,"teacher_disagreement_score":0.08166486,"about_ca_system_score_codex":0.000073921714,"about_ca_system_score_gemma":0.0004177186,"threshold_uncertainty_score":0.9983564},"labels":[],"label_agreement":null},{"id":"W2343900495","doi":"10.1007/s10742-016-0147-7","title":"The study of service use among homeless persons with mental illness: a methodological review","year":2016,"lang":"en","type":"review","venue":"Health Services and Outcomes Research Methodology","topic":"Homelessness and Social Issues","field":"Health Professions","cited_by":6,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"PsycINFO; Mental illness; Observational study; Mental health; Receipt; Service (business); Type of service; Medicine; Health services research; Population; MEDLINE; Psychology; Psychiatry; Public health; Nursing; Gerontology; Environmental health; Business","score_opus":0.6729901541732592,"score_gpt":0.6682930787085176,"score_spread":0.004697075464741629,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2343900495","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006039022,0.9797172,0.00003367764,0.0021593224,0.0005282973,0.011188662,0.00019173187,0.00006785675,0.00007426388],"genre_scores_gemma":[0.00022155805,0.99368125,0.0011504043,0.0010600726,0.0002055425,0.0029783552,0.00004682607,0.00012279235,0.0005331976],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.88222337,0.110982515,0.0024658947,0.0011037024,0.0011955182,0.002029007],"domain_scores_gemma":[0.9159088,0.0791556,0.0019921702,0.0013132287,0.0009994482,0.00063072884],"candidate_categories":["metaresearch","metaepi_narrow","sts","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.04824894,0.0008039412,0.009578667,0.000428088,0.004178304,0.000059905153,0.0014705032,0.00085391436,0.00016595406],"category_scores_gemma":[0.0013192282,0.00034577248,0.00035007676,0.0015705943,0.0006737562,0.00022411029,0.0015153645,0.0030527927,0.000038771028],"study_design_candidate":"design_other","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012105528,0.0001758087,0.01151858,0.26454213,0.000582044,0.000018049059,0.04883154,1.8223416e-8,3.474655e-8,0.00064634695,0.000057477744,0.6735069],"study_design_scores_gemma":[0.0009696603,0.0008519067,0.0072248783,0.083407514,0.00030918635,0.0000035088608,0.25301638,0.0000011080572,1.8942035e-8,0.000116095216,0.65368795,0.00041182365],"about_ca_topic_score_codex":0.031842843,"about_ca_topic_score_gemma":0.12245065,"teacher_disagreement_score":0.6730951,"about_ca_system_score_codex":0.00033070415,"about_ca_system_score_gemma":0.001373807,"threshold_uncertainty_score":0.99989945},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"not_applicable","genre":"review","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"design_other","genre":"review","about_ca_system":false,"about_ca_topic":false,"confidence":"low"}],"label_agreement":"split"},{"id":"W2889374799","doi":"10.1007/s10742-018-0187-2","title":"Causal inference for multi-level treatments with machine-learned propensity scores","year":2018,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Advanced Causal Inference Techniques","field":"Mathematics","cited_by":11,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Propensity score matching; Causal inference; Inverse probability; Inverse probability weighting; Multinomial logistic regression; Statistics; Econometrics; Observational study; Logistic regression; Matching (statistics); Computer science; Estimator; Bayesian probability; Average treatment effect; Mathematics; Posterior probability","score_opus":0.8430232517073458,"score_gpt":0.6674423948286655,"score_spread":0.1755808568786803,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2889374799","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.38473985,0.00041499274,0.60554564,0.0036865657,0.00014687181,0.0046970434,0.00016604959,0.00040019536,0.00020280125],"genre_scores_gemma":[0.12829962,0.00033274305,0.8690109,0.0010862064,0.00006530526,0.00035590093,0.0000207615,0.000049924274,0.00077860383],"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99539524,0.0020753676,0.000472133,0.0006361449,0.00038761157,0.0010335002],"domain_scores_gemma":[0.9914651,0.0066294493,0.00024503283,0.00056216755,0.0007680294,0.00033021282],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005621462,0.00029425768,0.0008783351,0.0002641275,0.00063232024,0.00005721104,0.00036365332,0.00017751129,0.000043576583],"category_scores_gemma":[0.0013167503,0.00018855344,0.00004765381,0.00028894388,0.0005269377,0.00020445495,0.0003460993,0.00042974766,0.00001009565],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.004189607,0.001126212,0.51874465,0.009331476,0.000660153,0.00004884437,0.019416839,0.0000019611962,0.0016515582,0.20192942,0.00039096377,0.2425083],"study_design_scores_gemma":[0.007504054,0.015066066,0.44238496,0.00092372147,0.00010098736,0.000094870375,0.0033074557,0.0050029624,0.0065349336,0.51517767,0.0028260106,0.0010762962],"about_ca_topic_score_codex":0.0037740627,"about_ca_topic_score_gemma":0.018598486,"teacher_disagreement_score":0.31324828,"about_ca_system_score_codex":0.00012548227,"about_ca_system_score_gemma":0.0002785505,"threshold_uncertainty_score":0.99930954},"labels":[],"label_agreement":null},{"id":"W3024135636","doi":"10.1007/s10742-023-00301-6","title":"Hierarchical causal variance decomposition for institution and provider comparisons in healthcare","year":2023,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Advanced Causal Inference Techniques","field":"Mathematics","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Princess Margaret Cancer Centre; University Health Network; University of Toronto; Public Health Ontario","funders":"Natural Sciences and Engineering Research Council of Canada; Canadian Institutes of Health Research; Ontario Institute for Cancer Research","keywords":"Multinomial logistic regression; Multilevel model; Context (archaeology); Variance (accounting); Health administration; Health care; Variation (astronomy); Logistic regression; Medicine; Quality (philosophy); Statistics; Public health; Nursing; Mathematics; Geography","score_opus":0.6102249160260278,"score_gpt":0.6500267204155956,"score_spread":0.03980180438956782,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3024135636","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.45888785,0.0014702275,0.41138747,0.121295966,0.00034978797,0.0056895404,0.00012646653,0.00069650804,0.000096178235],"genre_scores_gemma":[0.34328622,0.0015146978,0.65193826,0.0022932617,0.00007251219,0.00072552636,0.000059592534,0.00003465056,0.000075283],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9955494,0.0023948895,0.0005295997,0.0004613901,0.0002512178,0.0008135064],"domain_scores_gemma":[0.9896802,0.009559924,0.00012036154,0.00023887114,0.0001636182,0.00023706791],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008331794,0.00015703621,0.0006194185,0.00047785035,0.00038153515,0.000036555066,0.00014887998,0.00019240534,0.0000032505843],"category_scores_gemma":[0.00074998004,0.00013553842,0.000029428562,0.0005015291,0.00020848692,0.00017542462,0.00022839317,0.00059018424,0.0000024994245],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00035183938,0.000095408475,0.08169141,0.008304004,0.000024438115,0.000015739348,0.0039124805,0.000012154344,0.00027529706,0.8742744,0.00046753717,0.030575303],"study_design_scores_gemma":[0.0008602665,0.00063820445,0.1540555,0.00028207156,0.0000044610897,0.000021340635,0.0012598354,0.0059273457,0.00008143209,0.83484304,0.0018588532,0.00016763146],"about_ca_topic_score_codex":0.0030882887,"about_ca_topic_score_gemma":0.0088585345,"teacher_disagreement_score":0.24055077,"about_ca_system_score_codex":0.00013758661,"about_ca_system_score_gemma":0.00019666331,"threshold_uncertainty_score":0.5527096},"labels":[],"label_agreement":null},{"id":"W3205253370","doi":"10.1007/s10742-021-00260-w","title":"Initial validation of the global assessment of severity of illness","year":2021,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Chronic Disease Management Strategies","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University; University of Waterloo","funders":"Canadian Institutes of Health Research; Ontario Ministry of Research, Innovation and Science","keywords":"Health administration; Medicine; Public health; Pathology","score_opus":0.3486768783784317,"score_gpt":0.6126938030420473,"score_spread":0.26401692466361565,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3205253370","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9884045,0.0006712477,0.00048799033,0.0067383437,0.00019580619,0.00047075615,0.00005971091,0.000006406152,0.0029652375],"genre_scores_gemma":[0.9911675,0.00048183522,0.007728718,0.0005041423,0.000025059118,0.000009805647,0.000024861802,0.000004875937,0.000053205553],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99598926,0.0025593992,0.0004617015,0.00019313581,0.0005440802,0.0002524411],"domain_scores_gemma":[0.99789435,0.0009641187,0.00022327183,0.00038044425,0.00044515345,0.0000926761],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0036356798,0.00007581925,0.00054896093,0.00007025542,0.00007371872,0.0000057758134,0.00013915844,0.00006038273,0.00013417187],"category_scores_gemma":[0.00022444018,0.000051921445,0.00008153668,0.00045692362,0.00024619757,0.00004584351,0.00038469827,0.00016071962,2.4017893e-7],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022894087,0.0003498872,0.92191535,0.02304968,0.0002430304,0.0000108458225,0.0015127974,0.00002958158,0.00034745163,0.0367427,0.0000481999,0.015521514],"study_design_scores_gemma":[0.0010507192,0.0001968014,0.98387593,0.0002154917,0.000040541665,0.000008191314,0.0076528904,0.00019520351,0.0017008453,0.0046260757,0.00040013957,0.000037148897],"about_ca_topic_score_codex":0.002488659,"about_ca_topic_score_gemma":0.00050573004,"teacher_disagreement_score":0.061960578,"about_ca_system_score_codex":0.00009091094,"about_ca_system_score_gemma":0.0010951417,"threshold_uncertainty_score":0.37621245},"labels":[],"label_agreement":null},{"id":"W4388795592","doi":"10.1007/s10742-023-00317-y","title":"Propensity score weighting with survey weighted data when outcomes are binary: a simulation study","year":2023,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Advanced Causal Inference Techniques","field":"Mathematics","cited_by":6,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"London Health Sciences Centre","funders":"National Cancer Institute; National Institute on Aging; National Cancer Center","keywords":"Propensity score matching; Weighting; Statistics; Observational study; Average treatment effect; Population; Mathematics; Econometrics; Medicine","score_opus":0.8783707654311809,"score_gpt":0.649225151849151,"score_spread":0.2291456135820299,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4388795592","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9862556,0.00013318617,0.0071196537,0.0026821431,0.0000860136,0.0029370813,0.0001178536,0.00063237274,0.000036112157],"genre_scores_gemma":[0.85325414,0.0002573722,0.14470707,0.00076466665,0.000056096127,0.000170523,0.0002788073,0.00010407215,0.0004072775],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9853398,0.010710771,0.0007966238,0.0010596225,0.0009453862,0.0011477927],"domain_scores_gemma":[0.9716147,0.02513446,0.00048083818,0.0017102612,0.000752198,0.00030753537],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.030755555,0.0003532182,0.0013756987,0.00063055963,0.0007362805,0.00011329791,0.00095811475,0.00017454181,0.000036573583],"category_scores_gemma":[0.00311548,0.00023121583,0.000034170684,0.001171438,0.00020265733,0.00054486515,0.0020058432,0.00082943315,0.000018835028],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00023109376,0.00019363537,0.9899134,0.00097654364,0.00010721055,0.0000536236,0.0036954079,0.000019489104,0.000008467272,0.00074624293,0.00016044872,0.0038944415],"study_design_scores_gemma":[0.00080469,0.0008476855,0.94719416,0.00018341171,0.00001601328,0.000004570345,0.0047885748,0.0077562067,0.000008860022,0.037911486,0.00023542804,0.00024892882],"about_ca_topic_score_codex":0.008103124,"about_ca_topic_score_gemma":0.03883896,"teacher_disagreement_score":0.13758741,"about_ca_system_score_codex":0.00011043427,"about_ca_system_score_gemma":0.00021487074,"threshold_uncertainty_score":0.998502},"labels":[],"label_agreement":null},{"id":"W4401667657","doi":"10.1007/s10742-024-00335-4","title":"Deduplication methods for literature citations in systematic evidence reviews: practical insights to guide decision-making","year":2024,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Data deduplication; Computer science; Context (archaeology); Systematic review; Software; Data science; Management science; Data mining; Database; MEDLINE; Engineering","score_opus":0.9338542154844445,"score_gpt":0.7958391692124195,"score_spread":0.138015046272025,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4401667657","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"methods","model_version":"codex-gemma-dda1882f352a","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0016408347,0.17869294,0.78599846,0.026710767,0.00047519687,0.0063654366,0.000007948747,0.000012388831,0.00009599533],"genre_scores_gemma":[0.0058910307,0.0052042473,0.98019326,0.0057300897,0.000095355055,0.00191468,0.0000054979173,0.000022961362,0.0009428876],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.7580019,0.21701694,0.01683087,0.0028520906,0.004141216,0.0011569734],"domain_scores_gemma":[0.4113556,0.5789021,0.0022313946,0.0037790004,0.0031048504,0.0006270467],"candidate_categories":["metaresearch","scholarly_communication"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.5746341,0.00033896472,0.005186418,0.0026334058,0.00041244936,0.0019448393,0.0014131571,0.00021603149,0.00022821667],"category_scores_gemma":[0.38950756,0.00016149465,0.0007645596,0.0061275354,0.000060884,0.00070549693,0.0004044663,0.00060131185,0.0004621519],"study_design_candidate":"design_other","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00011225389,0.00009383206,0.0037195806,0.17153257,0.0002739391,0.000026912734,0.0531136,0.00008370357,0.00015692512,0.10141119,0.022777343,0.6466981],"study_design_scores_gemma":[0.00027767403,0.00049641094,0.016550772,0.083680995,0.00021851285,0.00014255762,0.013786826,0.10726324,0.000006310028,0.32712728,0.44993567,0.00051377644],"about_ca_topic_score_codex":0.00009436159,"about_ca_topic_score_gemma":0.0009528278,"teacher_disagreement_score":0.6461844,"about_ca_system_score_codex":0.00021439859,"about_ca_system_score_gemma":0.0004234812,"threshold_uncertainty_score":0.9990912},"labels":[],"label_agreement":null},{"id":"W4405356853","doi":"10.1007/s10742-024-00339-0","title":"Correction: Deduplication methods for literature citations in systematic evidence reviews: practical insights to guide decision-making","year":2024,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Academic Writing and Publishing","field":"Arts and Humanities","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Computer science; Management science; Data science; Data deduplication; Systematic review; Information retrieval; MEDLINE; Political science; Engineering; Database","score_opus":0.49538345948444795,"score_gpt":0.6471978090623675,"score_spread":0.1518143495779195,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4405356853","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00236374,0.38105842,0.5004173,0.10187478,0.0057319496,0.006659184,0.00002286495,0.00023687864,0.0016349052],"genre_scores_gemma":[0.015582959,0.01174415,0.95186883,0.014470946,0.0013330206,0.0020575242,0.000023152366,0.000052584583,0.0028668507],"study_design_codex":"qualitative","study_design_gemma":"not_applicable","domain_scores_codex":[0.9903203,0.007325395,0.0010261498,0.000544809,0.0002753985,0.0005079263],"domain_scores_gemma":[0.9052376,0.0936548,0.00015017041,0.00028365754,0.00048781076,0.00018594369],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.03635711,0.00016083154,0.00069788477,0.00084950775,0.0006448525,0.0009440258,0.00025926516,0.00015146579,0.000041857373],"category_scores_gemma":[0.023655105,0.000112996066,0.00008410341,0.0005790152,0.00007074358,0.00084528356,0.00013848765,0.0008503373,0.000021293903],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00010485494,0.000036728325,0.0002855762,0.109331585,0.000047295296,0.000008860248,0.33673298,0.00001761648,0.00002177802,0.30366942,0.0279816,0.22176172],"study_design_scores_gemma":[0.00016638111,0.0003178236,0.0009341781,0.11112357,0.000038146038,0.000070404865,0.046749678,0.021694452,0.0000026299176,0.05989163,0.758736,0.00027508638],"about_ca_topic_score_codex":0.00062392786,"about_ca_topic_score_gemma":0.0027067475,"teacher_disagreement_score":0.73075444,"about_ca_system_score_codex":0.00018439174,"about_ca_system_score_gemma":0.00025600864,"threshold_uncertainty_score":0.99227315},"labels":[],"label_agreement":null},{"id":"W4414588014","doi":"10.1007/s10742-025-00359-4","title":"Psychometric performance of EQ-5D-5L and SF-6Dv2 in cancer patients","year":2025,"lang":"en","type":"article","venue":"Health Services and Outcomes Research Methodology","topic":"Health Systems, Economic Evaluations, Quality of Life","field":"Economics, Econometrics and Finance","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Centre Intégré Universitaire de Santé et de Services Sociaux du Centre-Sud-de-l'Île-de-Montréal; Université de Montréal","funders":"","keywords":"Intraclass correlation; Rank correlation; Receiver operating characteristic; Spearman's rank correlation coefficient; Correlation; Ceiling effect; Breast cancer; Convergent validity; Psychometrics","score_opus":0.7045539261009228,"score_gpt":0.5948502686643811,"score_spread":0.10970365743654176,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4414588014","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.95438325,0.016827496,0.00010301125,0.026604822,0.00048384644,0.0008667893,0.00009766086,0.000012028944,0.0006210638],"genre_scores_gemma":[0.95816714,0.017039087,0.0068689906,0.016977342,0.000059940423,0.00020183064,0.00001611038,0.000022277272,0.0006472602],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99324965,0.0021860169,0.0030162598,0.00063887803,0.00014974849,0.00075942586],"domain_scores_gemma":[0.99289423,0.005405758,0.0009406272,0.00037710601,0.00016440541,0.00021786938],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.042947005,0.00017170004,0.0015175166,0.0022056196,0.00023361768,0.000033616554,0.00029900385,0.00019394,0.00009521717],"category_scores_gemma":[0.0016621515,0.00018157368,0.00004876982,0.0012131118,0.00016342722,0.00025595,0.00021224747,0.00041124728,0.000026822283],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00005374088,0.000086204425,0.97742414,0.005341346,0.000032437827,9.013854e-8,0.0021813265,0.0000119817705,0.0000011246892,0.00795009,0.00036605942,0.006551435],"study_design_scores_gemma":[0.0012908624,0.00025595116,0.98273164,0.00025313362,0.00000187449,4.313125e-7,0.0011038458,0.0017060561,0.0000028518773,0.00413694,0.008396975,0.00011943647],"about_ca_topic_score_codex":0.01863205,"about_ca_topic_score_gemma":0.004404045,"teacher_disagreement_score":0.041284855,"about_ca_system_score_codex":0.000339773,"about_ca_system_score_gemma":0.00025299395,"threshold_uncertainty_score":0.98790294},"labels":[],"label_agreement":null}]}