{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":305,"total_is_capped":false,"direct_labels_cover":3,"predictions_cover":305,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"4f6799dd99f6","filters":{"topic":"Reliability and Agreement in Measurement"}},"results":[{"id":"W2061141931","doi":"10.1007/s10459-010-9222-y","title":"Likert scales, levels of measurement and the “laws” of statistics","year":2010,"lang":"en","type":"article","venue":"Advances in Health Sciences Education","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4546,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McMaster University","funders":"","keywords":"Likert scale; Statistics; Parametric statistics; Econometrics; Nonparametric statistics; Variance (accounting); Regression analysis; Sample size determination; Sample (material); Ordinal data; Statistical analysis; Computer science; Psychology; Mathematics","authors":[{"name":"Geoff Norman","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1216247962799418,"gpt":0.4436029242752067,"spread":0.3219781279952649,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.09862829,0.0005457763,0.001071341,0.003256295,0.001201055,0.005128255,0.001863377,0.002152999,0.004264173],"category_scores_gemma":[0.3936297,0.0005765502,0.000842593,0.004296727,0.007670559,0.008620849,0.003045706,0.003933208,0.000777861],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001994183,"about_ca_system_score_gemma":0.002202694,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007003109,"about_ca_topic_score_gemma":0.0008146068,"domain_scores_codex":[0.7831526,0.1718428,0.01385659,0.00435591,0.02561523,0.001176757],"domain_scores_gemma":[0.51116,0.4333156,0.01428289,0.01939226,0.02024432,0.001605066],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0004286441,0.0002378997,0.02506026,0.001925551,0.0003470505,0.00008364552,0.01328629,0.00198155,0.001647535,0.7046926,0.01507958,0.2352293],"study_design_scores_gemma":[0.0001463508,0.0005302309,0.04073496,0.001402609,0.0001764933,0.0003353602,0.00882857,0.009856705,0.001722158,0.8765599,0.05943695,0.0002698058],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1042682,0.006966345,0.7600824,0.02095772,0.002308059,0.001872503,0.001830237,0.0007908837,0.1009238],"genre_scores_gemma":[0.7165388,0.002054977,0.2711376,0.003053043,0.0005838592,0.003394035,0.0006312722,0.0001207794,0.002485563],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9013717,"threshold_uncertainty_score":0.5216025,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2171762906","doi":"10.1016/j.jclinepi.2010.02.006","title":"The COSMIN study reached international consensus on taxonomy, terminology, and definitions of measurement properties for health-related patient-reported outcomes","year":2010,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":4442,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McMaster University","funders":"","keywords":"Terminology; Taxonomy (biology); Delphi method; Confusion; Delphi; Consistency (knowledge bases); Management science; Medicine; Psychology; Applied psychology; Computer science; Artificial intelligence; Engineering; Linguistics; Ecology","authors":[{"name":"Lidwine B. Mokkink","is_ca":false},{"name":"Caroline B. Terwee","is_ca":false},{"name":"Donald L. Patrick","is_ca":false},{"name":"Jordi Alonso","is_ca":false},{"name":"Paul W. Stratford","is_ca":true},{"name":"Dirk L. Knol","is_ca":false},{"name":"L.M. Bouter","is_ca":false},{"name":"Henrica C. W. de Vet","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.8170932433584581,"gpt":0.5349041107663476,"spread":0.2821891325921105,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2813033,0.001493887,0.003498483,0.008357699,0.002191629,0.005102483,0.003100543,0.00281847,0.001560173],"category_scores_gemma":[0.3131618,0.000711666,0.005177767,0.006007873,0.003761618,0.004468815,0.006231625,0.004497453,0.000485872],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004561922,"about_ca_system_score_gemma":0.008228051,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00585506,"about_ca_topic_score_gemma":0.01149089,"domain_scores_codex":[0.8946426,0.0623839,0.01688793,0.003991054,0.02039902,0.001695503],"domain_scores_gemma":[0.5667956,0.3284065,0.02480311,0.02638038,0.05180538,0.001808936],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"qualitative","study_design_scores_codex":[0.003311554,0.0007719955,0.5408508,0.005940793,0.003658373,0.0001882514,0.007703631,0.002518183,0.001409793,0.06089389,0.03448363,0.3382691],"study_design_scores_gemma":[0.001143946,0.003004629,0.7562182,0.01679817,0.007136582,0.0008386612,0.005830916,0.009937531,0.007730737,0.05284488,0.1378645,0.000651343],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3998616,0.05336991,0.4250203,0.02603535,0.003849854,0.011062,0.01748245,0.000911582,0.06240701],"genre_scores_gemma":[0.7377546,0.008070105,0.2156433,0.007647018,0.0007171867,0.01766471,0.009429741,0.0007581672,0.002315211],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.7186967,"threshold_uncertainty_score":0.886281,"prediction_status":"machine_predicted_unvalidated"},"labels":[{"model":"gemma","categories":["metaresearch"],"domain":"methods","study_design":"qualitative","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":[],"domain":null,"study_design":"qualitative","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"high"}],"label_agreement":"split"},{"id":"W2155243985","doi":"10.20982/tqmp.08.1.p023","title":"Computing Inter-Rater Reliability for Observational Data: An Overview and Tutorial","year":2012,"lang":"en","type":"article","venue":"Tutorials in Quantitative Methods for Psychology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":3862,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false},"ca_institutions":"","funders":"National Institute on Alcohol Abuse and Alcoholism","keywords":"Observational study; Reliability (semiconductor); Computer science; Syntax; Consistency (knowledge bases); Class (philosophy); Statistics; Multiple comparisons problem; Inter-rater reliability; Econometrics; Mathematics; Artificial intelligence; Power (physics); Rating scale","authors":[{"name":"Kevin A. Hallgren","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.8909602875101015,"gpt":0.7046596688682544,"spread":0.1863006186418471,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.06979387,0.003653719,0.003127687,0.01618263,0.001209161,0.003807294,0.003599142,0.00278731,0.01322493],"category_scores_gemma":[0.1407642,0.002858866,0.003396574,0.01500267,0.001947439,0.008113082,0.003334882,0.004965792,0.01857237],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001506085,"about_ca_system_score_gemma":0.003299826,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001694989,"about_ca_topic_score_gemma":0.002094904,"domain_scores_codex":[0.9320188,0.04221538,0.008408046,0.003793425,0.0131046,0.0004597739],"domain_scores_gemma":[0.8394294,0.123764,0.006926848,0.006772066,0.02234066,0.0007670119],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00009429502,0.0001778791,0.002026607,0.006763141,0.0003309888,0.0002702106,0.00205932,0.003273993,0.005289653,0.0449449,0.06619325,0.8685756],"study_design_scores_gemma":[0.0001649573,0.000791866,0.01365564,0.01097351,0.0004659924,0.005431902,0.001721629,0.05035447,0.01997095,0.2296043,0.6657985,0.001066321],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0004352524,0.00898443,0.9843138,0.0006793733,0.000236491,0.0006642518,0.0004387389,0.001761443,0.002486196],"genre_scores_gemma":[0.003187956,0.01208352,0.9792595,0.0002245173,0.0004559548,0.002216479,0.0007712265,0.0007829313,0.001017835],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9302061,"threshold_uncertainty_score":0.3691097,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1970325005","doi":"10.1037/a0029315","title":"When can categorical variables be treated as continuous? A comparison of robust continuous and categorical SEM estimation methods under suboptimal conditions.","year":2012,"lang":"en","type":"article","venue":"Psychological Methods","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":2534,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Categorical variable; Statistics; Mathematics; Normality; Continuous variable; Sample size determination; Ordinal data; Sample (material); Latent variable; Confirmatory factor analysis; Econometrics; Structural equation modeling","authors":[{"name":"Mijke Rhemtulla","is_ca":false},{"name":"Patricia É. Brosseau-Liard","is_ca":true},{"name":"Victoria Savalei","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.35917610160414,"gpt":0.5393551820295689,"spread":0.1801790804254289,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1675689,0.0007757712,0.001571767,0.002113848,0.0008731722,0.003427356,0.0021813,0.002006901,0.002787967],"category_scores_gemma":[0.5875014,0.0008818818,0.001842679,0.003849228,0.003748393,0.004485347,0.002477196,0.002417483,0.0006994708],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001531591,"about_ca_system_score_gemma":0.003104144,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002263082,"about_ca_topic_score_gemma":0.002712318,"domain_scores_codex":[0.7808656,0.1978369,0.004153942,0.005955649,0.01049045,0.0006974708],"domain_scores_gemma":[0.5048312,0.445881,0.01223159,0.02332484,0.01296824,0.0007632161],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002282603,0.0002682477,0.04043425,0.002693572,0.002570498,0.0004127681,0.005495862,0.05392162,0.003638741,0.2470811,0.01010677,0.631094],"study_design_scores_gemma":[0.0005078312,0.0009582113,0.02687798,0.001513708,0.0005347121,0.0007012549,0.002775303,0.445128,0.005860594,0.5011216,0.01370303,0.000317752],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02114103,0.000816984,0.9742245,0.001179081,0.000119162,0.0002270183,0.0002005415,0.0004026213,0.001688992],"genre_scores_gemma":[0.3197271,0.0003648511,0.6776032,0.0004327378,0.00006936018,0.0008611672,0.000316618,0.0002654476,0.0003595275],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8324311,"threshold_uncertainty_score":0.8861998,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2069378996","doi":"10.1016/j.jclinepi.2010.03.002","title":"Guidelines for Reporting Reliability and Agreement Studies (GRRAS) were proposed","year":2010,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":2097,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto; Western University","funders":"","keywords":"Reliability (semiconductor); Psychology; Medicine; Statistics; Mathematics; Physics","authors":[{"name":"Jan Kottner","is_ca":false},{"name":"Laurent Audigé","is_ca":false},{"name":"Stig Brorson","is_ca":false},{"name":"Allan Donner","is_ca":true},{"name":"Byron Gajewski","is_ca":false},{"name":"Asbjørn Hróbjartsson","is_ca":false},{"name":"Chris Roberts","is_ca":false},{"name":"Mohamed M. Shoukri","is_ca":true},{"name":"David L. Streiner","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.8672390330587612,"gpt":0.6777059197779776,"spread":0.1895331132807836,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.5299764,0.004530444,0.006944196,0.02728568,0.006222507,0.01396593,0.0113953,0.01120111,0.004208574],"category_scores_gemma":[0.8096142,0.004356,0.01283304,0.02297687,0.008835133,0.01141371,0.01073262,0.01353722,0.003646901],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.009257143,"about_ca_system_score_gemma":0.0202796,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007272535,"about_ca_topic_score_gemma":0.007582335,"domain_scores_codex":[0.2388922,0.4132555,0.2833625,0.0116744,0.04961578,0.003199714],"domain_scores_gemma":[0.1115323,0.6467489,0.04612198,0.05106989,0.143124,0.001402936],"domain_codex":"methods","domain_gemma":"reporting","domain_candidate":"reporting","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.001514506,0.0004769216,0.04573136,0.06551275,0.008106334,0.00126512,0.01908786,0.006288912,0.002667463,0.2715313,0.1217247,0.4560927],"study_design_scores_gemma":[0.002160756,0.002526182,0.05069066,0.1072572,0.01330444,0.005206225,0.01554416,0.02922835,0.01671845,0.3881652,0.3672489,0.00194948],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.008679581,0.02831781,0.8864473,0.01302487,0.006034357,0.03282714,0.008899582,0.002412104,0.0133573],"genre_scores_gemma":[0.03878463,0.005470316,0.9003786,0.002869799,0.0007234478,0.04722337,0.003008486,0.0003796962,0.001161614],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.4700236,"threshold_uncertainty_score":0.5796227,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1968667761","doi":"10.1016/j.ijnurstu.2011.01.016","title":"Guidelines for Reporting Reliability and Agreement Studies (GRRAS) were proposed","year":2011,"lang":"en","type":"article","venue":"International Journal of Nursing Studies","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":985,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto; Western University","funders":"","keywords":"Agreement; Reliability (semiconductor); Psychology; Physics","authors":[{"name":"Jan Kottner","is_ca":false},{"name":"Laurent Audigé","is_ca":false},{"name":"Stig Brorson","is_ca":false},{"name":"Allan Donner","is_ca":true},{"name":"Byron Gajewski","is_ca":false},{"name":"Asbjørn Hróbjartsson","is_ca":false},{"name":"Chris Roberts","is_ca":false},{"name":"Mohamed M. Shoukri","is_ca":true},{"name":"David L. Streiner","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7846223701604345,"gpt":0.5880428148793927,"spread":0.1965795552810418,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.5019003,0.004223516,0.006066342,0.02574288,0.007892279,0.01488543,0.009987378,0.009721867,0.005153972],"category_scores_gemma":[0.7899961,0.003943829,0.01167226,0.02222927,0.008885155,0.01054939,0.0104941,0.01269176,0.00421139],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01026282,"about_ca_system_score_gemma":0.02573442,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006504402,"about_ca_topic_score_gemma":0.008856425,"domain_scores_codex":[0.2527378,0.3981703,0.2785601,0.01039291,0.05623899,0.003899976],"domain_scores_gemma":[0.1273809,0.5842614,0.04647023,0.05347933,0.186624,0.001784235],"domain_codex":"methods","domain_gemma":"reporting","domain_candidate":"reporting","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.001598287,0.0007071302,0.03793082,0.06308522,0.004791379,0.001222195,0.02747568,0.005372055,0.003541815,0.2528992,0.1206058,0.4807704],"study_design_scores_gemma":[0.001952792,0.002939066,0.04373759,0.1079285,0.007957038,0.003857597,0.02758439,0.02525686,0.01971914,0.3059967,0.4512225,0.001847737],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01118248,0.02029995,0.8627846,0.01171641,0.006606252,0.05646001,0.008025568,0.002698998,0.02022576],"genre_scores_gemma":[0.03699348,0.003965331,0.8805749,0.00213665,0.0005578279,0.07140197,0.002452346,0.0003836909,0.001533652],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.4980997,"threshold_uncertainty_score":0.6142457,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2074840499","doi":"10.1207/s15324796abm2603_02","title":"Classification and regression tree analysis in public health: Methodological review and comparison with logistic regression","year":2003,"lang":"en","type":"review","venue":"Annals of Behavioral Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":898,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"St. Stephen's University","funders":"","keywords":"Logistic regression; Public health; Identification (biology); Population; Nonparametric statistics; Logistic model tree; Regression analysis; Health psychology; Decision tree; Statistics; Stepwise regression; Regression; Psychology; Medicine; Applied psychology; Computer science; Data mining; Mathematics; Environmental health; Pathology; Biology","authors":[{"name":"Stephenie C. Lemon","is_ca":true},{"name":"Jason Roy","is_ca":false},{"name":"Melissa A. Clark","is_ca":false},{"name":"Peter D. Friedmann","is_ca":false},{"name":"William Rakowski","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.9360556982721563,"gpt":0.6560495613872027,"spread":0.2800061368849536,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1854427,0.001871601,0.009260892,0.01788463,0.0009598598,0.00368786,0.004815409,0.002580002,0.00289425],"category_scores_gemma":[0.3334449,0.001448626,0.009167101,0.0294064,0.002012186,0.004330069,0.002213092,0.002381942,0.0005863361],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00532145,"about_ca_system_score_gemma":0.01253752,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009446583,"about_ca_topic_score_gemma":0.009189808,"domain_scores_codex":[0.7918258,0.1733718,0.01590145,0.003590908,0.01475321,0.000556753],"domain_scores_gemma":[0.4777797,0.4743695,0.01597392,0.008642334,0.02266285,0.0005717881],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0005747696,0.000149296,0.005226566,0.18092,0.01352102,0.0001143505,0.000647691,0.005917724,0.0001204399,0.009915958,0.005008831,0.7778833],"study_design_scores_gemma":[0.002744204,0.003758312,0.04105303,0.5277248,0.08964856,0.001874308,0.003130541,0.06532234,0.002424955,0.07613461,0.1853532,0.0008312531],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.001838756,0.9451407,0.04839266,0.001653412,0.0005953663,0.001290936,0.0002368684,0.00007021725,0.0007811521],"genre_scores_gemma":[0.04200533,0.8200037,0.1303138,0.0005345366,0.0005834056,0.005819531,0.0003850968,0.00006164909,0.0002929078],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.1854427,"threshold_uncertainty_score":0.9807265,"prediction_status":"machine_predicted_unvalidated"},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"not_applicable","genre":"review","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":[],"domain":null,"study_design":"design_other","genre":"review","about_ca_system":false,"about_ca_topic":false,"confidence":"low"}],"label_agreement":"split"},{"id":"W2105852486","doi":"10.1186/1472-6963-8-277","title":"Reliability of the interRAI suite of assessment instruments: a 12-country study of an integrated health information system","year":2008,"lang":"en","type":"article","venue":"BMC Health Services Research","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":677,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Homewood Research Institute; University of Waterloo","funders":"University of Waterloo; Curtin University of Technology","keywords":"Health informatics; Reliability (semiconductor); Medicine; Nursing research; Cohen's kappa; Kappa; Suite; Health care; Health administration; Nursing; Family medicine; Public health; Statistics","authors":[{"name":"John P. Hirdes","is_ca":true},{"name":"Gunnar Ljunggren","is_ca":false},{"name":"John N. Morris","is_ca":false},{"name":"Dinnus Frijters","is_ca":false},{"name":"Harriet Finne Soveri","is_ca":false},{"name":"Len Gray","is_ca":false},{"name":"Magnus Björkgren","is_ca":false},{"name":"R Gilgen","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1940493002678006,"gpt":0.4783379459711168,"spread":0.2842886457033162,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0513855,0.0004891213,0.0009765867,0.00347385,0.001127556,0.002136557,0.0009310014,0.0007060549,0.0009198678],"category_scores_gemma":[0.07628954,0.0007373724,0.001194774,0.004893403,0.002539806,0.00263801,0.003352891,0.001403675,0.0002117012],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001462575,"about_ca_system_score_gemma":0.001643926,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005038977,"about_ca_topic_score_gemma":0.003295637,"domain_scores_codex":[0.9597447,0.02773988,0.003036275,0.002841912,0.005396231,0.001241061],"domain_scores_gemma":[0.9157763,0.04819279,0.01397683,0.007717045,0.01265943,0.001677562],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000119665,0.000143895,0.9871697,0.00004566317,0.000220334,0.00003742123,0.004711872,0.0002756958,0.0001625397,0.0001846278,0.0001183082,0.006810271],"study_design_scores_gemma":[0.00002647713,0.000506316,0.988978,0.00009557114,0.00007869118,0.0001576363,0.007160877,0.001909811,0.0002827682,0.0001681814,0.0006077481,0.00002797319],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9978538,0.00009797692,0.001125169,0.00004612701,0.000008774252,0.00008323746,0.0001080391,0.000006984457,0.000669794],"genre_scores_gemma":[0.998899,0.00004372305,0.0008005549,0.00001245884,0.000003430182,0.00006971562,0.0001201813,0.000005006898,0.00004593758],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9486145,"threshold_uncertainty_score":0.2717557,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2007345088","doi":"10.1371/journal.pone.0073990","title":"The Case for Using the Repeatability Coefficient When Calculating Test–Retest Reliability","year":2013,"lang":"en","type":"article","venue":"PLoS ONE","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":474,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Dalhousie University","funders":"Curtin University of Technology","keywords":"Intraclass correlation; Repeatability; Reliability (semiconductor); Strengths and weaknesses; Computer science; Pearson product-moment correlation coefficient; Statistics; Test (biology); Measure (data warehouse); Reliability engineering; Correlation coefficient; Data mining; Medical physics; Machine learning; Mathematics; Reproducibility; Medicine; Psychology; Engineering","authors":[{"name":"Sharmila Vaz","is_ca":false},{"name":"Torbjörn Falkmer","is_ca":false},{"name":"Anne Passmore","is_ca":false},{"name":"Richard Parsons","is_ca":false},{"name":"Pantelis Andreou","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2965950402626327,"gpt":0.3528709709396792,"spread":0.0562759306770465,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.4940352,0.002530921,0.005727397,0.009974007,0.003664764,0.01062555,0.006213953,0.008707317,0.001440989],"category_scores_gemma":[0.75715,0.001976619,0.004891769,0.01124025,0.01495066,0.0162407,0.007405201,0.01882054,0.001546703],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004378862,"about_ca_system_score_gemma":0.009408763,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008443343,"about_ca_topic_score_gemma":0.008540183,"domain_scores_codex":[0.3533055,0.489402,0.05007901,0.03239944,0.07223766,0.00257642],"domain_scores_gemma":[0.1461179,0.7178635,0.03199954,0.05380201,0.0482715,0.001945594],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001156886,0.000185463,0.1146,0.009080076,0.006611285,0.001379752,0.02302811,0.004791981,0.003284951,0.1871354,0.05450526,0.5942408],"study_design_scores_gemma":[0.0004619239,0.003649607,0.08527841,0.03127594,0.004109183,0.008933462,0.01298787,0.03452655,0.01126062,0.5341878,0.2714023,0.001926418],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02263666,0.06789897,0.7834129,0.08140676,0.0192135,0.0008153017,0.0004081923,0.001189588,0.02301807],"genre_scores_gemma":[0.3229043,0.01125865,0.6215421,0.02839028,0.009178137,0.001747906,0.0002232873,0.001584668,0.003170605],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.5059648,"threshold_uncertainty_score":0.6239446,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1829168467","doi":"10.1191/0962280204sm365ra","title":"Sample size requirements for the design of reliability study: review and new results","year":2004,"lang":"en","type":"article","venue":"Statistical Methods in Medical Research","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":468,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Western University","funders":"","keywords":"Intraclass correlation; Sample size determination; Reliability (semiconductor); Variance (accounting); Statistics; Sample (material); Computer science; Mathematics; Reliability engineering; Psychometrics","authors":[{"name":"Mohamed M. Shoukri","is_ca":true},{"name":"Musa Hakan Asyalı","is_ca":false},{"name":"Allan Donner","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7388653050513273,"gpt":0.6767105014196586,"spread":0.0621548036316687,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1698967,0.001783208,0.01084743,0.007719052,0.0007318137,0.003003042,0.005395368,0.005002054,0.003589371],"category_scores_gemma":[0.3808528,0.001750659,0.004613635,0.005878017,0.00286646,0.005736259,0.002073616,0.003539041,0.001446041],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003460517,"about_ca_system_score_gemma":0.008207438,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001923023,"about_ca_topic_score_gemma":0.002516401,"domain_scores_codex":[0.8679073,0.0625247,0.03389155,0.006091706,0.02890284,0.0006819613],"domain_scores_gemma":[0.4880433,0.4582752,0.01548277,0.007107106,0.03035333,0.0007382764],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001265422,0.0001273453,0.001196677,0.1143539,0.001281539,0.0003621152,0.0003874899,0.001485826,0.00186959,0.00744992,0.01351812,0.8567021],"study_design_scores_gemma":[0.005908765,0.007839526,0.03307818,0.3216825,0.03182968,0.008435185,0.001264153,0.0101416,0.01296294,0.06792659,0.497986,0.0009449044],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.001690314,0.9316053,0.05510847,0.00448324,0.002466118,0.002055195,0.0004679291,0.0001460712,0.001977405],"genre_scores_gemma":[0.01985671,0.7844866,0.1728505,0.004011099,0.002862861,0.01408182,0.0009313648,0.0002076802,0.0007112714],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.8301033,"threshold_uncertainty_score":0.8985104,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2091019309","doi":"10.1002/sim.5466","title":"Sample size formulas for estimating intraclass correlation coefficients with precision and assurance","year":2012,"lang":"en","type":"article","venue":"Statistics in Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":467,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Robarts Clinical Trials; Western University","funders":"","keywords":"Intraclass correlation; Confidence interval; Reliability (semiconductor); Sample size determination; Statistics; Interval (graph theory); Mathematics; Coverage probability; Limit (mathematics); Interval estimation; Sample (material); Correlation coefficient; Correlation; Computer science; Reproducibility; Power (physics); Mathematical analysis; Combinatorics; Physics","authors":[{"name":"Guangyong Zou","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0854428886232476,"gpt":0.3958068923931848,"spread":0.3103640037699372,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07010303,0.001945607,0.002043521,0.006580195,0.0006737425,0.001839532,0.003850206,0.002883459,0.005361066],"category_scores_gemma":[0.438004,0.001025973,0.001452131,0.003597216,0.002146259,0.004309688,0.002959295,0.00473822,0.002070335],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001470158,"about_ca_system_score_gemma":0.001892213,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001341249,"about_ca_topic_score_gemma":0.001593563,"domain_scores_codex":[0.945505,0.03618129,0.003141245,0.002406095,0.01235633,0.0004100172],"domain_scores_gemma":[0.6935443,0.2722119,0.008609248,0.0114983,0.01373681,0.0003995289],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0002959715,0.0002159738,0.004739175,0.001086075,0.0004376358,0.0003353592,0.001241872,0.05546988,0.002294069,0.2932191,0.01682123,0.6238437],"study_design_scores_gemma":[0.0005529001,0.0007522691,0.006288769,0.001625516,0.0004590926,0.001145403,0.0002471306,0.4374853,0.006104487,0.5141327,0.03098891,0.0002173885],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0008068777,0.0004975127,0.9973032,0.000145091,0.00006766779,0.0002056953,0.00004702564,0.0001767709,0.0007500206],"genre_scores_gemma":[0.03011104,0.0009770368,0.9642659,0.0003458276,0.0002481178,0.002939021,0.0001731038,0.0002034385,0.0007365174],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.07010303,"threshold_uncertainty_score":0.3707446,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3172444956","doi":"10.1109/access.2021.3084050","title":"The Matthews Correlation Coefficient (MCC) is More Informative Than Cohen’s Kappa and Brier Score in Binary Classification Assessment","year":2021,"lang":"en","type":"article","venue":"IEEE Access","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":429,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Brier score; Kappa; Cohen's kappa; Correlation; Computer science; Statistics; Artificial intelligence; Binary classification; Metric (unit); Binary number; Odds; Machine learning; Mathematics; Natural language processing; Logistic regression; Support vector machine; Arithmetic","authors":[{"name":"Davide Chicco","is_ca":true},{"name":"Matthijs J. Warrens","is_ca":false},{"name":"Giuseppe Jurman","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1877563290803927,"gpt":0.4289589341158113,"spread":0.2412026050354187,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.04748533,0.002029689,0.002728327,0.01878001,0.002366354,0.004328595,0.002052732,0.003295845,0.00371662],"category_scores_gemma":[0.2309605,0.0005500402,0.001597397,0.0151497,0.004038429,0.005089923,0.003263172,0.002487127,0.002142449],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001600248,"about_ca_system_score_gemma":0.002380316,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003856976,"about_ca_topic_score_gemma":0.005155806,"domain_scores_codex":[0.9303644,0.02466812,0.0103636,0.01046705,0.02281631,0.001320581],"domain_scores_gemma":[0.692037,0.2103221,0.03930378,0.02041128,0.03449426,0.003431656],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001186598,0.0003482088,0.4350144,0.003715152,0.004061579,0.000978463,0.00497271,0.02609793,0.005308702,0.06540132,0.07289478,0.3800202],"study_design_scores_gemma":[0.0002186609,0.00237166,0.465639,0.002114486,0.00198283,0.003927005,0.006080043,0.109368,0.01744583,0.2283192,0.1609033,0.001629871],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.3018839,0.02365131,0.5825098,0.006985864,0.004290433,0.001482971,0.009727638,0.003979805,0.06548828],"genre_scores_gemma":[0.8530046,0.002222133,0.1320862,0.001302013,0.001366601,0.001053774,0.003145321,0.0008045346,0.005014942],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9525146,"threshold_uncertainty_score":0.2511294,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2030560722","doi":"10.1136/bmj.b4012","title":"Risk of bias versus quality assessment of randomised controlled trials: cross sectional study","year":2009,"lang":"en","type":"article","venue":"BMJ","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":345,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Jadad scale; Medicine; Kappa; Publication bias; Funnel plot; Sample size determination; Cohen's kappa; Statistics; Meta-analysis; Correlation; Relative risk; Internal medicine; Mathematics; Confidence interval","authors":[{"name":"Lisa Hartling","is_ca":true},{"name":"Maria B. Ospina","is_ca":true},{"name":"Yuanyuan Liang","is_ca":true},{"name":"D. M. Dryden","is_ca":true},{"name":"Nicola Hooton","is_ca":true},{"name":"Jennifer Krebs Seida","is_ca":true},{"name":"Terry P. Klassen","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.553386919390064,"gpt":0.5654401656422524,"spread":0.0120532462521884,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.6216255,0.003618134,0.01893017,0.01901945,0.002066863,0.01112254,0.004834319,0.009234565,0.005329171],"category_scores_gemma":[0.8567865,0.002926907,0.02735662,0.01854809,0.006578136,0.01217608,0.006333839,0.005503887,0.0008179558],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01063314,"about_ca_system_score_gemma":0.01335465,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001847652,"about_ca_topic_score_gemma":0.001871349,"domain_scores_codex":[0.134407,0.5255243,0.2635272,0.0202992,0.05504835,0.001193972],"domain_scores_gemma":[0.07244302,0.708156,0.1646973,0.0252089,0.02831884,0.00117593],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"systematic_review","study_design_gemma":"observational","study_design_scores_codex":[0.01394098,0.0002212679,0.05965591,0.515088,0.2741305,0.0003107625,0.002851541,0.002216209,0.0008158575,0.013372,0.005874976,0.111522],"study_design_scores_gemma":[0.02021836,0.007683179,0.07802325,0.502279,0.2734058,0.002998584,0.001948701,0.0167152,0.003922103,0.04954541,0.04221043,0.001049789],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"review","genre_gemma":"empirical","genre_scores_codex":[0.02736874,0.7019529,0.1765728,0.006816653,0.008190444,0.06664485,0.006594533,0.0007838161,0.005075155],"genre_scores_gemma":[0.443558,0.08471297,0.2160562,0.007727405,0.003906966,0.2389608,0.003369109,0.0004740024,0.001234448],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.3783745,"threshold_uncertainty_score":0.4666031,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2036060563","doi":"10.1186/1471-2288-10-82","title":"Inter-rater agreement and reliability of the COSMIN (COnsensus-based Standards for the selection of health status Measurement Instruments) Checklist","year":2010,"lang":"en","type":"article","venue":"BMC Medical Research Methodology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":289,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"McMaster University","funders":"Vrije Universiteit Amsterdam; University of Oxford; McMaster University; Goddard Space Flight Center; University of Washington","keywords":"Checklist; Kappa; Inter-rater reliability; Intraclass correlation; Cohen's kappa; Reliability (semiconductor); Medicine; Quality (philosophy); Agreement; Terminology; Psychology; Applied psychology; Physical therapy; Medical physics; Clinical psychology; Statistics; Psychometrics; Rating scale; Mathematics","authors":[{"name":"Lidwine B. Mokkink","is_ca":false},{"name":"Caroline B. Terwee","is_ca":false},{"name":"Elizabeth Gibbons","is_ca":false},{"name":"Paul W. Stratford","is_ca":true},{"name":"Jordi Alonso","is_ca":false},{"name":"Donald L. Patrick","is_ca":false},{"name":"Dirk L. Knol","is_ca":false},{"name":"L.M. Bouter","is_ca":false},{"name":"Henrica C. W. de Vet","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5948043968788056,"gpt":0.5666070490965269,"spread":0.02819734778227867,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.4358364,0.001445731,0.004907385,0.01960988,0.00250904,0.003799732,0.002722132,0.001870401,0.002273305],"category_scores_gemma":[0.5637624,0.001302706,0.006765738,0.01049603,0.002957994,0.003346483,0.006372036,0.001666486,0.0006816107],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003326969,"about_ca_system_score_gemma":0.007912249,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001977661,"about_ca_topic_score_gemma":0.003499456,"domain_scores_codex":[0.4615676,0.3050374,0.1589624,0.01472402,0.05723077,0.002477792],"domain_scores_gemma":[0.2919052,0.3872869,0.0759158,0.03428093,0.2079939,0.002617242],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00883135,0.0007415926,0.4160748,0.08138403,0.01958575,0.0009746623,0.07698122,0.004196166,0.01436923,0.00642896,0.02400911,0.3464232],"study_design_scores_gemma":[0.005621792,0.005573693,0.730319,0.06042423,0.02111987,0.002687831,0.0294494,0.02886988,0.02352265,0.01435929,0.07632324,0.00172913],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.593768,0.04515981,0.2468248,0.003392881,0.003150086,0.07143614,0.01232044,0.001221075,0.02272671],"genre_scores_gemma":[0.6843109,0.005268272,0.2060467,0.0005434036,0.0004476904,0.09748134,0.004410341,0.0004011316,0.00109023],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5641636,"threshold_uncertainty_score":0.6957142,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1983075605","doi":"10.1038/nmeth.2659","title":"Error bars","year":2013,"lang":"en","type":"article","venue":"Nature Methods","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":289,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Canada's Michael Smith Genome Sciences Centre","funders":"","keywords":"Computer science; Chemistry","authors":[{"name":"Martin Krzywinski","is_ca":true},{"name":"Naomi Altman","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2218999693596393,"gpt":0.5448362889887357,"spread":0.3229363196290964,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01591941,0.004834888,0.005354221,0.005947443,0.003910952,0.005495085,0.005759916,0.01168323,0.09772328],"category_scores_gemma":[0.06665467,0.002116508,0.003732589,0.005475305,0.004174754,0.005193331,0.00746158,0.01560661,0.09854192],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002407372,"about_ca_system_score_gemma":0.003556716,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004768458,"about_ca_topic_score_gemma":0.004167513,"domain_scores_codex":[0.9684801,0.009353418,0.003074848,0.00651668,0.0086893,0.003885752],"domain_scores_gemma":[0.9208025,0.03067856,0.00447975,0.02271541,0.0191546,0.002169243],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.003162698,0.002217439,0.005075125,0.007214942,0.001345059,0.0006341753,0.002033938,0.007401219,0.03773814,0.05608997,0.6577661,0.2193213],"study_design_scores_gemma":[0.0007518114,0.001426971,0.08731077,0.004328052,0.001545802,0.002202552,0.004091929,0.02001007,0.1449242,0.07022363,0.6620224,0.001161795],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"methods","genre_gemma":"commentary","genre_scores_codex":[0.05733129,0.01267184,0.3454002,0.01132414,0.09114092,0.002818074,0.1578027,0.06677206,0.2547388],"genre_scores_gemma":[0.3704357,0.006311566,0.2454044,0.01184355,0.004366423,0.01270354,0.1231438,0.02556718,0.2002238],"genre_candidate":"commentary","genre_consensus":null,"teacher_disagreement_score":0.9840806,"threshold_uncertainty_score":0,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2088910496","doi":"10.3109/0142159x.2012.703791","title":"Generalizability theory for the perplexed: A practical introduction and guide: AMEE Guide No. 68","year":2012,"lang":"en","type":"article","venue":"Medical Teacher","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":250,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McMaster University","funders":"","keywords":"Generalizability theory; Generalization; Reliability (semiconductor); Computer science; Variance (accounting); Psychology; Management science; Cognitive psychology; Statistics; Mathematics","authors":[{"name":"R Blöch","is_ca":true},{"name":"Geoffrey R. Norman","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1690163772069375,"gpt":0.4518711929609048,"spread":0.2828548157539673,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03119833,0.003989263,0.003476911,0.01197662,0.002308567,0.005912669,0.005773353,0.006615246,0.06087325],"category_scores_gemma":[0.1077792,0.003976623,0.004618803,0.006886112,0.006956663,0.01030201,0.004891738,0.01298802,0.03978866],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004798748,"about_ca_system_score_gemma":0.007861515,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004800941,"about_ca_topic_score_gemma":0.005515566,"domain_scores_codex":[0.9751943,0.01471875,0.004166177,0.00117193,0.004386545,0.0003623019],"domain_scores_gemma":[0.9112927,0.06674625,0.002110575,0.003424138,0.01558373,0.000842621],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00006164039,0.0002246239,0.0005031741,0.004137887,0.00006017357,0.0003123925,0.002276282,0.001215181,0.0008373705,0.05995014,0.7308387,0.1995824],"study_design_scores_gemma":[0.00008325909,0.0001070269,0.001614476,0.004931353,0.00003919304,0.001144724,0.0009221467,0.002246978,0.0004351769,0.1922998,0.7960126,0.0001633353],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001091593,0.03589374,0.8012942,0.05846156,0.008637086,0.01905422,0.008841429,0.007849426,0.05887676],"genre_scores_gemma":[0.006772849,0.02607008,0.8706964,0.01513242,0.002993847,0.03368826,0.006157403,0.003246085,0.03524259],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9688017,"threshold_uncertainty_score":0.2036413,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2095752327","doi":"10.1002/(sici)1097-0258(20000315)19:5<723::aid-sim379>3.0.co;2-a","title":"Interval estimation for Cohen's kappa as a measure of agreement","year":2000,"lang":"en","type":"article","venue":"Statistics in Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":217,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Western University","funders":"","keywords":"Confidence interval; Statistics; Mathematics; Measure (data warehouse); Kappa; Statistic; Variance (accounting); Delta method; Coverage probability; Asymptotic analysis; Computation; Asymptotic distribution; Cohen's kappa; Applied mathematics; Computer science; Algorithm","authors":[{"name":"Nicole Blackman","is_ca":false},{"name":"John J. Koval","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1194851870437682,"gpt":0.4260948892710158,"spread":0.3066097022272476,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0671707,0.0009194962,0.002020541,0.01051445,0.001272814,0.003126918,0.004042391,0.001764458,0.005610983],"category_scores_gemma":[0.351872,0.0004554826,0.002152083,0.007647032,0.002175091,0.003753557,0.00385122,0.003072929,0.001801827],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001567063,"about_ca_system_score_gemma":0.002102059,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001530363,"about_ca_topic_score_gemma":0.0008842369,"domain_scores_codex":[0.8824344,0.07347108,0.009351484,0.008111298,0.0255265,0.001105324],"domain_scores_gemma":[0.7267736,0.220119,0.01426846,0.01160473,0.02636991,0.0008644462],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001362526,0.0002520107,0.02050437,0.004183941,0.001781927,0.0003224274,0.004410565,0.02588647,0.003158843,0.1969858,0.02644013,0.714711],"study_design_scores_gemma":[0.0003359136,0.002555149,0.05820322,0.004742139,0.001664742,0.003483329,0.0034158,0.2608244,0.01144719,0.5630474,0.08938649,0.0008941182],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01449865,0.004029885,0.9684323,0.0003412143,0.0004213856,0.0004896483,0.0006398733,0.0007902564,0.01035678],"genre_scores_gemma":[0.2301384,0.002170677,0.7607723,0.0002709093,0.0004029033,0.003491173,0.001069422,0.0004346769,0.001249576],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.0671707,"threshold_uncertainty_score":0.3552369,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2044059462","doi":"10.1097/acm.0b013e31822a6cf8","title":"Rater-Based Assessments as Social Judgments: Rethinking the Etiology of Rater Errors","year":2011,"lang":"en","type":"review","venue":"Academic Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":194,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Northern British Columbia","funders":"","keywords":"Categorical variable; Psychology; Categorization; Impression formation; Inter-rater reliability; Social psychology; Construct (python library); Cognitive psychology; Social perception; Rating scale; Computer science; Perception; Developmental psychology; Artificial intelligence; Machine learning","authors":[{"name":"Andrea Gingerich","is_ca":true},{"name":"Glenn Regehr","is_ca":false},{"name":"Kevin W. Eva","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6437870321086094,"gpt":0.5584685302281239,"spread":0.08531850188048551,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.4511673,0.001638655,0.004595663,0.01004639,0.001354689,0.009585964,0.007055001,0.002789495,0.001269822],"category_scores_gemma":[0.6504135,0.001643176,0.00215461,0.01178842,0.01218326,0.01308951,0.00440528,0.006270309,0.000987304],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.006037916,"about_ca_system_score_gemma":0.009083715,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004272409,"about_ca_topic_score_gemma":0.005821215,"domain_scores_codex":[0.5092735,0.324151,0.03881156,0.0151426,0.1115256,0.001095674],"domain_scores_gemma":[0.1563227,0.7026173,0.04290565,0.02460744,0.07292757,0.0006193588],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001627359,0.00005104032,0.01441548,0.03252663,0.00177567,0.0002440347,0.01555455,0.001002736,0.0008672102,0.05699442,0.01273462,0.8636709],"study_design_scores_gemma":[0.0002632595,0.0008635504,0.1042098,0.180281,0.005461524,0.004543035,0.01545938,0.01332601,0.008862281,0.2353039,0.430334,0.001092154],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.006753442,0.8852514,0.07687549,0.02048205,0.002651354,0.0005141883,0.0001708653,0.0001541546,0.007147026],"genre_scores_gemma":[0.2306315,0.6492692,0.1026073,0.008568697,0.004599982,0.001691103,0.0002520228,0.0003349581,0.00204527],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.5488328,"threshold_uncertainty_score":0.6768085,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2056109249","doi":"10.1080/00016470412331294445","title":"How reliable are reliability studies of fracture classifications?A systematic review of their methodologies","year":2004,"lang":"en","type":"review","venue":"Acta Orthopaedica Scandinavica","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":184,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Health Sciences Centre; McMaster University Medical Centre","funders":"","keywords":"Checklist; Medicine; Reliability (semiconductor); Kappa; Cohen's kappa; MEDLINE; Statistics; Sample size determination; Medical physics; Data mining; Computer science; Mathematics; Psychology; Cognitive psychology","authors":[{"name":"Laurent Audigé","is_ca":false},{"name":"Mohit Bhandari","is_ca":true},{"name":"James F. Kellam","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3789064394489871,"gpt":0.4667575180918639,"spread":0.08785107864287689,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2000522,0.002455302,0.01332747,0.04295803,0.001532311,0.006696551,0.004301916,0.003177488,0.002348659],"category_scores_gemma":[0.567561,0.003434378,0.009043014,0.03072335,0.004006998,0.007064508,0.003192738,0.0018513,0.0004981706],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00899259,"about_ca_system_score_gemma":0.01943693,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006185446,"about_ca_topic_score_gemma":0.01492492,"domain_scores_codex":[0.73967,0.1309018,0.0949955,0.007031734,0.02632609,0.001074927],"domain_scores_gemma":[0.3918552,0.4947405,0.05963368,0.0110642,0.04152505,0.001181284],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","study_design_scores_codex":[0.0003178183,0.00002557815,0.003968664,0.8149716,0.0104904,0.0001523745,0.001254927,0.0001678559,0.0002296545,0.0009109087,0.0020166,0.1654936],"study_design_scores_gemma":[0.000392602,0.0003169277,0.01146131,0.9119914,0.04849047,0.0006546277,0.001488678,0.0002644461,0.0004330272,0.00225651,0.02214209,0.0001079346],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.00196058,0.9918207,0.002824452,0.0009367202,0.0002908053,0.001258829,0.000449117,0.00002289672,0.0004359272],"genre_scores_gemma":[0.04689759,0.9183223,0.02430459,0.0008819983,0.0003143168,0.008404923,0.0006447216,0.00003620523,0.0001932008],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.7999478,"threshold_uncertainty_score":0.986478,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1989853314","doi":"10.1186/1471-2288-9-5","title":"Measuring agreement of administrative data with chart data using prevalence unadjusted and adjusted kappa","year":2009,"lang":"en","type":"article","venue":"BMC Medical Research Methodology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":177,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true},"ca_institutions":"Calgary General Hospital; Alberta Bone and Joint Health Institute; University of Calgary","funders":"Canadian Institutes of Health Research; Fondation pour la Recherche Médicale","keywords":"Kappa; Cohen's kappa; Statistics; Medicine; Sampling (signal processing); Sample size determination; Sample (material); Mathematics; Computer science","authors":[{"name":"Guanmin Chen","is_ca":true},{"name":"Peter Faris","is_ca":true},{"name":"Brenda R. Hemmelgarn","is_ca":true},{"name":"Robin L. Walker","is_ca":true},{"name":"Hude Quan","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.9684346225908497,"gpt":0.6570201568897845,"spread":0.3114144657010651,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.09648629,0.0006123471,0.001207142,0.01005391,0.0009573254,0.002358024,0.001874339,0.0007150345,0.001162104],"category_scores_gemma":[0.2262986,0.0007431574,0.001915178,0.006129305,0.001578982,0.00244429,0.003176022,0.001092598,0.0002580222],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001856636,"about_ca_system_score_gemma":0.001564432,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005808953,"about_ca_topic_score_gemma":0.005312883,"domain_scores_codex":[0.888696,0.05959542,0.01806934,0.01033305,0.02170784,0.001598279],"domain_scores_gemma":[0.6882282,0.1970497,0.05584993,0.01727395,0.0400996,0.001498531],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0004987788,0.00004925606,0.9485668,0.0008216667,0.001774815,0.00007647606,0.00373188,0.002294669,0.001218815,0.001522389,0.0011122,0.03833212],"study_design_scores_gemma":[0.0000670308,0.0005188764,0.9640018,0.0004484807,0.0006819832,0.0007681657,0.003072342,0.01589035,0.003469284,0.006692749,0.00422552,0.0001634199],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8066431,0.002740497,0.1764896,0.0003354627,0.0002962922,0.0009678778,0.002799746,0.0005193895,0.009207902],"genre_scores_gemma":[0.9625052,0.000263889,0.03545959,0.00005613438,0.000052594,0.0004895788,0.0008236413,0.00005459042,0.000294936],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.09648629,"threshold_uncertainty_score":0.5102744,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2123033778","doi":"10.1177/0962280210383082","title":"Closed-form confidence intervals for functions of the normal mean and standard deviation","year":2010,"lang":"en","type":"article","venue":"Statistical Methods in Medical Research","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":172,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Robarts Clinical Trials; Western University","funders":"Ontario Ministry of Research and Innovation; Natural Sciences and Engineering Research Council of Canada","keywords":"Standard deviation; Confidence interval; Percentile; Mathematics; Statistics; Coefficient of variation; Robust confidence intervals; Normal distribution; Geometric standard deviation; Standard error; CDF-based nonparametric confidence interval; Variance (accounting); Mean difference; Range (aeronautics); Limits of agreement; Relative standard deviation; Medicine; Detection limit; Nuclear medicine","authors":[{"name":"Allan Donner","is_ca":true},{"name":"Guangyong Zou","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3547369148091911,"gpt":0.6128973161725231,"spread":0.258160401363332,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06944848,0.002301624,0.003653794,0.008764308,0.001137015,0.006345947,0.005509055,0.004454349,0.008516584],"category_scores_gemma":[0.4761174,0.001218985,0.002813069,0.006026366,0.004304228,0.008771112,0.004318448,0.007162822,0.003334382],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002099943,"about_ca_system_score_gemma":0.002185207,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001689323,"about_ca_topic_score_gemma":0.0008197676,"domain_scores_codex":[0.9488792,0.02787754,0.003729221,0.005805722,0.01259303,0.001115256],"domain_scores_gemma":[0.5299667,0.4047834,0.01846992,0.01858508,0.02731154,0.0008834078],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.000463601,0.0002024356,0.005101642,0.002281332,0.0007726901,0.0004672506,0.001709124,0.1409522,0.002328737,0.4686802,0.01098534,0.3660554],"study_design_scores_gemma":[0.0002017151,0.0003024453,0.004592849,0.002124247,0.0003000473,0.001168097,0.0004852129,0.4188668,0.005921539,0.5465518,0.01911555,0.0003696583],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001983352,0.001138368,0.994382,0.00019924,0.00007018195,0.00009502167,0.0001574071,0.0004935334,0.001481018],"genre_scores_gemma":[0.1615258,0.002908767,0.8287747,0.0004409321,0.0004124915,0.002185085,0.001213373,0.000886674,0.001652287],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.06944848,"threshold_uncertainty_score":0.367283,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1949714730","doi":"10.5435/00124635-200207000-00007","title":"Classification Systems in Orthopaedics","year":2002,"lang":"en","type":"review","venue":"Journal of the American Academy of Orthopaedic Surgeons","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":164,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Medicine; Reliability (semiconductor); Documentation; Kappa; Measure (data warehouse); Orthopedic surgery; Medical physics; Cohen's kappa; Reliability engineering; Data mining; Machine learning; Computer science; Surgery","authors":[{"name":"Donald S. Garbuz","is_ca":true},{"name":"Bassam A. Masri","is_ca":true},{"name":"John M. Esdaile","is_ca":true},{"name":"Clivе P. Duncan","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2429347439420307,"gpt":0.4163155049620289,"spread":0.1733807610199982,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009099592,0.002023842,0.003200271,0.01496269,0.001495009,0.004271083,0.003525417,0.003461382,0.009638134],"category_scores_gemma":[0.02430668,0.000627287,0.001641672,0.01764144,0.004807377,0.00706436,0.002509146,0.003954104,0.005890471],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004565349,"about_ca_system_score_gemma":0.006078522,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003899372,"about_ca_topic_score_gemma":0.003931344,"domain_scores_codex":[0.9913452,0.002949366,0.001858147,0.0008399073,0.002804088,0.0002033278],"domain_scores_gemma":[0.9858407,0.007897262,0.001765861,0.0006836044,0.003465219,0.0003474036],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00003817369,0.00005840838,0.001164124,0.01350961,0.0001274325,0.0001873047,0.0005892822,0.0008314544,0.0002283799,0.0682447,0.08568151,0.8293396],"study_design_scores_gemma":[0.0000230902,0.00007527752,0.002888725,0.01408101,0.00007263177,0.001583499,0.0006117728,0.0004570868,0.0001418308,0.06145021,0.918546,0.00006905844],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0004957415,0.9663518,0.01006129,0.006773459,0.005323781,0.0002400731,0.0002850955,0.000121327,0.01034738],"genre_scores_gemma":[0.009345684,0.9352216,0.03862502,0.004496975,0.004774121,0.0005652634,0.0008793102,0.00005039846,0.006041711],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.01496269,"threshold_uncertainty_score":0.04812378,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2152177373","doi":"10.2106/jbjs.h.01624","title":"Evaluating Agreement: Conducting a Reliability Study","year":2009,"lang":"en","type":"article","venue":"Journal of Bone and Joint Surgery","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":162,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Sunnybrook Health Science Centre; University of Toronto; McMaster University","funders":"","keywords":"Reliability (semiconductor); Sample size determination; Computer science; Reliability engineering; Context (archaeology); Test (biology); Psychology; Statistics; Engineering; Mathematics; Power (physics)","authors":[{"name":"Paul J. Karanicolas","is_ca":true},{"name":"Mohit Bhandari","is_ca":true},{"name":"Hans J. Kreder","is_ca":true},{"name":"Antonio Moroni","is_ca":false},{"name":"Martin Richardson","is_ca":false},{"name":"Stephen D. Walter","is_ca":true},{"name":"Geoff Norman","is_ca":true},{"name":"Gordon Guyatt","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5353733677564685,"gpt":0.4567027472231148,"spread":0.07867062053335366,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.4181999,0.001163982,0.003235349,0.009726854,0.002329537,0.00524967,0.002200436,0.001824558,0.002311321],"category_scores_gemma":[0.6037973,0.001328217,0.003497946,0.007982668,0.004677529,0.006516665,0.004764488,0.002814936,0.00104392],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002459252,"about_ca_system_score_gemma":0.007148245,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001443193,"about_ca_topic_score_gemma":0.001638001,"domain_scores_codex":[0.5381239,0.3333645,0.05585367,0.01224225,0.05785561,0.002560002],"domain_scores_gemma":[0.235508,0.5752224,0.03693643,0.03622833,0.113873,0.002231798],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.003220085,0.0013213,0.270816,0.01276703,0.00541332,0.0006365091,0.06580012,0.005184701,0.008110365,0.03327017,0.01366263,0.5797978],"study_design_scores_gemma":[0.001380115,0.01523935,0.4840362,0.01513119,0.007364997,0.004174836,0.09179558,0.06823237,0.03892202,0.1625184,0.1092386,0.001966278],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.2193921,0.004628196,0.7206406,0.002710921,0.001274124,0.02191811,0.001078803,0.0009971549,0.02735995],"genre_scores_gemma":[0.4933471,0.001227017,0.4901057,0.0004936762,0.0002351409,0.01298414,0.000406032,0.00027841,0.0009227138],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.5818001,"threshold_uncertainty_score":0.7174631,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2113321769","doi":"10.1136/eb-2013-101243","title":"The two-step Fagan's nomogram: ad hoc interpretation of a diagnostic test result without calculation","year":2013,"lang":"en","type":"article","venue":"Evidence-Based Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":136,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Prince Edward Island","funders":"","keywords":"Nomogram; Fagan inspection; Computer science; Test (biology); Medicine; Software engineering; Geology","authors":[{"name":"Charles Caraguel","is_ca":false},{"name":"Raphaël Vanderstichel","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1152710325688526,"gpt":0.3861066713332384,"spread":0.2708356387643858,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05881313,0.002507877,0.0040079,0.009951892,0.002152605,0.007085541,0.003103006,0.002322837,0.00537121],"category_scores_gemma":[0.1582203,0.001069661,0.004688522,0.004286156,0.003245012,0.004458294,0.004553264,0.004601576,0.002177442],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002642382,"about_ca_system_score_gemma":0.006619722,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004084047,"about_ca_topic_score_gemma":0.005720122,"domain_scores_codex":[0.9612862,0.02344061,0.004656325,0.002820207,0.007215939,0.0005808303],"domain_scores_gemma":[0.9309035,0.04861327,0.004177265,0.004789312,0.0103368,0.001179884],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.001331357,0.000138429,0.03856027,0.004304432,0.002528051,0.0008319115,0.001777812,0.02164517,0.001159854,0.05780335,0.07973793,0.7901815],"study_design_scores_gemma":[0.0008666254,0.002314342,0.03958431,0.007947457,0.003804449,0.01002192,0.002515501,0.2629789,0.006293549,0.2753058,0.3870088,0.001358276],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0131793,0.01661008,0.9359894,0.006405906,0.003434965,0.003404412,0.001362868,0.001363334,0.01824979],"genre_scores_gemma":[0.1731427,0.009080163,0.8047752,0.00172385,0.001950162,0.003113984,0.001181198,0.0006379249,0.004394765],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.05881313,"threshold_uncertainty_score":0.3110372,"prediction_status":"machine_predicted_unvalidated"},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"not_applicable","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"high"},{"model":"gpt","categories":[],"domain":null,"study_design":"design_other","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"medium"}],"label_agreement":"split"},{"id":"W1970971885","doi":"10.1016/j.jclinepi.2011.10.019","title":"A confidence interval approach to sample size estimation for interobserver agreement studies with multiple raters and outcomes","year":2012,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":131,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Western University; York University","funders":"","keywords":"Confidence interval; Triage; Sample size determination; Reliability (semiconductor); Medicine; Estimation; Medical physics; Sample (material); Interval estimation; Statistics; Scale (ratio); Mathematics; Psychiatry; Power (physics)","authors":[{"name":"Michael Rotondi","is_ca":true},{"name":"Allan Donner","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7278829789470725,"gpt":0.5892656106725227,"spread":0.1386173682745498,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.3642608,0.003350027,0.008748183,0.01241768,0.002026312,0.00524682,0.01174666,0.007999947,0.00582587],"category_scores_gemma":[0.7199979,0.002682676,0.008032386,0.007963128,0.005384813,0.006480915,0.00518119,0.01112405,0.001018248],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0023272,"about_ca_system_score_gemma":0.004143605,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004969955,"about_ca_topic_score_gemma":0.002087053,"domain_scores_codex":[0.577203,0.3526362,0.0170115,0.02195777,0.02943282,0.001758728],"domain_scores_gemma":[0.148967,0.8083075,0.008988395,0.02125471,0.01180191,0.0006805764],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.003198505,0.0006857861,0.02168138,0.004338884,0.01209687,0.0008863711,0.004365866,0.06273738,0.001968174,0.2233619,0.01198817,0.6526906],"study_design_scores_gemma":[0.001330653,0.003185797,0.01876159,0.003513272,0.006352435,0.00281978,0.001096412,0.6489965,0.004376221,0.2857167,0.02329763,0.0005530592],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001414163,0.0008695023,0.9960803,0.0002082438,0.0001371345,0.0004222174,0.0001058842,0.0002208084,0.0005416806],"genre_scores_gemma":[0.08291865,0.0007531751,0.9103679,0.0003907332,0.0003259894,0.003864127,0.0003587076,0.0002234458,0.0007972484],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.3642608,"threshold_uncertainty_score":0.7839797,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1978765295","doi":"10.2202/1557-4679.1275","title":"Sample Size Requirements for Interval Estimation of the Kappa Statistic for Interobserver Agreement Studies with a Binary Outcome and Multiple Raters","year":2010,"lang":"en","type":"article","venue":"The International Journal of Biostatistics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":127,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Western University","funders":"","keywords":"Statistics; Cohen's kappa; Confidence interval; Kappa; Intraclass correlation; Mathematics; Interval estimation; Statistic; Sample size determination; Sample (material); Binary number; Limit (mathematics); Interval (graph theory); Psychometrics; Combinatorics","authors":[{"name":"Allan Donner","is_ca":true},{"name":"Michael Rotondi","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2216258336390316,"gpt":0.4380071238304545,"spread":0.2163812901914229,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1786186,0.001069426,0.002989158,0.005049699,0.001218996,0.002704979,0.004168657,0.004818264,0.01082509],"category_scores_gemma":[0.5975481,0.001106063,0.001674337,0.002851962,0.001620932,0.002699228,0.002839935,0.002883696,0.003594608],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00103512,"about_ca_system_score_gemma":0.002557308,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0006303696,"about_ca_topic_score_gemma":0.0006430093,"domain_scores_codex":[0.7999874,0.1302816,0.02078545,0.004278774,0.04277185,0.001894894],"domain_scores_gemma":[0.245363,0.7036695,0.009069589,0.01281633,0.02805889,0.001022686],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.01426279,0.001348018,0.02602221,0.005384203,0.0004330233,0.002024927,0.004638802,0.03668181,0.02051931,0.146358,0.04766413,0.6946628],"study_design_scores_gemma":[0.008194519,0.02397966,0.09354905,0.01098537,0.001428294,0.0112449,0.003447028,0.3083707,0.08315584,0.3014544,0.1532092,0.0009808949],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0171504,0.001270079,0.9575879,0.001334542,0.0005864576,0.008586189,0.001186311,0.0006231448,0.01167502],"genre_scores_gemma":[0.1367383,0.001020211,0.8089746,0.0013515,0.0005279917,0.04652979,0.001939634,0.0005959983,0.002321908],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.8213813,"threshold_uncertainty_score":0.9446369,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2044481915","doi":"10.1038/modpathol.3800496","title":"Interobserver agreement and reproducibility in classification of invasive breast carcinoma: an NCI breast cancer family registry study","year":2005,"lang":"en","type":"article","venue":"Modern Pathology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":116,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Mount Sinai Hospital; University of Toronto; Jewish General Hospital; Statistics Canada","funders":"National Cancer Institute; National Institutes of Health; National Institute of Informatics","keywords":"Medicine; Reproducibility; Breast cancer; Pathology; Breast carcinoma; Cancer registry; Cancer; Oncology; Radiology; Internal medicine; Epidemiology","authors":[{"name":"Teri A. Longacre","is_ca":false},{"name":"Marguerite Ennis","is_ca":true},{"name":"Louise Quenneville","is_ca":true},{"name":"Anita Bane","is_ca":true},{"name":"Ira J. Bleiweiss","is_ca":false},{"name":"Beverley A. Carter","is_ca":false},{"name":"Edison Catelano","is_ca":false},{"name":"Michael Hendrickson","is_ca":false},{"name":"Hanina Hibshoosh","is_ca":false},{"name":"Lester J. Layfield","is_ca":false},{"name":"Lorenzo Memeo","is_ca":false},{"name":"Hong Wu","is_ca":false},{"name":"Frances P. O’Malley","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1848026354599528,"gpt":0.3738318780764844,"spread":0.1890292426165316,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03375296,0.000408019,0.00081324,0.002234005,0.001113063,0.001067597,0.001532056,0.0009578331,0.0004054733],"category_scores_gemma":[0.08315826,0.000610295,0.0009523365,0.001492744,0.001253217,0.001449554,0.00156369,0.0006865822,0.0002700154],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001294197,"about_ca_system_score_gemma":0.0009842607,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01056357,"about_ca_topic_score_gemma":0.01146171,"domain_scores_codex":[0.9618706,0.02394361,0.003527408,0.003078818,0.006606475,0.0009731456],"domain_scores_gemma":[0.9088395,0.05273433,0.009896713,0.01374067,0.01378193,0.001006971],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002803385,0.00005571851,0.995416,0.00001585722,0.0001833182,0.00005693233,0.0009539947,0.0001721427,0.0002510607,0.00004309988,0.0001103156,0.002461069],"study_design_scores_gemma":[0.00002486232,0.0001640223,0.9962748,0.000009274984,0.0001941556,0.0003033985,0.0006704039,0.001572887,0.0004633041,0.00006465847,0.0002417373,0.00001657966],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9975634,0.0002084222,0.001180308,0.00002444417,0.00001573941,0.0000415732,0.0001655283,0.00001655478,0.0007840921],"genre_scores_gemma":[0.9990483,0.00003491524,0.0006162337,0.00001166041,0.000009251821,0.00003455055,0.0001640308,0.000009422761,0.00007152803],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03375296,"threshold_uncertainty_score":0.1785049,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2155433306","doi":"10.1590/s1413-35552006000200002","title":"Importance and clarification of measurement properties in rehabilitation","year":2006,"lang":"en","type":"article","venue":"Brazilian Journal of Physical Therapy","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":109,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"Canadian Institutes of Health Research; Coordenação de Aperfeiçoamento de Pessoal de Nível Superior; University of Alberta","keywords":"Reliability (semiconductor); Rehabilitation; Quality (philosophy); Clinical Practice; Validity; Field (mathematics); Psychology; Applied psychology; Computer science; Management science; Psychometrics; Medicine; Power (physics); Physical therapy; Clinical psychology; Engineering; Mathematics; Epistemology","authors":[{"name":"Inaê Caroline Gadotti","is_ca":true},{"name":"Edgar Ramos Vieira","is_ca":true},{"name":"DJ Magee","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1405243827265361,"gpt":0.3289915533775897,"spread":0.1884671706510536,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.5265373,0.001879051,0.005026582,0.008848739,0.004210239,0.01272785,0.004794448,0.005083947,0.002679521],"category_scores_gemma":[0.7908763,0.001797447,0.003886353,0.008381511,0.02299368,0.02787443,0.01113353,0.01121504,0.0006656747],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.008790876,"about_ca_system_score_gemma":0.01610827,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002000458,"about_ca_topic_score_gemma":0.001374725,"domain_scores_codex":[0.2757599,0.5946434,0.06579299,0.01034944,0.05146606,0.001988299],"domain_scores_gemma":[0.078285,0.8123348,0.03484827,0.03491873,0.03903238,0.0005808545],"domain_codex":"methods","domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0004245309,0.0002103353,0.02032837,0.02160717,0.001282085,0.0005876711,0.043885,0.003791974,0.001742336,0.5092048,0.009624623,0.3873112],"study_design_scores_gemma":[0.0002788232,0.0008374367,0.02812892,0.04436032,0.001581714,0.002114599,0.02204284,0.01737767,0.006625598,0.7739904,0.1019814,0.0006803665],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.03779555,0.05266853,0.7981293,0.07260732,0.007349647,0.002747036,0.0004234115,0.0005068624,0.02777231],"genre_scores_gemma":[0.5851784,0.009730586,0.3845882,0.009261401,0.002768681,0.006839112,0.0002681579,0.0003439474,0.001021589],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.5265373,"threshold_uncertainty_score":0.5838639,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2470750097","doi":"","title":"Enhancing retrieval of best evidence for health care from bibliographic databases: calibration of the hand search of the literature.","year":2001,"lang":"en","type":"article","venue":"PubMed","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":102,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"McMaster University; Hamilton Health Sciences","funders":"","keywords":"Cohen's kappa; Statistic; Information retrieval; Reliability (semiconductor); Computer science; MEDLINE; Health care; Test (biology); Medical education; Database; Medicine; Statistics; Machine learning; Mathematics","authors":[{"name":"Wilczynski Nl","is_ca":true},{"name":"McKibbon Ka","is_ca":false},{"name":"R. Brian Haynes","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.267435042832476,"gpt":0.4016326631986881,"spread":0.1341976203662121,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.6883293,0.002464194,0.006557555,0.03774231,0.003608851,0.007785964,0.004683338,0.003018969,0.002194203],"category_scores_gemma":[0.907478,0.002733299,0.004469305,0.02037497,0.005249839,0.01359337,0.01257516,0.002880094,0.0008985504],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.009159689,"about_ca_system_score_gemma":0.0214805,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003382695,"about_ca_topic_score_gemma":0.006523068,"domain_scores_codex":[0.2192397,0.5681716,0.1422984,0.01217144,0.05655236,0.001566484],"domain_scores_gemma":[0.03695323,0.8111023,0.06555261,0.03664881,0.04846524,0.001277911],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.005946592,0.0007221386,0.04841704,0.07319462,0.005231753,0.0002361015,0.02555256,0.003213265,0.006786405,0.00396708,0.008000621,0.8187318],"study_design_scores_gemma":[0.01368791,0.0160264,0.3785789,0.1869423,0.02997992,0.003529121,0.02721867,0.08422091,0.05128494,0.1065944,0.09846916,0.003467456],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2813936,0.07282669,0.5061377,0.01620227,0.002380591,0.09847105,0.002220384,0.003391362,0.01697637],"genre_scores_gemma":[0.3619817,0.007154993,0.5925779,0.001836012,0.0005219351,0.03411905,0.0008893394,0.0002457465,0.0006733999],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.3116707,"threshold_uncertainty_score":0.3843455,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1887790309","doi":"10.1186/1742-5573-3-11","title":"New patient-oriented summary measure of net total gain in certainty for dichotomous diagnostic tests","year":2006,"lang":"en","type":"article","venue":"Epidemiologic Perspectives & Innovations","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":96,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Reciprocal; Measure (data warehouse); Certainty; Youden's J statistic; Index (typography); Medicine; Statistics; Population; Disease; Computer science; Test (biology); Predictive value; Mathematics; Data mining; Internal medicine","authors":[{"name":"Shai Linn","is_ca":false},{"name":"Peter Grunau","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.08524577208288033,"gpt":0.3642964651287134,"spread":0.2790506930458331,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01594656,0.0007594263,0.001207038,0.004217846,0.000297095,0.002172892,0.001164499,0.0008568835,0.003003012],"category_scores_gemma":[0.1050719,0.0002437917,0.001178373,0.00328201,0.001028181,0.0029448,0.001488866,0.001280352,0.0003891224],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001056687,"about_ca_system_score_gemma":0.0009813602,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005408329,"about_ca_topic_score_gemma":0.0005424439,"domain_scores_codex":[0.9884488,0.005378886,0.001265137,0.001066922,0.003661399,0.0001788467],"domain_scores_gemma":[0.9273159,0.05235349,0.009375686,0.003856254,0.006204836,0.0008937572],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001649843,0.0003702053,0.3742493,0.001343374,0.0019497,0.0003891602,0.000853256,0.0744962,0.002497263,0.05305044,0.006274959,0.4828763],"study_design_scores_gemma":[0.0003299834,0.00470858,0.3206073,0.0005829369,0.001626874,0.004429583,0.0005968041,0.4894123,0.006471334,0.1568822,0.01390718,0.0004449913],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.2012082,0.002715598,0.7805951,0.001636694,0.0003151764,0.0005673528,0.0030998,0.0008228333,0.00903921],"genre_scores_gemma":[0.842776,0.0006447379,0.1533754,0.0002462777,0.0003371749,0.0005407623,0.001409293,0.00005516969,0.0006152781],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9840534,"threshold_uncertainty_score":0.08433449,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2016242508","doi":"10.1016/j.jclinepi.2010.12.001","title":"The difference between reliability and agreement","year":2011,"lang":"en","type":"letter","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":93,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Scopus; Inter-rater reliability; Intraclass correlation; Reliability (semiconductor); Kappa; Cohen's kappa; Statistics; Psychology; Medicine; Mathematics; MEDLINE; Physics; Psychometrics; Political science","authors":[{"name":"Jan Kottner","is_ca":false},{"name":"David L. Streiner","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6917992205636752,"gpt":0.5490965920628558,"spread":0.1427026285008194,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1372379,0.0004935426,0.002328253,0.002346867,0.002991236,0.006091199,0.002580834,0.02689106,0.003497682],"category_scores_gemma":[0.5732886,0.00124841,0.001299495,0.001670936,0.0155545,0.00922126,0.004946429,0.03307545,0.002581487],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.006234543,"about_ca_system_score_gemma":0.005728168,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003325837,"about_ca_topic_score_gemma":0.005717814,"domain_scores_codex":[0.7752062,0.1416858,0.02765923,0.01108553,0.04146769,0.00289556],"domain_scores_gemma":[0.2536535,0.6922848,0.01114704,0.01187921,0.02730665,0.003728742],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0008965942,0.0001464487,0.02753557,0.001002658,0.000394438,0.002997119,0.00533125,0.0005052766,0.0005678362,0.1564834,0.5777726,0.2263668],"study_design_scores_gemma":[0.0007078043,0.0006110605,0.03672771,0.004028156,0.0004236799,0.01623499,0.004474833,0.006438271,0.001574569,0.5435691,0.3846717,0.0005380408],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"commentary","genre_gemma":"commentary","genre_scores_codex":[0.002081647,0.002918512,0.003178047,0.9792037,0.007287101,0.00002033908,0.00005430559,0.00002826633,0.005228137],"genre_scores_gemma":[0.1035361,0.002003598,0.007566639,0.8489074,0.0346866,0.0002527263,0.0000625804,0.00007121012,0.002913233],"genre_candidate":"commentary","genre_consensus":"commentary","teacher_disagreement_score":0.8627622,"threshold_uncertainty_score":0.7257919,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2099954138","doi":"10.1016/j.ygyno.2005.07.040","title":"Kappa statistics to measure interrater and intrarater agreement for 1790 cervical biopsy specimens among twelve pathologists: Qualitative histopathologic analysis and methodologic issues","year":2005,"lang":"en","type":"article","venue":"Gynecologic Oncology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":90,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"National Cancer Institute","keywords":"Medicine; Biopsy; Inter-rater reliability; Cohen's kappa; Cervical cancer; Radiology; Kappa; Family medicine; Cancer; Statistics; Internal medicine","authors":[{"name":"Anaís Malpica","is_ca":false},{"name":"Jasenka Matisic","is_ca":true},{"name":"Dirk Van Niekirk","is_ca":true},{"name":"Christopher P. Crum","is_ca":false},{"name":"Gregg Staerkel","is_ca":false},{"name":"José‐Miguel Yamal","is_ca":false},{"name":"Dennis D. Cox","is_ca":false},{"name":"E. Neely Atkinson","is_ca":false},{"name":"Karen Adler‐Storthz","is_ca":false},{"name":"Neal Poulin","is_ca":true},{"name":"Calum MacAulay","is_ca":true},{"name":"Michele Follen","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2655803757781627,"gpt":0.4873603395796752,"spread":0.2217799638015124,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1495038,0.0008187036,0.001833516,0.008298258,0.005271873,0.002904084,0.002677912,0.001076376,0.001786564],"category_scores_gemma":[0.3544491,0.001212884,0.00258565,0.005299124,0.00317973,0.004034961,0.003602822,0.002238778,0.0005891897],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002996556,"about_ca_system_score_gemma":0.004290004,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006174028,"about_ca_topic_score_gemma":0.01757649,"domain_scores_codex":[0.8283029,0.1018141,0.02900114,0.006852168,0.03211521,0.001914398],"domain_scores_gemma":[0.3716541,0.5093099,0.01508072,0.02190541,0.08031054,0.001739308],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002769144,0.0004261956,0.601936,0.003629873,0.005316655,0.0004953324,0.1124669,0.006046343,0.008468976,0.02441374,0.01041317,0.2236177],"study_design_scores_gemma":[0.0005420201,0.00311548,0.7053232,0.002625778,0.003877252,0.00365687,0.1041653,0.0749438,0.02466912,0.04622641,0.02983876,0.001016136],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.725691,0.003414091,0.2400243,0.001061573,0.0009635572,0.002286069,0.001855304,0.0007466816,0.02395756],"genre_scores_gemma":[0.9000795,0.0003503212,0.09588832,0.0001164311,0.00009695974,0.001411562,0.0004019506,0.0002657988,0.001389025],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8504962,"threshold_uncertainty_score":0.7906609,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2146976162","doi":"10.1002/(sici)1097-0258(20000215)19:3<373::aid-sim337>3.0.co;2-y","title":"Testing the equality of two dependent kappa statistics","year":2000,"lang":"en","type":"article","venue":"Statistics in Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":89,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Guelph; Western University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Statistics; Kappa; Correlation; Monte Carlo method; Mathematics; Cohen's kappa; Goodness of fit; Dependency (UML); Sample size determination; Variable (mathematics); Computer science; Artificial intelligence","authors":[{"name":"Allan Donner","is_ca":true},{"name":"Mohamed M. Shoukri","is_ca":true},{"name":"Neil Klar","is_ca":false},{"name":"Emma Bartfay","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2670104097609483,"gpt":0.4556427207423286,"spread":0.1886323109813803,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2024872,0.001724252,0.00346632,0.01081366,0.002679649,0.004627347,0.004520973,0.00304675,0.006440107],"category_scores_gemma":[0.6414766,0.001136942,0.003469868,0.005554335,0.008107116,0.006132675,0.008412695,0.003641232,0.002040525],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002056354,"about_ca_system_score_gemma":0.004251299,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001444876,"about_ca_topic_score_gemma":0.001068565,"domain_scores_codex":[0.6833567,0.2018484,0.02441823,0.02663719,0.06068893,0.003050507],"domain_scores_gemma":[0.2930488,0.58917,0.03147649,0.04178861,0.04199441,0.00252169],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00485243,0.0004249489,0.08294743,0.003998037,0.005079336,0.001206204,0.01164089,0.02395484,0.009584379,0.2162581,0.01214763,0.6279057],"study_design_scores_gemma":[0.00121013,0.005388763,0.1578186,0.002839608,0.002276931,0.00619514,0.008677211,0.1980949,0.03148092,0.5421497,0.04215,0.00171808],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0582719,0.000765665,0.927771,0.0003420737,0.0003227377,0.0017462,0.0008243784,0.0009541623,0.009001925],"genre_scores_gemma":[0.4803271,0.0004444955,0.5114686,0.0002526985,0.0001413218,0.004702276,0.0009464609,0.0004831482,0.001233878],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.2024872,"threshold_uncertainty_score":0.9834752,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3035592618","doi":"10.1186/s12874-020-01022-x","title":"Using multiple agreement methods for continuous repeated measures data: a tutorial for practitioners","year":2020,"lang":"en","type":"article","venue":"BMC Medical Research Methodology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":88,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada; Emory University","keywords":"Concordance; Cohen's kappa; Computer science; Concordance correlation coefficient; Data mining; Statistics; Strengths and weaknesses; Correlation coefficient; Pulmonary disease; Limits of agreement; Medical physics; Medicine; Mathematics; Machine learning; Psychology","authors":[{"name":"Richard Parker","is_ca":false},{"name":"Charles Scott","is_ca":false},{"name":"Vanda Inácio","is_ca":false},{"name":"Nathaniel T. Stevens","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.9644013985579888,"gpt":0.7181859517571121,"spread":0.2462154468008767,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1127555,0.005298162,0.003411827,0.01117061,0.001516849,0.00537741,0.007489451,0.007449409,0.02740369],"category_scores_gemma":[0.3081675,0.003898024,0.005118295,0.00689824,0.005349374,0.01125236,0.004451348,0.01513,0.02267841],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002690501,"about_ca_system_score_gemma":0.005410047,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002319067,"about_ca_topic_score_gemma":0.003040342,"domain_scores_codex":[0.9147992,0.060495,0.009523525,0.002798112,0.01182273,0.0005614527],"domain_scores_gemma":[0.5427142,0.4043837,0.009474179,0.0112366,0.03030152,0.001889738],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001909828,0.0003208034,0.001267667,0.01291967,0.0004461607,0.0008374805,0.005272673,0.003483378,0.002504589,0.05131692,0.3853798,0.5360599],"study_design_scores_gemma":[0.0002116449,0.0003869919,0.001966381,0.0145977,0.0001651115,0.003003834,0.001909227,0.01234895,0.002034667,0.1909147,0.771984,0.0004768965],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0003064985,0.02022635,0.9498793,0.01327117,0.00375168,0.001683465,0.0008970306,0.004437332,0.005546991],"genre_scores_gemma":[0.002778684,0.01586731,0.9657905,0.003992304,0.002378706,0.004652568,0.0004630288,0.001715393,0.002361503],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.1127555,"threshold_uncertainty_score":0.5963151,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2143965974","doi":"10.1093/ije/dyp370","title":"Forest plots in reports of systematic reviews: a cross-sectional study reviewing current practice","year":2010,"lang":"en","type":"article","venue":"International Journal of Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":87,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa","funders":"Cancer Research UK; University of Ottawa","keywords":"Cross-sectional study; Current (fluid); Medicine; MEDLINE; Systematic review; Environmental health; Geography; Political science; Engineering; Pathology","authors":[{"name":"David L. Schriger","is_ca":false},{"name":"Douglas G. Altman","is_ca":true},{"name":"J. A. Vetter","is_ca":true},{"name":"T. Heafner","is_ca":true},{"name":"David Moher","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5444736336084718,"gpt":0.5819775103364283,"spread":0.03750387672795652,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3471574,0.001500219,0.005232633,0.04341212,0.003049714,0.008866622,0.003152788,0.003726477,0.008365551],"category_scores_gemma":[0.7955589,0.003485176,0.006705336,0.05412522,0.006175871,0.01941464,0.008046193,0.002923868,0.001514246],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.007858462,"about_ca_system_score_gemma":0.01124411,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003225607,"about_ca_topic_score_gemma":0.00509193,"domain_scores_codex":[0.3680687,0.2762184,0.2522604,0.03190148,0.06823771,0.003313254],"domain_scores_gemma":[0.07207054,0.5995772,0.2606144,0.02579801,0.04032029,0.001619474],"domain_codex":null,"domain_gemma":"reporting","domain_candidate":"reporting","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002530599,0.0002908027,0.6813094,0.128097,0.009606525,0.0007739231,0.02379706,0.0005913458,0.000679402,0.004578889,0.01570261,0.1320425],"study_design_scores_gemma":[0.002024978,0.002677146,0.6528972,0.2017326,0.01816977,0.01008646,0.03025607,0.003103298,0.002012328,0.01322661,0.06315677,0.0006566588],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"review","genre_gemma":"empirical","genre_scores_codex":[0.3573643,0.5232458,0.0523041,0.01050566,0.002251505,0.02422269,0.0209407,0.0006203551,0.008544819],"genre_scores_gemma":[0.8726303,0.04452614,0.04371454,0.004376017,0.0009314964,0.02819747,0.004550014,0.0002938888,0.0007801751],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.6528426,"threshold_uncertainty_score":0.8050712,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2107006322","doi":"10.1370/afm.1195","title":"Methods to Achieve High Interrater Reliability in Data Collection From Primary Care Medical Records","year":2011,"lang":"en","type":"article","venue":"The Annals of Family Medicine","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":83,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Élisabeth Bruyère Hospital; Bruyère; University of Ottawa","funders":"","keywords":"Medicine; Inter-rater reliability; Reliability (semiconductor); Quality assurance; Chart; Confidence interval; Audit; Statistics; Sample size determination; Data collection; Control chart; Quality (philosophy); Sample (material); Quality management; Statistic; Medical physics; Operations management; Computer science; Mathematics","authors":[{"name":"Clare Liddy","is_ca":true},{"name":"Marcus Wiens","is_ca":true},{"name":"William Hogg","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7358387871238369,"gpt":0.5387267113294011,"spread":0.1971120757944358,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.4494376,0.001963734,0.002092944,0.00680213,0.003620515,0.002718403,0.00337755,0.001660893,0.00311711],"category_scores_gemma":[0.5453711,0.002009993,0.002553984,0.004614541,0.003923964,0.003040939,0.005724682,0.002076327,0.001699946],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003277385,"about_ca_system_score_gemma":0.009155004,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00165151,"about_ca_topic_score_gemma":0.00309549,"domain_scores_codex":[0.31782,0.5350838,0.06897607,0.01997205,0.05563333,0.002514652],"domain_scores_gemma":[0.2300593,0.4101933,0.1057243,0.09298165,0.1584456,0.002595827],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.006953705,0.003368411,0.2574466,0.0126812,0.002621296,0.0005600724,0.04318593,0.01061905,0.02330761,0.01655531,0.01793925,0.6047615],"study_design_scores_gemma":[0.009335961,0.02201714,0.598985,0.01045048,0.002349256,0.002809879,0.01055469,0.09721164,0.09594142,0.04278404,0.1058024,0.001758084],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.101973,0.001032896,0.8176724,0.001044604,0.000638798,0.06527662,0.0006690422,0.00163973,0.01005278],"genre_scores_gemma":[0.2864311,0.0002361743,0.5925184,0.0006057493,0.0003719126,0.1182982,0.0003944308,0.0002727814,0.0008712043],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.5505624,"threshold_uncertainty_score":0.6789415,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2134076777","doi":"10.1016/j.jclinepi.2009.08.005","title":"A valid and reliable belief elicitation method for Bayesian priors","year":2009,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":80,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Women's College Hospital; University of Toronto; Toronto General Hospital; University Health Network; Toronto Western Hospital; Hospital for Sick Children; Public Health Ontario","funders":"Canadian Institutes of Health Research","keywords":"Prior probability; Bayesian probability; Expert elicitation; Statistics; Computer science; Econometrics; Mathematics","authors":[{"name":"Sindhu R. Johnson","is_ca":true},{"name":"George Tomlinson","is_ca":true},{"name":"Gillian Hawker","is_ca":true},{"name":"John Granton","is_ca":true},{"name":"Haddas A. Grosbein","is_ca":true},{"name":"Brian M. Feldman","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5853364478923457,"gpt":0.6222949697557054,"spread":0.03695852186335968,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.04757501,0.001459333,0.002022841,0.003057045,0.001578751,0.003387183,0.002820388,0.003348619,0.006423545],"category_scores_gemma":[0.3211897,0.001160702,0.001738637,0.002982897,0.001941236,0.004632197,0.005004637,0.005516848,0.002127061],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00178788,"about_ca_system_score_gemma":0.004448973,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002105901,"about_ca_topic_score_gemma":0.002464406,"domain_scores_codex":[0.9215541,0.05976751,0.003496174,0.004047163,0.01043938,0.0006956105],"domain_scores_gemma":[0.7010356,0.2508114,0.007167449,0.02181828,0.01802882,0.001138524],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001473651,0.0004956273,0.004194047,0.00103933,0.0006134632,0.0001966259,0.003215626,0.04214112,0.006627216,0.2899884,0.01390523,0.6361097],"study_design_scores_gemma":[0.0004409805,0.00033934,0.003161289,0.0005141161,0.0002460071,0.0003941264,0.0004182303,0.3852188,0.007465807,0.5874419,0.01403703,0.000322328],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.002270498,0.00007479062,0.9955052,0.0003957739,0.00003255417,0.0002386685,0.0002032593,0.0002235386,0.001055688],"genre_scores_gemma":[0.0842551,0.0001179391,0.9126337,0.0002394494,0.00008397829,0.001402435,0.0003842825,0.00009471568,0.0007885777],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.952425,"threshold_uncertainty_score":0.2516037,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2177903965","doi":"10.24095/hpcdp.32.1.05","title":"2008 Niday Perinatal Database quality audit: report of a quality assurance project","year":2011,"lang":"en","type":"article","venue":"Chronic diseases and injuries in Canada","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":71,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true},"ca_institutions":"Ottawa Hospital; Ottawa Public Health; University of Ottawa; Champlain Regional College; Children's Hospital of Eastern Ontario; Ontario Stroke Network","funders":"","keywords":"Intraclass correlation; Quality assurance; Cohen's kappa; Data quality; Kappa; Audit; Database; Statistic; Statistics; Quality (philosophy); Medicine; Sample (material); Reliability (semiconductor); Mathematics; Computer science; Reproducibility; Accounting; Operations management; Physics; Business; Engineering","authors":[{"name":"Sandra Dunn","is_ca":true},{"name":"Jim Bottomley","is_ca":true},{"name":"Аль-Музайкер Мохаммед Али Яхья Али","is_ca":true},{"name":"Mark Walker","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1220847053585366,"gpt":0.3818689116768931,"spread":0.2597842063183565,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.09523007,0.0007494903,0.0009032841,0.007015973,0.003907014,0.003784553,0.00261459,0.0008061589,0.001841471],"category_scores_gemma":[0.1257191,0.0009797688,0.0006492006,0.01035724,0.001315943,0.001295931,0.003866361,0.001525988,0.000695195],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.06072624,"about_ca_system_score_gemma":0.2008036,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.717592,"about_ca_topic_score_gemma":0.6344219,"domain_scores_codex":[0.8933913,0.0239343,0.01809927,0.003065914,0.05809533,0.003414033],"domain_scores_gemma":[0.6327121,0.0223658,0.0325035,0.01460712,0.2891142,0.008697294],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0005380205,0.0007223605,0.714375,0.002978034,0.0002347591,0.0002453612,0.006143426,0.00137512,0.002116555,0.001220077,0.05756796,0.2124834],"study_design_scores_gemma":[0.0001412707,0.0004744709,0.9339725,0.0008851485,0.0001608787,0.0001613804,0.002754172,0.002228746,0.003744507,0.0001712978,0.05522858,0.00007704658],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6880793,0.007497375,0.05197532,0.04170817,0.0005958084,0.07118054,0.0740485,0.00315677,0.06175816],"genre_scores_gemma":[0.7247719,0.006227021,0.170862,0.00454589,0.0002175461,0.01989382,0.05407827,0.000647784,0.01875577],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.90477,"threshold_uncertainty_score":0.5681423,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2592866053","doi":"10.1186/s13643-017-0441-7","title":"Effect of standardized training on the reliability of the Cochrane risk of bias assessment tool: a prospective study","year":2017,"lang":"en","type":"article","venue":"Systematic Reviews","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":65,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta; St. Michael's Hospital; University of Toronto","funders":"","keywords":"Medicine; Kappa; Reliability (semiconductor); Physical therapy; Randomized controlled trial; Cohen's kappa; Risk assessment; MEDLINE; Clinical psychology; Statistics; Surgery","authors":[{"name":"Bruno R. da Costa","is_ca":false},{"name":"Brooke Beckett","is_ca":false},{"name":"Alison Diaz","is_ca":false},{"name":"Nina M. Resta","is_ca":false},{"name":"Bradley C. Johnston","is_ca":true},{"name":"Matthias Egger","is_ca":false},{"name":"Peter Jüni","is_ca":true},{"name":"Susan Armijo‐Olivo","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2307356376426931,"gpt":0.4609718262253066,"spread":0.2302361885826134,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.433074,0.001755508,0.00523106,0.005035989,0.001305317,0.003316375,0.002928259,0.002939075,0.003024753],"category_scores_gemma":[0.7264251,0.002652823,0.009298286,0.006887711,0.004945758,0.005723073,0.003862865,0.00235193,0.0005882411],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004363573,"about_ca_system_score_gemma":0.008418731,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001557113,"about_ca_topic_score_gemma":0.001731764,"domain_scores_codex":[0.3386748,0.4839733,0.1169342,0.01670979,0.04122595,0.002481927],"domain_scores_gemma":[0.1176713,0.6045773,0.1891591,0.04751734,0.03888532,0.002189668],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.06563739,0.004280526,0.5518354,0.07209261,0.03524795,0.0003687745,0.01005033,0.004105384,0.001541391,0.002330682,0.00366244,0.2488472],"study_design_scores_gemma":[0.02563669,0.06710579,0.7994869,0.03549402,0.03722257,0.001723485,0.002551067,0.01241925,0.003222152,0.003741033,0.01051756,0.0008794632],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7669736,0.1112863,0.05233425,0.002178684,0.0009206143,0.05802941,0.002247431,0.0004128271,0.005616973],"genre_scores_gemma":[0.936367,0.00455802,0.02764271,0.0005727383,0.000235505,0.02975115,0.0006008619,0.00007608551,0.0001958466],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.566926,"threshold_uncertainty_score":0.6991208,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2022913092","doi":"10.1007/s11135-013-9919-0","title":"On the choice of measures of reliability and validity in the content-analysis of texts","year":2013,"lang":"en","type":"article","venue":"Quality & Quantity","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":61,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Reliability (semiconductor); Rhetorical question; Interpretation (philosophy); Reading comprehension; Complement (music); Reading (process); Kappa; Computer science; Measure (data warehouse); Content (measure theory); Psychology; Natural language processing; Content validity; Comprehension; Linguistics; Statistics; Social psychology; Cognitive psychology; Mathematics; Psychometrics; Data mining; Philosophy","authors":[{"name":"Антон Олейник","is_ca":true},{"name":"Irina Popova","is_ca":false},{"name":"Svetlana Kirdina","is_ca":false},{"name":"Tatyana Shatalova","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6107004055274742,"gpt":0.4566016238261046,"spread":0.1540987817013695,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.541793,0.002545875,0.008126822,0.01661878,0.005150335,0.02090329,0.009393757,0.01458731,0.002089737],"category_scores_gemma":[0.7980718,0.002844259,0.005209146,0.01394614,0.02571153,0.02689298,0.01054025,0.0145451,0.001330598],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.009846215,"about_ca_system_score_gemma":0.01226202,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004079759,"about_ca_topic_score_gemma":0.004716741,"domain_scores_codex":[0.3475615,0.5517341,0.03599764,0.01454016,0.04803233,0.002134253],"domain_scores_gemma":[0.0711372,0.8797029,0.007860939,0.01708987,0.02320761,0.001001566],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.002185821,0.0006913263,0.02868072,0.004095567,0.002842804,0.0004190354,0.01870241,0.006566782,0.00353463,0.6692401,0.008258676,0.2547823],"study_design_scores_gemma":[0.0008728753,0.001227992,0.03435435,0.008274422,0.001130663,0.0007761896,0.008267,0.06552855,0.006247818,0.8629308,0.009479401,0.0009099682],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.08002254,0.0118908,0.8504657,0.02699562,0.001070525,0.003429642,0.001058546,0.0005415359,0.02452511],"genre_scores_gemma":[0.4610806,0.003294003,0.5245227,0.002612823,0.0008772577,0.005605782,0.0005927028,0.0003572896,0.001056797],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.458207,"threshold_uncertainty_score":0.5650508,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2004544084","doi":"10.1016/j.jclinepi.2006.02.006","title":"Interrater reliability of measurements of comorbid illness should be reported","year":2006,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":59,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Baycrest Hospital; Queen's University","funders":"Cancer Care Ontario","keywords":"Inter-rater reliability; Intraclass correlation; Medicine; Reliability (semiconductor); Rating scale; Comorbidity; Physical therapy; Psychometrics; Statistics; Psychiatry; Clinical psychology","authors":[{"name":"Stephen F. Hall","is_ca":true},{"name":"Patti A. Groome","is_ca":true},{"name":"David L. Streiner","is_ca":true},{"name":"Paula A. Rochon","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.7802261328157349,"gpt":0.5869670242980766,"spread":0.1932591085176584,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1318251,0.0009398888,0.003417529,0.00469615,0.002350608,0.002835242,0.001946325,0.00286654,0.001921932],"category_scores_gemma":[0.5261459,0.0009963551,0.002577439,0.003273273,0.001728507,0.003225656,0.0024189,0.003113695,0.001817773],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001246883,"about_ca_system_score_gemma":0.002963068,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002196019,"about_ca_topic_score_gemma":0.004049331,"domain_scores_codex":[0.7651232,0.1325067,0.05632435,0.00738445,0.03592323,0.002738049],"domain_scores_gemma":[0.3678989,0.3394076,0.04882221,0.0807601,0.1597924,0.003318755],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.003270912,0.0006615176,0.5829631,0.00541475,0.00303939,0.001026322,0.0201392,0.002450579,0.01579594,0.01009772,0.04911155,0.306029],"study_design_scores_gemma":[0.0003846917,0.001787012,0.8341867,0.00419249,0.001659631,0.004463231,0.00892091,0.02761507,0.03668544,0.02687668,0.05245991,0.0007682351],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"commentary","genre_scores_codex":[0.6183822,0.01036292,0.2914526,0.01105502,0.008944585,0.00466807,0.005313286,0.001928938,0.04789242],"genre_scores_gemma":[0.8796483,0.00106423,0.1087912,0.001017463,0.001068598,0.002836003,0.002196429,0.0004142421,0.002963711],"genre_candidate":"commentary","genre_consensus":null,"teacher_disagreement_score":0.8681749,"threshold_uncertainty_score":0.6971663,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2111817119","doi":"10.1016/j.jpainsymman.2009.06.013","title":"Evaluating Correlation and Interrater Reliability for Four Performance Scales in the Palliative Care Setting","year":2010,"lang":"en","type":"article","venue":"Journal of Pain and Symptom Management","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":56,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Health Sciences Centre; Sunnybrook Health Science Centre","funders":"","keywords":"Inter-rater reliability; Correlation; Medicine; Scale (ratio); Reliability (semiconductor); Kappa; Palliative care; Population; Statistics; Spearman's rank correlation coefficient; Intraclass correlation; Psychometrics; Clinical psychology; Rating scale; Nursing; Mathematics","authors":[{"name":"Jeff Myers","is_ca":true},{"name":"Kate Gardiner","is_ca":true},{"name":"Kristin Harris","is_ca":true},{"name":"Tammy Lilien","is_ca":true},{"name":"Margaret Bennett","is_ca":true},{"name":"Edward Chow","is_ca":true},{"name":"Debbie Selby","is_ca":true},{"name":"Liying Zhang","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1194752482627371,"gpt":0.3982255808639538,"spread":0.2787503326012167,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1087103,0.0007852516,0.001451911,0.003588794,0.00217878,0.002625855,0.001390869,0.001452359,0.0007089553],"category_scores_gemma":[0.2678504,0.0009638503,0.002103118,0.002468468,0.002974712,0.002482758,0.002800737,0.001807726,0.0004890064],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00184613,"about_ca_system_score_gemma":0.002598538,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002862908,"about_ca_topic_score_gemma":0.006307227,"domain_scores_codex":[0.8845154,0.07572266,0.01269136,0.005715979,0.01951552,0.001839084],"domain_scores_gemma":[0.556608,0.3579651,0.01443296,0.01386523,0.05517545,0.001953237],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002686576,0.0006251213,0.8890794,0.0007673268,0.001963377,0.0002288084,0.02598529,0.003269131,0.004165994,0.001925455,0.001164789,0.06813881],"study_design_scores_gemma":[0.0004918892,0.003406892,0.9288654,0.0004865648,0.001506479,0.0007150505,0.01513757,0.03266693,0.009254677,0.003842086,0.003299476,0.0003267844],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9734154,0.0007862201,0.02014449,0.0001530318,0.0002249345,0.0007818892,0.0002193136,0.0001011781,0.004173585],"genre_scores_gemma":[0.9868334,0.0002036814,0.01166365,0.00003993118,0.0000480851,0.0006069278,0.0002280729,0.00003786858,0.0003383761],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1087103,"threshold_uncertainty_score":0.5749219,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2099077995","doi":"10.1177/0962280215601133","title":"Assessing agreement between two measurement systems: An alternative to the limits of agreement approach","year":2015,"lang":"en","type":"article","venue":"Statistical Methods in Medical Research","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":55,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Interchangeability; Agreement; Metric (unit); Limits of agreement; Computer science; Units of measurement; Physics; Engineering","authors":[{"name":"Nathaniel T. Stevens","is_ca":true},{"name":"Stefan H. Steiner","is_ca":true},{"name":"Robert J. MacKay","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.8455312682296875,"gpt":0.6788734831139276,"spread":0.1666577851157599,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2813988,0.003244342,0.007231329,0.01592052,0.003134051,0.01252793,0.008230767,0.006203576,0.003454399],"category_scores_gemma":[0.5302305,0.002015884,0.005998513,0.01582323,0.01398283,0.01765872,0.01277285,0.01015346,0.0009714012],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005107608,"about_ca_system_score_gemma":0.007275657,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003406334,"about_ca_topic_score_gemma":0.002579288,"domain_scores_codex":[0.5175982,0.376289,0.02086416,0.02465912,0.05854621,0.00204333],"domain_scores_gemma":[0.342473,0.5630491,0.03204897,0.03796117,0.02279761,0.001670043],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001475917,0.0005524866,0.03115584,0.006220709,0.008652559,0.0004821384,0.01318524,0.03076527,0.002958579,0.5688689,0.00609168,0.3295907],"study_design_scores_gemma":[0.0002533723,0.001710406,0.01470377,0.001895689,0.001520682,0.00101864,0.00259763,0.101988,0.003240132,0.8492968,0.02118682,0.0005881195],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.006730264,0.0037189,0.9821073,0.001102171,0.0003784034,0.0005709992,0.0002052106,0.0002533529,0.004933381],"genre_scores_gemma":[0.3283771,0.002434271,0.6629106,0.001161645,0.0006371604,0.002884294,0.0003264693,0.0003340533,0.0009343741],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.2813988,"threshold_uncertainty_score":0.8861632,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2079234813","doi":"10.1111/j.0006-341x.2002.00209.x","title":"Interval Estimation for a Difference Between Intraclass Kappa Statistics","year":2002,"lang":"en","type":"article","venue":"Biometrics","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":48,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Western University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Statistics; Confidence interval; Cohen's kappa; Mathematics; Interval estimation; Kappa; Statistic; Sample size determination; Intraclass correlation; Reproducibility","authors":[{"name":"Allan Dormer","is_ca":true},{"name":"Guangyong Zou","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.4256073761305363,"gpt":0.418085093842297,"spread":0.007522282288239368,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07155238,0.001684424,0.002640531,0.01015776,0.001227233,0.003590522,0.004322316,0.002896364,0.004625821],"category_scores_gemma":[0.3717094,0.0008260179,0.002631608,0.004594629,0.002432992,0.004701082,0.004542513,0.005026207,0.001681692],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001090178,"about_ca_system_score_gemma":0.00162566,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000826223,"about_ca_topic_score_gemma":0.0005720568,"domain_scores_codex":[0.9028804,0.05897373,0.006320077,0.009172386,0.02153203,0.001121408],"domain_scores_gemma":[0.6689631,0.2766858,0.01346639,0.01936478,0.02043458,0.001085329],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00194195,0.000349776,0.02036106,0.003044674,0.001988284,0.0004114165,0.002755391,0.0326596,0.007779424,0.168248,0.01080405,0.7496563],"study_design_scores_gemma":[0.000782556,0.003058058,0.05143866,0.002593399,0.001510109,0.0038525,0.001560871,0.3658221,0.02132258,0.5055968,0.04139427,0.001068118],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.005624362,0.001034147,0.9903058,0.0001412949,0.0001664364,0.0001860576,0.0001756191,0.0006372098,0.001729031],"genre_scores_gemma":[0.1373969,0.000726314,0.8586091,0.0001877135,0.0002108737,0.001428156,0.000518573,0.0003891254,0.0005332498],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.07155238,"threshold_uncertainty_score":0.3784097,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2500917129","doi":"10.1016/j.diii.2016.05.014","title":"Agreement studies in radiology research","year":2016,"lang":"en","type":"article","venue":"Diagnostic and Interventional Imaging","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":48,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta Hospital; Université de Montréal; Hôpital Notre-Dame; Health Sciences Centre; Centre Hospitalier de l’Université de Montréal","funders":"","keywords":"Medicine; Confidence interval; Medical physics; Reliability (semiconductor); Sample size determination; Nuclear medicine; Statistics; Internal medicine","authors":[{"name":"Behzad Farzin","is_ca":true},{"name":"Jean‐Christophe Gentric","is_ca":true},{"name":"Mary Pham","is_ca":true},{"name":"Sophie Tremblay-Paquet","is_ca":true},{"name":"Lyne Brosseau","is_ca":true},{"name":"Claudie Roy","is_ca":true},{"name":"Sarah Jamali","is_ca":true},{"name":"Miguel Chagnon","is_ca":true},{"name":"Tim E. Darsaut","is_ca":true},{"name":"F Guilbert","is_ca":true},{"name":"Olivier Naggara","is_ca":false},{"name":"Jean Raymond","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.512024444147994,"gpt":0.5438569514778593,"spread":0.03183250732986531,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.5016562,0.00145614,0.004164213,0.02610896,0.005393894,0.008767208,0.006382681,0.005105689,0.004288536],"category_scores_gemma":[0.8333657,0.002671226,0.004200634,0.01891211,0.02240271,0.01703166,0.0116964,0.007238288,0.0006775729],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.006228419,"about_ca_system_score_gemma":0.009391206,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005092114,"about_ca_topic_score_gemma":0.003442822,"domain_scores_codex":[0.2251874,0.6646104,0.0342638,0.0191274,0.05463159,0.002179432],"domain_scores_gemma":[0.02385804,0.9109249,0.01868659,0.02572123,0.02006514,0.0007440507],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"theoretical_or_conceptual","study_design_gemma":"observational","study_design_scores_codex":[0.001367138,0.0008068302,0.3514411,0.009839845,0.01018393,0.0006937623,0.03707882,0.007982107,0.0008413378,0.3913778,0.003890656,0.1844967],"study_design_scores_gemma":[0.0004094513,0.002958141,0.2717995,0.01469419,0.005017526,0.004349203,0.02206278,0.0317482,0.006437837,0.5989473,0.04086218,0.0007137567],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"review","genre_scores_codex":[0.2635214,0.1388338,0.5097904,0.01081575,0.003099205,0.002358455,0.001002956,0.0002558396,0.0703222],"genre_scores_gemma":[0.9146019,0.006400105,0.07265326,0.001747393,0.001318847,0.001547048,0.0002860646,0.0001450412,0.001300375],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.4983438,"threshold_uncertainty_score":0.6145467,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2142892303","doi":"10.2466/pr0.2000.87.3f.1171","title":"Creating Comparability among Reliability Coefficients: The Case of Cronbach Alpha and Cohen Kappa","year":2000,"lang":"en","type":"article","venue":"Psychological Reports","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":44,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Winnipeg","funders":"","keywords":"Cronbach's alpha; Comparability; Kappa; Psychology; Reliability (semiconductor); Alpha (finance); Estimator; Statistics; Metric (unit); Cohen's kappa; Contrast (vision); Complement (music); Psychometrics; Social psychology; Clinical psychology; Mathematics; Computer science; Artificial intelligence; Combinatorics; Chemistry; Engineering","authors":[{"name":"Gilbert Becker","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.123497322714613,"gpt":0.4136398494609489,"spread":0.2901425267463359,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2893915,0.001940116,0.0026171,0.01343988,0.00242077,0.008759093,0.003955299,0.002650175,0.002251213],"category_scores_gemma":[0.6922681,0.001496713,0.001864432,0.01025729,0.01029712,0.01249362,0.007947391,0.005799122,0.001023831],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002995654,"about_ca_system_score_gemma":0.004985053,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002260406,"about_ca_topic_score_gemma":0.002035672,"domain_scores_codex":[0.5901139,0.2814668,0.03061114,0.031042,0.06435286,0.002413269],"domain_scores_gemma":[0.3095525,0.5167066,0.03425601,0.07215506,0.06552055,0.001809307],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0008562023,0.0001674794,0.07863238,0.00368424,0.004034626,0.0005735213,0.02429599,0.005090767,0.004601373,0.2869406,0.01468066,0.5764422],"study_design_scores_gemma":[0.0002512812,0.001267899,0.08909812,0.004478869,0.001817936,0.001909555,0.01403639,0.03601953,0.01323705,0.7534858,0.08356907,0.0008284727],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.06320585,0.004951853,0.8967443,0.002308967,0.001897838,0.001583619,0.0006063784,0.001030379,0.02767086],"genre_scores_gemma":[0.4778067,0.001170417,0.5149935,0.0006408839,0.0007666002,0.00222601,0.0004242187,0.0005149256,0.001456862],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.7106085,"threshold_uncertainty_score":0.8763068,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2353892345","doi":"10.1111/hir.12140","title":"Inter‐rater reliability of h‐index scores calculated by Web of Science and Scopus for clinical epidemiology scientists","year":2016,"lang":"en","type":"article","venue":"Health Information & Libraries Journal","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":42,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true},"ca_institutions":"Ottawa Hospital","funders":"Ottawa Hospital Research Institute","keywords":"Scopus; Rank correlation; Bibliometrics; Reliability (semiconductor); Web of science; Statistics; Spearman's rank correlation coefficient; Index (typography); Inter-rater reliability; Psychology; Medicine; Meta-analysis; MEDLINE; Mathematics; Library science; Computer science; World Wide Web; Physics; Political science; Internal medicine","authors":[{"name":"Benjamin Walker","is_ca":true},{"name":"Sepand Alavifard","is_ca":true},{"name":"Surain B. Roberts","is_ca":true},{"name":"Andrea Lanes","is_ca":true},{"name":"Tim Ramsay","is_ca":true},{"name":"Sylvain Boet","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2502676357798633,"gpt":0.4679676814020811,"spread":0.2177000456222178,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.213295,0.000696766,0.002371781,0.01416377,0.001350905,0.003308625,0.00134904,0.0009085533,0.001561278],"category_scores_gemma":[0.4192153,0.0004715266,0.002805394,0.01186874,0.001818587,0.002737998,0.004782323,0.0008656609,0.0005778433],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00171028,"about_ca_system_score_gemma":0.003075143,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002203064,"about_ca_topic_score_gemma":0.002364291,"domain_scores_codex":[0.7711523,0.1113742,0.05570934,0.01232562,0.0467209,0.002717613],"domain_scores_gemma":[0.404357,0.3301619,0.07826196,0.04104887,0.142928,0.003242193],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.003160034,0.0003591587,0.8646543,0.003323188,0.004153618,0.0001495692,0.01128333,0.002114675,0.002147241,0.001990944,0.004249251,0.1024147],"study_design_scores_gemma":[0.000432438,0.001499483,0.9522843,0.00123885,0.001847662,0.0004052682,0.004905706,0.01601311,0.006360973,0.00407562,0.01064195,0.0002946332],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9056996,0.005089752,0.06094467,0.0009490548,0.0008226528,0.004499536,0.006219162,0.0005891562,0.01518653],"genre_scores_gemma":[0.9750682,0.0005178616,0.01888081,0.00009285513,0.000175934,0.002401667,0.002087169,0.0001207627,0.0006546041],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9858362,"threshold_uncertainty_score":0.9701473,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1881569770","doi":"10.1002/9781118445112.stat05243","title":"Kappa and Its Dependence on Marginal Rates","year":2014,"lang":"en","type":"other","venue":"Wiley StatsRef: Statistics Reference Online","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":40,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Kappa; Cohen's kappa; Statistic; Statistics; Measure (data warehouse); Mathematics; Econometrics; Computer science; Data mining; Geometry","authors":[{"name":"Richard J. Cook","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1823082849611272,"gpt":0.4110886459547939,"spread":0.2287803609936667,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1601893,0.001007573,0.002702901,0.00845749,0.001954245,0.007363737,0.003909732,0.002115751,0.01057079],"category_scores_gemma":[0.6394528,0.001206575,0.002389144,0.00886359,0.01226823,0.009608658,0.006138598,0.004925571,0.002173976],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003561123,"about_ca_system_score_gemma":0.002631947,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004621143,"about_ca_topic_score_gemma":0.002457384,"domain_scores_codex":[0.7691673,0.1565474,0.01108234,0.02276102,0.03820197,0.002239952],"domain_scores_gemma":[0.1893239,0.7242617,0.01835148,0.04143479,0.02499456,0.001633632],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0006901461,0.00005702805,0.04519963,0.001434777,0.001233696,0.0002358073,0.004892434,0.01924479,0.0004585148,0.7124016,0.01416348,0.199988],"study_design_scores_gemma":[0.00004009366,0.0001255308,0.02119608,0.0008841442,0.0002346579,0.0007133152,0.0006174185,0.04747188,0.000856935,0.9131123,0.01452671,0.0002210561],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0618249,0.0121809,0.8756861,0.005682828,0.001272893,0.0003757516,0.001530617,0.0009223705,0.04052377],"genre_scores_gemma":[0.8261549,0.003751827,0.1596333,0.001092542,0.001279769,0.0008441337,0.0008242474,0.000741116,0.005678189],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.1601893,"threshold_uncertainty_score":0.8471722,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2075431957","doi":"10.1007/s10877-008-9127-y","title":"A Measure of Confidence in Bland–Altman Analysis for the Interchangeability of Two Methods of Measurement","year":2008,"lang":"en","type":"article","venue":"Journal of Clinical Monitoring and Computing","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":40,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University Health Network","funders":"","keywords":"Interchangeability; Measure (data warehouse); Confidence interval; Limits of agreement; Medicine; Bland–Altman plot; Statistics; Medical physics; Computer science; Mathematics; Data mining; Internal medicine; Nuclear medicine","authors":[{"name":"David Preiss","is_ca":true},{"name":"Joseph A. Fisher","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.6837745116735408,"gpt":0.587837256182952,"spread":0.09593725549058874,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1824326,0.001669087,0.002196364,0.006123318,0.002880333,0.005095093,0.003252754,0.002690142,0.002453907],"category_scores_gemma":[0.5294111,0.001218756,0.004089103,0.006355456,0.003654056,0.00644115,0.003896077,0.005840687,0.0008741924],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001820301,"about_ca_system_score_gemma":0.003953225,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002083073,"about_ca_topic_score_gemma":0.002485754,"domain_scores_codex":[0.7971411,0.1268227,0.02664093,0.01303366,0.03468819,0.001673518],"domain_scores_gemma":[0.3778082,0.4575313,0.03451329,0.06858841,0.06013957,0.001419225],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00446014,0.001093655,0.2340491,0.003422698,0.009145772,0.000379337,0.01189752,0.02154273,0.01451832,0.07617742,0.01914306,0.6041702],"study_design_scores_gemma":[0.001011365,0.006382846,0.3706066,0.003464725,0.0045787,0.005175058,0.003795977,0.3409198,0.06675407,0.1208953,0.07461677,0.001798918],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.05197372,0.001237995,0.9357073,0.0005125939,0.0005331933,0.001102635,0.001120798,0.001831791,0.005979891],"genre_scores_gemma":[0.4459255,0.0002752322,0.5474167,0.0003359447,0.0001756082,0.00311867,0.001148551,0.0008474817,0.0007562412],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.8175674,"threshold_uncertainty_score":0.9648074,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2140519023","doi":"10.1002/9781118445112.stat05255","title":"Receiver Operating Characteristic (<scp>ROC</scp>) Curves","year":2014,"lang":"en","type":"other","venue":"Wiley StatsRef: Statistics Reference Online","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":39,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"","keywords":"Receiver operating characteristic; Fraction (chemistry); Boundary (topology); Mathematics; Statistics; Arbitrariness; Mathematical analysis; Chromatography","authors":[{"name":"James A. Hanley","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.14698234004203,"gpt":0.3834437404836891,"spread":0.236461400441659,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0207505,0.001790515,0.001633231,0.01399378,0.00044831,0.003375844,0.002121124,0.001620865,0.06512433],"category_scores_gemma":[0.1757751,0.0004729378,0.002031621,0.01537901,0.0009136604,0.003332625,0.001683648,0.002050933,0.03678649],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001491242,"about_ca_system_score_gemma":0.001745745,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001815637,"about_ca_topic_score_gemma":0.001401019,"domain_scores_codex":[0.9739127,0.01100225,0.003819925,0.001939611,0.008836294,0.0004892241],"domain_scores_gemma":[0.864269,0.09007046,0.01236735,0.008719168,0.02370114,0.0008727949],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0007842453,0.0001481517,0.01365255,0.006273397,0.00053921,0.0004344578,0.0003739937,0.005597753,0.0009145748,0.03621374,0.4443555,0.4907125],"study_design_scores_gemma":[0.0002848368,0.000910107,0.04921104,0.006514979,0.0007908398,0.00506511,0.0005029502,0.0213976,0.008054194,0.06561205,0.8411703,0.0004860607],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02109902,0.04447591,0.5012701,0.008885007,0.003501508,0.00264943,0.1549139,0.03175704,0.231448],"genre_scores_gemma":[0.2602479,0.03245536,0.4768394,0.005312098,0.004828942,0.007338484,0.1157518,0.01642443,0.08080152],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.06512433,"threshold_uncertainty_score":0.2178626,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}