{"id":"W2050257625","doi":"10.1016/j.jclinepi.2007.10.023","title":"Reliability studies of diagnostic tests are not using enough observers for robust estimation of interobserver agreement: a simulation study","year":2008,"lang":"en","type":"article","venue":"Journal of Clinical Epidemiology","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":false,"ca_institutions":"Centre for Advancing Health Outcomes; University of British Columbia","funders":"","keywords":"Kappa; Reliability (semiconductor); Statistics; Sample (material); Variance (accounting); Cohen's kappa; Sample size determination; Variation (astronomy); Inter-rater reliability; Computer science; Population; Variable (mathematics); Econometrics; Mathematics; Medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2197331,0.00180543,0.003247483,0.001885624,0.001693878,0.003012965,0.003588215,0.005777923,0.002072226],"category_scores_gemma":[0.4984232,0.002159695,0.006172688,0.001676774,0.004283318,0.00503096,0.002701383,0.004446288,0.0004588486],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003371228,"about_ca_system_score_gemma":0.002847444,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01161506,"about_ca_topic_score_gemma":0.007295201,"domain_scores_codex":[0.8176178,0.1659139,0.005223185,0.005350474,0.00445891,0.001435663],"domain_scores_gemma":[0.09345365,0.8675121,0.01243933,0.01813311,0.007626625,0.0008351482],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.01515247,0.003397201,0.1733222,0.001856561,0.008936201,0.001336137,0.004718181,0.696141,0.002250554,0.03295272,0.004493288,0.05544339],"study_design_scores_gemma":[0.00285545,0.004900925,0.03102866,0.0005103405,0.003871363,0.001308214,0.0009082451,0.9119822,0.002272223,0.03829945,0.001741724,0.0003212476],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8185762,0.002202563,0.1720017,0.002043815,0.0001079865,0.001158386,0.0007253797,0.0002005667,0.002983468],"genre_scores_gemma":[0.9607819,0.00017435,0.03788208,0.0002414412,0.00002560315,0.0004193662,0.0002422857,0.0000402652,0.0001926467],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7802669,"threshold_uncertainty_score":0.962208,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.8782298280510391,"score_gpt":0.620131203012851,"score_spread":0.2580986250381881,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}