{"id":"W2050084558","doi":"10.1016/j.healthpol.2004.05.004","title":"The consistency of panelists’ appropriateness ratings: do experts produce clinically logical scores for rectal cancer treatment?","year":2004,"lang":"en","type":"article","venue":"Health Policy","topic":"Colorectal Cancer Surgical Treatments","field":"Medicine","cited_by":5,"is_retracted":false,"has_abstract":false,"ca_institutions":"Institute for Clinical Evaluative Sciences; Princess Margaret Cancer Centre; University of Toronto","funders":"National Cancer Institute; Ontario Ministry of Health and Long-Term Care","keywords":"Medicine; Consistency (knowledge bases); Rating scale; Appropriateness criteria; Colorectal cancer; Cancer; Statistics; Internal medicine; Radiology; Mathematics; Artificial intelligence; Computer science","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3357733,0.0007705233,0.002046377,0.006210217,0.001711936,0.004739758,0.002659539,0.004070563,0.002146566],"category_scores_gemma":[0.6951016,0.00109686,0.002630594,0.003986704,0.003582978,0.004358861,0.003245602,0.003050686,0.0007433677],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003323312,"about_ca_system_score_gemma":0.003635254,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004349034,"about_ca_topic_score_gemma":0.007726825,"domain_scores_codex":[0.5761389,0.3293976,0.03944543,0.01174936,0.04002503,0.003243815],"domain_scores_gemma":[0.1760869,0.6818004,0.04491557,0.02866113,0.06540352,0.003132474],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002963376,0.0003309134,0.8451214,0.001209239,0.006154648,0.000264783,0.007347935,0.005941582,0.001350779,0.005427476,0.02200098,0.1018869],"study_design_scores_gemma":[0.0010337,0.001202595,0.9141774,0.001376249,0.002315046,0.0008089655,0.00513664,0.03342824,0.004089027,0.01944832,0.01656692,0.0004169775],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8181762,0.008495936,0.08399855,0.03351759,0.002244444,0.001849624,0.003913376,0.0003688389,0.04743545],"genre_scores_gemma":[0.971346,0.0004537879,0.02293042,0.003002767,0.0004130828,0.0003928951,0.0010448,0.00008627957,0.000330043],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.6642267,"threshold_uncertainty_score":0.8191097,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1100990112215007,"score_gpt":0.4554487002357484,"score_spread":0.3453496890142477,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}