{"id":"W4385694112","doi":"10.1159/000531054","title":"Clinical Validation of Novel Digital Measures: Statistical Methods for Reliability Evaluation","year":2023,"lang":"en","type":"review","venue":"Digital Biomarkers","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"Bayer (Canada)","funders":"","keywords":"Reliability (semiconductor); Categorical variable; Computer science; Reliability engineering; Measure (data warehouse); Data mining; Machine learning; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.119369,0.001712715,0.004555145,0.008493403,0.000523366,0.004513093,0.003394578,0.003116176,0.002431801],"category_scores_gemma":[0.2322037,0.0008978162,0.002710982,0.006707411,0.005308757,0.0039902,0.002680867,0.00576652,0.00139578],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002818782,"about_ca_system_score_gemma":0.0066452,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001646955,"about_ca_topic_score_gemma":0.00153506,"domain_scores_codex":[0.9007214,0.0630367,0.009480616,0.004561469,0.02177402,0.0004258351],"domain_scores_gemma":[0.5872821,0.3585245,0.01841159,0.01088508,0.0241258,0.0007709349],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.000128,0.0001044515,0.004525516,0.03418905,0.001437325,0.00009282927,0.0005333035,0.003494672,0.0009467474,0.05293293,0.01171525,0.8899],"study_design_scores_gemma":[0.0002672118,0.001620675,0.02567813,0.1105682,0.004599842,0.003123467,0.001179633,0.03533474,0.007965479,0.3173973,0.4914579,0.0008073913],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"review","genre_gemma":"methods","genre_scores_codex":[0.001583672,0.7217264,0.2624697,0.007999169,0.001410924,0.0006299551,0.0005599328,0.0002310024,0.003389218],"genre_scores_gemma":[0.05606026,0.5706941,0.3587185,0.004861071,0.004354468,0.003274842,0.0007847323,0.0002124415,0.001039563],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.119369,"threshold_uncertainty_score":0.6312912,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.6501770228660378,"score_gpt":0.6044108355425473,"score_spread":0.04576618732349058,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}