{"id":"W4404936882","doi":"10.1101/2024.11.29.24318211","title":"Methods for analytical validation of novel digital clinical measures: A simulation study","year":2024,"lang":"en","type":"preprint","venue":"medRxiv","topic":"Statistical Methods in Clinical Trials","field":"Mathematics","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"Arnold Ventures","keywords":"Computer science; Model validation; Reliability engineering; Data science; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","metaepi_narrow"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.03052012,0.0004594681,0.002241028,0.0002289691,0.00004264843,0.0001793437,0.0006228805,0.0007950232,0.00004848136],"category_scores_gemma":[0.5007122,0.0003794784,0.001062284,0.0003168975,0.0002439097,0.00004925978,0.001137519,0.001238971,0.00001293701],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00007613375,"about_ca_system_score_gemma":0.0002559783,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000002743934,"about_ca_topic_score_gemma":8.305987e-7,"domain_scores_codex":[0.9907277,0.00248565,0.004356018,0.001269334,0.0008157251,0.0003455847],"domain_scores_gemma":[0.7996981,0.1972403,0.0009725759,0.001170627,0.0007282947,0.0001901382],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.003412516,0.0312097,0.05162847,0.01155022,0.01108756,0.00003219477,0.002184458,0.009659863,0.0002309298,0.2007074,0.001287489,0.6770092],"study_design_scores_gemma":[0.001371943,0.0005138065,0.000673093,0.0003127982,0.001856604,5.555839e-7,0.00006439078,0.163598,0.0001861723,0.8308592,0.0002338198,0.0003295897],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1268077,0.00003568179,0.866296,0.0001242235,0.002654691,0.003071731,0.0004687492,0.0001571358,0.0003841202],"genre_scores_gemma":[0.36453,0.000003147704,0.6344377,0.00001299085,0.0006428151,0.0001706729,0.00001122519,0.00008351282,0.0001078771],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.6766796,"threshold_uncertainty_score":0.9998657,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.8446405011541336,"score_gpt":0.7065212277254581,"score_spread":0.1381192734286755,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}