{"id":"W4411548986","doi":"10.2139/ssrn.5311193","title":"Benchmarking Clinical Prediction Problems on Observational Databases","year":2025,"lang":"en","type":"preprint","venue":"SSRN Electronic Journal","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Benchmarking; Observational study; Database; Computer science; Data mining; Data science; Statistics; Business; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02923535,0.001725806,0.002534078,0.003974664,0.0007048331,0.003463912,0.003246266,0.002997468,0.003223008],"category_scores_gemma":[0.1246284,0.0008321115,0.001634161,0.003620717,0.001278588,0.002885778,0.002963683,0.002530091,0.0007291993],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001658184,"about_ca_system_score_gemma":0.00361468,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00761683,"about_ca_topic_score_gemma":0.004918021,"domain_scores_codex":[0.9811296,0.01157875,0.002056082,0.002662414,0.001915509,0.0006576813],"domain_scores_gemma":[0.856096,0.1206494,0.003918627,0.01063783,0.005971797,0.002726425],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"observational","study_design_scores_codex":[0.003269627,0.002722561,0.1141585,0.00105179,0.001192077,0.0004651581,0.0002838506,0.66061,0.001013022,0.008988651,0.01952507,0.1867196],"study_design_scores_gemma":[0.0002510368,0.00043787,0.007457376,0.00009016345,0.0001225218,0.0001509389,0.0001345279,0.9734224,0.0007616968,0.01612648,0.001027865,0.00001720409],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7870008,0.005819281,0.1817707,0.004998718,0.0008210979,0.0007205129,0.01250436,0.002611129,0.003753478],"genre_scores_gemma":[0.9220504,0.0009172498,0.0579557,0.0003204899,0.0003305546,0.0002321151,0.01717649,0.0001236349,0.0008934572],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02923535,"threshold_uncertainty_score":0.1546131,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1050535358908832,"score_gpt":0.3880925681081164,"score_spread":0.2830390322172333,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}