{"id":"W4379388771","doi":"10.26434/chemrxiv-2023-q11q4","title":"Real-World Molecular Out-Of-Distribution: Specification and Investigation","year":2023,"lang":"en","type":"preprint","venue":"ChemRxiv","topic":"Computational Drug Discovery Methods","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université Laval","funders":"Mitacs","keywords":"Computer science; Benchmark (surveying); Protocol (science); Calibration; Generalization; Software deployment; Code (set theory); Mood; Sample (material); Set (abstract data type); Covariate; Source code; Distribution (mathematics); Data mining; Machine learning; Artificial intelligence; Software engineering; Statistics; Mathematics; Programming language; Psychology","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0241429,0.0009986146,0.001103528,0.0007527554,0.0007568536,0.002498565,0.00314296,0.002285484,0.00173638],"category_scores_gemma":[0.1050094,0.0005828531,0.00123472,0.0008441166,0.002844559,0.003533517,0.003590593,0.003692306,0.000309551],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002292965,"about_ca_system_score_gemma":0.001712822,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001837647,"about_ca_topic_score_gemma":0.001318879,"domain_scores_codex":[0.9896375,0.005885696,0.0004002958,0.001729513,0.001806486,0.0005404035],"domain_scores_gemma":[0.9258873,0.05827559,0.004203474,0.008068072,0.002839253,0.0007263436],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006423473,0.0004776847,0.01758933,0.0006802116,0.0002014164,0.0006107434,0.0004631462,0.7903047,0.006242268,0.1266999,0.007517193,0.04857111],"study_design_scores_gemma":[0.00007320425,0.0002573955,0.00264888,0.00007890763,0.00002625599,0.0002893189,0.0001406361,0.9129212,0.003948378,0.07716184,0.002416865,0.00003713651],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1779219,0.001108439,0.8111237,0.003269615,0.0001480342,0.0003965116,0.0008690984,0.0008143801,0.004348272],"genre_scores_gemma":[0.8445972,0.0006941343,0.1498646,0.001074661,0.0001382047,0.0005562395,0.001562786,0.0002230035,0.001289245],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0241429,"threshold_uncertainty_score":0.1276814,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08792836779937473,"score_gpt":0.337564671848105,"score_spread":0.2496363040487302,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}