{"id":"W4411969915","doi":"10.1101/2025.06.26.661884","title":"Novel binning-based methods for model fitting and data splitting improved machine learning imbalanced data","year":2025,"lang":"en","type":"preprint","venue":"bioRxiv (Cold Spring Harbor Laboratory)","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Machine learning; Artificial intelligence; Data mining; Algorithm","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006038726,0.001581349,0.001446907,0.001730092,0.0007261719,0.001632168,0.002301157,0.001338507,0.001872175],"category_scores_gemma":[0.01532271,0.000740662,0.001623908,0.001667324,0.0008512374,0.002239846,0.002603726,0.003173395,0.0007687302],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001385785,"about_ca_system_score_gemma":0.001739515,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004753896,"about_ca_topic_score_gemma":0.005053456,"domain_scores_codex":[0.9977932,0.0008905444,0.0001931561,0.0004526016,0.0005514176,0.0001190574],"domain_scores_gemma":[0.9942761,0.0028004,0.000461419,0.00110708,0.001158517,0.0001965127],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004646872,0.0002652154,0.004656055,0.0001904762,0.000229923,0.0001315546,0.0003183962,0.7239115,0.0109443,0.01340792,0.003521239,0.2419588],"study_design_scores_gemma":[0.000007138653,0.00001881324,0.0002430925,0.000006481507,0.000006638813,0.00001391578,0.00001275297,0.9937754,0.001654267,0.00369416,0.0005582235,0.000009210525],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01249345,0.0001696216,0.9849547,0.0001242186,0.00004029014,0.00005621309,0.0001197495,0.001769447,0.0002723193],"genre_scores_gemma":[0.2520176,0.0001921429,0.7440823,0.0002699511,0.00005283185,0.0003160347,0.001160339,0.0007927534,0.001116065],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.006038726,"threshold_uncertainty_score":0.03193623,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06597440103141576,"score_gpt":0.3401000506503915,"score_spread":0.2741256496189757,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}