{"id":"W4398216167","doi":"10.1186/s12958-024-01232-8","title":"Testing the generalizability and effectiveness of deep learning models among clinics: sperm detection as a pilot study","year":2024,"lang":"en","type":"article","venue":"Reproductive Biology and Endocrinology","topic":"Reproductive Biology and Fertility","field":"Medicine","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"CReATe Fertility Centre; University of Toronto","funders":"National Key Research and Development Program of China; Shenzhen Science and Technology Innovation Program; Basic and Applied Basic Research Foundation of Guangdong Province; Chinese University of Hong Kong; National Natural Science Foundation of China; Chinese University of Hong Kong, Shenzhen","keywords":"Generalizability theory; Artificial intelligence; Computer science; Deep learning; Preprocessor; Sample (material); Machine learning; Intraclass correlation; Object detection; Pattern recognition (psychology); Statistics; Reproducibility; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002142749,0.0002224136,0.0005404781,0.0001164569,0.0002323475,0.00000838745,0.00007465604,0.0001254811,0.000007617991],"category_scores_gemma":[0.002303957,0.0001435284,0.00005196322,0.0002427768,0.001766482,0.0001000198,0.0001803099,0.000658816,0.000003213516],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004386974,"about_ca_system_score_gemma":0.00004473889,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004291712,"about_ca_topic_score_gemma":0.0000176483,"domain_scores_codex":[0.996137,0.001763723,0.0003714169,0.001356645,0.00005553615,0.0003156346],"domain_scores_gemma":[0.9979545,0.001159865,0.00009650454,0.0005271237,0.0002093159,0.0000527302],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00502997,0.0003339912,0.8489585,0.0001955884,0.0004200415,0.00002548257,0.0007809275,0.00003527516,0.1116026,0.001054473,3.04488e-7,0.03156288],"study_design_scores_gemma":[0.0006144001,0.009778066,0.9644812,0.00002808043,0.0002070065,0.0005808427,0.000758111,0.0006213689,0.006804192,0.01594599,0.00005412129,0.0001266225],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9900652,0.007146969,0.0005615268,0.0001716174,0.0004306443,0.001093737,0.000002135288,0.0001130075,0.0004151305],"genre_scores_gemma":[0.9992234,0.0002592282,0.00006826155,0.00001795557,0.0002691615,0.0001114367,0.000005224402,0.00001532133,0.0000299918],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1155227,"threshold_uncertainty_score":0.6508678,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06820193175808054,"score_gpt":0.3389963059083316,"score_spread":0.270794374150251,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}