{"id":"W4400137488","doi":"10.21203/rs.3.rs-4559295/v1","title":"Bias in Histopathology Datasets: A Comprehensive Investigation on Possible Factors","year":2024,"lang":"en","type":"preprint","venue":"Research Square","topic":"AI in cancer detection","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Wilfrid Laurier University; Brock University; Ontario Tech University","funders":"","keywords":"Histopathology; Computer science; Medicine; Pathology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01897035,0.001024674,0.001090654,0.001780494,0.001032247,0.001931605,0.001317777,0.001196993,0.0009514033],"category_scores_gemma":[0.06575111,0.0003366489,0.0008190825,0.002426223,0.001388521,0.001662467,0.001860926,0.0009913146,0.0006436119],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001241649,"about_ca_system_score_gemma":0.001186406,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00337965,"about_ca_topic_score_gemma":0.004830146,"domain_scores_codex":[0.9853256,0.004025456,0.001703593,0.003755233,0.004582156,0.0006079677],"domain_scores_gemma":[0.954398,0.02843768,0.004032355,0.006844852,0.005795237,0.0004917983],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002435258,0.0005261278,0.5636323,0.002987673,0.002213943,0.001383761,0.001194295,0.04834723,0.03796286,0.006964909,0.04651701,0.2858347],"study_design_scores_gemma":[0.0003199363,0.001043005,0.4968675,0.001090456,0.001278814,0.008512727,0.001731444,0.2340669,0.112309,0.04628506,0.09614816,0.0003471737],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8593967,0.01593835,0.09749883,0.003873347,0.0009713969,0.0004634963,0.0127338,0.002963824,0.006160282],"genre_scores_gemma":[0.9395142,0.001857521,0.03028898,0.001265108,0.0002476631,0.0002299208,0.0243745,0.00061311,0.001609052],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9810296,"threshold_uncertainty_score":0.100326,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.272354271637148,"score_gpt":0.426866932588683,"score_spread":0.154512660951535,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}