{"id":"W4416181902","doi":"10.1038/s41598-025-23461-6","title":"Development of a machine learning model for automatic data extraction from breast cancer pathology reports","year":2025,"lang":"en","type":"article","venue":"Scientific Reports","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo; University of British Columbia; University of British Columbia Hospital","funders":"Faculty of Medicine, University of British Columbia","keywords":"Pipeline (software); Scalability; Data extraction; Breast cancer; Human breast; Information extraction; Big data; Labeled data","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003915275,0.0007461047,0.0006921056,0.001974947,0.0005211296,0.001549393,0.001679054,0.00112319,0.001176412],"category_scores_gemma":[0.009352474,0.0004632039,0.001242676,0.001359484,0.000324871,0.001486455,0.0007121385,0.001449998,0.001193826],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001683748,"about_ca_system_score_gemma":0.003707564,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01795025,"about_ca_topic_score_gemma":0.02663168,"domain_scores_codex":[0.9991434,0.0002256746,0.0001111019,0.0002436857,0.0002177452,0.00005834423],"domain_scores_gemma":[0.9953945,0.003142381,0.0002342337,0.0002361314,0.0009103002,0.00008239244],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002570767,0.0005196063,0.02885789,0.0005454335,0.0002261128,0.0004370834,0.000501802,0.3384857,0.01668238,0.006751038,0.01904156,0.5876944],"study_design_scores_gemma":[0.00001058299,0.00003384084,0.001179188,0.00002150517,0.00002553327,0.00005941813,0.00003557193,0.9893985,0.00408269,0.002298993,0.002840533,0.0000135849],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.04909987,0.0006472163,0.9344628,0.001597674,0.0001032558,0.0005404478,0.00324642,0.008937111,0.001365124],"genre_scores_gemma":[0.2697448,0.0005106373,0.7165215,0.0004804053,0.0001190536,0.0009202216,0.008536566,0.0002010788,0.002965866],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01795025,"threshold_uncertainty_score":0.0356915,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04661846175580905,"score_gpt":0.3170582380593819,"score_spread":0.2704397763035729,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}