{"id":"W4412163652","doi":"10.1158/1557-3265.aimachine-b007","title":"Abstract B007: TheBlueScrubs-v1: A Large-Scale Curated Dataset with ∼11 Billion Oncology Tokens for AI-Driven Cancer Research","year":2025,"lang":"en","type":"article","venue":"Clinical Cancer Research","topic":"Radiomics and Machine Learning in Medical Imaging","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Cancer; Scale (ratio); Oncology; Precision oncology; Medicine; Internal medicine; Clinical Oncology; Computer science; Computational biology; Biology; Cartography; Geography","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002779758,0.001948509,0.001024084,0.004467074,0.001753057,0.001876375,0.002671524,0.002915086,0.01471786],"category_scores_gemma":[0.01389842,0.0006275489,0.00165314,0.003562731,0.001129392,0.001787424,0.003261079,0.002426671,0.0225943],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001575766,"about_ca_system_score_gemma":0.004001665,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01441477,"about_ca_topic_score_gemma":0.02797714,"domain_scores_codex":[0.9971828,0.0007612861,0.0003150646,0.0008615227,0.0006524061,0.0002269686],"domain_scores_gemma":[0.9921616,0.00342587,0.0005167443,0.001530729,0.001714681,0.0006504945],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0007879137,0.0003387977,0.006833628,0.003658175,0.0001994249,0.0006940938,0.0004179704,0.004625194,0.01549429,0.00210304,0.9156594,0.04918808],"study_design_scores_gemma":[0.001177345,0.0005982335,0.02868375,0.001080283,0.0002993066,0.001630857,0.0008581182,0.03633344,0.02558158,0.005690124,0.8977994,0.0002676303],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.02440696,0.002670615,0.009642882,0.001974967,0.0006461253,0.0006293496,0.9378158,0.01650408,0.00570909],"genre_scores_gemma":[0.01348779,0.0002926922,0.01522706,0.0004507224,0.00009764936,0.0007128653,0.967172,0.0008378612,0.00172136],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.01471786,"threshold_uncertainty_score":0.04923612,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2354833862385869,"score_gpt":0.6182858435125832,"score_spread":0.3828024572739963,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}