{"id":"W4408158553","doi":"10.1200/cci-24-00143","title":"Using a Longformer Large Language Model for Segmenting Unstructured Cancer Pathology Reports","year":2025,"lang":"en","type":"article","venue":"JCO Clinical Cancer Informatics","topic":"Topic Modeling","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo; University of British Columbia","funders":"","keywords":"Pathology; Market segmentation; Computer science; Natural language processing; Medicine; Artificial intelligence; Business","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002313405,0.001309282,0.0005078054,0.001372906,0.0004774964,0.001306742,0.00198802,0.001255446,0.004353959],"category_scores_gemma":[0.00451091,0.000596432,0.001368195,0.0008433231,0.0006406759,0.002758434,0.001120995,0.001771607,0.002887429],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001979546,"about_ca_system_score_gemma":0.002545193,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01802088,"about_ca_topic_score_gemma":0.02963447,"domain_scores_codex":[0.9992034,0.0002442131,0.00006797164,0.0003075556,0.0001209704,0.00005577949],"domain_scores_gemma":[0.9970265,0.001522647,0.0002401149,0.0002913261,0.0008312158,0.00008813121],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00129483,0.0004753349,0.01292953,0.0005035716,0.0002284002,0.0008468876,0.001218933,0.4638649,0.04032868,0.009293939,0.01914918,0.4498659],"study_design_scores_gemma":[0.00003384817,0.0001242627,0.0009827212,0.0000201192,0.00005602857,0.0001798104,0.00008245898,0.983365,0.008176924,0.00306155,0.003890149,0.0000271526],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06808569,0.0005682973,0.9123838,0.0009268952,0.0001361812,0.0003409008,0.002290505,0.01325057,0.002017204],"genre_scores_gemma":[0.5386092,0.0005986107,0.4370279,0.0007663894,0.0001205917,0.000686927,0.01021618,0.001040286,0.01093394],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01802088,"threshold_uncertainty_score":0.03583193,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0939272117815288,"score_gpt":0.4464086519327034,"score_spread":0.3524814401511746,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}