{"id":"W4406061941","doi":"10.1016/j.lungcan.2025.108080","title":"Assessing the feasibility and external validity of natural language processing-extracted data for advanced lung cancer patients","year":2025,"lang":"en","type":"article","venue":"Lung Cancer","topic":"Lung Cancer Research Studies","field":"Medicine","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"Roche (Canada); University Health Network; Systems, Applications & Products in Data Processing (Canada); Princess Margaret Cancer Centre","funders":"Princess Margaret Cancer Foundation; F. Hoffmann-La Roche","keywords":"Medicine; Lung cancer; Intensive care medicine; Natural language processing; Medical physics; Oncology; Computer science","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000422873,0.0001821241,0.0003801832,0.00006267449,0.0002338861,0.00006956852,0.0003157322,0.00005809402,0.0000287398],"category_scores_gemma":[0.0007006282,0.0001184851,0.00005560672,0.0002856174,0.0002165635,0.0004427401,0.0003332151,0.0003136946,6.276658e-8],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005356801,"about_ca_system_score_gemma":0.0006971786,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007290661,"about_ca_topic_score_gemma":0.00064984,"domain_scores_codex":[0.9983646,0.00006964859,0.0003083546,0.0005007716,0.0004107065,0.0003459069],"domain_scores_gemma":[0.9984044,0.0002608591,0.0001840646,0.0005955214,0.0004908086,0.00006434674],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0005469078,0.0001410481,0.9009616,0.004004566,0.0002499328,0.000002270355,0.0007247851,0.000007969536,0.00585934,0.000009175076,0.005135969,0.08235639],"study_design_scores_gemma":[0.004028474,0.00007197745,0.9661036,0.0025257,0.0006133138,9.793739e-7,0.0003730268,0.02182245,0.003105758,0.00002385065,0.001154236,0.0001766099],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9102039,0.084753,0.0004859866,0.001603882,0.000538203,0.00179135,0.0003811691,0.00004260739,0.000199919],"genre_scores_gemma":[0.9970297,0.0007677796,0.0005521806,0.000326738,0.0001857191,0.0003174373,0.00007119414,0.00001988407,0.0007293359],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.08682585,"threshold_uncertainty_score":0.4831681,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06031855068028288,"score_gpt":0.4893047198645877,"score_spread":0.4289861691843049,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}