{"id":"W4414818872","doi":"10.1007/s11604-025-01884-5","title":"Accuracy and reproducibility of large language model measurements of liver metastases: comparison with radiologist measurements","year":2025,"lang":"en","type":"article","venue":"Japanese Journal of Radiology","topic":"Hepatocellular Carcinoma Treatment and Prognosis","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University Health Centre; McGill University; Ottawa Hospital","funders":"National Cancer Institute; National Institutes of Health","keywords":"Reproducibility; Colorectal cancer; Interpretation (philosophy); Cancer; Measure (data warehouse)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"medium","status":"direct model label, unvalidated"}],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003605996,0.0001604324,0.0009661053,0.0002145757,0.00004059252,0.000003675692,0.0001306579,0.00008141877,0.00002272769],"category_scores_gemma":[0.001226053,0.000102044,0.0001471021,0.0002107477,0.000204342,0.00009864086,0.00003744972,0.000173615,4.454379e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00006741867,"about_ca_system_score_gemma":0.0001674689,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00007371834,"about_ca_topic_score_gemma":0.00002361717,"domain_scores_codex":[0.9979889,0.0004128623,0.0007774745,0.0003282296,0.0002906922,0.0002018222],"domain_scores_gemma":[0.9980506,0.0001838636,0.0006037832,0.0005725015,0.0004909092,0.0000983295],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002000283,0.0005860262,0.8808904,0.0001823286,0.0008160865,0.0000452632,0.001653478,0.00006706869,0.1124477,0.0000150971,0.000157775,0.001138548],"study_design_scores_gemma":[0.01450832,0.004265469,0.6242445,0.0003799266,0.002560589,0.001506478,0.001989921,0.005452715,0.3447118,0.00007554962,0.00006662146,0.000238134],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9920322,0.006478177,0.0006078786,0.0002017344,0.00004977595,0.00037041,0.000008036743,0.000006949129,0.0002448743],"genre_scores_gemma":[0.9957631,0.00007554825,0.004002125,0.00007749025,0.00002293817,0.000006019775,0.000008354094,0.000007475166,0.00003695962],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2566459,"threshold_uncertainty_score":0.4161234,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1232889954669182,"score_gpt":0.337942713974256,"score_spread":0.2146537185073378,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}