{"id":"W4414818872","doi":"10.1007/s11604-025-01884-5","title":"Accuracy and reproducibility of large language model measurements of liver metastases: comparison with radiologist measurements","year":2025,"lang":"en","type":"article","venue":"Japanese Journal of Radiology","topic":"Hepatocellular Carcinoma Treatment and Prognosis","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University Health Centre; McGill University; Ottawa Hospital","funders":"National Cancer Institute; National Institutes of Health","keywords":"Reproducibility; Colorectal cancer; Interpretation (philosophy); Cancer; Measure (data warehouse)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"medium","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01132975,0.0005486586,0.0006947592,0.001904698,0.000323737,0.001421715,0.0008366155,0.000694327,0.0006940388],"category_scores_gemma":[0.04463953,0.0003519695,0.0007422698,0.000819549,0.0006529241,0.0009328546,0.001174232,0.0002759795,0.0005503333],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004834849,"about_ca_system_score_gemma":0.0002919039,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001342511,"about_ca_topic_score_gemma":0.002022675,"domain_scores_codex":[0.9884251,0.004973553,0.001381565,0.002737487,0.002214504,0.0002677627],"domain_scores_gemma":[0.9729222,0.01185043,0.005517025,0.005858687,0.003490297,0.0003613961],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001424641,0.00006553902,0.9501897,0.0002010111,0.00064668,0.000159956,0.0008819295,0.002176364,0.006618306,0.00008824735,0.000441924,0.03710579],"study_design_scores_gemma":[0.00008864659,0.0007823359,0.9624866,0.00006835029,0.0004958239,0.001914078,0.0006454278,0.02042331,0.01119511,0.0003471595,0.001479052,0.00007409002],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9789519,0.001104661,0.01705419,0.00007245303,0.00005014446,0.00005008209,0.000608096,0.0005019146,0.001606544],"genre_scores_gemma":[0.9965755,0.0000692461,0.002803407,0.00002017465,0.0000161115,0.0000198382,0.0003006394,0.00004981743,0.0001451815],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9886702,"threshold_uncertainty_score":0.05991817,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1232889954669182,"score_gpt":0.337942713974256,"score_spread":0.2146537185073378,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}