{"id":"W4415973317","doi":"10.2196/73605","title":"Large Language Model Versus Manual Review for Clinical Data Curation in Breast Cancer: Retrospective Comparative Study","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"AI in cancer detection","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Data curation; Data extraction; Data quality; Scalability; MEDLINE; Quality (philosophy); Information extraction","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03409275,0.0006189311,0.001145697,0.003972775,0.0006305141,0.001839743,0.001181656,0.0006815039,0.001625652],"category_scores_gemma":[0.08509908,0.0005585981,0.001620115,0.002960808,0.0008740966,0.002861928,0.001931475,0.0006075103,0.000614785],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001779294,"about_ca_system_score_gemma":0.002200886,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002297053,"about_ca_topic_score_gemma":0.002806755,"domain_scores_codex":[0.9542416,0.02943903,0.004615198,0.004623936,0.00618916,0.0008910873],"domain_scores_gemma":[0.8928307,0.05992871,0.0222389,0.009463302,0.01379396,0.001744486],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.007734848,0.001470517,0.9173735,0.001547823,0.001107749,0.0004706784,0.003722455,0.000610611,0.0008135724,0.0002684761,0.001264867,0.06361485],"study_design_scores_gemma":[0.001188537,0.01585047,0.9463975,0.0009208413,0.003061648,0.003711132,0.008792421,0.01043209,0.002329992,0.0007050263,0.006378107,0.0002321832],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9917966,0.002307125,0.003759079,0.0001428587,0.00004358342,0.0006504934,0.0004130521,0.00005152885,0.00083553],"genre_scores_gemma":[0.9941531,0.0006987805,0.003413912,0.0001436827,0.00005775618,0.0007030361,0.0006050259,0.00003756589,0.000187125],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9659073,"threshold_uncertainty_score":0.1803018,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1057282937158271,"score_gpt":0.4951944393852492,"score_spread":0.389466145669422,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}