{"id":"W7114920428","doi":"10.2196/69707","title":"Using Large Language Models to Summarize Evidence in Biomedical Articles: Exploratory Comparison Between AI- and Human-Annotated Bibliographies","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Chatbot; Context (archaeology); Task (project management); Quality (philosophy); Language model; Exploratory research","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1491597,0.001149306,0.001619487,0.02323157,0.001586314,0.008030099,0.002269529,0.0014095,0.002864696],"category_scores_gemma":[0.5214439,0.0009659279,0.003323657,0.01536779,0.002575944,0.008442649,0.005819223,0.001622422,0.0005422796],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004685606,"about_ca_system_score_gemma":0.004981556,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004015294,"about_ca_topic_score_gemma":0.01163666,"domain_scores_codex":[0.8347914,0.1269488,0.01640913,0.009005918,0.01214322,0.0007015546],"domain_scores_gemma":[0.1597552,0.7757819,0.03834797,0.01394704,0.01118064,0.0009872509],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.006630328,0.001695664,0.3517997,0.03192125,0.01021256,0.001937304,0.1165963,0.02764047,0.007446582,0.007858197,0.008911137,0.4273504],"study_design_scores_gemma":[0.002880605,0.005483015,0.4320078,0.01859048,0.01325679,0.003080802,0.07599763,0.3287548,0.01355318,0.06060888,0.04433757,0.001448465],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7599861,0.008501939,0.198878,0.002410121,0.0001871591,0.008663914,0.00976208,0.0034577,0.008152946],"genre_scores_gemma":[0.8043821,0.001087212,0.1830968,0.0003165516,0.00008259103,0.00626238,0.00398683,0.0002565303,0.0005290137],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8508403,"threshold_uncertainty_score":0.7888413,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5636217479071519,"score_gpt":0.6090546913221788,"score_spread":0.04543294341502691,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}