{"id":"W4416529406","doi":"10.1186/s41077-025-00396-6","title":"Ability of AI detection tools and humans to accurately identify different forms of AI-generated written content","year":2025,"lang":"en","type":"article","venue":"Advances in Simulation","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Calgary; Centre Hospitalier Universitaire de Sherbrooke; Alberta Children's Hospital","funders":"","keywords":"Reliability (semiconductor); Content (measure theory); Content analysis; Health services research","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06751171,0.0009213823,0.0009045377,0.009116062,0.001087697,0.007540087,0.001256705,0.001380234,0.004511686],"category_scores_gemma":[0.3722113,0.0004582681,0.001123252,0.003595824,0.002577156,0.005854771,0.004060737,0.001176262,0.002339467],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00119977,"about_ca_system_score_gemma":0.002089176,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007708159,"about_ca_topic_score_gemma":0.00137918,"domain_scores_codex":[0.9390177,0.02615895,0.00997904,0.005466116,0.0181794,0.001198789],"domain_scores_gemma":[0.4686572,0.3797526,0.05478631,0.02485818,0.06805642,0.003889369],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.003227412,0.0006303865,0.2812469,0.004082229,0.0009230277,0.0003175446,0.02264938,0.002514448,0.01672537,0.005620738,0.01048051,0.6515821],"study_design_scores_gemma":[0.0005310598,0.004992343,0.7178637,0.004417807,0.001529413,0.001966455,0.02441224,0.05411688,0.08361384,0.03207411,0.07306747,0.001414613],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8392496,0.002249814,0.1141709,0.001266738,0.0007437869,0.002127233,0.001531344,0.002539859,0.03612085],"genre_scores_gemma":[0.8747475,0.0008438393,0.1173541,0.0004482212,0.0002317137,0.00187008,0.001037053,0.0003632656,0.003104249],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.06751171,"threshold_uncertainty_score":0.3570403,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2063734400272602,"score_gpt":0.500212117337602,"score_spread":0.2938386773103417,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}