{"id":"W7108079106","doi":"10.1007/s43681-025-00906-2","title":"The devil is in the details: using machine-learning to scrutinize “state-of-the-art” language models’ responses to public inquiries across 3 continents","year":2025,"lang":"en","type":"article","venue":"AI and Ethics","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":false,"ca_institutions":"École Nationale d'Administration Publique","funders":"Social Sciences and Humanities Research Council","keywords":"Indigenous; Sample (material); Field (mathematics); Quality (philosophy); Advice (programming); Comparative research; Variety (cybernetics); Public policy","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03636647,0.0002799784,0.0004552556,0.002780089,0.003158905,0.008617197,0.001614512,0.002810045,0.002228824],"category_scores_gemma":[0.1688309,0.0002905246,0.0005630906,0.002727599,0.008389727,0.008611858,0.004661409,0.005383222,0.0008594249],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003073052,"about_ca_system_score_gemma":0.003793746,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0248183,"about_ca_topic_score_gemma":0.01979049,"domain_scores_codex":[0.9733396,0.02088477,0.0009395648,0.001175379,0.002854,0.0008066447],"domain_scores_gemma":[0.8806347,0.0828879,0.008085459,0.01608489,0.01116288,0.001144197],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"observational","study_design_scores_codex":[0.0009898251,0.0004636901,0.2915986,0.0004015335,0.0005726437,0.0009277035,0.3144344,0.01484532,0.003963924,0.2125611,0.03212509,0.1271162],"study_design_scores_gemma":[0.00008987479,0.0005344161,0.1277748,0.001130445,0.0003087764,0.0007605239,0.4207778,0.09998718,0.01007045,0.1768022,0.161248,0.0005156489],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8644006,0.000942704,0.02060499,0.07420489,0.0007429157,0.000137265,0.0008139787,0.000182906,0.03796965],"genre_scores_gemma":[0.9852929,0.0002914221,0.004946691,0.007383518,0.0001264816,0.00005537622,0.0003444114,0.0001061528,0.001453048],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03636647,"threshold_uncertainty_score":0.1923266,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2726920714253809,"score_gpt":0.5012050833285081,"score_spread":0.2285130119031272,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}