{"id":"W4414897380","doi":"10.2196/77061","title":"Human-Machine Agreement in Medical Ethics: Patient Autonomy Case-Based Evaluation of Large Language Models","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Autonomy; Domain (mathematical analysis); Agreement; MEDLINE; Personal autonomy; Human health","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04708526,0.001014729,0.0006794559,0.002171289,0.001267672,0.003575252,0.002483888,0.002844816,0.006542128],"category_scores_gemma":[0.2038387,0.0003441528,0.001297267,0.001227726,0.003291667,0.005477446,0.0043116,0.002648687,0.0004994665],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004881471,"about_ca_system_score_gemma":0.002276666,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004882481,"about_ca_topic_score_gemma":0.00603852,"domain_scores_codex":[0.9389945,0.0523471,0.002518223,0.001819173,0.00375011,0.0005708119],"domain_scores_gemma":[0.594737,0.379837,0.006567301,0.009041979,0.007635273,0.002181434],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.01162366,0.007002006,0.04429315,0.005304322,0.001474594,0.002445704,0.02147388,0.4510973,0.006658251,0.1008018,0.02649716,0.3213282],"study_design_scores_gemma":[0.001502828,0.002752264,0.00981469,0.0006080678,0.0003117486,0.0006239091,0.003615825,0.8851454,0.005598707,0.07484159,0.0149713,0.0002137414],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8904161,0.002054773,0.07927355,0.005202428,0.0003222901,0.00202262,0.001369877,0.0008441227,0.01849427],"genre_scores_gemma":[0.9350222,0.0001851794,0.06157353,0.0004695785,0.00005666476,0.0008584873,0.0007556994,0.00009113384,0.0009875273],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.04708526,"threshold_uncertainty_score":0.2490136,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1325686782199469,"score_gpt":0.5126770639173798,"score_spread":0.3801083856974329,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}