{"id":"W4416872437","doi":"10.1016/j.rhum.2025.10.431","title":"Évaluation de la qualité des questions d’examens aux formats docimologiques variés générées par l’intelligence artificielle générative : une aide pour la créativité et un gain de temps pour les enseignants ?","year":2025,"lang":"fr","type":"article","venue":"Revue du Rhumatisme","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"Hotel Dieu Hospital","funders":"","keywords":"Questions and answers; Research methodology; Lexico","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03795189,0.001024253,0.001073948,0.003214725,0.0005913447,0.004799524,0.001721447,0.002307489,0.005026551],"category_scores_gemma":[0.1998129,0.0004811259,0.001415958,0.00134751,0.001110857,0.003168644,0.002231041,0.001457543,0.002622487],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001549663,"about_ca_system_score_gemma":0.001303638,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002698658,"about_ca_topic_score_gemma":0.001442479,"domain_scores_codex":[0.9538627,0.02598401,0.003528797,0.003834545,0.01168273,0.001107254],"domain_scores_gemma":[0.708088,0.2338942,0.008710253,0.006966779,0.03973527,0.002605525],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.007087627,0.002325262,0.2579572,0.002433649,0.001271378,0.0004280813,0.01667106,0.007085525,0.03482961,0.002949879,0.009405062,0.6575555],"study_design_scores_gemma":[0.001373168,0.0110117,0.6657775,0.001767973,0.001954949,0.002612294,0.01705792,0.06627146,0.1322949,0.00568263,0.09355409,0.0006413814],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9368696,0.002504584,0.04376811,0.001760875,0.0003928896,0.000772816,0.001556345,0.001940196,0.01043473],"genre_scores_gemma":[0.9478238,0.0006165415,0.04058203,0.0006923922,0.0001653105,0.0008865024,0.001964564,0.0003626314,0.006906294],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03795189,"threshold_uncertainty_score":0.2007111,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1885168460368752,"score_gpt":0.4275571090114395,"score_spread":0.2390402629745643,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}