{"id":"W4416872437","doi":"10.1016/j.rhum.2025.10.431","title":"Évaluation de la qualité des questions d’examens aux formats docimologiques variés générées par l’intelligence artificielle générative : une aide pour la créativité et un gain de temps pour les enseignants ?","year":2025,"lang":"fr","type":"article","venue":"Revue du Rhumatisme","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"Hotel Dieu Hospital","funders":"","keywords":"Questions and answers; Research methodology; Lexico","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.006962441,0.0004914358,0.0006977225,0.0003687638,0.001013944,0.0002095268,0.0003077608,0.0008070032,0.000463289],"category_scores_gemma":[0.007469859,0.0005310214,0.0001974171,0.0008018874,0.0008656426,0.0004483115,0.00009707197,0.001050866,0.000251821],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009315772,"about_ca_system_score_gemma":0.003241801,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01529555,"about_ca_topic_score_gemma":0.00197381,"domain_scores_codex":[0.9912195,0.005392951,0.001479098,0.0006076322,0.0003107839,0.0009900086],"domain_scores_gemma":[0.9888449,0.009139902,0.0004951588,0.000545738,0.0006636452,0.0003106516],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00008900539,0.0008984532,0.02512067,0.001465446,0.000189486,0.00009428681,0.1348392,0.005843545,0.002749135,0.320035,0.001981159,0.5066946],"study_design_scores_gemma":[0.0001902074,0.0004439978,0.04940968,0.01000376,0.0005063205,0.0004420061,0.0856504,0.08770903,0.08691137,0.6751192,0.002909916,0.0007041222],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5931279,0.008003488,0.3639917,0.02427715,0.0005850171,0.0008959599,0.00007308066,0.0001986584,0.008847066],"genre_scores_gemma":[0.9473618,0.01216112,0.033316,0.001022388,0.0005223663,0.0003091056,0.000097831,0.00005871459,0.005150707],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5059905,"threshold_uncertainty_score":0.9997141,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1885168460368752,"score_gpt":0.4275571090114395,"score_spread":0.2390402629745643,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}