{"id":"W4404162510","doi":"10.1002/ffo2.199","title":"Calibration Feedback With the Practical Scoring Rule Does Not Improve Calibration of Confidence","year":2024,"lang":"en","type":"article","venue":"Futures & Foresight Science","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Defence Research and Development Canada; Université du Québec à Montréal","funders":"","keywords":"Calibration; Computer science; Confidence interval; Artificial intelligence; Statistics; Machine learning; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.002228403,0.0004217797,0.000591787,0.0002601398,0.0001860337,0.0004782879,0.0008082819,0.0005402911,0.007592931],"category_scores_gemma":[0.02677997,0.0002212619,0.0001827714,0.0001712778,0.0005287633,0.0007844424,0.0005659215,0.0007570263,0.0009607725],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000233799,"about_ca_system_score_gemma":0.0004038067,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008983343,"about_ca_topic_score_gemma":0.0007337526,"domain_scores_codex":[0.9982448,0.0007428536,0.0001563665,0.0003369284,0.0004105981,0.0001085394],"domain_scores_gemma":[0.9792215,0.01331949,0.002894026,0.00280897,0.0007777984,0.000978149],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.02681757,0.02308841,0.03713769,0.001158028,0.0002577645,0.0001278822,0.001822656,0.01139725,0.1871818,0.001500972,0.004871187,0.7046388],"study_design_scores_gemma":[0.006036704,0.1196235,0.5422369,0.0009873953,0.0006547606,0.0006641994,0.001364267,0.1359819,0.1647351,0.01092043,0.01638972,0.0004051458],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9916226,0.0001119268,0.005064601,0.000128596,0.00004359115,0.00009980435,0.00004562848,0.0002523229,0.002630778],"genre_scores_gemma":[0.9912913,0.00007715773,0.006743181,0.0001050376,0.00001996459,0.0001440052,0.00008009841,0.00003369094,0.00150545],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9977716,"threshold_uncertainty_score":0.02540082,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01930742933790456,"score_gpt":0.328052727097001,"score_spread":0.3087452977590964,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}