{"id":"W4410390504","doi":"10.1007/s41870-025-02555-4","title":"Assessing GPT model uncertainty in mathematical OCR tasks via entropy analysis","year":2025,"lang":"en","type":"article","venue":"International Journal of Information Technology","topic":"Reservoir Engineering and Simulation Methods","field":"Engineering","cited_by":2,"is_retracted":false,"has_abstract":false,"ca_institutions":"Wilfrid Laurier University","funders":"","keywords":"Computer science; Entropy (arrow of time); Artificial intelligence; Data mining; Machine learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004369109,0.00009637296,0.0002469684,0.003144928,0.00001609326,0.00009296467,0.0003840308,0.0001462591,0.00003328389],"category_scores_gemma":[0.000308369,0.00009028461,0.000106423,0.0009151594,0.00002603993,0.0009000307,0.00003720635,0.0003223057,0.000006638498],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002396694,"about_ca_system_score_gemma":0.00004365315,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000002002439,"about_ca_topic_score_gemma":0.000001313743,"domain_scores_codex":[0.9987276,0.00001586266,0.0008340085,0.00004369552,0.0002571327,0.0001216883],"domain_scores_gemma":[0.9992747,0.00008782751,0.0001580417,0.000118127,0.0003350236,0.00002627413],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000008813701,0.00001177315,0.0007061996,0.00001701816,0.0002710218,0.000003359947,0.00009810759,0.9737215,0.0003048433,0.01182749,0.00006385725,0.012966],"study_design_scores_gemma":[0.0004660413,0.000006510445,0.0004687828,0.00005145197,0.00003464685,0.00001388593,0.0001364331,0.9741029,0.0009184629,0.02318918,0.0005447533,0.00006694093],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1687254,0.00004291109,0.8290188,0.0005142721,0.000249451,0.00003469028,0.00000230365,0.00007648602,0.001335762],"genre_scores_gemma":[0.9257954,0.00003331289,0.0740701,0.00004961627,0.00001736492,0.000003765122,0.000008114642,0.000004095357,0.00001828376],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.7570699,"threshold_uncertainty_score":0.36817,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.009238933779717358,"score_gpt":0.3115749087716572,"score_spread":0.3023359749919398,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}