{"id":"W4312108337","doi":"10.48550/arxiv.2212.11146","title":"The Challenges of HTR Model Training: Feedback from the Project Donner le gout de l'archive a l'ere numerique","year":2022,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Handwritten Text Recognition Techniques","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université du Québec à Rimouski; Université de Montréal","funders":"","keywords":"Computer science; Handwriting; Process (computing); Handwriting recognition; Base (topology); Scale (ratio); Language model; Character (mathematics); Natural language processing; Word error rate; Data science; Artificial intelligence; Speech recognition; Feature extraction; Programming language; Cartography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0007234485,0.0003225603,0.0003602302,0.0001358268,0.0004759678,0.000124654,0.004019155,0.0001972962,0.0000181364],"category_scores_gemma":[0.00007578164,0.0002545447,0.00033384,0.0003419697,0.0002983912,0.0002291111,0.003127254,0.001049935,0.000006684632],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001673838,"about_ca_system_score_gemma":0.001191029,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001554607,"about_ca_topic_score_gemma":0.0005976468,"domain_scores_codex":[0.9975222,0.0006966097,0.0002695576,0.0009380222,0.0001669526,0.0004066586],"domain_scores_gemma":[0.9970686,0.0007210663,0.0004020805,0.001593021,0.0001309762,0.00008429564],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000113942,0.000248498,0.0001905786,0.00008966742,0.0004418925,0.0001290088,0.03338287,0.04961635,0.0002328852,0.8954719,0.002347864,0.01773456],"study_design_scores_gemma":[0.0003287668,0.00007301629,0.0001881998,0.0001204008,0.00004947529,0.000005935688,0.0047124,0.5016955,0.0005128197,0.4900903,0.001833373,0.0003898715],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04353579,0.0005542251,0.9365607,0.002428995,0.0001913976,0.0009869362,0.0002038504,0.0004754851,0.01506264],"genre_scores_gemma":[0.9872814,0.002084034,0.009763203,0.0001407176,0.00005939701,0.0000284202,0.00001917676,0.00003023061,0.0005934341],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9437456,"threshold_uncertainty_score":0.9999907,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1201216217698076,"score_gpt":0.2170851636345285,"score_spread":0.09696354186472089,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}