{"id":"W4391767333","doi":"10.1007/978-3-031-70543-4_11","title":"CATMuS Medieval: A Multilingual Large-Scale Cross-Century Dataset in Latin Script for Handwritten Text Recognition and Beyond","year":2024,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Handwritten Text Recognition Techniques","field":"Computer Science","cited_by":12,"is_retracted":false,"has_abstract":false,"ca_institutions":"Canada Research Chairs; University of Toronto; Université de Montréal","funders":"","keywords":"Computer science; Natural language processing; Scale (ratio); Artificial intelligence; Speech recognition; Linguistics; Geography; Cartography; Philosophy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004273813,0.001398574,0.0005734152,0.002934646,0.001076037,0.001265082,0.001213215,0.0009480037,0.0143439],"category_scores_gemma":[0.001184463,0.0002761553,0.0007689221,0.003067913,0.0004849684,0.0009830049,0.001733957,0.0008404127,0.01830936],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006264607,"about_ca_system_score_gemma":0.001060671,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02721085,"about_ca_topic_score_gemma":0.072133,"domain_scores_codex":[0.9995253,0.00006495282,0.00004890763,0.0001663166,0.0001137602,0.00008084912],"domain_scores_gemma":[0.9993427,0.0000619275,0.00004896132,0.0002009406,0.0002113908,0.0001340437],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0008859024,0.0003403907,0.01567979,0.001117277,0.0001905523,0.0008390232,0.0007741768,0.002083564,0.01759694,0.001904645,0.815733,0.1428549],"study_design_scores_gemma":[0.00019419,0.0001485961,0.09965418,0.0003366648,0.000108525,0.001183614,0.001945179,0.006377988,0.01291935,0.00168929,0.8752954,0.0001470327],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.105938,0.002156357,0.005588813,0.0005265045,0.0006778993,0.0002498703,0.8488967,0.009532093,0.0264338],"genre_scores_gemma":[0.0314351,0.0002730014,0.006546628,0.0001394661,0.0000737133,0.000171185,0.9533864,0.0006539531,0.007320529],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.02721085,"threshold_uncertainty_score":0.05410492,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02611180828481044,"score_gpt":0.294718516514478,"score_spread":0.2686067082296676,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}