{"id":"W2890631628","doi":"10.1016/j.dib.2018.08.099","title":"MiBio: A dataset for OCR post-processing evaluation","year":2018,"lang":"en","type":"article","venue":"Data in Brief","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"","keywords":"Computer science; Ground truth; Natural language processing; Preprocessor; Artificial intelligence; Benchmark (surveying); Sentence; Segmentation; Information retrieval; Optical character recognition; Word (group theory); Text segmentation; Linguistics; Image (mathematics); Cartography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00271668,0.004223021,0.001594122,0.008879711,0.001604764,0.002158097,0.004030414,0.002968336,0.02083873],"category_scores_gemma":[0.01031253,0.0006202644,0.001728212,0.00552745,0.0007036009,0.002726975,0.00272196,0.001903777,0.03131789],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002180703,"about_ca_system_score_gemma":0.002263626,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01204203,"about_ca_topic_score_gemma":0.02335714,"domain_scores_codex":[0.9937549,0.0008579418,0.0008838262,0.001139971,0.002987736,0.0003756154],"domain_scores_gemma":[0.990155,0.001881388,0.000767187,0.002582924,0.004214041,0.0003995169],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0005310346,0.0007140334,0.003441549,0.002636262,0.000216602,0.0002341829,0.000140901,0.003035814,0.0140335,0.001259939,0.8248726,0.1488836],"study_design_scores_gemma":[0.0006837379,0.0008002653,0.04816387,0.0007955172,0.0003342677,0.001737529,0.0006400877,0.03631306,0.06902209,0.004428689,0.8366615,0.0004193278],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.02310783,0.002482371,0.01848664,0.000569408,0.0006457323,0.001994685,0.9030472,0.03174589,0.01792024],"genre_scores_gemma":[0.01045881,0.0002953499,0.0229303,0.0001705563,0.00009293534,0.001278713,0.9592789,0.000952228,0.004542176],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.02083873,"threshold_uncertainty_score":0.06971252,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06855534351809031,"score_gpt":0.3859505036611572,"score_spread":0.3173951601430669,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}