{"id":"W4319597719","doi":"10.5334/johd.95","title":"MultiHATHI: A Complete Collection of Multilingual Prose Fiction in the HathiTrust Digital Library","year":2023,"lang":"en","type":"article","venue":"Journal of Open Humanities Data","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Bespoke; Metadata; Computer science; Digital library; Classifier (UML); English language; World Wide Web; Information retrieval; Natural language processing; Artificial intelligence; Linguistics; Literature; Art; Poetry","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006231831,0.0008974321,0.0006937363,0.01247117,0.001797711,0.002616699,0.001038891,0.00111565,0.02161973],"category_scores_gemma":[0.004316409,0.0002939558,0.0005953143,0.01386523,0.0007140151,0.002967219,0.00243062,0.0009840286,0.02651446],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001439791,"about_ca_system_score_gemma":0.00199101,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01664353,"about_ca_topic_score_gemma":0.05296014,"domain_scores_codex":[0.9991701,0.0001380207,0.0001052874,0.0001687482,0.0002971261,0.0001206846],"domain_scores_gemma":[0.9973581,0.0007071872,0.0002803342,0.0005306274,0.0007534109,0.0003701865],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002562755,0.0001074742,0.01146179,0.002561678,0.00006383966,0.0005822787,0.002478006,0.0004402304,0.00225604,0.003102506,0.9140636,0.06262641],"study_design_scores_gemma":[0.00003399049,0.00003248051,0.02953377,0.0003715955,0.00003429595,0.0004871944,0.001750596,0.0008932977,0.001887204,0.0009480707,0.9639735,0.00005401648],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"empirical","genre_scores_codex":[0.03420883,0.003376062,0.001115022,0.0006079423,0.0003350352,0.0001047341,0.9317678,0.00207751,0.02640715],"genre_scores_gemma":[0.01891634,0.0006375014,0.002640842,0.0001263639,0.0001287123,0.0001412662,0.9694312,0.0003184161,0.007659328],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02161973,"threshold_uncertainty_score":0.07232523,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1386274117001172,"score_gpt":0.3461929316426599,"score_spread":0.2075655199425427,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}