{"id":"W4409678925","doi":"10.22148/001c.128010","title":"The “Mapping German fiction in translation” dataset: Data collection, scope, and data quality","year":2025,"lang":"en","type":"article","venue":"Journal of Cultural Analytics","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal","funders":"","keywords":"Scope (computer science); German; Computer science; Translation (biology); Data quality; Quality (philosophy); Data collection; Information retrieval; Data science; History; Statistics; Engineering; Operations management; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003712231,0.000682471,0.0006639403,0.008186221,0.001132823,0.002323367,0.001108922,0.001299697,0.009980333],"category_scores_gemma":[0.02321832,0.0002194086,0.0005209501,0.01067852,0.0008864044,0.001320909,0.002343733,0.001052852,0.01058716],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001538539,"about_ca_system_score_gemma":0.002623453,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00934694,"about_ca_topic_score_gemma":0.02179378,"domain_scores_codex":[0.9962761,0.001058518,0.0006542469,0.0005752796,0.001158143,0.0002776225],"domain_scores_gemma":[0.9887691,0.005464866,0.0009401199,0.002007063,0.00233495,0.0004839325],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002291921,0.0001413227,0.01957073,0.002584262,0.0001008541,0.0004248502,0.001865302,0.001170133,0.001785646,0.005777743,0.9174312,0.04891858],"study_design_scores_gemma":[0.0001114009,0.00004964933,0.04132538,0.0006239642,0.00004984228,0.0003515125,0.002026055,0.001108167,0.002014489,0.002483823,0.9497887,0.00006708778],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.02146305,0.0008946364,0.001808335,0.001175685,0.0001596694,0.0002950396,0.9674398,0.0006533304,0.006110449],"genre_scores_gemma":[0.01446906,0.000253853,0.004029494,0.0001785368,0.00005415728,0.0006804726,0.9783993,0.0001306951,0.001804411],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.009980333,"threshold_uncertainty_score":0.03338748,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1018037993760922,"score_gpt":0.4145446143603592,"score_spread":0.312740814984267,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}