{"id":"W2183772626","doi":"10.4242/balisagevol8.huitfeldt02","title":"The MLCD Overlap Corpus (MOC)","year":2012,"lang":"en","type":"article","venue":"Balisage series on markup technologies","topic":"Digital Humanities and Scholarship","field":"Arts and Humanities","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Natural language processing; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004567735,0.0007500019,0.0008681833,0.009515409,0.003908332,0.004524092,0.002064779,0.001601468,0.05211345],"category_scores_gemma":[0.02561439,0.0008070709,0.0004194521,0.01076836,0.00226361,0.004921978,0.007354988,0.002443107,0.01896176],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002163623,"about_ca_system_score_gemma":0.004489657,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007998256,"about_ca_topic_score_gemma":0.009506025,"domain_scores_codex":[0.9940816,0.002329458,0.0006982656,0.001019466,0.001615451,0.0002558956],"domain_scores_gemma":[0.9835789,0.007383844,0.0007922411,0.003593908,0.00397207,0.0006790934],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0005642315,0.0002076244,0.002708221,0.00340353,0.00004262263,0.0007313441,0.01301297,0.001390664,0.009466377,0.09774813,0.5567619,0.3139624],"study_design_scores_gemma":[0.00007293191,0.00002897063,0.002889178,0.0004319745,0.00001589526,0.0004084916,0.001556437,0.001781069,0.004010731,0.009298436,0.9794455,0.00006046504],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.06099697,0.004245605,0.2315388,0.004842727,0.00193535,0.004718722,0.3902022,0.01775315,0.2837666],"genre_scores_gemma":[0.1523865,0.001293595,0.3026313,0.001146454,0.0006387162,0.009468487,0.4727402,0.008366085,0.05132863],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.05211345,"threshold_uncertainty_score":0.1743369,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03398389952082131,"score_gpt":0.2191594948432474,"score_spread":0.1851755953224261,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}