{"meta":{"query_hash":"3de55248b53f","filters":{"topic":"Text and Document Classification Technologies"},"cohort_total":374,"direct_labels_cover":2,"predictions_cover":374,"exported":374,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/3de55248b53f","api":"https://metacan.xera.ac/api/v1/cohort?topic=Text+and+Document+Classification+Technologies"},"results":[{"id":"W1035981622","doi":"10.1007/978-3-642-40846-5_43","title":"MLG: Enchancing Multi-label Classification with Modularity-Based Label Grouping","year":2013,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ducks Unlimited Canada","funders":"","keywords":"Computer science; Multi-label classification; Modularity (biology); Relevance (law); Binary number; Data mining; Graph; Artificial intelligence; Pattern recognition (psychology); Binary classification; Machine learning; Theoretical computer science; Support vector machine; Mathematics","score_opus":0.04651001208176469,"score_gpt":0.2663176553733737,"score_spread":0.219807643291609,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1035981622","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.003476872,0.00020283404,0.98423356,0.00024940164,0.00015070787,0.00013747795,0.00024516787,0.01038477,0.00091921614],"genre_scores_gemma":[0.051828843,0.00013631774,0.93804896,0.00049537263,0.00019647434,0.00023001526,0.0014979308,0.0021099236,0.0054561617],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99542254,0.0013510245,0.00019548116,0.0012656691,0.0014286869,0.0003366128],"domain_scores_gemma":[0.9925997,0.0024374288,0.00032503126,0.0033167037,0.0010384308,0.0002826464],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00493528,0.0021637268,0.0024114684,0.004051907,0.0018721662,0.0025765821,0.006344234,0.0033633919,0.010475855],"category_scores_gemma":[0.013197865,0.0013100142,0.002747302,0.0040471144,0.0025054596,0.005478817,0.009310673,0.00430633,0.008095055],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005090526,0.00027609672,0.00095956103,0.00026956262,0.00017248698,0.00018578536,0.00042432945,0.024215225,0.015463522,0.022682,0.031997167,0.90284514],"study_design_scores_gemma":[0.00012842777,0.00017064843,0.0006221156,0.000080402846,0.00009153136,0.00021100645,0.00018411085,0.811727,0.017428834,0.14958382,0.019711748,0.000060406008],"about_ca_topic_score_codex":0.004755719,"about_ca_topic_score_gemma":0.008251977,"teacher_disagreement_score":0.010475855,"about_ca_system_score_codex":0.0014772164,"about_ca_system_score_gemma":0.0017072726,"threshold_uncertainty_score":0.035045207},"labels":[],"label_agreement":null},{"id":"W123190706","doi":"","title":"Topic Classification of Blog Posts Using Distant Supervision","year":2012,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":24,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Blogosphere; Computer science; Classifier (UML); Vocabulary; Binary classification; Artificial intelligence; Class (philosophy); Information retrieval; Sample (material); Natural language processing; Data science; World Wide Web; Support vector machine; The Internet","score_opus":0.06051903039669124,"score_gpt":0.3021238606092946,"score_spread":0.24160483021260334,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W123190706","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.517301,0.002538458,0.44561514,0.00076961087,0.00046051445,0.00056402455,0.004519244,0.012224841,0.016007198],"genre_scores_gemma":[0.89000803,0.0003679311,0.09284701,0.00011368402,0.00039593512,0.00021169145,0.008201214,0.00020316624,0.007651242],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9991001,0.00022450354,0.00007120199,0.00029074398,0.00021011819,0.00010341517],"domain_scores_gemma":[0.9968811,0.0012934007,0.0003568528,0.0004958877,0.0008362844,0.00013649365],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013921075,0.0010032157,0.00070237415,0.0028223929,0.0008039457,0.0010365419,0.0008585103,0.0010924559,0.0020332742],"category_scores_gemma":[0.0045809494,0.00023334891,0.0005752194,0.0017710152,0.00049990637,0.0017689066,0.0010708913,0.0009529831,0.0026460108],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012834243,0.0009871774,0.03822216,0.00045442628,0.00023388547,0.0003176863,0.0005960105,0.024033602,0.040828843,0.0018389124,0.028475765,0.86272806],"study_design_scores_gemma":[0.00011596463,0.00040677865,0.034529082,0.00008289128,0.00013552586,0.00035276552,0.00039727587,0.90944046,0.038580634,0.0072616176,0.008621554,0.00007536764],"about_ca_topic_score_codex":0.0035880238,"about_ca_topic_score_gemma":0.0071691466,"teacher_disagreement_score":0.0035880238,"about_ca_system_score_codex":0.00041673754,"about_ca_system_score_gemma":0.0006471512,"threshold_uncertainty_score":0.0073622465},"labels":[],"label_agreement":null},{"id":"W129830436","doi":"10.1007/978-3-642-21402-8_23","title":"Naive Bayesian Classifier Based on the Improved Feature Weighting Algorithm","year":2011,"lang":"en","type":"book-chapter","venue":"Communications in computer and information science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":13,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Nipissing University","funders":"","keywords":"Weighting; Computer science; Naive Bayes classifier; Feature (linguistics); Classifier (UML); Text categorization; Artificial intelligence; Search engine indexing; Bayesian probability; Data mining; Categorization; Information retrieval; Machine learning; Pattern recognition (psychology); Support vector machine","score_opus":0.036231446674629415,"score_gpt":0.26089570440606147,"score_spread":0.22466425773143206,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W129830436","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005577577,0.00079411926,0.9904909,0.00016952095,0.00019310776,0.00009288716,0.00012861469,0.0007006615,0.0018526531],"genre_scores_gemma":[0.15586147,0.0011907958,0.8268833,0.00044013938,0.00072539673,0.00035841245,0.001427829,0.00022268324,0.012889941],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9961433,0.0008670631,0.00030910986,0.00076694554,0.0016799034,0.00023370964],"domain_scores_gemma":[0.9973907,0.00079561915,0.00010417354,0.00022006499,0.0014372665,0.00005226239],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0025618856,0.0007972334,0.0027767771,0.0019643584,0.0010921161,0.0018052266,0.002915947,0.0017363118,0.004887678],"category_scores_gemma":[0.0066666226,0.0006128387,0.0010817354,0.0022416166,0.0005744168,0.0029391549,0.0009297892,0.0016790463,0.0030871476],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003565649,0.00022354796,0.0017403833,0.0002327053,0.00017674423,0.00010018968,0.00007034457,0.03868094,0.007904936,0.014764948,0.014929572,0.92081916],"study_design_scores_gemma":[0.00008554864,0.00008779403,0.0013619928,0.000040208728,0.00016560915,0.0003316385,0.000021955375,0.967703,0.004308412,0.01820504,0.0076150536,0.00007370486],"about_ca_topic_score_codex":0.008541129,"about_ca_topic_score_gemma":0.0086801415,"teacher_disagreement_score":0.008541129,"about_ca_system_score_codex":0.00076308247,"about_ca_system_score_gemma":0.0021788254,"threshold_uncertainty_score":0.016982853},"labels":[],"label_agreement":null},{"id":"W142320376","doi":"","title":"NTCIR-7 Patent Mining Experiments at RALI","year":2008,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Task (project management); Class (philosophy); Set (abstract data type); Information retrieval; Focus (optics); Bridge (graph theory); Code (set theory); Test (biology); Natural language processing; Data science; Artificial intelligence; Programming language; Engineering","score_opus":0.14456748463194688,"score_gpt":0.27666719370641846,"score_spread":0.13209970907447158,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W142320376","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.48826566,0.013862183,0.025074253,0.019083237,0.007576146,0.006778848,0.25047868,0.03450246,0.1543786],"genre_scores_gemma":[0.31420186,0.0018138937,0.078308456,0.0035483507,0.0011417299,0.0028908807,0.54703647,0.0026531068,0.048405245],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9902597,0.0048773717,0.00079567044,0.0009965706,0.0020896897,0.0009809976],"domain_scores_gemma":[0.98896235,0.0043073753,0.0003427554,0.0018536596,0.0032373967,0.0012966003],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010723345,0.0022508907,0.0028371408,0.0042620013,0.004539496,0.0033485945,0.0035685298,0.0035233847,0.0175359],"category_scores_gemma":[0.018232,0.0007448913,0.001919823,0.0036982023,0.0010872813,0.004395225,0.0029537797,0.0026531834,0.016884958],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.003525271,0.0039991075,0.0054472676,0.0032641978,0.0004530154,0.0023393244,0.0012037114,0.0042196577,0.029999295,0.0047962894,0.83605,0.10470284],"study_design_scores_gemma":[0.008503427,0.0058217323,0.071417436,0.0005426712,0.0011054219,0.0048891255,0.0049109603,0.07508368,0.12303571,0.011890748,0.6919092,0.000889819],"about_ca_topic_score_codex":0.042039685,"about_ca_topic_score_gemma":0.055513877,"teacher_disagreement_score":0.042039685,"about_ca_system_score_codex":0.002968604,"about_ca_system_score_gemma":0.0030700164,"threshold_uncertainty_score":0.08358997},"labels":[],"label_agreement":null},{"id":"W142552274","doi":"10.1007/978-3-642-41062-8_19","title":"Text Categorization via Similarity Search","year":2013,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Computer science; Artificial intelligence; Similarity (geometry); Cluster analysis; Categorization; Centroid; Outlier; Preprocessor; Metric (unit); Similarity measure; Point (geometry); Text categorization; Class (philosophy); Pattern recognition (psychology); Mathematics","score_opus":0.024038456127953765,"score_gpt":0.25591752152998387,"score_spread":0.2318790654020301,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W142552274","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02117245,0.0028442205,0.95520616,0.000437694,0.00034544282,0.0006317257,0.001244916,0.0076185153,0.010498837],"genre_scores_gemma":[0.14671099,0.0014047495,0.8161401,0.0002923211,0.0003192058,0.0004672147,0.0067758374,0.00045028076,0.02743921],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9982926,0.00026068217,0.00017379457,0.00049710734,0.00066731515,0.000108548964],"domain_scores_gemma":[0.99880266,0.0003624507,0.00008769726,0.00030843043,0.00038139286,0.000057355577],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009776372,0.00088938186,0.0019861108,0.0071495385,0.0011950089,0.0023018594,0.0017839455,0.001275834,0.011891456],"category_scores_gemma":[0.0029605872,0.00038755668,0.0016764267,0.0074633127,0.00053343474,0.0033415346,0.0022738965,0.00092076795,0.011045397],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014847859,0.00021633154,0.00045201823,0.00024035566,0.000088755536,0.00005823773,0.00006922018,0.0022393144,0.016050758,0.007908832,0.017310899,0.9552168],"study_design_scores_gemma":[0.00017487546,0.000813357,0.0049007637,0.00017574418,0.0004031308,0.0024180629,0.0006336159,0.67306995,0.07635,0.1510828,0.08982685,0.00015079563],"about_ca_topic_score_codex":0.0017398486,"about_ca_topic_score_gemma":0.0026348336,"teacher_disagreement_score":0.011891456,"about_ca_system_score_codex":0.0006385113,"about_ca_system_score_gemma":0.0011737999,"threshold_uncertainty_score":0.039780855},"labels":[],"label_agreement":null},{"id":"W1482760454","doi":"10.5555/1793274.1793346","title":"Methods for augmenting semantic models with structural information for text classification","year":2008,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Natural language processing; ENCODE; Artificial intelligence; Semantics (computer science); Representation (politics); Feature (linguistics); Word (group theory); Syntactic structure; Information retrieval; Syntax; Linguistics","score_opus":0.07300728272857057,"score_gpt":0.3366887500066414,"score_spread":0.26368146727807085,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1482760454","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.037810884,0.0005726195,0.95553255,0.0010356653,0.0001226488,0.00017514527,0.0003459267,0.0022787321,0.002125789],"genre_scores_gemma":[0.29796728,0.00031698527,0.69746953,0.00021211196,0.0001809053,0.0004505652,0.0013450172,0.00020573092,0.0018518978],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9977023,0.001073074,0.00013530538,0.0003048476,0.0006918758,0.000092575654],"domain_scores_gemma":[0.9880459,0.008010183,0.0006952357,0.00161108,0.0014714806,0.00016613046],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0043117166,0.00095872284,0.0008843809,0.0029025574,0.00060548994,0.0015802461,0.0015804884,0.0012419127,0.0025286158],"category_scores_gemma":[0.01541842,0.0004268456,0.001374561,0.0023665428,0.0010147725,0.0057218443,0.0014891678,0.0019524437,0.0014345688],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005912813,0.00070589595,0.005481428,0.00036610346,0.00024834948,0.00008610931,0.0002950877,0.13002938,0.0115014715,0.039863247,0.008522087,0.8023096],"study_design_scores_gemma":[0.000039892628,0.000072916315,0.0004976927,0.000033093667,0.000055224296,0.00003655771,0.000047471352,0.9566041,0.0038679538,0.03642488,0.002295681,0.000024449912],"about_ca_topic_score_codex":0.0016777888,"about_ca_topic_score_gemma":0.0038494898,"teacher_disagreement_score":0.0043117166,"about_ca_system_score_codex":0.0010880651,"about_ca_system_score_gemma":0.0012793556,"threshold_uncertainty_score":0.02280277},"labels":[],"label_agreement":null},{"id":"W1489199265","doi":"10.1007/11758532_30","title":"An Adaptive Fuzzy kNN Text Classifier","year":2006,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":12,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Nipissing University","funders":"Beijing Jiaotong University","keywords":"Computer science; Categorization; Artificial intelligence; Text categorization; Feature selection; Classifier (UML); Selection (genetic algorithm); Machine learning; Dimension (graph theory); Data mining; Pattern recognition (psychology); Mathematics","score_opus":0.023312524362474062,"score_gpt":0.2540993049945257,"score_spread":0.23078678063205166,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1489199265","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.028898334,0.0010841434,0.95944107,0.00023879149,0.0004947544,0.00020823792,0.0004770397,0.0039605596,0.0051971804],"genre_scores_gemma":[0.2173148,0.00064660487,0.7558836,0.00044026066,0.0003535152,0.00023363411,0.001280994,0.00019262366,0.023654006],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9993262,0.000055169185,0.000050041814,0.00017660689,0.0003411221,0.00005091505],"domain_scores_gemma":[0.99899,0.00022021992,0.00003296267,0.000113386,0.0006070687,0.00003625541],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008151124,0.00051306223,0.0010963092,0.0015243625,0.00079506973,0.000999665,0.0020762794,0.0011302405,0.006027477],"category_scores_gemma":[0.0022146683,0.0003136984,0.0006267817,0.0014929575,0.0003218849,0.0015897191,0.00087708497,0.00083292986,0.0032895443],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002491596,0.00011518734,0.00062808313,0.00008699956,0.000044767563,0.00007658612,0.000031775697,0.01674794,0.022188554,0.002299631,0.0072595673,0.9502718],"study_design_scores_gemma":[0.00003236382,0.000105726955,0.0010716204,0.00002594506,0.00007606045,0.00026505184,0.000030475481,0.9664505,0.017789543,0.0040589957,0.010062786,0.000030823452],"about_ca_topic_score_codex":0.007055005,"about_ca_topic_score_gemma":0.008867113,"teacher_disagreement_score":0.007055005,"about_ca_system_score_codex":0.0007150423,"about_ca_system_score_gemma":0.0008436016,"threshold_uncertainty_score":0.020163953},"labels":[],"label_agreement":null},{"id":"W1502037483","doi":"","title":"Spectral Learning with Type-2 Fuzzy Numbers for Question/Answering System.","year":2009,"lang":"en","type":"article","venue":"European Society for Fuzzy Logic and Technology Conference","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Artificial intelligence; Semi-supervised learning; Graph; Fuzzy number; Fuzzy logic; Machine learning; Theoretical computer science; Pattern recognition (psychology); Mathematics; Fuzzy set","score_opus":0.01910307234349519,"score_gpt":0.24663209151925072,"score_spread":0.22752901917575552,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1502037483","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.024588617,0.00021325497,0.9728263,0.00034723806,0.000058640533,0.000085266896,0.000083051586,0.00027558635,0.0015220107],"genre_scores_gemma":[0.5328319,0.00015914308,0.46463054,0.0001406057,0.00006499027,0.00019357252,0.00020908732,0.00003094789,0.0017391132],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99863774,0.00065354706,0.00007905782,0.0002603707,0.0003280401,0.000041250958],"domain_scores_gemma":[0.99724686,0.0016735129,0.00024122106,0.0003029557,0.0004473618,0.00008808849],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019982564,0.00035420462,0.00044170913,0.001033686,0.00061466696,0.0009341687,0.0010285269,0.00095944654,0.0019389108],"category_scores_gemma":[0.009002837,0.00016472237,0.00055043556,0.00069622835,0.0010075297,0.0023684201,0.00066046324,0.0008870482,0.0005466966],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004613089,0.00028305393,0.0033910947,0.0003266561,0.00009919332,0.00021774229,0.0006718848,0.25532797,0.015825475,0.22206816,0.006061415,0.49526596],"study_design_scores_gemma":[0.0000062507515,0.00003411592,0.00028893605,0.00000834631,0.000006432685,0.000039312898,0.000031563177,0.9265052,0.0021266637,0.06984569,0.0010973467,0.000010091257],"about_ca_topic_score_codex":0.0013155544,"about_ca_topic_score_gemma":0.0017695599,"teacher_disagreement_score":0.0019982564,"about_ca_system_score_codex":0.0012628416,"about_ca_system_score_gemma":0.00068487204,"threshold_uncertainty_score":0.010567963},"labels":[],"label_agreement":null},{"id":"W1507852567","doi":"10.1007/11425274_17","title":"Evaluation of Two Systems on Multi-class Multi-label Document Classification","year":2005,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":52,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Computer science; Document classification; Classifier (UML); Search engine indexing; Artificial intelligence; Class (philosophy); Multi-label classification; Pattern recognition (psychology); Data mining; Information retrieval; Natural language processing; Machine learning","score_opus":0.09346704776640828,"score_gpt":0.3400993522796007,"score_spread":0.2466323045131924,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1507852567","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.74204487,0.011707406,0.19492197,0.0024287046,0.0034254408,0.0031169718,0.005228391,0.022883452,0.014242708],"genre_scores_gemma":[0.7330969,0.0017672199,0.22932236,0.0008671067,0.0007351464,0.0010829964,0.016420634,0.00081461255,0.01589291],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99174833,0.002373959,0.0007552522,0.00195937,0.002524631,0.00063855504],"domain_scores_gemma":[0.9754066,0.01329193,0.0006326172,0.0022816407,0.007264553,0.0011226436],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0094597405,0.0024690256,0.002711565,0.0038274003,0.0017664941,0.003998599,0.0038641929,0.005224612,0.0054241186],"category_scores_gemma":[0.020410752,0.0007269921,0.0015248873,0.002612311,0.00087460974,0.00419083,0.0026864903,0.0017178891,0.0036803707],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.01623368,0.004835855,0.013400987,0.001821449,0.00204644,0.00047928892,0.0005113481,0.035433054,0.029829301,0.0011519737,0.025700258,0.8685564],"study_design_scores_gemma":[0.0023258664,0.005412925,0.027327918,0.00017536839,0.0020149976,0.00076986715,0.00086948293,0.8907587,0.05857226,0.0018025325,0.009689447,0.00028055048],"about_ca_topic_score_codex":0.02392591,"about_ca_topic_score_gemma":0.020838078,"teacher_disagreement_score":0.02392591,"about_ca_system_score_codex":0.0026576258,"about_ca_system_score_gemma":0.002294772,"threshold_uncertainty_score":0.050028443},"labels":[],"label_agreement":null},{"id":"W1520586504","doi":"10.1007/11424918_39","title":"Vocabulary Completion Through Word Cooccurrence Analysis Using Unlabeled Documents for Text Categorization","year":2005,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval","funders":"","keywords":"Computer science; Vocabulary; Text categorization; Categorization; Classifier (UML); Natural language processing; Artificial intelligence; Word (group theory); Vocabulary learning; Set (abstract data type); Training set; Information retrieval; Machine learning; Linguistics","score_opus":0.03748189831121202,"score_gpt":0.29811954903343774,"score_spread":0.2606376507222257,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1520586504","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.040212806,0.0014729854,0.9487871,0.00016103464,0.00028040298,0.00042887643,0.0011504182,0.00552063,0.0019857485],"genre_scores_gemma":[0.17704481,0.00091224804,0.80470085,0.00009954569,0.00027578286,0.0006469415,0.00835673,0.0006502203,0.0073128105],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99827087,0.00035381792,0.00020237445,0.0005329081,0.00047149416,0.00016846212],"domain_scores_gemma":[0.99694675,0.0012956401,0.000163771,0.00045363358,0.0010297891,0.00011044289],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014868347,0.0013488868,0.0018720654,0.0051708017,0.0012153955,0.0015907238,0.0017900246,0.0011540514,0.0038859379],"category_scores_gemma":[0.004503657,0.0004571089,0.0014404936,0.0044457726,0.0006333578,0.0023430386,0.0015755481,0.0017565247,0.0047406238],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003813374,0.00036925363,0.0011160978,0.0003486125,0.00009700979,0.00010541115,0.00027017258,0.0036863242,0.069411635,0.0022169254,0.008691513,0.9133057],"study_design_scores_gemma":[0.00017692173,0.00049698964,0.0051565957,0.00015489954,0.00043912188,0.00068726647,0.0010499425,0.81105506,0.11833357,0.038513042,0.023781905,0.00015473446],"about_ca_topic_score_codex":0.005096616,"about_ca_topic_score_gemma":0.0072506587,"teacher_disagreement_score":0.0051708017,"about_ca_system_score_codex":0.00044497638,"about_ca_system_score_gemma":0.0018664934,"threshold_uncertainty_score":0.012999713},"labels":[],"label_agreement":null},{"id":"W1523209510","doi":"10.1007/978-3-642-01347-8_28","title":"Enhancing Text Clustering Performance Using Semantic Similarity","year":2009,"lang":"en","type":"book-chapter","venue":"Lecture notes in business information processing","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":12,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"WordNet; Semantic similarity; Computer science; Cluster analysis; Vector space model; Natural language processing; Explicit semantic analysis; Document clustering; Information retrieval; Artificial intelligence; Ambiguity; Similarity (geometry); Ontology; Semantic computing; Probabilistic latent semantic analysis; Semantic technology; Semantic Web; Image (mathematics)","score_opus":0.020265127446488226,"score_gpt":0.2444281122522229,"score_spread":0.22416298480573468,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1523209510","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.35213742,0.0015675455,0.62412363,0.00032712182,0.0004389032,0.00015724858,0.00032856502,0.011818501,0.009101088],"genre_scores_gemma":[0.7075607,0.00036494646,0.28321683,0.00012004349,0.00021269645,0.000074945056,0.0010988121,0.00063442957,0.006716539],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9991622,0.00013845267,0.00005966132,0.00018212611,0.00037813024,0.00007938046],"domain_scores_gemma":[0.9981444,0.0005766308,0.00011186555,0.00023160099,0.00084871345,0.00008684856],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00086667115,0.00074587006,0.0009967012,0.002109692,0.0007836419,0.001418116,0.0009776019,0.0010833244,0.003513777],"category_scores_gemma":[0.0032412647,0.00023996194,0.0005215617,0.0028087492,0.00027470468,0.0020070912,0.000853279,0.00044579367,0.0028022178],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017254694,0.0007470464,0.0023844508,0.0002177924,0.0001261881,0.00008486164,0.00010980656,0.036086947,0.23520729,0.0018950424,0.006639301,0.71477586],"study_design_scores_gemma":[0.00010664636,0.0005294052,0.003244906,0.000011817297,0.00016113213,0.00025243446,0.00015182562,0.6825186,0.30673364,0.0024404111,0.003799454,0.000049719707],"about_ca_topic_score_codex":0.001392884,"about_ca_topic_score_gemma":0.002052924,"teacher_disagreement_score":0.003513777,"about_ca_system_score_codex":0.00044053214,"about_ca_system_score_gemma":0.00052723364,"threshold_uncertainty_score":0.011754751},"labels":[],"label_agreement":null},{"id":"W1524205027","doi":"","title":"Dominant meanings classification model for web information","year":2003,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Hierarchy; Context (archaeology); Domain (mathematical analysis); Set (abstract data type); Task (project management); Information retrieval; Artificial intelligence; Meaning (existential); Word (group theory); Naive Bayes classifier; Natural language processing; Mathematics; Support vector machine","score_opus":0.035331896340517456,"score_gpt":0.2603957226477704,"score_spread":0.22506382630725294,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1524205027","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06425987,0.0014352454,0.9209171,0.002008889,0.00027690484,0.0005817383,0.0015489736,0.0022736695,0.006697661],"genre_scores_gemma":[0.5244432,0.00083849224,0.4604273,0.0006255023,0.00041354043,0.0011586054,0.0030847373,0.00021664279,0.008792001],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99645317,0.0009725949,0.0003283912,0.0006346938,0.0013296534,0.00028138683],"domain_scores_gemma":[0.99178153,0.0050501027,0.0005666832,0.0007153875,0.0016570552,0.00022921477],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005408344,0.0012465798,0.0010771885,0.006861175,0.0013371138,0.0026243038,0.0027888836,0.0018294974,0.0031936106],"category_scores_gemma":[0.016215479,0.00042721097,0.002200936,0.0031270804,0.0011190393,0.0064735687,0.0011406314,0.0023191662,0.0018173202],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008927874,0.00081616716,0.01888373,0.0006334356,0.00037597842,0.0009817965,0.0015432001,0.11245274,0.006610453,0.11200312,0.027327348,0.7174793],"study_design_scores_gemma":[0.00003991222,0.00007003303,0.0015970346,0.000051834108,0.00007305376,0.00028015696,0.00012669302,0.9051133,0.0015066161,0.087051585,0.0040533245,0.00003648049],"about_ca_topic_score_codex":0.010141076,"about_ca_topic_score_gemma":0.009611072,"teacher_disagreement_score":0.010141076,"about_ca_system_score_codex":0.0023469431,"about_ca_system_score_gemma":0.0025793102,"threshold_uncertainty_score":0.028602421},"labels":[],"label_agreement":null},{"id":"W1524564918","doi":"10.1007/978-3-642-01818-3_35","title":"An Empirical Study of Category Skew on Feature Selection for Text Categorization","year":2009,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"","keywords":"Skew; Categorical variable; Feature selection; Computer science; Categorization; Text categorization; Selection (genetic algorithm); Feature (linguistics); Measure (data warehouse); Artificial intelligence; Pattern recognition (psychology); Data mining; Machine learning","score_opus":0.026645668405953876,"score_gpt":0.3034475151411274,"score_spread":0.2768018467351735,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1524564918","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9912608,0.00041104775,0.006793922,0.00011001174,0.000032049637,0.00002716808,0.00020870089,0.0000596616,0.0010967087],"genre_scores_gemma":[0.9969939,0.000055470475,0.0021233882,0.000030455578,0.000027299267,0.000013304929,0.00045497064,0.000023199716,0.00027797808],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9911117,0.0056610955,0.00044006255,0.0007877692,0.0017253045,0.00027396542],"domain_scores_gemma":[0.6219091,0.33912644,0.013024782,0.015289333,0.009133244,0.0015171405],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.018081617,0.00035632652,0.00052482967,0.0010425459,0.0006161046,0.0010925938,0.00069965585,0.0006472835,0.0022762918],"category_scores_gemma":[0.13698855,0.00016920427,0.00045132052,0.001773221,0.0010720061,0.0028496722,0.0010989839,0.0011481347,0.00045278567],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0053240936,0.0010880624,0.7385889,0.00030345508,0.00045312988,0.00022219252,0.0014836821,0.011337157,0.008818304,0.0031001102,0.005423759,0.22385716],"study_design_scores_gemma":[0.00018769185,0.002625991,0.79927063,0.00013419797,0.00035330773,0.0015724873,0.0025679967,0.16788992,0.008927122,0.0138354525,0.0025107386,0.000124505],"about_ca_topic_score_codex":0.0009279626,"about_ca_topic_score_gemma":0.0009283031,"teacher_disagreement_score":0.018081617,"about_ca_system_score_codex":0.0006092974,"about_ca_system_score_gemma":0.0004152006,"threshold_uncertainty_score":0.09562588},"labels":[],"label_agreement":null},{"id":"W1525194303","doi":"10.1007/11562382_11","title":"Filtering Contents with Bigrams and Named Entities to Improve Text Classification","year":2005,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Bigram; Computer science; Information retrieval; Call for bids; Window (computing); Artificial intelligence; Measure (data warehouse); Natural language processing; Data mining; World Wide Web; Trigram","score_opus":0.022896628920236126,"score_gpt":0.2413735191497738,"score_spread":0.2184768902295377,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1525194303","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.27722034,0.0073117614,0.6562559,0.001139753,0.0024995648,0.00081331556,0.010910307,0.031730462,0.012118653],"genre_scores_gemma":[0.35566163,0.0024444254,0.587374,0.0004984288,0.0012582812,0.00042106843,0.02486761,0.0022431628,0.025231449],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99876356,0.00017339338,0.00018855231,0.00029507498,0.00043867205,0.0001408086],"domain_scores_gemma":[0.9957569,0.0014862854,0.00029951677,0.0005694045,0.001641795,0.00024603086],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001248371,0.0017983896,0.0017473998,0.009150917,0.0014899443,0.0023829115,0.0010416647,0.0015076057,0.0066436864],"category_scores_gemma":[0.00493288,0.0005064978,0.0014965229,0.005901293,0.0004256429,0.0032501563,0.0013397723,0.0015171062,0.011607166],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007633729,0.00044557606,0.00787667,0.00048370627,0.00018436999,0.00038128736,0.0002750615,0.0021386151,0.10717679,0.0014027266,0.023894893,0.85497683],"study_design_scores_gemma":[0.00020469159,0.0012911024,0.04849771,0.00042950947,0.001955586,0.0026083572,0.0017236323,0.5043271,0.3259748,0.01883965,0.093870096,0.0002777629],"about_ca_topic_score_codex":0.0038272822,"about_ca_topic_score_gemma":0.006615571,"teacher_disagreement_score":0.009150917,"about_ca_system_score_codex":0.0005071616,"about_ca_system_score_gemma":0.0011617186,"threshold_uncertainty_score":0.02222532},"labels":[],"label_agreement":null},{"id":"W1528447234","doi":"10.1145/563932.563930","title":"Classifying text documents by associating terms with text categories","year":2002,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":111,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Categorization; Computer science; Text categorization; Association rule learning; Classifier (UML); Artificial intelligence; Text mining; Natural language processing; Information retrieval; Machine learning; Data mining","score_opus":0.018336211844475054,"score_gpt":0.22870159268345128,"score_spread":0.2103653808389762,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1528447234","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.3063246,0.0059238747,0.6530637,0.0015550344,0.0009776915,0.0022412827,0.006522781,0.0044131284,0.018977888],"genre_scores_gemma":[0.29828453,0.0024575803,0.68581766,0.00018601658,0.00049061875,0.00084337493,0.0070859524,0.00015743588,0.0046768114],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9986193,0.00026289467,0.00022866773,0.0002658584,0.0005233717,0.00009997378],"domain_scores_gemma":[0.9965927,0.0018944007,0.00040196587,0.00028971492,0.0007147492,0.00010658159],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012694781,0.0009086961,0.00088141504,0.01298669,0.0010182356,0.002209197,0.0010073729,0.000993777,0.0024255626],"category_scores_gemma":[0.0068055107,0.00020439521,0.0010190901,0.008686708,0.00067737146,0.0030979512,0.0009225401,0.00086976925,0.0028692384],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00033788578,0.00050417986,0.028246187,0.0011126199,0.000150192,0.00047117245,0.0010970791,0.0030960876,0.03532609,0.009688441,0.007814031,0.9121561],"study_design_scores_gemma":[0.00028792446,0.0026050485,0.13505346,0.0017304019,0.0018366252,0.0065527274,0.007628246,0.3856679,0.104585916,0.1871757,0.16630475,0.00057134527],"about_ca_topic_score_codex":0.0014702512,"about_ca_topic_score_gemma":0.0019156091,"teacher_disagreement_score":0.01298669,"about_ca_system_score_codex":0.0005075071,"about_ca_system_score_gemma":0.00088477664,"threshold_uncertainty_score":0.008114278},"labels":[],"label_agreement":null},{"id":"W1532889113","doi":"10.1007/978-3-540-45237-9_8","title":"A Multilingual Approach to Multilingual Information Retrieval","year":2003,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Search engine indexing; Natural language processing; Information retrieval; Set (abstract data type); Artificial intelligence; Multilingualism; Programming language; Linguistics","score_opus":0.023396323009704394,"score_gpt":0.2649531029623329,"score_spread":0.24155677995262848,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1532889113","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0043865447,0.002121877,0.97831327,0.0005569549,0.00022314397,0.00009892902,0.00034181328,0.001937375,0.012020043],"genre_scores_gemma":[0.13666365,0.0034634003,0.8327941,0.0006469151,0.0008460788,0.0003151461,0.0025389092,0.0010964699,0.021635339],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9973201,0.0010878479,0.0003235109,0.0003241375,0.0007422023,0.00020217129],"domain_scores_gemma":[0.99725336,0.0008865757,0.00014130231,0.0005628946,0.0010350412,0.00012079763],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0018961295,0.0006283584,0.0010268977,0.0044307015,0.0019788134,0.0044218367,0.0015464564,0.00090297306,0.009234552],"category_scores_gemma":[0.0056556375,0.0006706569,0.0013535254,0.004684061,0.001150864,0.007512877,0.0043373033,0.0013558968,0.00472731],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003705522,0.0002467939,0.0012438061,0.0008705595,0.00026383912,0.0008028058,0.0015980134,0.010519395,0.015137597,0.18487923,0.047834825,0.73623264],"study_design_scores_gemma":[0.00011129897,0.0003043109,0.0017162809,0.00033983059,0.00062166894,0.002922732,0.0018649597,0.22672541,0.031044684,0.4064745,0.32753167,0.00034259784],"about_ca_topic_score_codex":0.0034925565,"about_ca_topic_score_gemma":0.0062133637,"teacher_disagreement_score":0.009234552,"about_ca_system_score_codex":0.0009728076,"about_ca_system_score_gemma":0.0011639262,"threshold_uncertainty_score":0.03089261},"labels":[],"label_agreement":null},{"id":"W1535872236","doi":"10.1007/978-3-642-39736-3_16","title":"Matching Semi-structured Documents Using Similarity of Regions through Fuzzy Rule-Based System","year":2013,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of New Brunswick","funders":"","keywords":"Computer science; Information retrieval; Fuzzy logic; Similarity (geometry); Categorization; Set (abstract data type); Artificial intelligence; Matching (statistics); Data mining; Representation (politics); Similarity measure; Semantic similarity; Metric (unit); Natural language processing; Image (mathematics); Mathematics","score_opus":0.031460472136494416,"score_gpt":0.2695239977017202,"score_spread":0.23806352556522578,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1535872236","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1150941,0.0007282886,0.8784064,0.0000993019,0.000115337316,0.00030911143,0.00044981172,0.0025085183,0.0022891096],"genre_scores_gemma":[0.43722004,0.0003595845,0.55970955,0.00006387524,0.000046736583,0.00014400412,0.00084685127,0.00008199303,0.0015273205],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99780554,0.00019444371,0.00034389584,0.0006825069,0.00087025523,0.00010338948],"domain_scores_gemma":[0.9978516,0.0006207771,0.00026041397,0.00028102146,0.0009133352,0.00007292296],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012262651,0.00053837884,0.0013004508,0.0035888592,0.00067222305,0.0020123483,0.0016811707,0.0009830208,0.0013128301],"category_scores_gemma":[0.0048269997,0.00036010979,0.0010686818,0.0028211114,0.0005243789,0.0021263256,0.0007760418,0.00040167817,0.0008188074],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010025944,0.00030684934,0.0056451443,0.0005630141,0.00024108733,0.0006242955,0.0006063849,0.04145616,0.09583467,0.004026763,0.0028970612,0.84679604],"study_design_scores_gemma":[0.00006896426,0.000345564,0.005643513,0.0000775409,0.00039638535,0.0008170008,0.0003505472,0.9164565,0.06465636,0.006972418,0.0041192034,0.000095942276],"about_ca_topic_score_codex":0.0045551797,"about_ca_topic_score_gemma":0.0034838845,"teacher_disagreement_score":0.0045551797,"about_ca_system_score_codex":0.00064547296,"about_ca_system_score_gemma":0.0010265309,"threshold_uncertainty_score":0.009057283},"labels":[],"label_agreement":null},{"id":"W1536461222","doi":"10.11606/t.55.2013.tde-03052013-101143","title":"Organização flexível de documentos","year":2013,"lang":"pt","type":"dissertation","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Cluster analysis; Fuzzy clustering; Computer science; Data mining; Fuzzy logic; Information retrieval; Heuristic; Cluster (spacecraft); Artificial intelligence","score_opus":0.01848219833181003,"score_gpt":0.2807644531478932,"score_spread":0.2622822548160832,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1536461222","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.13234691,0.009594461,0.6928258,0.0019402223,0.0005300088,0.0015274571,0.0029732487,0.016241014,0.14202085],"genre_scores_gemma":[0.45931885,0.0073715393,0.4892424,0.00030784248,0.0004969406,0.00092425034,0.0050141644,0.0013040442,0.036019985],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9942508,0.0014402684,0.00054293586,0.0012944626,0.0021514175,0.00032014833],"domain_scores_gemma":[0.992226,0.0027790756,0.0008366231,0.002423271,0.0014253416,0.00030968772],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004764689,0.001729319,0.0012098794,0.0068226554,0.0018434568,0.010974364,0.0017452203,0.0010582327,0.0064653363],"category_scores_gemma":[0.011747258,0.000646718,0.0015259098,0.006496454,0.0019071992,0.006921023,0.0036970838,0.0020801271,0.0038277789],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006398102,0.00025444358,0.005304929,0.002051628,0.000190221,0.0008700547,0.0031456167,0.012404282,0.020834036,0.08114258,0.0077628824,0.8653996],"study_design_scores_gemma":[0.00039634775,0.0008328029,0.014855754,0.0021183821,0.0005423841,0.0034179154,0.0062841414,0.20400539,0.07037628,0.14831096,0.548509,0.0003507955],"about_ca_topic_score_codex":0.0047574593,"about_ca_topic_score_gemma":0.0042873793,"teacher_disagreement_score":0.010974364,"about_ca_system_score_codex":0.0026476171,"about_ca_system_score_gemma":0.0020437876,"threshold_uncertainty_score":0.0251984},"labels":[],"label_agreement":null},{"id":"W1537473998","doi":"10.1007/11510888_57","title":"Text Classification Using Small Number of Features","year":2005,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":16,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Artificial intelligence; Pattern recognition (psychology); Information retrieval","score_opus":0.040018100165544614,"score_gpt":0.2860904354397913,"score_spread":0.24607233527424668,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1537473998","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10972972,0.0025847065,0.85938656,0.0005843732,0.0008998488,0.000796195,0.004365361,0.011252381,0.010400853],"genre_scores_gemma":[0.481261,0.0010852634,0.46869773,0.0002948949,0.0007476949,0.0010794341,0.01325318,0.00045417467,0.03312675],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99906975,0.00013238145,0.000112796224,0.00025868486,0.00034845588,0.00007788661],"domain_scores_gemma":[0.99771106,0.0011696843,0.00011416208,0.00045123225,0.00046683324,0.00008699799],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008726835,0.0011686026,0.0015498778,0.0029339415,0.0007693117,0.0013742403,0.0010170566,0.001011874,0.009968307],"category_scores_gemma":[0.0036518672,0.00033601228,0.0011485794,0.0028855514,0.00033538177,0.0029684403,0.0011587683,0.00083107984,0.008423195],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005413413,0.00024833603,0.001638038,0.00023394088,0.00009542357,0.00017186615,0.000033170698,0.0038168048,0.052363258,0.0010661407,0.011719549,0.9280721],"study_design_scores_gemma":[0.00020423389,0.0013436365,0.018689757,0.00014106088,0.00045452398,0.0017368101,0.00024151309,0.7912732,0.12297263,0.01949859,0.04332076,0.00012338236],"about_ca_topic_score_codex":0.0010742598,"about_ca_topic_score_gemma":0.001772072,"teacher_disagreement_score":0.009968307,"about_ca_system_score_codex":0.0003399087,"about_ca_system_score_gemma":0.000628986,"threshold_uncertainty_score":0.03334731},"labels":[],"label_agreement":null},{"id":"W1547865988","doi":"10.1007/978-3-540-88192-6_10","title":"Enhancing Text Categorization Using Sentence Semantics","year":2008,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Categorization; Natural language processing; Sentence; Phrase; Term (time); Weighting; Artificial intelligence; Set (abstract data type); Semantics (computer science); Meaning (existential); Text categorization; Word (group theory); Information retrieval; Linguistics","score_opus":0.026956552141217945,"score_gpt":0.2548127334415361,"score_spread":0.22785618130031815,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1547865988","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12377659,0.0030991447,0.84370494,0.0008646567,0.0011671068,0.00032518088,0.001897278,0.013924554,0.011240491],"genre_scores_gemma":[0.38173795,0.0013274018,0.594223,0.0004970295,0.000785614,0.0002798009,0.0074482122,0.0010572469,0.012643761],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99948895,0.00012276055,0.000056679593,0.00012809283,0.00016060098,0.000042905725],"domain_scores_gemma":[0.99859685,0.0005346497,0.00009090124,0.00013893354,0.0005810966,0.0000575261],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007201555,0.0009890627,0.00082440436,0.002151814,0.0004754127,0.001264213,0.00067987916,0.0006772042,0.0052025965],"category_scores_gemma":[0.0023184658,0.00020421638,0.00082002033,0.0017445949,0.00023856059,0.00297771,0.0010762474,0.0008022938,0.004366781],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00038591167,0.0003390405,0.0011815262,0.0004826321,0.00006929864,0.00012671483,0.00024011233,0.0023882021,0.14175117,0.0033449782,0.020822063,0.8288682],"study_design_scores_gemma":[0.00020925229,0.0012680071,0.008392013,0.00024030702,0.00080681796,0.0014700417,0.0011956376,0.5572176,0.2924755,0.060127176,0.076456964,0.0001406118],"about_ca_topic_score_codex":0.0007352123,"about_ca_topic_score_gemma":0.0012487919,"teacher_disagreement_score":0.0052025965,"about_ca_system_score_codex":0.00027263194,"about_ca_system_score_gemma":0.00047683236,"threshold_uncertainty_score":0.017404377},"labels":[],"label_agreement":null},{"id":"W1550901011","doi":"10.1002/9780470176535.ch3","title":"Feature Extraction, Selection, and Creation","year":2007,"lang":"en","type":"other","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University; École de Technologie Supérieure; Université du Québec à Montréal","funders":"","keywords":"Selection (genetic algorithm); Computer science; Feature selection; Feature (linguistics); Artificial intelligence","score_opus":0.010262836556326458,"score_gpt":0.28003685267498324,"score_spread":0.26977401611865676,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1550901011","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0132030165,0.0033384874,0.90278804,0.00079069677,0.0008615279,0.0015959517,0.011218166,0.031466894,0.03473724],"genre_scores_gemma":[0.049113877,0.0048961537,0.82310736,0.00046923058,0.00055394747,0.0020676737,0.030994935,0.0035844534,0.08521246],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99922574,0.0000668484,0.00006666111,0.00019446862,0.00037518676,0.000071049355],"domain_scores_gemma":[0.99884284,0.00039187956,0.000056362267,0.00021250865,0.00046575698,0.000030585852],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008459573,0.0012522449,0.0011231118,0.0028710712,0.00071769557,0.0018993095,0.0012192728,0.00052805163,0.03578128],"category_scores_gemma":[0.0031606322,0.0005209007,0.0011002986,0.0029540032,0.00028643978,0.0018952705,0.0008471225,0.00082027516,0.020642912],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007404179,0.00007818253,0.0006287516,0.00024847945,0.000015866668,0.00008670341,0.000058473146,0.00085199677,0.0150830895,0.0021293217,0.056860104,0.9238849],"study_design_scores_gemma":[0.00010290093,0.00040109482,0.01573759,0.0004323368,0.00019203096,0.0014234191,0.00030955434,0.06768954,0.21430834,0.022536265,0.6766802,0.0001868199],"about_ca_topic_score_codex":0.0023878363,"about_ca_topic_score_gemma":0.002545065,"teacher_disagreement_score":0.03578128,"about_ca_system_score_codex":0.00051269215,"about_ca_system_score_gemma":0.0011199574,"threshold_uncertainty_score":0.11970037},"labels":[],"label_agreement":null},{"id":"W1560461490","doi":"10.1007/978-3-642-13059-5_17","title":"Semi-supervised Probability Propagation on Instance-Attribute Graphs","year":2010,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of New Brunswick","funders":"","keywords":"Computer science; Discriminative model; Graph; Theoretical computer science; Nonparametric statistics; Artificial intelligence; Machine learning; Pattern recognition (psychology); Mathematics","score_opus":0.024539000935987827,"score_gpt":0.24331539554980702,"score_spread":0.2187763946138192,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1560461490","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010896548,0.00026013327,0.9859094,0.00024365861,0.000041943797,0.00009489899,0.0003959389,0.0012118989,0.00094558275],"genre_scores_gemma":[0.44015265,0.0008038959,0.54683435,0.0004180482,0.00040955326,0.00045476962,0.003906064,0.000629445,0.006391272],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9963683,0.0014085127,0.00021957078,0.0009627929,0.0008959073,0.0001448763],"domain_scores_gemma":[0.9773752,0.017182322,0.0009587561,0.0025745407,0.0016593514,0.0002498527],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0033046757,0.001171332,0.0016142435,0.003152239,0.00079126004,0.002124922,0.0038622462,0.0021806827,0.0023014892],"category_scores_gemma":[0.016623504,0.0012716085,0.0018454198,0.0033083274,0.001280482,0.005134026,0.0021506054,0.0027346236,0.0012276927],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004768209,0.00046747792,0.003787659,0.0006081945,0.000538399,0.00038374227,0.0003182737,0.48058388,0.0069745244,0.039640866,0.014951447,0.45126876],"study_design_scores_gemma":[0.000010194395,0.000017737817,0.0003075341,0.000018697634,0.000030733958,0.00008081673,0.0000088739125,0.9659096,0.0013772362,0.031642597,0.000586323,0.0000097640595],"about_ca_topic_score_codex":0.0028820252,"about_ca_topic_score_gemma":0.0061473786,"teacher_disagreement_score":0.0038622462,"about_ca_system_score_codex":0.0010931961,"about_ca_system_score_gemma":0.0011139244,"threshold_uncertainty_score":0.017476976},"labels":[],"label_agreement":null},{"id":"W1564407722","doi":"10.1007/978-3-540-30134-9_67","title":"Analyzing the Temporal Sequences for Text Categorization","year":2004,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Categorization; Computer science; Artificial intelligence; Classifier (UML); Text categorization; Cluster analysis; Pattern recognition (psychology); Representation (politics); Natural language processing","score_opus":0.025440861889619294,"score_gpt":0.2649863272172401,"score_spread":0.23954546532762078,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1564407722","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.20029831,0.010205283,0.76851106,0.0006460959,0.00044275686,0.00044468313,0.007364692,0.0050597633,0.0070273452],"genre_scores_gemma":[0.54998606,0.0028470214,0.42763326,0.00013078113,0.00039253544,0.00039192775,0.01300453,0.00033245335,0.0052814162],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9993036,0.00013941013,0.00007834412,0.00018622038,0.00021390524,0.000078451034],"domain_scores_gemma":[0.99758434,0.0013143114,0.00026787628,0.00021589162,0.0004794769,0.0001379681],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011412873,0.0006785224,0.0006165578,0.006003106,0.0006475047,0.0010695232,0.0008043326,0.0007000894,0.0040501812],"category_scores_gemma":[0.0039369795,0.00024416717,0.0007661588,0.0058087194,0.00032629858,0.0018220744,0.0004766274,0.00066718826,0.002472015],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006756896,0.00028936847,0.009252417,0.00045148612,0.00008939221,0.0002154078,0.00023055007,0.010399849,0.04174957,0.005160416,0.009442469,0.9220434],"study_design_scores_gemma":[0.000077004326,0.0005132425,0.01646645,0.0001970698,0.0002706817,0.001154215,0.00070672756,0.87617254,0.03653916,0.04028339,0.027534792,0.00008474888],"about_ca_topic_score_codex":0.0039422056,"about_ca_topic_score_gemma":0.004812853,"teacher_disagreement_score":0.006003106,"about_ca_system_score_codex":0.00054080563,"about_ca_system_score_gemma":0.000842788,"threshold_uncertainty_score":0.013549268},"labels":[],"label_agreement":null},{"id":"W1569526680","doi":"10.1007/978-3-540-30115-8_27","title":"An Efficient Method to Estimate Labelled Sample Size for Transductive LDA(QDA/MDA) Based on Bayes Risk","year":2004,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"University of Toronto","keywords":"Computer science; Artificial intelligence; Machine learning; Gaussian; Linear discriminant analysis; Bayes' theorem; Supervised learning; Bayesian probability; Sample size determination; Semi-supervised learning; Pattern recognition (psychology); Sample (material); Mathematics; Statistics; Artificial neural network","score_opus":0.017771599480654515,"score_gpt":0.3131416018898215,"score_spread":0.295370002409167,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1569526680","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014255382,0.000090894006,0.9977702,0.000042388525,0.000030026218,0.000051819585,0.000026883134,0.0004268726,0.00013542715],"genre_scores_gemma":[0.051827088,0.00012356846,0.94606364,0.000096302596,0.00010049781,0.00045062852,0.00025442406,0.00027188653,0.0008120036],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9933078,0.0031248122,0.00043124772,0.0010650433,0.0018673607,0.00020372157],"domain_scores_gemma":[0.9828388,0.011601579,0.00050347956,0.001975585,0.0028183316,0.00026220776],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009699789,0.0013646251,0.0031492559,0.0020878888,0.0014223116,0.0022190022,0.002849228,0.002109974,0.0037515874],"category_scores_gemma":[0.036501102,0.0011975185,0.0017287312,0.0012005521,0.0013207746,0.0036606397,0.003175874,0.003817026,0.001901064],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00040333832,0.00027280176,0.0028117343,0.0003075149,0.00027671934,0.000084195264,0.00035475736,0.11063493,0.016725898,0.04214327,0.006920399,0.8190645],"study_design_scores_gemma":[0.000040422106,0.00006653009,0.00073594577,0.000034195295,0.000049570946,0.00010886899,0.000029723582,0.95232934,0.004105156,0.040460672,0.001991976,0.00004770443],"about_ca_topic_score_codex":0.002569643,"about_ca_topic_score_gemma":0.004214403,"teacher_disagreement_score":0.009699789,"about_ca_system_score_codex":0.001637299,"about_ca_system_score_gemma":0.0021816378,"threshold_uncertainty_score":0.051298022},"labels":[],"label_agreement":null},{"id":"W1571679273","doi":"10.1007/978-3-642-02611-9_85","title":"A New Fuzzy Hierarchical Classification Based on SVM for Text Categorization","year":2009,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Sherbrooke","funders":"","keywords":"Computer science; Artificial intelligence; Support vector machine; Machine learning; Categorization; Preprocessor; Fuzzy logic; Classifier (UML); Data mining; Pattern recognition (psychology); Text categorization","score_opus":0.02621470035049042,"score_gpt":0.2659694151321511,"score_spread":0.2397547147816607,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1571679273","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020003222,0.0010852205,0.9725782,0.00015235392,0.00042688556,0.00015334792,0.00044475327,0.0026270517,0.002528855],"genre_scores_gemma":[0.21190517,0.00058608974,0.7752225,0.0002209041,0.0003290178,0.00027792997,0.0015132797,0.0001592974,0.009785757],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9988391,0.0001529478,0.000094192925,0.00024428568,0.0005780679,0.000091374],"domain_scores_gemma":[0.9992156,0.00019161082,0.00003851444,0.000081279184,0.00042559762,0.00004738329],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00084956904,0.0005268762,0.0012232979,0.0016599788,0.0007214476,0.0009539957,0.0012236388,0.00080240465,0.004125255],"category_scores_gemma":[0.001298583,0.00026180138,0.0009214582,0.0014855278,0.00023509815,0.0016542013,0.00074527046,0.00076455896,0.001979306],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00028568474,0.00017745812,0.0011651131,0.00018536221,0.00012071266,0.00006365619,0.000053872427,0.007425471,0.033341188,0.0031057445,0.009460842,0.94461477],"study_design_scores_gemma":[0.000059301306,0.00025772926,0.0040140697,0.00004449424,0.00014220625,0.00029488365,0.000059526647,0.94917357,0.026195187,0.006139986,0.01355906,0.000059921644],"about_ca_topic_score_codex":0.0034912291,"about_ca_topic_score_gemma":0.0041205566,"teacher_disagreement_score":0.004125255,"about_ca_system_score_codex":0.00061585737,"about_ca_system_score_gemma":0.0007420675,"threshold_uncertainty_score":0.013800383},"labels":[],"label_agreement":null},{"id":"W1585793187","doi":"10.1007/978-3-642-21881-1_35","title":"Incorporating Game Theory in Feature Selection for Text Categorization","year":2011,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"","keywords":"Categorization; Feature selection; Text categorization; Computer science; Selection (genetic algorithm); Feature (linguistics); Artificial intelligence; Demonstrative; Game theory; Machine learning; Natural language processing; Information retrieval; Mathematics; Linguistics; Mathematical economics","score_opus":0.02111208103021165,"score_gpt":0.24479334971361844,"score_spread":0.2236812686834068,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1585793187","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011610569,0.00025906164,0.9858591,0.00030378468,0.00006967982,0.00011658052,0.000050874332,0.00014915668,0.0015812013],"genre_scores_gemma":[0.6273198,0.0003933043,0.36576018,0.0003602533,0.00018260544,0.00048176703,0.00019685621,0.00010700274,0.005198273],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99683076,0.002085851,0.000121036865,0.000281519,0.00044444457,0.00023637399],"domain_scores_gemma":[0.9842248,0.0143360505,0.00027759388,0.00032536502,0.00060503086,0.00023114694],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0054547694,0.0010461207,0.0022636047,0.0016395639,0.00091859524,0.001972931,0.0023639875,0.0014615135,0.0031030935],"category_scores_gemma":[0.014436646,0.00065809477,0.001452445,0.0012357492,0.0011913015,0.004131464,0.0016243529,0.0020256543,0.00053347286],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00039064576,0.0006523414,0.0020351568,0.00033947953,0.00041334654,0.00018585187,0.00027666677,0.636544,0.0030349828,0.14129825,0.006864156,0.20796508],"study_design_scores_gemma":[0.00002041182,0.00004168712,0.00011129793,0.00000861038,0.000016894985,0.000015318352,0.000013199679,0.9413783,0.00020267324,0.05785289,0.000325861,0.000012860581],"about_ca_topic_score_codex":0.0049733114,"about_ca_topic_score_gemma":0.0068567027,"teacher_disagreement_score":0.0054547694,"about_ca_system_score_codex":0.0021490187,"about_ca_system_score_gemma":0.0015342779,"threshold_uncertainty_score":0.028847873},"labels":[],"label_agreement":null},{"id":"W1586413166","doi":"10.3115/1118935.1118941","title":"Text classification in Asian languages without word segmentation","year":2003,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":43,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Text segmentation; Artificial intelligence; Natural language processing; Language model; n-gram; Word (group theory); Segmentation; Feature (linguistics); Character (mathematics); Key (lock); Word lists by frequency; Simple (philosophy); Linguistics; Mathematics","score_opus":0.02359207191929053,"score_gpt":0.29467681341369245,"score_spread":0.2710847414944019,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1586413166","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.17542739,0.0006635594,0.80860156,0.0004115114,0.00017615421,0.0003496536,0.0012556842,0.0054907813,0.007623725],"genre_scores_gemma":[0.5110043,0.00031513913,0.47609097,0.00022408942,0.00015578709,0.00027492194,0.0028202226,0.00030643414,0.008808168],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99946696,0.00010981916,0.00006783788,0.0001375969,0.00015824474,0.00005963389],"domain_scores_gemma":[0.99865013,0.0003737377,0.00016954105,0.00024752395,0.00047637403,0.00008267027],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000644347,0.0008699421,0.000695827,0.0021298383,0.0007928103,0.001081589,0.0006515451,0.0006578367,0.0025449742],"category_scores_gemma":[0.0019991677,0.00019819876,0.00082014967,0.002126963,0.0003478452,0.0017729367,0.000721372,0.0005608591,0.0024462081],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00036610267,0.0003388096,0.012597713,0.00034203808,0.00016953076,0.00036944024,0.0006331161,0.011626483,0.12244176,0.0049643526,0.007673885,0.8384768],"study_design_scores_gemma":[0.00007017403,0.0005493285,0.020925073,0.0000634908,0.00029063565,0.0010164314,0.0010278593,0.77553904,0.15873224,0.015428766,0.026218113,0.00013884882],"about_ca_topic_score_codex":0.0025435209,"about_ca_topic_score_gemma":0.0063122194,"teacher_disagreement_score":0.0025449742,"about_ca_system_score_codex":0.00034944495,"about_ca_system_score_gemma":0.0008471343,"threshold_uncertainty_score":0.008513749},"labels":[],"label_agreement":null},{"id":"W158988288","doi":"","title":"Enhancing Cross Document Coreference of Web Documents with Context Similarity and Very Large Scale Text Categorization","year":2010,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Lockheed Martin (Canada)","funders":"","keywords":"Coreference; Computer science; Categorization; Context (archaeology); Task (project management); Information retrieval; Similarity (geometry); Benchmark (surveying); Set (abstract data type); Natural language processing; Feature (linguistics); Artificial intelligence; Scale (ratio); Resolution (logic)","score_opus":0.009312888888777668,"score_gpt":0.25510209062650036,"score_spread":0.24578920173772267,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W158988288","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.30064577,0.0010433774,0.6891085,0.0002504558,0.00013541573,0.00022662323,0.00030467857,0.004594643,0.003690544],"genre_scores_gemma":[0.69905645,0.0002406703,0.2930109,0.00024298056,0.00012679513,0.00019665423,0.0021854867,0.00031763426,0.004622424],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9969406,0.0010195846,0.000214553,0.00096353114,0.0005708183,0.00029101752],"domain_scores_gemma":[0.9955205,0.0023512526,0.00023605631,0.0008556412,0.0009082067,0.00012836509],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0036954435,0.0008816877,0.0011986609,0.004193358,0.0013127552,0.0014397764,0.0016906576,0.0017990292,0.0019315052],"category_scores_gemma":[0.01069567,0.00040132453,0.0011806751,0.0026520921,0.0006982111,0.003016654,0.002867757,0.0012944797,0.0016928093],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00049652316,0.0005080686,0.00999184,0.00018169379,0.00019347182,0.0002126275,0.0006531144,0.025401771,0.034693293,0.0018712317,0.0055312268,0.92026514],"study_design_scores_gemma":[0.00007133996,0.0005169964,0.01511656,0.00003268303,0.00014980724,0.0007532634,0.0005589795,0.90980977,0.05630014,0.008897886,0.007725619,0.00006701264],"about_ca_topic_score_codex":0.004000789,"about_ca_topic_score_gemma":0.0051705535,"teacher_disagreement_score":0.004193358,"about_ca_system_score_codex":0.0006155581,"about_ca_system_score_gemma":0.0010715057,"threshold_uncertainty_score":0.019543588},"labels":[],"label_agreement":null},{"id":"W1590732297","doi":"10.1007/11766247_28","title":"Beyond the Bag of Words: A Text Representation for Sentence Selection","year":2006,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":17,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Selection (genetic algorithm); Sentence; Natural language processing; Representation (politics); Artificial intelligence; Computer science; Linguistics; Psychology; Political science; Philosophy","score_opus":0.020344372462501047,"score_gpt":0.26771300048168784,"score_spread":0.2473686280191868,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1590732297","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011095362,0.0016194928,0.9731184,0.00042868318,0.0003471216,0.00025624657,0.0042449716,0.0069032027,0.0019864137],"genre_scores_gemma":[0.09605204,0.0013524146,0.8809522,0.00031767593,0.00058181834,0.00064912124,0.013965798,0.0009614574,0.0051675024],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9983241,0.0006303431,0.00019986396,0.00033318557,0.0004203239,0.00009215217],"domain_scores_gemma":[0.99667346,0.0018745179,0.00023375709,0.0004469138,0.0006406414,0.00013071032],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002015695,0.0013363098,0.0014570964,0.0035648833,0.00072116713,0.0020183616,0.0018797365,0.0011965563,0.0067927944],"category_scores_gemma":[0.006214448,0.00038391273,0.0012012899,0.0043652514,0.00039837274,0.004217742,0.0013605503,0.001391926,0.005460388],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00056594016,0.00017372423,0.00068904937,0.0004990665,0.00011284966,0.00015500603,0.0002259516,0.005545797,0.022935722,0.0054420307,0.030486338,0.9331686],"study_design_scores_gemma":[0.00018552541,0.0008695738,0.0032445989,0.0003249394,0.0005966049,0.0009647599,0.00046111597,0.7904113,0.04917656,0.07716543,0.07638138,0.00021830008],"about_ca_topic_score_codex":0.0014666734,"about_ca_topic_score_gemma":0.0016795772,"teacher_disagreement_score":0.0067927944,"about_ca_system_score_codex":0.00041943195,"about_ca_system_score_gemma":0.000965681,"threshold_uncertainty_score":0.022724152},"labels":[],"label_agreement":null},{"id":"W1595744771","doi":"10.5555/1786374.1786451","title":"Maximum entropy modeling with feature selection for text categorization","year":2008,"lang":"en","type":"article","venue":"Asia Information Retrieval Symposium","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Feature selection; Principle of maximum entropy; Categorization; Computer science; Text categorization; Artificial intelligence; Entropy (arrow of time); Pattern recognition (psychology); Feature (linguistics); Selection (genetic algorithm); Cross entropy; Data mining; Machine learning","score_opus":0.011482431156226472,"score_gpt":0.21436809348240127,"score_spread":0.2028856623261748,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1595744771","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020633234,0.00039463822,0.97752243,0.00018500962,0.00005344552,0.000044152246,0.0001541241,0.00051003107,0.00050280755],"genre_scores_gemma":[0.7482014,0.0005781764,0.2440822,0.0001531267,0.00025372682,0.0003121453,0.0011438028,0.00019322154,0.0050821477],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99918336,0.00041248335,0.000048621216,0.00012386532,0.00016130082,0.000070377784],"domain_scores_gemma":[0.99798214,0.0016008116,0.000081310805,0.0001376347,0.00016699669,0.00003106547],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0020626336,0.0006453936,0.0011998044,0.0009999593,0.0005199287,0.00094912254,0.0009645127,0.00069375127,0.0014784287],"category_scores_gemma":[0.0045423154,0.00037693814,0.0012696413,0.0011563832,0.00035310182,0.0016573116,0.0007373084,0.0009964083,0.00065463386],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00057874597,0.00031789835,0.0025475135,0.00018202534,0.0002848302,0.00020215617,0.00015318528,0.56477094,0.009636167,0.014263576,0.0060734516,0.4009895],"study_design_scores_gemma":[0.0000041786184,0.000017082135,0.00028732567,0.0000027917536,0.000010434832,0.00001160879,0.0000036643542,0.9942305,0.0006740615,0.0045646206,0.00018861113,0.0000051811876],"about_ca_topic_score_codex":0.0026499573,"about_ca_topic_score_gemma":0.0022835527,"teacher_disagreement_score":0.0026499573,"about_ca_system_score_codex":0.0005362634,"about_ca_system_score_gemma":0.0006097514,"threshold_uncertainty_score":0.010908365},"labels":[],"label_agreement":null},{"id":"W160585330","doi":"10.1007/978-3-642-33486-3_23","title":"Semi-supervised Multi-label Classification","year":2012,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":33,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Artificial intelligence; Semi-supervised learning; Machine learning; Subspace topology; Margin (machine learning); Supervised learning; Classifier (UML); Exploit; Pattern recognition (psychology); Labeled data; Unsupervised learning; Artificial neural network","score_opus":0.0571843465909377,"score_gpt":0.28266592207948016,"score_spread":0.22548157548854247,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W160585330","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012098642,0.0008525261,0.9781055,0.00028025254,0.00027056312,0.00023336415,0.0008924859,0.0041073817,0.0031593912],"genre_scores_gemma":[0.2026156,0.00055098097,0.7694378,0.00047200252,0.00043254608,0.0006722781,0.0090604825,0.0008256786,0.01593255],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9942274,0.0018422866,0.00048577168,0.0016551027,0.0014774614,0.00031189018],"domain_scores_gemma":[0.9892265,0.004197069,0.0006902558,0.002591437,0.003007493,0.00028736243],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0044231,0.0017518097,0.0027190582,0.0023322883,0.0013239408,0.0026961006,0.0037433626,0.0024476561,0.004359585],"category_scores_gemma":[0.006894827,0.00082258857,0.0021220904,0.0021594584,0.0009893351,0.003016459,0.0029560232,0.0021108838,0.0071130283],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00044862548,0.0004147531,0.0020498168,0.00058096217,0.0003233039,0.00016752836,0.00019276567,0.022053774,0.017079484,0.0036546378,0.02599479,0.9270396],"study_design_scores_gemma":[0.00003869928,0.00019801213,0.0016860937,0.00013468556,0.00014698687,0.0005329966,0.00017089453,0.9432368,0.021237757,0.020922769,0.011625667,0.00006866507],"about_ca_topic_score_codex":0.0012834338,"about_ca_topic_score_gemma":0.003816212,"teacher_disagreement_score":0.0044231,"about_ca_system_score_codex":0.00067162624,"about_ca_system_score_gemma":0.0015804861,"threshold_uncertainty_score":0.023391843},"labels":[],"label_agreement":null},{"id":"W162797994","doi":"","title":"Capturing Temporal Sequences for Text Representation Using Hierarchical SOMs.","year":2004,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Computer science; Representation (politics); Artificial intelligence; Categorization; Cluster analysis; Curse of dimensionality; Feature (linguistics); Code (set theory); Feature learning; Text categorization; Hierarchical clustering; Architecture; Unsupervised learning; Pattern recognition (psychology); Self-organizing map; Sequence (biology); Natural language processing","score_opus":0.07229402046359994,"score_gpt":0.32926944764510196,"score_spread":0.256975427181502,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W162797994","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.03871461,0.00029729895,0.9570931,0.00011352803,0.00007514372,0.000074789394,0.00058751233,0.0011141138,0.0019300152],"genre_scores_gemma":[0.397232,0.00029658733,0.5983975,0.00005102909,0.000045995017,0.0001246121,0.0012728835,0.00009465173,0.0024847414],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99985576,0.00003619024,0.000010622472,0.000030258587,0.000048137477,0.000019033521],"domain_scores_gemma":[0.99949944,0.00018066104,0.000067604604,0.00007435139,0.0001469215,0.000031045773],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00032842925,0.0003476824,0.0002275123,0.00083176675,0.00022522428,0.0006392115,0.0006053945,0.0003839175,0.0018176758],"category_scores_gemma":[0.001724767,0.00016323994,0.00047173837,0.0013355546,0.00024727272,0.0011465662,0.00041853526,0.00055690674,0.00071426074],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046196827,0.00022351368,0.004354174,0.000551647,0.00014551874,0.00024482314,0.0005465711,0.1611294,0.13129328,0.032935455,0.00885985,0.6592539],"study_design_scores_gemma":[0.000011707157,0.00004088269,0.0013086298,0.000016340065,0.000016397951,0.000068733985,0.00010469771,0.9633689,0.014067835,0.017295005,0.0036894707,0.000011500423],"about_ca_topic_score_codex":0.0032907627,"about_ca_topic_score_gemma":0.0062088375,"teacher_disagreement_score":0.0032907627,"about_ca_system_score_codex":0.00041923163,"about_ca_system_score_gemma":0.00038639648,"threshold_uncertainty_score":0.006543219},"labels":[],"label_agreement":null},{"id":"W1632892920","doi":"10.3233/ida-2002-6204","title":"Boosting strategy for classification","year":2002,"lang":"en","type":"article","venue":"Intelligent Data Analysis","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Canadian Imperial Bank of Commerce (Canada)","funders":"","keywords":"Boosting (machine learning); Artificial intelligence; Computer science; Pattern recognition (psychology); Machine learning","score_opus":0.31184824777260145,"score_gpt":0.36698307522512075,"score_spread":0.0551348274525193,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1632892920","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0014015381,0.00162864,0.9920952,0.00022096609,0.00020114933,0.00007831989,0.0000369215,0.00035194194,0.0039854203],"genre_scores_gemma":[0.14295997,0.0030592838,0.83851695,0.0008357405,0.00096635224,0.0006510697,0.00035438073,0.0002346924,0.0124216825],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9978666,0.00073043315,0.000113095186,0.000343969,0.0008216167,0.0001242796],"domain_scores_gemma":[0.9988662,0.0005155922,0.000060414135,0.00020534803,0.0003004208,0.00005203005],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0028410314,0.0010465502,0.0021216525,0.0017114558,0.0006452934,0.0018133733,0.001979731,0.0015678371,0.0046150363],"category_scores_gemma":[0.0050019547,0.00052683626,0.0014002676,0.0016327299,0.00084281457,0.0018794269,0.0014236605,0.002015184,0.005176905],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00010582845,0.00011851026,0.0008492229,0.00039805047,0.00026096622,0.00013190511,0.00018026232,0.11010607,0.007528349,0.2155313,0.016857404,0.6479321],"study_design_scores_gemma":[0.000050243023,0.00017398274,0.00040799342,0.00009741072,0.00007221677,0.00029915053,0.000032286065,0.714772,0.0047988454,0.22107863,0.058170132,0.000047200072],"about_ca_topic_score_codex":0.0006992792,"about_ca_topic_score_gemma":0.0005377962,"teacher_disagreement_score":0.0046150363,"about_ca_system_score_codex":0.0007166605,"about_ca_system_score_gemma":0.00065724546,"threshold_uncertainty_score":0.015438855},"labels":[],"label_agreement":null},{"id":"W167522204","doi":"","title":"Beyond TFIDF weighting for text categorization in the vector space model","year":2005,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":232,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval","funders":"","keywords":"Weighting; tf–idf; Vector space model; Computer science; Artificial intelligence; Categorization; Leverage (statistics); Vocabulary; Feature selection; Support vector machine; Text categorization; Word (group theory); Feature vector; Natural language processing; Machine learning; Information retrieval; Pattern recognition (psychology); Mathematics; Term (time)","score_opus":0.02088681033409115,"score_gpt":0.2605201725384578,"score_spread":0.23963336220436662,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W167522204","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0069516073,0.0018671585,0.98831964,0.00030608082,0.00017190748,0.000082468185,0.00012375477,0.00048425092,0.0016931444],"genre_scores_gemma":[0.2809679,0.0031575314,0.70256704,0.0003590392,0.000948815,0.0003813535,0.0009544413,0.00031918724,0.010344768],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99740905,0.0010357929,0.00018100762,0.00038445301,0.0008324778,0.0001573406],"domain_scores_gemma":[0.99539644,0.0024802764,0.00028418278,0.00082260737,0.00091389526,0.0001025363],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0041207187,0.0011103632,0.0016118138,0.003532721,0.0007365138,0.0022819345,0.0014361298,0.001757777,0.0037789394],"category_scores_gemma":[0.012652707,0.00029786985,0.0011568735,0.0056226887,0.0009035217,0.0068755317,0.0007987497,0.0014573116,0.0025312977],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021653398,0.00017351008,0.001849657,0.0003874978,0.0001277073,0.00010213389,0.00023086795,0.061755337,0.008326645,0.09910979,0.008145613,0.81957483],"study_design_scores_gemma":[0.000029890103,0.00013373847,0.0011243446,0.00006139974,0.000045228237,0.00024565967,0.00006912193,0.7415646,0.005202009,0.23541516,0.016035767,0.00007302973],"about_ca_topic_score_codex":0.003041183,"about_ca_topic_score_gemma":0.002228802,"teacher_disagreement_score":0.0041207187,"about_ca_system_score_codex":0.0012527055,"about_ca_system_score_gemma":0.00091940217,"threshold_uncertainty_score":0.02179271},"labels":[],"label_agreement":null},{"id":"W1714192071","doi":"","title":"Categorical proportional difference: a feature selection method for text categorization","year":2008,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":47,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"","keywords":"Artificial intelligence; Computer science; Feature selection; Categorical variable; Word (group theory); Task (project management); Naive Bayes classifier; Mutual information; Natural language processing; Feature (linguistics); Selection (genetic algorithm); Categorization; Measure (data warehouse); Support vector machine; Pattern recognition (psychology); Machine learning; Data mining; Mathematics","score_opus":0.029536126455235182,"score_gpt":0.2917414232733742,"score_spread":0.26220529681813903,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1714192071","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02636944,0.0006221407,0.96676666,0.00019541422,0.0002027513,0.00051568646,0.0008954974,0.003328197,0.0011043194],"genre_scores_gemma":[0.2976147,0.0002333767,0.69574857,0.00028408147,0.00021981116,0.0011080637,0.002049441,0.0002480662,0.0024938376],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9960334,0.0011607514,0.00033446972,0.0008092428,0.0014814337,0.00018067437],"domain_scores_gemma":[0.9956702,0.0022949593,0.000312341,0.00048627806,0.0011295311,0.0001066317],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0045283716,0.0010819188,0.0013745314,0.005162566,0.0006889248,0.0009572151,0.0017120065,0.0008905767,0.0028250527],"category_scores_gemma":[0.009728521,0.00027336853,0.0013182008,0.003916801,0.00065718184,0.0014125556,0.0011310391,0.0011360662,0.0011865954],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007381495,0.00026307837,0.0051297112,0.00029190356,0.00024488557,0.0001514952,0.00020432817,0.009801404,0.020922653,0.0030250305,0.0087246895,0.95050263],"study_design_scores_gemma":[0.0004030557,0.001231861,0.022209672,0.00008361142,0.00025022775,0.0015562859,0.00028467912,0.8563497,0.05742226,0.027865764,0.032047298,0.00029549678],"about_ca_topic_score_codex":0.001420061,"about_ca_topic_score_gemma":0.0013008651,"teacher_disagreement_score":0.005162566,"about_ca_system_score_codex":0.00064650946,"about_ca_system_score_gemma":0.0008573253,"threshold_uncertainty_score":0.02394861},"labels":[],"label_agreement":null},{"id":"W1718341272","doi":"10.1007/3-540-44645-1_18","title":"Multilingual Information Retrieval Based on Parallel Texts from the Web","year":2001,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":16,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Clef; Machine translation; Information retrieval; Parallel corpora; Cross-language information retrieval; Artificial intelligence; Natural language processing; Task (project management); Web page; World Wide Web","score_opus":0.018873960000008832,"score_gpt":0.2507413725531626,"score_spread":0.23186741255315377,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1718341272","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12825903,0.011849009,0.79962146,0.0018267389,0.0007977145,0.0004811405,0.004619722,0.011630627,0.040914547],"genre_scores_gemma":[0.4007663,0.007886554,0.545829,0.00046358985,0.0013144788,0.00044034922,0.015204636,0.0012423666,0.026852757],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99907327,0.0002891013,0.000112838374,0.00017535148,0.0002819242,0.00006751362],"domain_scores_gemma":[0.99845934,0.00082323333,0.00009640993,0.00018317073,0.00037192335,0.000065874905],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006175537,0.0007286841,0.0011605275,0.0056511667,0.00093335164,0.0028366377,0.00080194644,0.00074497936,0.009505312],"category_scores_gemma":[0.0038229323,0.00041097685,0.00072171784,0.005264392,0.00052916363,0.0060636313,0.0018446933,0.0008480827,0.006155156],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014101604,0.00035467526,0.0010655073,0.0013061531,0.00017876123,0.0009322191,0.0005064256,0.007790829,0.06377114,0.018250298,0.029253935,0.87518],"study_design_scores_gemma":[0.00047757427,0.00079499936,0.005790822,0.0004976858,0.00097212754,0.0038814112,0.0013935505,0.50492996,0.1855273,0.12630907,0.16908643,0.00033916187],"about_ca_topic_score_codex":0.0011636296,"about_ca_topic_score_gemma":0.0018027931,"teacher_disagreement_score":0.009505312,"about_ca_system_score_codex":0.0005176774,"about_ca_system_score_gemma":0.0006422042,"threshold_uncertainty_score":0.031798422},"labels":[],"label_agreement":null},{"id":"W1749331913","doi":"10.1007/978-3-642-03070-3_50","title":"New Semantic Similarity Based Model for Text Clustering Using Extended Gloss Overlaps","year":2009,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":16,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; WordNet; Semantic similarity; Vector space model; Ambiguity; Cluster analysis; Natural language processing; Artificial intelligence; Explicit semantic analysis; Information retrieval; Similarity (geometry); Semantic computing; Semantic Web; Semantic technology; Image (mathematics)","score_opus":0.043327171249890384,"score_gpt":0.2861407243885287,"score_spread":0.24281355313863834,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1749331913","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010340524,0.00039485528,0.9837336,0.00014068262,0.00008058087,0.0001786091,0.0010554821,0.0019645214,0.002111153],"genre_scores_gemma":[0.21011506,0.0005527406,0.7714465,0.00019329459,0.00017619439,0.00077615154,0.0075682113,0.0007491472,0.008422595],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99664634,0.0006202864,0.00041947525,0.0007845332,0.0013754732,0.00015384435],"domain_scores_gemma":[0.9975338,0.0006565401,0.00016729666,0.00064684794,0.0009198676,0.00007564802],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0018272218,0.00087944826,0.0014528048,0.0045803385,0.0013750206,0.0024979478,0.0031096498,0.0016511714,0.003796825],"category_scores_gemma":[0.0058868895,0.0005598966,0.0019257546,0.0051265275,0.00080856617,0.006724368,0.0025608405,0.001339852,0.0025112447],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00092129566,0.0006024571,0.003856904,0.0007403235,0.0005379464,0.00048210312,0.0011481686,0.113998234,0.026113357,0.09465429,0.024503801,0.7324411],"study_design_scores_gemma":[0.000032298478,0.000087953915,0.0010905161,0.00005556083,0.00012271032,0.0002631301,0.0001517946,0.9444794,0.0068644015,0.03675791,0.01003093,0.00006345367],"about_ca_topic_score_codex":0.00836304,"about_ca_topic_score_gemma":0.011660581,"teacher_disagreement_score":0.00836304,"about_ca_system_score_codex":0.0013160099,"about_ca_system_score_gemma":0.0014502407,"threshold_uncertainty_score":0.016628742},"labels":[],"label_agreement":null},{"id":"W1765750589","doi":"10.1007/3-540-32394-5_2","title":"An Evidential Approach to Classification Combination for Text Categorisation","year":2006,"lang":"en","type":"book-chapter","venue":"Studies in fuzziness and soft computing","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"","keywords":"Artificial intelligence; Perspective (graphical); Computer science; Categorization; Evidential reasoning approach; Support vector machine; Machine learning; Pattern recognition (psychology); Text categorization; k-nearest neighbors algorithm; Decision support system","score_opus":0.08955658772586585,"score_gpt":0.337119009009146,"score_spread":0.24756242128328015,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1765750589","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0026277911,0.00036093916,0.99392235,0.00030792638,0.000075073774,0.00006650566,0.00005739492,0.0002695815,0.0023125035],"genre_scores_gemma":[0.13549213,0.00036356706,0.8580589,0.000273537,0.0003753713,0.0002620289,0.00035335956,0.00007760302,0.0047433753],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9914385,0.0030163804,0.0009094701,0.0013345149,0.0030677554,0.00023339153],"domain_scores_gemma":[0.98685247,0.008489595,0.0005055816,0.002115772,0.0018997212,0.0001368774],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008566208,0.00077565445,0.0015810339,0.0036834616,0.001526989,0.0043116407,0.0035214385,0.0017829287,0.0059708217],"category_scores_gemma":[0.022704273,0.0007974861,0.002472302,0.0030687498,0.0027557611,0.00835666,0.0030577702,0.0040889066,0.0015916479],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018062796,0.0001899165,0.0008993413,0.00045799417,0.00022332714,0.00029896433,0.001129601,0.020031393,0.005136522,0.5058984,0.0064509176,0.45910308],"study_design_scores_gemma":[0.000021268303,0.0001088189,0.00065614586,0.00012697613,0.00015574066,0.00043562026,0.00014780794,0.318425,0.00524959,0.6604118,0.014198103,0.00006314512],"about_ca_topic_score_codex":0.0006389931,"about_ca_topic_score_gemma":0.0013425791,"teacher_disagreement_score":0.008566208,"about_ca_system_score_codex":0.0010819688,"about_ca_system_score_gemma":0.0010163607,"threshold_uncertainty_score":0.045303047},"labels":[],"label_agreement":null},{"id":"W1772561895","doi":"10.22456/2175-2745.39702","title":"Support Vector Machines and Kernel Functions for Text Processing","year":2013,"lang":"en","type":"article","venue":"Revista de Informática Teórica e Aplicada","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":16,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"York University","keywords":"Support vector machine; Computer science; Preprocessor; Kernel method; Artificial intelligence; Kernel (algebra); Radial basis function kernel; Polynomial kernel; Tree kernel; String kernel; Classifier (UML); Structured support vector machine; Pattern recognition (psychology); Relevance vector machine; Machine learning; Mathematics; Discrete mathematics","score_opus":0.013212008035483972,"score_gpt":0.25099284871470506,"score_spread":0.2377808406792211,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1772561895","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0035284632,0.008124978,0.9818202,0.000813002,0.00031023493,0.000073894786,0.00023300185,0.001407314,0.003688842],"genre_scores_gemma":[0.12522608,0.01414216,0.8470078,0.000510372,0.0012593224,0.00035501446,0.0011894563,0.00046503174,0.009844679],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99772435,0.0007548629,0.00021145119,0.00034056848,0.00083772256,0.0001310251],"domain_scores_gemma":[0.99649966,0.0020770407,0.0003831451,0.00038609823,0.00058520795,0.000068864276],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019378518,0.0011530817,0.0012124862,0.003285565,0.00048614765,0.003049168,0.0014217171,0.0019868067,0.004213181],"category_scores_gemma":[0.009374789,0.00039048138,0.0010993079,0.0048945965,0.0012437736,0.004787968,0.0009195345,0.0023372865,0.0050408207],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017010144,0.000114006136,0.00099316,0.0013173635,0.0001469991,0.00038573006,0.00032459674,0.04348597,0.0093191415,0.16946499,0.018365216,0.7559128],"study_design_scores_gemma":[0.00003541671,0.00016635445,0.002019154,0.00041285696,0.00007792936,0.0007855204,0.00028052792,0.5552259,0.017045613,0.31400853,0.109785296,0.00015690053],"about_ca_topic_score_codex":0.00078827114,"about_ca_topic_score_gemma":0.00051442283,"teacher_disagreement_score":0.004213181,"about_ca_system_score_codex":0.0008256595,"about_ca_system_score_gemma":0.00069819676,"threshold_uncertainty_score":0.014094532},"labels":[],"label_agreement":null},{"id":"W1806134291","doi":"10.5555/1793274.1793337","title":"Integrating structure and meaning: a new method for encoding structure for text classification","year":2008,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; ENCODE; Natural language processing; Encoding (memory); Artificial intelligence; Representation (politics); Word (group theory); Semantics (computer science); Feature (linguistics); Syntactic structure; Curse of dimensionality; Computation; Scheme (mathematics); Information retrieval; Linguistics; Syntax; Algorithm; Mathematics","score_opus":0.054831259281673025,"score_gpt":0.32242067072547426,"score_spread":0.2675894114438012,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1806134291","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005606349,0.00052333943,0.9856337,0.00055063184,0.00031644758,0.00018309096,0.0011789387,0.004210743,0.0017966975],"genre_scores_gemma":[0.044141695,0.00048201083,0.94935304,0.00026724342,0.00024309481,0.00040451772,0.0018163335,0.00064784056,0.0026443342],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.997693,0.00048308188,0.0004137874,0.00048821673,0.00080798246,0.000113876864],"domain_scores_gemma":[0.9945328,0.002265577,0.00044934682,0.0013154243,0.0012424755,0.0001943412],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0020994004,0.001002287,0.0010356575,0.0051030396,0.0011591739,0.003026098,0.0014837303,0.0012839162,0.0043558404],"category_scores_gemma":[0.011397576,0.0006334471,0.001550844,0.0053538037,0.0014509306,0.009154588,0.002606229,0.0022552987,0.002464132],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00026198555,0.00010669537,0.0015475048,0.00052433903,0.0001028716,0.00015450944,0.001352579,0.0027755937,0.021742675,0.084292024,0.020551872,0.86658734],"study_design_scores_gemma":[0.0001606754,0.00048148705,0.002992215,0.00064621336,0.000536282,0.001066032,0.0010607438,0.27803993,0.052064825,0.48544976,0.17722419,0.00027767674],"about_ca_topic_score_codex":0.0019515733,"about_ca_topic_score_gemma":0.0028176648,"teacher_disagreement_score":0.0051030396,"about_ca_system_score_codex":0.0009436507,"about_ca_system_score_gemma":0.0018949863,"threshold_uncertainty_score":0.014571786},"labels":[],"label_agreement":null},{"id":"W1826301668","doi":"10.1109/ijcnn.2003.1223678","title":"A comparison of SOM based document categorization systems","year":2004,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Categorization; Computer science; Artificial intelligence; Self-organizing map; Architecture; Feature (linguistics); Feature vector; Space (punctuation); Unsupervised learning; Text categorization; Machine learning; Data mining; Pattern recognition (psychology); Cluster analysis","score_opus":0.03131328734871104,"score_gpt":0.3084639845942755,"score_spread":0.27715069724556446,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1826301668","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6240831,0.008411445,0.29301926,0.0011803099,0.001130554,0.0010575247,0.0032089583,0.018385684,0.049523227],"genre_scores_gemma":[0.7558211,0.0031127024,0.21874957,0.00025323,0.00019601661,0.00048146356,0.005949226,0.0003763,0.015060459],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9983985,0.00029881662,0.00015306153,0.00018184098,0.00085087196,0.00011695245],"domain_scores_gemma":[0.99622995,0.0011958559,0.0000946522,0.00036326412,0.0019390242,0.00017724589],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00275773,0.00050076836,0.0008786174,0.0036345324,0.0006860485,0.0019033651,0.0011617478,0.001014195,0.0037988417],"category_scores_gemma":[0.0057963347,0.00023268837,0.00057109003,0.0026468982,0.0002365509,0.0020245258,0.00078913954,0.00040111854,0.0019377143],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0024869414,0.0006031044,0.009267745,0.0010636867,0.00045837878,0.000099998986,0.00028293097,0.021176178,0.016415255,0.0040976773,0.009349488,0.93469876],"study_design_scores_gemma":[0.00051323493,0.003095888,0.04281564,0.0003559363,0.0006522976,0.00062417553,0.0019247873,0.79281956,0.079699,0.009876447,0.06737464,0.00024839307],"about_ca_topic_score_codex":0.0047620744,"about_ca_topic_score_gemma":0.00638646,"teacher_disagreement_score":0.0047620744,"about_ca_system_score_codex":0.0011062225,"about_ca_system_score_gemma":0.0008276453,"threshold_uncertainty_score":0.014584422},"labels":[],"label_agreement":null},{"id":"W1828567212","doi":"10.1016/j.eswa.2015.09.044","title":"A latent Beta-Liouville allocation model","year":2015,"lang":"en","type":"article","venue":"Expert Systems with Applications","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Latent Dirichlet allocation; Computer science; Prior probability; Dirichlet distribution; Artificial intelligence; Consistency (knowledge bases); Topic model; Machine learning; Categorization; Latent variable; Beta distribution; Pattern recognition (psychology); Mathematics; Bayesian probability; Statistics","score_opus":0.051503094570884714,"score_gpt":0.2743410845641952,"score_spread":0.2228379899933105,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1828567212","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017697508,0.00044222802,0.9738961,0.00105347,0.000110851135,0.000059551796,0.0003385229,0.0003197755,0.0060821003],"genre_scores_gemma":[0.69857496,0.0011551509,0.22111182,0.0009370363,0.0005054662,0.0007784293,0.0015453257,0.00035777586,0.07503405],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9979079,0.0012081221,0.00006909339,0.00038942092,0.0002174907,0.0002080193],"domain_scores_gemma":[0.9955059,0.0029396634,0.00029076118,0.00042030716,0.0005478092,0.00029549352],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0038986336,0.0007037967,0.0017791832,0.0015675201,0.0011776126,0.004108306,0.003393218,0.003451847,0.012019372],"category_scores_gemma":[0.010577857,0.0008415659,0.0012606814,0.0022157317,0.0019853606,0.0040109945,0.002153123,0.0030896862,0.0037167843],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020535843,0.00018433595,0.0015559496,0.00012018993,0.00010527314,0.00012523343,0.00023735639,0.21697715,0.0009165197,0.7149988,0.008232394,0.056341525],"study_design_scores_gemma":[0.00003258099,0.000029203184,0.00019065474,0.000021035828,0.000019515857,0.000042732907,0.000024991816,0.8416613,0.00017600138,0.15521644,0.0025657113,0.000019916457],"about_ca_topic_score_codex":0.0041809455,"about_ca_topic_score_gemma":0.004372941,"teacher_disagreement_score":0.012019372,"about_ca_system_score_codex":0.0018374799,"about_ca_system_score_gemma":0.001867406,"threshold_uncertainty_score":0.040208757},"labels":[],"label_agreement":null},{"id":"W1845278523","doi":"10.1007/3-540-70659-3_58","title":"Document Classification Using Phrases","year":2002,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Natural language processing; Computer science; Artificial intelligence; Grammar; Classifier (UML); Naive Bayes classifier; Bayes classifier; Pattern recognition (psychology); Linguistics; Support vector machine","score_opus":0.04930136608321829,"score_gpt":0.27855149538897356,"score_spread":0.22925012930575528,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1845278523","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.019356057,0.007537655,0.9186376,0.0009195436,0.0015411293,0.0009769253,0.010059494,0.013921842,0.02704974],"genre_scores_gemma":[0.10386794,0.0051341755,0.81796163,0.00048384522,0.0010124808,0.0009200961,0.024390593,0.0009229488,0.04530628],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9986066,0.00022342213,0.00020201321,0.0003943276,0.0004724678,0.000101139085],"domain_scores_gemma":[0.99824095,0.00066894037,0.000106544474,0.0003291172,0.00058126,0.00007315889],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011158352,0.0015671335,0.001395004,0.007907696,0.0011687519,0.0031831039,0.0011582435,0.0009448968,0.019407429],"category_scores_gemma":[0.0038997207,0.00043625827,0.001729714,0.007909016,0.0005759639,0.0035148119,0.0014917374,0.001376796,0.023780394],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015458,0.00009363759,0.000960238,0.00052913796,0.00009963811,0.00012008785,0.00009508795,0.0012571298,0.02114435,0.0070304554,0.029954424,0.93856114],"study_design_scores_gemma":[0.00017676673,0.0012505391,0.007917932,0.0009073509,0.0010934768,0.0033326694,0.00072888436,0.24553941,0.1847755,0.10017081,0.45385513,0.0002514735],"about_ca_topic_score_codex":0.0011270688,"about_ca_topic_score_gemma":0.0013489833,"teacher_disagreement_score":0.019407429,"about_ca_system_score_codex":0.00058929896,"about_ca_system_score_gemma":0.0009869726,"threshold_uncertainty_score":0.0649243},"labels":[],"label_agreement":null},{"id":"W18794550","doi":"10.24348/coria.2005.50","title":"Étude sur l'impact du sous-langage dans la classification automatique d'appels d'offres.","year":2005,"lang":"fr","type":"article","venue":"Association en Recherche d’Information et Applications","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Humanities; Philosophy","score_opus":0.06243501596119376,"score_gpt":0.34292259833258215,"score_spread":0.2804875823713884,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W18794550","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.53248525,0.005225168,0.43589318,0.00092025363,0.00051553437,0.0009879393,0.0039320737,0.009538033,0.010502573],"genre_scores_gemma":[0.48393667,0.0011242727,0.4934282,0.00023193755,0.00016114718,0.0004856795,0.006298713,0.00075127376,0.013582085],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9959532,0.0012895026,0.00046335225,0.0006994409,0.001383594,0.00021079378],"domain_scores_gemma":[0.97503823,0.015103803,0.0014518689,0.0018329562,0.0061590457,0.00041405694],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0046968334,0.00081434567,0.0008276354,0.0034673114,0.0011857925,0.0029062761,0.00089871604,0.0012897563,0.0036863585],"category_scores_gemma":[0.019700177,0.0002625433,0.001010593,0.0025249585,0.000597791,0.0028444862,0.00088970736,0.0010434461,0.0033922086],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000970969,0.00029003114,0.029557265,0.00090306654,0.00017806957,0.0002726735,0.0018294721,0.0035275081,0.08067712,0.0017829328,0.0070473608,0.87296355],"study_design_scores_gemma":[0.00025167226,0.0025546455,0.14696826,0.00092271477,0.0012442295,0.0043559903,0.005783705,0.3286924,0.3519598,0.005941046,0.15096892,0.00035668476],"about_ca_topic_score_codex":0.009500137,"about_ca_topic_score_gemma":0.016111027,"teacher_disagreement_score":0.009500137,"about_ca_system_score_codex":0.00067984225,"about_ca_system_score_gemma":0.0012539936,"threshold_uncertainty_score":0.02483952},"labels":[],"label_agreement":null},{"id":"W1881830221","doi":"10.1111/coin.12064","title":"Document Clustering With Dual Supervision Through Feature Reweighting","year":2015,"lang":"en","type":"article","venue":"Computational Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":22,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"Canadian Network for Research and Innovation in Machining Technology, Natural Sciences and Engineering Research Council of Canada","keywords":"Cluster analysis; Computer science; Feature (linguistics); Brown clustering; Artificial intelligence; Pairwise comparison; Correlation clustering; Pattern recognition (psychology); Fuzzy clustering; Consensus clustering; Data mining; Conceptual clustering; Machine learning; Canopy clustering algorithm","score_opus":0.05995408911021713,"score_gpt":0.3051056388127768,"score_spread":0.24515154970255967,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1881830221","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.023208095,0.0002368133,0.97132224,0.00014137586,0.00004822919,0.00011644798,0.00020595545,0.0033852311,0.0013354984],"genre_scores_gemma":[0.3400945,0.000192639,0.6529134,0.00018349689,0.000118238815,0.00030096673,0.001748711,0.00047324222,0.0039748037],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9980367,0.00050802936,0.0001293478,0.00064094097,0.00055786694,0.00012715533],"domain_scores_gemma":[0.9966827,0.00078713463,0.0002784317,0.0010698534,0.0010423197,0.00013961359],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019726409,0.0011293779,0.0013541075,0.0015685107,0.0008718021,0.001300877,0.0022235413,0.0011404586,0.0020489292],"category_scores_gemma":[0.0073414086,0.0004503411,0.0009166433,0.0019857027,0.0008963191,0.0022307744,0.0017951628,0.0017332442,0.0020339196],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046751313,0.00032695438,0.0029240565,0.00023927267,0.00020189134,0.00011465133,0.00038437443,0.08059643,0.025274307,0.0074240165,0.012039909,0.8700067],"study_design_scores_gemma":[0.00003825895,0.00008238704,0.00086429407,0.000018065597,0.000045037348,0.00010427509,0.000055724762,0.973424,0.010672913,0.010977823,0.0036869252,0.000030372534],"about_ca_topic_score_codex":0.0033380617,"about_ca_topic_score_gemma":0.0065177362,"teacher_disagreement_score":0.0033380617,"about_ca_system_score_codex":0.0007022878,"about_ca_system_score_gemma":0.001399643,"threshold_uncertainty_score":0.010432482},"labels":[],"label_agreement":null},{"id":"W1882783948","doi":"10.1007/978-3-642-32584-7_30","title":"Classifying Websites into Non-topical Categories","year":2012,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Bigram; Classifier (UML); Information retrieval; Web page; Support vector machine; Set (abstract data type); Artificial intelligence; World Wide Web; Trigram","score_opus":0.022527970990159556,"score_gpt":0.26058073308932184,"score_spread":0.2380527620991623,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1882783948","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.67578036,0.010614765,0.17443587,0.0011765669,0.00074411754,0.0009885762,0.014530282,0.004981613,0.116747804],"genre_scores_gemma":[0.8425495,0.004041582,0.09431517,0.0002580176,0.00056948204,0.0003252066,0.023746014,0.0004907468,0.03370427],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99898595,0.00012919282,0.00008968969,0.0001912561,0.0004568204,0.00014707838],"domain_scores_gemma":[0.99763083,0.00080158544,0.00021486131,0.0002674783,0.0008842931,0.0002007895],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00057238975,0.0006951165,0.0005855349,0.012777232,0.00092500495,0.002951535,0.00061275694,0.0006547003,0.0037021893],"category_scores_gemma":[0.0027642576,0.00016980892,0.0007827131,0.008338794,0.00042708352,0.0025184515,0.0008213472,0.00068314647,0.004754498],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027835515,0.0005484176,0.085741214,0.0012478451,0.00016805089,0.00032124366,0.0012457286,0.0012167165,0.03581987,0.008238143,0.035736065,0.8294384],"study_design_scores_gemma":[0.000085232816,0.0010915211,0.42135125,0.0014981225,0.0012981952,0.005396163,0.011895535,0.1678116,0.0861161,0.07510768,0.2281294,0.00021920024],"about_ca_topic_score_codex":0.001677669,"about_ca_topic_score_gemma":0.0038915996,"teacher_disagreement_score":0.012777232,"about_ca_system_score_codex":0.0005421661,"about_ca_system_score_gemma":0.0006541652,"threshold_uncertainty_score":0.01238507},"labels":[],"label_agreement":null},{"id":"W1888496803","doi":"10.1007/978-3-642-02976-9_46","title":"Automatic Detecting Documents Containing Personal Health Information","year":2009,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"National Research Council Canada","funders":"","keywords":"Computer science; Artificial intelligence; Decision tree; Support vector machine; Natural language processing; Categorization; Information retrieval; Lexical analysis; Text categorization; Naive Bayes classifier; The Internet; Task (project management); Supervised learning; Machine learning; World Wide Web","score_opus":0.01851048022841444,"score_gpt":0.268608716320946,"score_spread":0.25009823609253157,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1888496803","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5632409,0.024899995,0.32238054,0.0024690228,0.0021325438,0.0013245668,0.038387366,0.020241344,0.02492367],"genre_scores_gemma":[0.5754009,0.0061358586,0.3485603,0.0005860273,0.0010782116,0.00028623175,0.03830288,0.0005143533,0.029135203],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9994276,0.00005338047,0.00006495396,0.00013569328,0.0002489237,0.00006941414],"domain_scores_gemma":[0.9971601,0.0014627913,0.0002970033,0.00021136587,0.000741021,0.00012768582],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00060792296,0.0007091867,0.0008068571,0.00548948,0.0007471745,0.0014875777,0.00068324123,0.001070126,0.0030000042],"category_scores_gemma":[0.002602601,0.00027193414,0.0005332294,0.0026340568,0.00028611062,0.0010163089,0.0004812782,0.0005128427,0.0028314956],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00090097357,0.0003798194,0.017462622,0.0011625965,0.00010021162,0.0013893197,0.00042211352,0.0009981332,0.14661086,0.0016089039,0.042962674,0.78600174],"study_design_scores_gemma":[0.00021755665,0.000969606,0.13186717,0.0007058643,0.001278007,0.01517237,0.0016420103,0.13385747,0.55694324,0.008992075,0.1481506,0.00020404955],"about_ca_topic_score_codex":0.0033692184,"about_ca_topic_score_gemma":0.0048947707,"teacher_disagreement_score":0.00548948,"about_ca_system_score_codex":0.0005197352,"about_ca_system_score_gemma":0.0008267159,"threshold_uncertainty_score":0.010035992},"labels":[],"label_agreement":null},{"id":"W1888927200","doi":"10.3233/ida-2012-00557","title":"Feature ranking fusion for text classifier","year":2012,"lang":"en","type":"article","venue":"Intelligent Data Analysis","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo; Ontario Tech University","funders":"","keywords":"Artificial intelligence; Pattern recognition (psychology); Classifier (UML); Computer science; Fusion; Machine learning; Natural language processing; Linguistics","score_opus":0.09784571685237035,"score_gpt":0.34321365686519,"score_spread":0.24536794001281964,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1888927200","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04925236,0.0027853723,0.9327549,0.00047774962,0.00057839253,0.00027645964,0.0013537769,0.006273726,0.0062472047],"genre_scores_gemma":[0.6586749,0.0010563495,0.32390907,0.00034319132,0.0008828534,0.00045505894,0.004938137,0.00030137194,0.009439055],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9976234,0.00038330766,0.00017937225,0.00040894785,0.0011348759,0.00027010424],"domain_scores_gemma":[0.99783427,0.00045096574,0.00013707625,0.0003081781,0.0011771534,0.00009241597],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001966682,0.0010466175,0.0019592238,0.0034706015,0.000818617,0.0016307412,0.0011144027,0.0012677182,0.004750905],"category_scores_gemma":[0.004466045,0.00023224641,0.0013576484,0.0033702464,0.00029688858,0.0020490072,0.0008757263,0.0010180585,0.0046052355],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00062357297,0.0003137747,0.0021000858,0.0002294955,0.00017989137,0.00016988735,0.00006540603,0.019247778,0.05403979,0.0035952108,0.019654194,0.8997809],"study_design_scores_gemma":[0.00007071642,0.0005618205,0.0066200807,0.000046588677,0.00030718106,0.00035344524,0.000084028456,0.9083929,0.05756773,0.010140592,0.015749201,0.000105669955],"about_ca_topic_score_codex":0.001982544,"about_ca_topic_score_gemma":0.0021428943,"teacher_disagreement_score":0.004750905,"about_ca_system_score_codex":0.00071139104,"about_ca_system_score_gemma":0.00094450655,"threshold_uncertainty_score":0.01589334},"labels":[],"label_agreement":null},{"id":"W1902658720","doi":"10.5430/air.v4n2p143","title":"A text feature selection method based on category-distribution divergence","year":2015,"lang":"en","type":"article","venue":"Artificial Intelligence Research","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"National Natural Science Foundation of China","keywords":"Feature selection; Selection (genetic algorithm); Divergence (linguistics); Artificial intelligence; Computer science; Feature (linguistics); Natural language processing; Pattern recognition (psychology); Distribution (mathematics); Mathematics; Statistics; Linguistics; Philosophy","score_opus":0.24040444128353383,"score_gpt":0.445637965919208,"score_spread":0.20523352463567418,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1902658720","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.062039226,0.0007558408,0.932987,0.00022980571,0.00017923162,0.0003232782,0.00049505517,0.0017132087,0.0012774005],"genre_scores_gemma":[0.53015983,0.00038231796,0.4628056,0.00017591851,0.00024153906,0.00075747055,0.0019888463,0.00016117361,0.003327273],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9985972,0.00019596978,0.00015240182,0.00031906745,0.00064686785,0.00008849129],"domain_scores_gemma":[0.99797386,0.0007173722,0.0001248168,0.00012072362,0.0009919337,0.00007127463],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013109067,0.00080615934,0.0014131368,0.00441257,0.00063676323,0.0008860214,0.0007554564,0.0007132524,0.0014106138],"category_scores_gemma":[0.0039308453,0.00018492575,0.0010564529,0.0030036273,0.00035599666,0.0011988218,0.0005924535,0.0006448157,0.0005851129],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003496683,0.0002100319,0.007264901,0.00021132077,0.00014196515,0.00021696619,0.0001550203,0.011017355,0.035360545,0.0014035557,0.0043404414,0.93932813],"study_design_scores_gemma":[0.0002756518,0.00075939816,0.034744877,0.00006719196,0.00024525655,0.0017963822,0.00028770528,0.8829726,0.050979815,0.007962786,0.019705411,0.00020289017],"about_ca_topic_score_codex":0.0021100973,"about_ca_topic_score_gemma":0.0016699393,"teacher_disagreement_score":0.00441257,"about_ca_system_score_codex":0.0004474888,"about_ca_system_score_gemma":0.0007790976,"threshold_uncertainty_score":0.006932795},"labels":[],"label_agreement":null},{"id":"W192243523","doi":"10.1007/978-3-319-06483-3_19","title":"Text Representation Using Multi-level Latent Dirichlet Allocation","year":2014,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Latent Dirichlet allocation; Representation (politics); Computer science; Granularity; Artificial intelligence; Topic model; Pattern recognition (psychology); Machine learning; Natural language processing","score_opus":0.08373228379650947,"score_gpt":0.3067533469916922,"score_spread":0.22302106319518272,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W192243523","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0032031985,0.00066131965,0.9926644,0.0002365312,0.00011481573,0.000076482305,0.00051470875,0.0019370721,0.000591414],"genre_scores_gemma":[0.17779915,0.0015744457,0.79818916,0.00044508156,0.0005587639,0.000866771,0.008355768,0.0009907633,0.011220156],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99698645,0.0011977153,0.00029646888,0.0007835001,0.0004935522,0.0002423676],"domain_scores_gemma":[0.99562633,0.002760095,0.00020853631,0.00062472984,0.00066090014,0.00011947684],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0025489053,0.0013418352,0.0022305907,0.0037446925,0.0011563237,0.0030079458,0.0028634013,0.0022617758,0.005844774],"category_scores_gemma":[0.009851437,0.00086241256,0.002956522,0.004524066,0.00083271717,0.0039923997,0.0028206822,0.0035079245,0.0054370337],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00076787925,0.0003423077,0.0008357466,0.00054665055,0.0002559435,0.00021060728,0.00041564618,0.09850766,0.013003879,0.02829876,0.02281383,0.83400106],"study_design_scores_gemma":[0.00004084852,0.0000444342,0.00023461685,0.00003380598,0.00006457047,0.00008939026,0.000056091456,0.9582333,0.004693901,0.03232244,0.0041514947,0.000035076973],"about_ca_topic_score_codex":0.0041398006,"about_ca_topic_score_gemma":0.0049941624,"teacher_disagreement_score":0.005844774,"about_ca_system_score_codex":0.0012304825,"about_ca_system_score_gemma":0.0015799423,"threshold_uncertainty_score":0.019552708},"labels":[],"label_agreement":null},{"id":"W1935171541","doi":"10.1109/icassp.1997.596083","title":"Accurate keyword spotting using strictly lexical fillers","year":2002,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institut National de la Recherche Scientifique","funders":"","keywords":"Keyword spotting; Computer science; Vocabulary; Set (abstract data type); Task (project management); Range (aeronautics); Directory; Natural language processing; Speech recognition; Artificial intelligence; Spotting; Linguistics","score_opus":0.09808095789106017,"score_gpt":0.2754248937137858,"score_spread":0.17734393582272565,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1935171541","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07832672,0.00041825933,0.9072838,0.000102501486,0.00012679123,0.0001754518,0.00017998941,0.010606831,0.0027797637],"genre_scores_gemma":[0.35320267,0.0002548025,0.6387876,0.00018981853,0.00014199501,0.0003245915,0.00063083926,0.0007461526,0.0057215677],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9989802,0.0001899419,0.00017443569,0.0002789844,0.00027762016,0.00009872784],"domain_scores_gemma":[0.99682546,0.0014918935,0.00023808125,0.0007637103,0.0005188477,0.00016205179],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011087065,0.0008793117,0.0012781218,0.00072827114,0.00034861523,0.0011954056,0.0015530422,0.0010030967,0.005392503],"category_scores_gemma":[0.00523484,0.00054720277,0.0005270178,0.0005206279,0.0006531482,0.0031552555,0.0011824612,0.00061694917,0.004802076],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019512575,0.00018807332,0.001079941,0.0004968264,0.000053360818,0.00051266485,0.00039441357,0.009088666,0.48672473,0.0060771722,0.0028020476,0.49063084],"study_design_scores_gemma":[0.00015801456,0.0011720632,0.0019650457,0.00004678717,0.00010379276,0.0015006973,0.00028359724,0.26674294,0.702206,0.008002078,0.017676378,0.00014249161],"about_ca_topic_score_codex":0.0005856733,"about_ca_topic_score_gemma":0.00081186555,"teacher_disagreement_score":0.005392503,"about_ca_system_score_codex":0.00026002649,"about_ca_system_score_gemma":0.0005166395,"threshold_uncertainty_score":0.018039703},"labels":[],"label_agreement":null},{"id":"W1960913922","doi":"10.1007/3-540-44886-1_41","title":"Feature Selection Strategies for Text Categorization","year":2003,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":34,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval","funders":"","keywords":"Feature selection; Categorization; Computer science; Selection (genetic algorithm); Text categorization; Feature (linguistics); Rank (graph theory); Artificial intelligence; Set (abstract data type); Filter (signal processing); Function (biology); Representation (politics); Machine learning; Data mining; Pattern recognition (psychology); Mathematics","score_opus":0.018434168115925784,"score_gpt":0.2540111248480112,"score_spread":0.2355769567320854,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1960913922","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017527409,0.0026864556,0.97440183,0.00022945713,0.00016706309,0.00017751985,0.0004362455,0.0024179553,0.0019560603],"genre_scores_gemma":[0.19521554,0.001547232,0.7884749,0.00026226058,0.0003760878,0.0005928451,0.0031749306,0.00044738626,0.009908844],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9992136,0.00023375353,0.000094953335,0.00015528189,0.00022834125,0.00007403511],"domain_scores_gemma":[0.9982754,0.0010004691,0.000060252605,0.00020148336,0.0004116729,0.000050792198],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0016432365,0.0009862849,0.0013224342,0.0024677282,0.00074723247,0.0012813812,0.0016862216,0.00088317425,0.0044779778],"category_scores_gemma":[0.0034885905,0.0003949352,0.00090946275,0.0026328894,0.00038537872,0.0018218716,0.00087404164,0.0009872472,0.002495321],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015878073,0.00011440387,0.00046536478,0.00011604755,0.000057729936,0.00007733833,0.00007926731,0.0054471293,0.0097666625,0.0030728637,0.009604596,0.9710397],"study_design_scores_gemma":[0.0002283097,0.00044397588,0.0044191317,0.00010577346,0.00028896442,0.000740144,0.00031578421,0.8501797,0.037157476,0.083215125,0.022817003,0.00008865974],"about_ca_topic_score_codex":0.0019722718,"about_ca_topic_score_gemma":0.002656563,"teacher_disagreement_score":0.0044779778,"about_ca_system_score_codex":0.00038340563,"about_ca_system_score_gemma":0.0006250866,"threshold_uncertainty_score":0.014980316},"labels":[],"label_agreement":null},{"id":"W1970187450","doi":"10.1145/2245276.2245457","title":"Enhancing semi-supervised document clustering with feature supervision","year":2012,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":16,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Cluster analysis; Computer science; Pairwise comparison; Feature (linguistics); Artificial intelligence; Brown clustering; Consensus clustering; Data mining; Correlation clustering; Fuzzy clustering; Pattern recognition (psychology); Conceptual clustering; Machine learning; Canopy clustering algorithm","score_opus":0.014138814128383205,"score_gpt":0.24251825036800329,"score_spread":0.2283794362396201,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1970187450","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.03299342,0.00021484599,0.96185756,0.00013550889,0.000032993543,0.00013751297,0.00017355471,0.003150451,0.0013040453],"genre_scores_gemma":[0.3382365,0.00017200089,0.6573293,0.00016474775,0.00008333481,0.00023131887,0.0015741957,0.00032183586,0.0018867386],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9968702,0.0012911664,0.00017792734,0.00067121035,0.0008657125,0.00012375122],"domain_scores_gemma":[0.9901451,0.0038584382,0.0007967363,0.0021998405,0.002756354,0.00024358735],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0030980292,0.0012022583,0.0015119929,0.0013268725,0.00093254977,0.0013619232,0.0020396109,0.0012075785,0.0011742332],"category_scores_gemma":[0.011377547,0.00041242345,0.000977511,0.001499832,0.0010221374,0.002550819,0.002026736,0.0015504513,0.0014712486],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006553699,0.0007016925,0.0063872375,0.00053202896,0.0002579628,0.00020086636,0.0009839947,0.1668173,0.04407053,0.006983385,0.009779951,0.76262975],"study_design_scores_gemma":[0.00003880961,0.00012244645,0.0014137216,0.000022482172,0.00004100132,0.0001542397,0.00013231994,0.96740997,0.018840006,0.008431478,0.0033495722,0.000044115037],"about_ca_topic_score_codex":0.002774945,"about_ca_topic_score_gemma":0.0054042516,"teacher_disagreement_score":0.0030980292,"about_ca_system_score_codex":0.00076648995,"about_ca_system_score_gemma":0.0015779659,"threshold_uncertainty_score":0.016384125},"labels":[],"label_agreement":null},{"id":"W1975412704","doi":"10.1109/ifsa-nafips.2013.6608380","title":"Neighborhood Rough Sets based Multi-Label classification","year":2013,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Multi-label classification; Pattern recognition (psychology); Artificial intelligence; Computer science; Feature (linguistics); Rough set; Data mining; Correlation; Machine learning; Mathematics","score_opus":0.0625039937731114,"score_gpt":0.29024486199336424,"score_spread":0.22774086822025286,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1975412704","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.028481444,0.001048557,0.96704394,0.00027271535,0.00010055318,0.00013433732,0.00021992388,0.00042698378,0.002271513],"genre_scores_gemma":[0.5578761,0.0008688661,0.4379494,0.0001367248,0.00016805735,0.00032374501,0.00091406016,0.00006779073,0.0016952573],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9946181,0.0015780139,0.0003525445,0.00070923014,0.0025221594,0.00021997918],"domain_scores_gemma":[0.9963554,0.0017198179,0.00044218646,0.00045013338,0.0009367977,0.00009569781],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0030242773,0.00072237704,0.0020133331,0.0030669458,0.0010533019,0.0021335008,0.0017722085,0.0010378759,0.0010505725],"category_scores_gemma":[0.008226121,0.00030550908,0.0016815508,0.0019460734,0.00083395315,0.0024884748,0.0012701923,0.0012154232,0.0003797397],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00044999944,0.00030831003,0.0052587013,0.0006005142,0.0003696983,0.00027837054,0.0005494297,0.23026523,0.0072651203,0.047451187,0.00793868,0.6992648],"study_design_scores_gemma":[0.000031597454,0.00011543218,0.0015347748,0.000055484776,0.00009398649,0.00013001852,0.00012542741,0.9528649,0.005242796,0.036061827,0.0036836402,0.000059997812],"about_ca_topic_score_codex":0.0024651964,"about_ca_topic_score_gemma":0.0019738146,"teacher_disagreement_score":0.0030669458,"about_ca_system_score_codex":0.0011898193,"about_ca_system_score_gemma":0.00094334106,"threshold_uncertainty_score":0.015994132},"labels":[],"label_agreement":null},{"id":"W1978317631","doi":"10.1108/00220410710743306","title":"Machine learning for Asian language text classification","year":2007,"lang":"en","type":"article","venue":"Journal of Documentation","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Computer science; Text segmentation; Artificial intelligence; Segmentation; Natural language processing; Language model; Support vector machine; Principle of maximum entropy; Market segmentation; Naive Bayes classifier; Word (group theory); Pattern recognition (psychology); Machine learning; Mathematics","score_opus":0.02066179093718157,"score_gpt":0.3197743031696622,"score_spread":0.29911251223248064,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1978317631","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.13571978,0.0058657345,0.8290572,0.002877423,0.0005962008,0.0005887462,0.0018131245,0.00469116,0.018790608],"genre_scores_gemma":[0.63858616,0.0017292354,0.3508476,0.0004400887,0.00034368815,0.000753201,0.0018926518,0.0002035464,0.005203842],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99745816,0.0013481205,0.00020168239,0.00032054735,0.0005481025,0.00012332582],"domain_scores_gemma":[0.9936215,0.003933885,0.0005533403,0.0006129617,0.0011415529,0.00013664953],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0037232826,0.0007235038,0.00075428025,0.002068666,0.00072889734,0.0016560142,0.0007659927,0.00061673403,0.0044428143],"category_scores_gemma":[0.010809655,0.00019731405,0.00070162525,0.0033697565,0.00047326498,0.002435737,0.0007927918,0.0014784505,0.0022371567],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046012175,0.0004213258,0.017260838,0.0006820439,0.00022681143,0.00024929468,0.00030010944,0.061210264,0.0074069663,0.019732272,0.011218546,0.8808314],"study_design_scores_gemma":[0.000057788813,0.0003072381,0.008858259,0.00019270378,0.00009288202,0.00025455342,0.0003446789,0.9364767,0.0111186225,0.030410817,0.011824007,0.000061712126],"about_ca_topic_score_codex":0.0032380386,"about_ca_topic_score_gemma":0.0033076638,"teacher_disagreement_score":0.0044428143,"about_ca_system_score_codex":0.0009990775,"about_ca_system_score_gemma":0.0014820104,"threshold_uncertainty_score":0.019690812},"labels":[],"label_agreement":null},{"id":"W1983349993","doi":"10.1016/j.neunet.2006.12.005","title":"The learning vector quantization algorithm applied to automatic text classification tasks","year":2007,"lang":"en","type":"article","venue":"Neural Networks","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":38,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Vedecká Grantová Agentúra MŠVVaŠ SR a SAV; McGill University","keywords":"Learning vector quantization; Computer science; Artificial intelligence; Classifier (UML); Artificial neural network; Word-sense disambiguation; Categorization; Linde–Buzo–Gray algorithm; Text categorization; Machine learning; Word (group theory); Natural language processing; Pattern recognition (psychology); Vector quantization; Mathematics; WordNet","score_opus":0.020014776508508893,"score_gpt":0.2704345014242594,"score_spread":0.2504197249157505,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1983349993","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0114901755,0.0022997211,0.98073214,0.0005180922,0.00062444824,0.000197028,0.00035195597,0.0018441402,0.0019423431],"genre_scores_gemma":[0.16940066,0.0016366051,0.8197133,0.00038088424,0.00034394898,0.00042470652,0.0012197818,0.00020528457,0.006674839],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9980572,0.00063641695,0.00024611334,0.00029925993,0.0006674416,0.00009345454],"domain_scores_gemma":[0.9974632,0.00096849166,0.00009944834,0.0003438172,0.0010683275,0.00005667725],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0027210359,0.0005407652,0.0012119038,0.0013186522,0.00073541194,0.0011849225,0.001267029,0.0010765782,0.003176144],"category_scores_gemma":[0.007320526,0.0003133346,0.00051323074,0.0026076946,0.0005690123,0.0018070259,0.00081020704,0.0016518293,0.0014677808],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014310303,0.00008235258,0.0005915553,0.00016714139,0.000048372152,0.000028722374,0.00007223318,0.018475702,0.007407563,0.011764197,0.008830606,0.9523886],"study_design_scores_gemma":[0.00008841324,0.00021484427,0.0016390843,0.000087885724,0.00005864924,0.0001887763,0.00007013982,0.92096794,0.018965341,0.042736825,0.014930346,0.00005173739],"about_ca_topic_score_codex":0.0076132044,"about_ca_topic_score_gemma":0.005919899,"teacher_disagreement_score":0.0076132044,"about_ca_system_score_codex":0.000841377,"about_ca_system_score_gemma":0.0017937169,"threshold_uncertainty_score":0.015137792},"labels":[],"label_agreement":null},{"id":"W1988996388","doi":"10.5555/777092.777258","title":"Generalized features: their application to classification","year":2002,"lang":"en","type":"article","venue":"National Conference on Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Computer science; sort; Focus (optics); Set (abstract data type); Feature (linguistics); Process (computing); Artificial intelligence; Machine learning; Information retrieval; Data mining","score_opus":0.16865849311093994,"score_gpt":0.3426979531147663,"score_spread":0.17403946000382636,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1988996388","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005734586,0.0019085195,0.9887122,0.00055966235,0.00016585783,0.00010918649,0.00045513685,0.0009546025,0.0014001364],"genre_scores_gemma":[0.27379844,0.0033365218,0.7158289,0.0006707516,0.0009787929,0.00065851817,0.0016085922,0.0003929543,0.0027265095],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9960939,0.0012715466,0.00034727206,0.00083892787,0.0012648413,0.00018338517],"domain_scores_gemma":[0.9898018,0.0067060413,0.0007487011,0.001324753,0.001224312,0.00019445541],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0047569494,0.0013661425,0.0020049012,0.005278148,0.0007262553,0.0033974196,0.0021207712,0.0019712097,0.0035444465],"category_scores_gemma":[0.021569397,0.00061647367,0.0018670479,0.0067153233,0.0021760105,0.004545464,0.0030760434,0.003570511,0.0010815221],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002710195,0.00011026146,0.007371751,0.0007253477,0.0002763189,0.0004205153,0.0006529116,0.07606166,0.0026187296,0.17295778,0.013689591,0.7248441],"study_design_scores_gemma":[0.00005336688,0.00010434717,0.0020666486,0.00019153144,0.00009361383,0.0004763488,0.00013128821,0.46918163,0.0017926036,0.5039879,0.021839626,0.00008096041],"about_ca_topic_score_codex":0.0030491885,"about_ca_topic_score_gemma":0.0013536975,"teacher_disagreement_score":0.005278148,"about_ca_system_score_codex":0.0011955764,"about_ca_system_score_gemma":0.0009509592,"threshold_uncertainty_score":0.025157392},"labels":[],"label_agreement":null},{"id":"W1990582178","doi":"10.4304/jetwi.4.3.207-220","title":"Query Classification using Wikipedia’s Category Graph","year":2012,"lang":"en","type":"article","venue":"Journal of Emerging Technologies in Web Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Lakehead University; University of Waterloo","funders":"","keywords":"Computer science; Information retrieval; Graph; Artificial intelligence; Theoretical computer science","score_opus":0.06849810695475955,"score_gpt":0.32776206232280003,"score_spread":0.2592639553680405,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1990582178","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.47516334,0.0018526139,0.47233865,0.0018528842,0.00038545765,0.0006939032,0.0067458684,0.027908511,0.013058874],"genre_scores_gemma":[0.76058704,0.00020722706,0.22797169,0.0001846423,0.000092057526,0.00011328324,0.007236588,0.00031949824,0.0032879864],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9990497,0.00018652389,0.00007425594,0.00019481449,0.00037377476,0.00012096134],"domain_scores_gemma":[0.9955195,0.0018148992,0.00031557804,0.0005580798,0.0016028653,0.00018905947],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007509567,0.0006399143,0.0006828835,0.005550399,0.0006804208,0.0015435441,0.0010184612,0.0007959233,0.0022747642],"category_scores_gemma":[0.0064320047,0.0001476152,0.00046581254,0.0034887383,0.00028021017,0.0017481077,0.0007399501,0.00055995374,0.0010609602],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00088443566,0.00047138377,0.02622305,0.00032094916,0.00021482013,0.00026211873,0.00028316397,0.053757787,0.031141415,0.007876619,0.049136654,0.82942754],"study_design_scores_gemma":[0.000032797092,0.00009380637,0.0042421413,0.000019837315,0.000044950753,0.00016435905,0.00015341087,0.96863997,0.014138785,0.0071526733,0.0052883895,0.000028901906],"about_ca_topic_score_codex":0.020201517,"about_ca_topic_score_gemma":0.02133629,"teacher_disagreement_score":0.020201517,"about_ca_system_score_codex":0.0012609535,"about_ca_system_score_gemma":0.0012285255,"threshold_uncertainty_score":0.04016781},"labels":[],"label_agreement":null},{"id":"W1990688383","doi":"10.1016/j.fss.2009.05.011","title":"Adaptive learning of ordinal–numerical mappings through fuzzy clustering for the objects of mixed features","year":2009,"lang":"en","type":"article","venue":"Fuzzy Sets and Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta; Thompson Rivers University","funders":"","keywords":"Mathematics; Ordinal regression; Ordinal data; Ordinal optimization; Feature (linguistics); Fuzzy set; Partition (number theory); Fuzzy clustering; Cluster analysis; Fuzzy logic; Algorithm; Similarity (geometry); Pattern recognition (psychology); Artificial intelligence; Data mining; Computer science; Image (mathematics); Combinatorics; Statistics","score_opus":0.032938078485090866,"score_gpt":0.2695217214324401,"score_spread":0.2365836429473492,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1990688383","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.038731396,0.000094702926,0.96039206,0.000087163426,0.000014819752,0.000024996994,0.00002452974,0.00016343126,0.000466941],"genre_scores_gemma":[0.5981801,0.00011536183,0.39992583,0.000047317582,0.000031391402,0.00009981925,0.00015773746,0.00005667496,0.0013857493],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9991008,0.00031216818,0.00006457104,0.00025561245,0.00020591168,0.00006091302],"domain_scores_gemma":[0.99776745,0.0012161409,0.00024132675,0.00027409111,0.00043296104,0.00006809284],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0021486578,0.0004265796,0.0007593966,0.0012096887,0.00048844155,0.001188159,0.0012907179,0.0007308188,0.0010400797],"category_scores_gemma":[0.008850651,0.00032079977,0.00070922385,0.0010721392,0.0007915753,0.0021542287,0.0013523342,0.00097497785,0.00027091507],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00044677954,0.00019984017,0.00460569,0.00022499576,0.00016597554,0.00009345104,0.00058960135,0.3179323,0.013068496,0.038927417,0.0016556537,0.62208974],"study_design_scores_gemma":[0.000007945205,0.000026873307,0.0007235285,0.000009510987,0.000012001077,0.000023439563,0.000036986727,0.98222405,0.0015672357,0.015005948,0.00035070852,0.000011627584],"about_ca_topic_score_codex":0.0018836772,"about_ca_topic_score_gemma":0.002128978,"teacher_disagreement_score":0.0021486578,"about_ca_system_score_codex":0.0008032622,"about_ca_system_score_gemma":0.0006364893,"threshold_uncertainty_score":0.0113633275},"labels":[],"label_agreement":null},{"id":"W1991215305","doi":"10.1145/2245276.2245306","title":"Semi-supervised document clustering with dual supervision through seeding","year":2012,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"Natural Sciences and Engineering Research Council of Canada; Mitacs","keywords":"Cluster analysis; Seeding; Computer science; Document clustering; Pairwise comparison; Artificial intelligence; Cluster (spacecraft); Correlation clustering; Data mining; Pattern recognition (psychology); Machine learning; Engineering","score_opus":0.03048652227191006,"score_gpt":0.26419614324423446,"score_spread":0.2337096209723244,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1991215305","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013899632,0.00013861949,0.98398006,0.00008588435,0.000017696384,0.00010666037,0.00007661855,0.0009861151,0.0007087943],"genre_scores_gemma":[0.25531232,0.00011133341,0.7409336,0.00013305258,0.00006501276,0.00032391775,0.0008744033,0.00024533455,0.0020009982],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9967145,0.0012806898,0.00018619157,0.0009539915,0.000706602,0.00015803122],"domain_scores_gemma":[0.99227285,0.002819872,0.00073016604,0.002350224,0.0015084053,0.00031845886],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003457849,0.0011607972,0.001809795,0.0015957672,0.001412791,0.0017721149,0.003061383,0.0017189893,0.0015788948],"category_scores_gemma":[0.011784726,0.00079118874,0.0010474953,0.0021428107,0.0019145329,0.0030076113,0.002837427,0.0018173921,0.0011664312],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00071504945,0.00038785464,0.0047068624,0.00036770332,0.0002110715,0.0002986198,0.0010866475,0.3937536,0.022204282,0.03403985,0.0098858755,0.5323427],"study_design_scores_gemma":[0.000032975455,0.000046336616,0.00027309274,0.000014739536,0.000015469972,0.00006325876,0.000044278044,0.9781616,0.0049906312,0.014848504,0.0014886254,0.000020503221],"about_ca_topic_score_codex":0.0035044528,"about_ca_topic_score_gemma":0.006875278,"teacher_disagreement_score":0.0035044528,"about_ca_system_score_codex":0.0013587769,"about_ca_system_score_gemma":0.0019207478,"threshold_uncertainty_score":0.018287063},"labels":[],"label_agreement":null},{"id":"W1991547055","doi":"10.1016/j.ipm.2013.08.002","title":"An investigation into the application of ensemble learning for entailment classification","year":2013,"lang":"en","type":"article","venue":"Information Processing & Management","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":12,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"Invest Northern Ireland","keywords":"Ensemble learning; Artificial intelligence; Natural language processing; Computer science; Textual entailment; Logical consequence; Machine learning; Information retrieval","score_opus":0.016242983431172527,"score_gpt":0.2641613966963166,"score_spread":0.24791841326514408,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1991547055","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.18129475,0.00142016,0.80591416,0.0012648861,0.00016996937,0.00029665412,0.00032351684,0.0010209397,0.008294974],"genre_scores_gemma":[0.63133806,0.00066923205,0.36406884,0.00027349684,0.00014074048,0.00012814152,0.0006312829,0.00011547742,0.0026348045],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9953993,0.0027610518,0.00020968755,0.00042860684,0.0009648912,0.00023639566],"domain_scores_gemma":[0.9695239,0.021799266,0.00047224006,0.0037455976,0.0042019053,0.00025707408],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.012778644,0.0005732442,0.0010071823,0.0019665998,0.0012461494,0.002118626,0.0017150784,0.0012448143,0.0023078618],"category_scores_gemma":[0.03455282,0.00030718523,0.001069565,0.002932335,0.0005220904,0.0038282315,0.001508119,0.002345577,0.00059146585],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004967104,0.00057326973,0.018099017,0.00018542234,0.0004816379,0.00018976646,0.0006579813,0.06282953,0.011138298,0.022750948,0.0036062347,0.8789911],"study_design_scores_gemma":[0.000016514185,0.00033387452,0.0032285955,0.000052454947,0.00014045212,0.00027953158,0.00028609278,0.95544755,0.010486335,0.024579287,0.005118362,0.000030908806],"about_ca_topic_score_codex":0.0038150083,"about_ca_topic_score_gemma":0.006424857,"teacher_disagreement_score":0.012778644,"about_ca_system_score_codex":0.000737767,"about_ca_system_score_gemma":0.0012668172,"threshold_uncertainty_score":0.0675807},"labels":[],"label_agreement":null},{"id":"W1992565631","doi":"10.1109/dbkda.2010.32","title":"Clustering Relational Database Entities Using K-means","year":2010,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ontario Tech University","funders":"","keywords":"Computer science; Cluster analysis; Homogeneous; Data type; Task (project management); Perspective (graphical); Relational database; Vectorization (mathematics); Data mining; Process (computing); The Internet; Information retrieval; Database; Parallel computing; Artificial intelligence; World Wide Web; Programming language; Mathematics","score_opus":0.04904588250724925,"score_gpt":0.27802594019934707,"score_spread":0.2289800576920978,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1992565631","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017700339,0.00048656604,0.9770183,0.00015695501,0.00004332036,0.0002573454,0.00089939596,0.0024089536,0.0010287698],"genre_scores_gemma":[0.102361284,0.00036733167,0.8923753,0.000050480972,0.00003100805,0.00025284066,0.003215628,0.00014949916,0.0011965666],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99563676,0.00069878995,0.00063144957,0.0012842375,0.0015144395,0.00023431078],"domain_scores_gemma":[0.99684095,0.0008903982,0.00028074597,0.00083694403,0.001074476,0.00007636763],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0016935155,0.0011456454,0.0022697893,0.006383135,0.0018517227,0.004244387,0.0032969553,0.0015470734,0.0024719764],"category_scores_gemma":[0.008011459,0.00088422844,0.0021153924,0.009407375,0.0006380037,0.0032868097,0.0018274689,0.0011316367,0.002322136],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003727807,0.00029601523,0.006399703,0.0005281979,0.00048575967,0.00018498051,0.0009884933,0.15826453,0.009419716,0.010289616,0.010479895,0.80229026],"study_design_scores_gemma":[0.00003520984,0.000065123924,0.0023056772,0.00004734772,0.00011556372,0.0002109681,0.00058298535,0.95617497,0.010949271,0.016324816,0.013105562,0.0000826077],"about_ca_topic_score_codex":0.015331269,"about_ca_topic_score_gemma":0.016478559,"teacher_disagreement_score":0.015331269,"about_ca_system_score_codex":0.0012036585,"about_ca_system_score_gemma":0.001931188,"threshold_uncertainty_score":0.03048408},"labels":[],"label_agreement":null},{"id":"W1996429742","doi":"10.1145/1188966.1189013","title":"Exploring a new space of features for document classification","year":2006,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"","keywords":"Computer science; Space (punctuation); Information retrieval; Artificial intelligence; Pattern recognition (psychology)","score_opus":0.1032342966842447,"score_gpt":0.2800124430266422,"score_spread":0.17677814634239747,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1996429742","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05576851,0.0028748445,0.9330671,0.0011014937,0.00014751687,0.0002038783,0.0019342568,0.0021384824,0.0027639044],"genre_scores_gemma":[0.3215572,0.0014256692,0.67040414,0.00019622022,0.00030890756,0.0005206198,0.0036505,0.0001968374,0.0017398935],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9982345,0.0004975963,0.00019641512,0.00043347472,0.00051740004,0.00012050033],"domain_scores_gemma":[0.99527645,0.00259747,0.00038130942,0.00065183075,0.0009312838,0.00016162264],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0021221421,0.0009641879,0.0012153196,0.005335013,0.0007171921,0.0030369225,0.0012595658,0.0010746528,0.0020147227],"category_scores_gemma":[0.009058546,0.00028049859,0.001312147,0.005454896,0.0010427828,0.0054663937,0.0013519343,0.0013252181,0.00087598007],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00033616732,0.00029625863,0.007041563,0.00041790024,0.0001279792,0.00019352778,0.00039535278,0.019355595,0.013521076,0.024253622,0.0070774877,0.9269835],"study_design_scores_gemma":[0.00011925561,0.0008585921,0.009645897,0.00037566858,0.00022385732,0.0008609215,0.0006461414,0.77319527,0.013966883,0.16079941,0.03908219,0.0002258878],"about_ca_topic_score_codex":0.0020629526,"about_ca_topic_score_gemma":0.0016405376,"teacher_disagreement_score":0.005335013,"about_ca_system_score_codex":0.00079092913,"about_ca_system_score_gemma":0.000762655,"threshold_uncertainty_score":0.011223137},"labels":[],"label_agreement":null},{"id":"W1997305228","doi":"10.1109/nlpke.2010.5587767","title":"Automatic classification of documents by formality","year":2010,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Formality; Computer science; Naive Bayes classifier; Artificial intelligence; Feature selection; Classifier (UML); Support vector machine; Machine learning; Decision tree; Task (project management); Style (visual arts); Data mining; Natural language processing; Engineering","score_opus":0.01347406047579485,"score_gpt":0.2704840205753174,"score_spread":0.25700996009952254,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1997305228","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6312392,0.0043419898,0.32944214,0.001078757,0.00052339194,0.0007694658,0.009952767,0.009130212,0.013522111],"genre_scores_gemma":[0.76175565,0.0010612021,0.22178619,0.00009763128,0.00031793647,0.00023165802,0.010964426,0.0002525846,0.003532722],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9977398,0.0004214641,0.00029474354,0.00038130977,0.00097217486,0.00019048597],"domain_scores_gemma":[0.9874471,0.005786377,0.0017709006,0.0011540434,0.0034536384,0.000387961],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0018123956,0.00077103236,0.00080195366,0.009146565,0.00078538526,0.0022328927,0.0006996752,0.0005198816,0.0019364661],"category_scores_gemma":[0.012997996,0.00024371035,0.0006863637,0.004923573,0.0004716464,0.0026098907,0.0007840706,0.0009791016,0.0014352083],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005422566,0.00029516188,0.06395314,0.00060501404,0.0001124339,0.00025324564,0.0006561862,0.0054145018,0.03024001,0.0051044826,0.0113171935,0.8815064],"study_design_scores_gemma":[0.00025419449,0.0007862133,0.21431339,0.00060873386,0.00038260742,0.0026803904,0.0022072198,0.54641783,0.101369575,0.05300361,0.07757604,0.00040011998],"about_ca_topic_score_codex":0.0017218802,"about_ca_topic_score_gemma":0.001926642,"teacher_disagreement_score":0.009146565,"about_ca_system_score_codex":0.0007588942,"about_ca_system_score_gemma":0.00081990316,"threshold_uncertainty_score":0.009585023},"labels":[],"label_agreement":null},{"id":"W1999957058","doi":"10.1109/secon.2012.6196948","title":"An enhanced approach for classifying emotions using customized decision tree algorithm","year":2012,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Computer science; Decision tree; Machine learning; Decision tree learning; Artificial intelligence; Data mining; Conversation; Tree (set theory); Statistical classification; Algorithm; Mathematics","score_opus":0.06251321651385613,"score_gpt":0.3311836594047334,"score_spread":0.26867044289087727,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1999957058","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.016198127,0.00013892501,0.9815578,0.000109730645,0.00006335636,0.0001261806,0.00019377061,0.0006450882,0.0009671254],"genre_scores_gemma":[0.23535216,0.00019333372,0.7608044,0.00015980018,0.000114079725,0.00035462264,0.0012499866,0.00008662942,0.0016850166],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99835855,0.0003706614,0.00019461715,0.00036939597,0.0005711847,0.00013558703],"domain_scores_gemma":[0.998483,0.0006593752,0.00009751521,0.0001398179,0.0005670742,0.00005329702],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013671474,0.0008316982,0.0009316027,0.0020220436,0.0005037947,0.0010451265,0.0012841382,0.0008946779,0.002200869],"category_scores_gemma":[0.003581218,0.00023853352,0.0013503728,0.0018764257,0.00025265434,0.0015582584,0.00067664747,0.0011100676,0.0009743947],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00033344765,0.00035713546,0.0051574437,0.00016436043,0.00017918911,0.0002123998,0.00024289808,0.112412944,0.014134159,0.008334459,0.004721268,0.8537503],"study_design_scores_gemma":[0.00002567282,0.000088040295,0.0010916865,0.000015594194,0.000036935275,0.0001090753,0.000041458476,0.9853345,0.003975266,0.0069166394,0.0023432316,0.000021835209],"about_ca_topic_score_codex":0.002299725,"about_ca_topic_score_gemma":0.0018881453,"teacher_disagreement_score":0.002299725,"about_ca_system_score_codex":0.00049943675,"about_ca_system_score_gemma":0.00078864157,"threshold_uncertainty_score":0.0073626637},"labels":[],"label_agreement":null},{"id":"W2000918452","doi":"10.1145/1281192.1281260","title":"A concept-based model for enhancing text categorization","year":2007,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":65,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Natural language processing; Categorization; Sentence; Artificial intelligence; Phrase; Term (time); Weighting; Graph; Information retrieval; Theoretical computer science","score_opus":0.02597749126124376,"score_gpt":0.28160541450190296,"score_spread":0.2556279232406592,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2000918452","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0060187248,0.00031773138,0.98971915,0.00028675087,0.00008181383,0.00041449687,0.00035695234,0.0010704052,0.0017339995],"genre_scores_gemma":[0.103756085,0.00046850994,0.8906437,0.00026517178,0.000092842194,0.0010504569,0.0009986327,0.000100456265,0.0026241231],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9982322,0.0004046697,0.00011259681,0.00041097784,0.0007659274,0.000073783944],"domain_scores_gemma":[0.9977648,0.0011747065,0.00012209627,0.00019251685,0.0006892347,0.00005650875],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002313172,0.0012449862,0.00066171447,0.0037400117,0.0007282894,0.0016645249,0.0023146681,0.0011924327,0.0036661725],"category_scores_gemma":[0.0070577348,0.00035229584,0.0013265724,0.0034178295,0.00072395976,0.0046485267,0.0011775761,0.0015427925,0.0016824396],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00030212235,0.0004592792,0.0024765092,0.0007628257,0.00019672643,0.00032681925,0.00096490234,0.069766,0.019199183,0.10822101,0.014146707,0.78317785],"study_design_scores_gemma":[0.000041672334,0.00013717271,0.0011501614,0.000086177526,0.00009389679,0.00033720676,0.00014871436,0.90246654,0.005554552,0.067491755,0.022434432,0.000057655863],"about_ca_topic_score_codex":0.0066191633,"about_ca_topic_score_gemma":0.0056406674,"teacher_disagreement_score":0.0066191633,"about_ca_system_score_codex":0.0016818839,"about_ca_system_score_gemma":0.002022671,"threshold_uncertainty_score":0.013161242},"labels":[],"label_agreement":null},{"id":"W2005656884","doi":"10.1109/iccitechnology.2013.6579523","title":"Truncated singular value decomposition for semantic-based data retrieval","year":2013,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Montréal","funders":"Université du Québec à Trois-Rivières","keywords":"Indexation; Vector space model; Computer science; Search engine indexing; Weighting; Dimension (graph theory); Information retrieval; Singular value decomposition; Abstraction; Representation (politics); Explicit semantic analysis; Vector space; Knowledge representation and reasoning; Data mining; Natural language processing; Artificial intelligence; Semantic computing; Mathematics; Semantic technology; Semantic Web","score_opus":0.04307560925490692,"score_gpt":0.3085439826486582,"score_spread":0.26546837339375123,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2005656884","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0033186718,0.0013007674,0.9934681,0.00018327803,0.000083158695,0.000055393462,0.00019032707,0.00051246875,0.0008878901],"genre_scores_gemma":[0.115114726,0.0024898683,0.8778052,0.00016319707,0.000251141,0.0002170211,0.0015243589,0.000104937535,0.0023297258],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99784756,0.0006751358,0.00024399502,0.00027126062,0.0008784713,0.000083558734],"domain_scores_gemma":[0.998678,0.00043645024,0.00016794713,0.00027295784,0.00040348273,0.000041034345],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019672082,0.000695766,0.00125564,0.0024310676,0.0003983382,0.0016826912,0.000765992,0.00082548684,0.0021913084],"category_scores_gemma":[0.005625822,0.00023277313,0.00083195337,0.0036933317,0.00074626046,0.0017094235,0.0009961829,0.0010093701,0.0021697918],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00023447814,0.00014937863,0.0006992844,0.0006671321,0.00013151752,0.00024757657,0.00020611676,0.078608125,0.027023805,0.07641558,0.011533666,0.8040833],"study_design_scores_gemma":[0.000025832365,0.00013284554,0.00064355525,0.00007156099,0.00003994167,0.00020837146,0.0001106815,0.8884779,0.0055836,0.0907644,0.013890174,0.000051067036],"about_ca_topic_score_codex":0.0016267024,"about_ca_topic_score_gemma":0.0012917275,"teacher_disagreement_score":0.0024310676,"about_ca_system_score_codex":0.0006395165,"about_ca_system_score_gemma":0.0008769396,"threshold_uncertainty_score":0.010403693},"labels":[],"label_agreement":null},{"id":"W2009275125","doi":"10.4304/jetwi.2.3.160-166","title":"A Novel Class-Based Data Fusion Technique for Information Retrieval","year":2010,"lang":"en","type":"article","venue":"Journal of Emerging Technologies in Web Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Computer science; Class (philosophy); Information retrieval; Fusion; Artificial intelligence; Data mining","score_opus":0.04809799884645045,"score_gpt":0.3307790280869064,"score_spread":0.28268102924045596,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2009275125","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007413917,0.0005398556,0.98974496,0.00012724898,0.00009337423,0.000076323144,0.00012901,0.0010084542,0.00086697727],"genre_scores_gemma":[0.15395114,0.00047950202,0.84214616,0.00018853706,0.00021698517,0.00025833765,0.0006213549,0.00015128689,0.001986662],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9971648,0.00045114523,0.00024202428,0.00049250043,0.0015138149,0.00013567788],"domain_scores_gemma":[0.99771404,0.0006588376,0.00021602123,0.0005273901,0.0008270786,0.000056674206],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019977763,0.0007911205,0.0014940738,0.0033103263,0.00093067164,0.0016312405,0.0014626177,0.0013690732,0.0025526357],"category_scores_gemma":[0.005198218,0.0003256413,0.0016834225,0.0045427643,0.00071845175,0.003060161,0.0016405829,0.0013908122,0.0017486188],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00036441395,0.00017140881,0.0009876941,0.0002028093,0.00020588741,0.00006905038,0.00017563405,0.014431855,0.06027829,0.010459839,0.0047352,0.90791786],"study_design_scores_gemma":[0.000077099685,0.00028592214,0.0023250494,0.000042762098,0.00020559387,0.0006774205,0.00011934294,0.88011587,0.081748195,0.014703687,0.019600753,0.00009834106],"about_ca_topic_score_codex":0.0016361941,"about_ca_topic_score_gemma":0.0013786245,"teacher_disagreement_score":0.0033103263,"about_ca_system_score_codex":0.0008431576,"about_ca_system_score_gemma":0.0007559173,"threshold_uncertainty_score":0.0105654},"labels":[],"label_agreement":null},{"id":"W2011200591","doi":"10.7152/acro.v23i1.14234","title":"Classification in Terms of Basic Concepts","year":2013,"lang":"en","type":"article","venue":"Advances in Classification Research Online","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Natural language processing; Data science; Artificial intelligence","score_opus":0.10644580374751796,"score_gpt":0.447580356272246,"score_spread":0.3411345525247281,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2011200591","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04411045,0.018259866,0.81563365,0.0097015435,0.0025394903,0.0020341328,0.01275377,0.0017264811,0.09324053],"genre_scores_gemma":[0.26542687,0.015687877,0.6735491,0.0016840268,0.002493043,0.0031951875,0.021601034,0.0002659592,0.016096903],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.995475,0.0008504165,0.0007143783,0.0009636228,0.0018229411,0.00017369304],"domain_scores_gemma":[0.9966779,0.0015733785,0.00041567028,0.0004900232,0.0007081722,0.0001348447],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003135238,0.001126876,0.0010144811,0.008926807,0.001214716,0.0068661836,0.0020278802,0.0011589106,0.009277726],"category_scores_gemma":[0.010070302,0.00021743514,0.0012372419,0.010502805,0.0029371239,0.009829624,0.0019732022,0.0019764963,0.0044486434],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015525291,0.00018937356,0.007643347,0.0018886694,0.00017261802,0.00022435274,0.0014839111,0.0037471338,0.0037956054,0.5354592,0.033880327,0.41136023],"study_design_scores_gemma":[0.000023396442,0.00015898341,0.00527109,0.0007861608,0.00007353166,0.0004921654,0.0010651916,0.017016651,0.001292226,0.8467125,0.12704693,0.000061147955],"about_ca_topic_score_codex":0.0012420511,"about_ca_topic_score_gemma":0.0007208072,"teacher_disagreement_score":0.009277726,"about_ca_system_score_codex":0.0013804198,"about_ca_system_score_gemma":0.0017795322,"threshold_uncertainty_score":0.031037092},"labels":[],"label_agreement":null},{"id":"W2012971775","doi":"10.1080/0952813x.2012.721010","title":"Naive Bayes text classifiers: a locally weighted learning approach","year":2012,"lang":"en","type":"article","venue":"Journal of Experimental & Theoretical Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":107,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of New Brunswick","funders":"","keywords":"Naive Bayes classifier; Computer science; Artificial intelligence; Machine learning; Conditional independence; Bayes error rate; Bayesian programming; Bayes' theorem; Benchmark (surveying); Complement (music); Bayes classifier; Bayesian probability; Support vector machine; Bayes factor","score_opus":0.036113385853511676,"score_gpt":0.3060859303784622,"score_spread":0.26997254452495056,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2012971775","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0058195987,0.0010329804,0.98882675,0.00041116402,0.00014246709,0.0003434066,0.00027909613,0.0014290655,0.0017154478],"genre_scores_gemma":[0.19332926,0.0010869127,0.7942524,0.0009873775,0.0008124894,0.0011559505,0.0020196012,0.0003061264,0.0060499525],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9906984,0.003562261,0.00073127256,0.0015262563,0.003203726,0.00027813556],"domain_scores_gemma":[0.98939985,0.0056844354,0.0007626645,0.0010629129,0.0029077786,0.00018236466],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0070018196,0.001987149,0.0031221001,0.005481208,0.0014534357,0.00289259,0.0050245533,0.0030288717,0.0040486427],"category_scores_gemma":[0.024739508,0.0007887874,0.0015649147,0.0045854156,0.0013425204,0.006020168,0.0018075178,0.0029598442,0.0033276002],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00041010496,0.00035346215,0.003629642,0.0006069218,0.00037066333,0.00020413943,0.0002766852,0.07446691,0.0052057216,0.017966853,0.017327702,0.8791811],"study_design_scores_gemma":[0.00009218669,0.00020290812,0.00086928764,0.00013752462,0.00018265503,0.000299779,0.0001155762,0.89903957,0.004123312,0.085331395,0.0095339315,0.00007193008],"about_ca_topic_score_codex":0.003620075,"about_ca_topic_score_gemma":0.0045931027,"teacher_disagreement_score":0.0070018196,"about_ca_system_score_codex":0.0014632368,"about_ca_system_score_gemma":0.0018187567,"threshold_uncertainty_score":0.037029564},"labels":[],"label_agreement":null},{"id":"W2013023084","doi":"10.1007/s10994-013-5371-6","title":"Beam search algorithms for multilabel learning","year":2013,"lang":"en","type":"article","venue":"Machine Learning","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":90,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Inference; Beam search; Computer science; Machine learning; Artificial intelligence; Probabilistic logic; Classifier (UML); Task (project management); Range (aeronautics); Algorithm; Search algorithm","score_opus":0.031059016798618035,"score_gpt":0.28921241142287696,"score_spread":0.2581533946242589,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2013023084","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0016772706,0.00057394005,0.9951504,0.00020986296,0.00005212282,0.00004868135,0.00014270634,0.0008877399,0.0012572904],"genre_scores_gemma":[0.046756677,0.0006233525,0.94415843,0.00055882393,0.00018173318,0.0005935036,0.0012726204,0.00071187323,0.005142992],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.995754,0.0023786381,0.0002037212,0.0006267076,0.00076448405,0.00027249422],"domain_scores_gemma":[0.98785365,0.008808124,0.00035927558,0.0015698359,0.0011549005,0.00025427592],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006210132,0.0015637848,0.0036749735,0.0035723941,0.0025256178,0.002311798,0.004622538,0.0031445946,0.01566523],"category_scores_gemma":[0.022685315,0.0014542775,0.0018059209,0.0060476684,0.002337182,0.0058276122,0.004292376,0.0048211487,0.0057156626],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006126372,0.00038013145,0.0010342291,0.0005225143,0.00026460752,0.00008997994,0.0003410903,0.16989568,0.0021981895,0.2318424,0.04309098,0.54972756],"study_design_scores_gemma":[0.00013559639,0.00007144243,0.0001456021,0.00006759887,0.000044930774,0.000053188043,0.000058288093,0.5778378,0.0011835392,0.41402537,0.0063446052,0.000031924134],"about_ca_topic_score_codex":0.0042951196,"about_ca_topic_score_gemma":0.007780662,"teacher_disagreement_score":0.01566523,"about_ca_system_score_codex":0.0015793339,"about_ca_system_score_gemma":0.002321513,"threshold_uncertainty_score":0.052405417},"labels":[],"label_agreement":null},{"id":"W2016325519","doi":"10.1016/j.ipl.2003.09.002","title":"A new differential LSI space-based probabilistic document classifier","year":2003,"lang":"en","type":"article","venue":"Information Processing Letters","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Northern British Columbia","funders":"","keywords":"Classifier (UML); Probabilistic logic; Probabilistic classification; Computer science; Search engine indexing; Artificial intelligence; Pattern recognition (psychology); Data mining; A priori and a posteriori; Document classification; Adaptability; Machine learning; Support vector machine; Naive Bayes classifier","score_opus":0.011591561788639012,"score_gpt":0.22220464448286778,"score_spread":0.21061308269422876,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2016325519","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.018249035,0.0011100746,0.9736264,0.00031258984,0.0002875182,0.00010066249,0.00037248732,0.003134225,0.0028069867],"genre_scores_gemma":[0.28736907,0.000986522,0.6909477,0.0005192067,0.0005526026,0.00031520703,0.0023708227,0.0002674306,0.016671421],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99809915,0.00019440429,0.00011486449,0.00033034928,0.0011296625,0.0001316619],"domain_scores_gemma":[0.9988662,0.00023932317,0.0000702782,0.00017794114,0.0005756838,0.00007062799],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011883236,0.00064792414,0.0015527679,0.0025763346,0.0008110926,0.0017573645,0.0018934205,0.0011861557,0.0036807503],"category_scores_gemma":[0.0022251648,0.0003160977,0.00088050973,0.0023270617,0.0005291114,0.0027728858,0.0015321027,0.0010873916,0.0036413874],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00031151852,0.00018372182,0.0016054139,0.00012924644,0.00006462381,0.00008552875,0.000045432986,0.007016772,0.035139278,0.00658657,0.007404163,0.94142765],"study_design_scores_gemma":[0.000043706554,0.00021393535,0.002131874,0.000017610526,0.00009017247,0.0007700149,0.00003328452,0.9458182,0.03148755,0.005711124,0.013623722,0.000058874877],"about_ca_topic_score_codex":0.0018745225,"about_ca_topic_score_gemma":0.0025665078,"teacher_disagreement_score":0.0036807503,"about_ca_system_score_codex":0.0007419487,"about_ca_system_score_gemma":0.0013844412,"threshold_uncertainty_score":0.012313306},"labels":[],"label_agreement":null},{"id":"W2018764947","doi":"10.1016/j.ipm.2011.11.001","title":"A three-phase method for patent classification","year":2012,"lang":"en","type":"article","venue":"Information Processing & Management","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":60,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"McGill University","keywords":"Phase (matter); Computer science; Information retrieval; Chemistry","score_opus":0.07881797612441159,"score_gpt":0.3411085603720877,"score_spread":0.2622905842476761,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2018764947","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.004905673,0.00022503007,0.98944587,0.00019363151,0.00013529471,0.0005765103,0.00041089545,0.0023834568,0.0017236477],"genre_scores_gemma":[0.040434185,0.00016032983,0.95011336,0.00014876401,0.00011977967,0.0006085243,0.0016164451,0.00015888081,0.006639783],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99653566,0.0007104812,0.0004261113,0.00054614776,0.0015317429,0.00024978083],"domain_scores_gemma":[0.994586,0.0018562914,0.000189959,0.00065539667,0.002551396,0.00016097461],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0031046043,0.0010153996,0.0012605541,0.004556916,0.0017152531,0.00244083,0.0023468293,0.0017842208,0.010246552],"category_scores_gemma":[0.007058891,0.00053505326,0.0014662609,0.0039117513,0.000556438,0.002568915,0.0016712586,0.0015512207,0.006802034],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002854557,0.00028725015,0.0011274341,0.0001259203,0.0000664552,0.000046991452,0.00008551697,0.0031288464,0.0096729295,0.006452172,0.008813701,0.9699073],"study_design_scores_gemma":[0.0004032726,0.0007558193,0.006789749,0.0001002441,0.00033360303,0.0010959827,0.00028389294,0.82779646,0.057566047,0.04124877,0.063402876,0.00022323574],"about_ca_topic_score_codex":0.006260076,"about_ca_topic_score_gemma":0.008352148,"teacher_disagreement_score":0.010246552,"about_ca_system_score_codex":0.00082703115,"about_ca_system_score_gemma":0.0044477945,"threshold_uncertainty_score":0.034278095},"labels":[],"label_agreement":null},{"id":"W2022780779","doi":"10.5539/cis.v4n6p48","title":"Semi-Automatic Labeling of Training Data Sets in Text Classification","year":2011,"lang":"en","type":"article","venue":"Computer and Information Science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Carelessness; Computer science; Set (abstract data type); Training set; Process (computing); Reduction (mathematics); Data set; Data mining; Data reduction; Information retrieval; Artificial intelligence; Labeled data","score_opus":0.13891772596855814,"score_gpt":0.30321141967432413,"score_spread":0.164293693705766,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2022780779","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.13674869,0.00085824216,0.84421563,0.00043118818,0.00022172608,0.0015341477,0.0022053686,0.008449119,0.005335876],"genre_scores_gemma":[0.2150701,0.00029235435,0.77268535,0.00019820922,0.00008346246,0.0012903177,0.0075977887,0.00032624125,0.0024561682],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.98950255,0.0054178187,0.0011112364,0.0014822915,0.0021346554,0.0003513987],"domain_scores_gemma":[0.96042055,0.022974238,0.0023649163,0.0072793127,0.006533419,0.0004275218],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00560216,0.0010279509,0.0013142382,0.0036641613,0.0018738197,0.0022331008,0.0019500906,0.0015166578,0.0021993439],"category_scores_gemma":[0.020761598,0.0005364888,0.0010596244,0.0031052968,0.0011523085,0.0028225968,0.0016439025,0.0016507298,0.0038434255],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00095503405,0.0012918764,0.008738826,0.0012144739,0.0001175544,0.00026766397,0.0012238532,0.017573586,0.059966918,0.0035287954,0.014241553,0.8908798],"study_design_scores_gemma":[0.0001870272,0.0011227749,0.025257576,0.00050903496,0.00024556514,0.0015466221,0.0017748387,0.6676418,0.23210162,0.018544683,0.050782632,0.0002858389],"about_ca_topic_score_codex":0.0025506322,"about_ca_topic_score_gemma":0.004965837,"teacher_disagreement_score":0.00560216,"about_ca_system_score_codex":0.0008803508,"about_ca_system_score_gemma":0.0019688087,"threshold_uncertainty_score":0.029627442},"labels":[],"label_agreement":null},{"id":"W2024888043","doi":"10.1145/2340416.2340421","title":"A unified framework for document clustering with dual supervision","year":2012,"lang":"en","type":"article","venue":"ACM SIGAPP Applied Computing Review","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Cluster analysis; Computer science; Seeding; Document clustering; Correlation clustering; Conceptual clustering; Brown clustering; Data mining; Single-linkage clustering; Artificial intelligence; Clustering high-dimensional data; Pairwise comparison; Constrained clustering; CURE data clustering algorithm; Pattern recognition (psychology); Physics","score_opus":0.03878235484616066,"score_gpt":0.3065368105442365,"score_spread":0.2677544556980758,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2024888043","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0004627901,0.00013944165,0.9984835,0.00007811337,0.000017022385,0.000042815907,0.00006441481,0.00033491905,0.00037701632],"genre_scores_gemma":[0.03341696,0.00031718588,0.96291685,0.00011568385,0.0001202025,0.00030422298,0.00077564066,0.0002066016,0.0018267102],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9951119,0.0017809784,0.00028649665,0.0011586179,0.0014190427,0.00024297803],"domain_scores_gemma":[0.9964373,0.00086634315,0.00027220702,0.0009640155,0.0012278843,0.00023221743],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0052300077,0.0014235874,0.0023918038,0.003608054,0.0017425283,0.0037937057,0.0044678943,0.001954849,0.0025395597],"category_scores_gemma":[0.008247283,0.0009445209,0.0022675141,0.0045674057,0.0017395464,0.0038267185,0.0045544077,0.0033332459,0.0022232314],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020329453,0.00025709622,0.0014986375,0.000520532,0.00036945601,0.00024099195,0.00072801043,0.25134557,0.007383936,0.24874347,0.021246566,0.46746245],"study_design_scores_gemma":[0.000029790577,0.00004612638,0.0002660282,0.00003310732,0.00004003576,0.000112513946,0.00006183757,0.8983923,0.001463546,0.0879576,0.011559448,0.000037597278],"about_ca_topic_score_codex":0.006160885,"about_ca_topic_score_gemma":0.011492478,"teacher_disagreement_score":0.006160885,"about_ca_system_score_codex":0.0022364894,"about_ca_system_score_gemma":0.003867941,"threshold_uncertainty_score":0.027659237},"labels":[],"label_agreement":null},{"id":"W2036162726","doi":"10.1142/s0218001413500110","title":"THE USE OF WEAK ESTIMATORS TO ACHIEVE LANGUAGE DETECTION AND TRACKING IN MULTILINGUAL DOCUMENTS","year":2013,"lang":"en","type":"article","venue":"International Journal of Pattern Recognition and Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"","keywords":"Estimator; Computer science; Variety (cybernetics); Perspective (graphical); Class (philosophy); Artificial intelligence; Word (group theory); Tracking (education); Machine learning; Natural language processing; Mathematics; Statistics","score_opus":0.09369886442347809,"score_gpt":0.340577001474837,"score_spread":0.24687813705135891,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2036162726","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011154574,0.00036233844,0.98763067,0.00014166243,0.000051032872,0.000023902572,0.000018656468,0.00019504219,0.00042226896],"genre_scores_gemma":[0.27241442,0.0008589276,0.72270775,0.00033327908,0.00034090123,0.00019012865,0.0002569443,0.00023069061,0.002666941],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99414754,0.0025529603,0.00045234908,0.001571665,0.0010019077,0.00027353593],"domain_scores_gemma":[0.9583622,0.028525239,0.0034443075,0.004836161,0.0042226906,0.0006094148],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.013327574,0.0014910458,0.0016335469,0.0027667563,0.0012041815,0.002529773,0.0022742501,0.0022613755,0.0008687638],"category_scores_gemma":[0.061607353,0.0010084583,0.00086506514,0.001725616,0.0022959153,0.0055444455,0.004278054,0.0029678026,0.0014326336],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005384482,0.0002477314,0.014817152,0.00050470926,0.00030358374,0.00022601505,0.00093632226,0.10564069,0.035750754,0.052293595,0.0021174145,0.7866236],"study_design_scores_gemma":[0.000031716987,0.00028941187,0.0037799596,0.00006298442,0.00007517106,0.00023840339,0.0002103443,0.9099719,0.0314686,0.049013574,0.004768902,0.000088940775],"about_ca_topic_score_codex":0.0012144436,"about_ca_topic_score_gemma":0.0011788557,"teacher_disagreement_score":0.013327574,"about_ca_system_score_codex":0.00073231733,"about_ca_system_score_gemma":0.001059804,"threshold_uncertainty_score":0.070483744},"labels":[],"label_agreement":null},{"id":"W2048541556","doi":"10.1007/s10044-014-0382-x","title":"Discriminative learning of generative models: large margin multinomial mixture models for document classification","year":2014,"lang":"en","type":"article","venue":"Pattern Analysis and Applications","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Discriminative model; Generative model; Artificial intelligence; Computer science; Margin (machine learning); Multinomial distribution; Generative grammar; Pattern recognition (psychology); Machine learning; Mixture model; Support vector machine; Mathematics; Statistics","score_opus":0.029579852196899705,"score_gpt":0.2820173542255078,"score_spread":0.2524375020286081,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2048541556","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009008596,0.00058316713,0.9886486,0.00027243726,0.000043877368,0.00004386699,0.00016586867,0.0009051602,0.00032856816],"genre_scores_gemma":[0.44525617,0.0013960877,0.5364214,0.00089111284,0.0005356685,0.0006601355,0.0038774775,0.0010200862,0.009941884],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9970811,0.0015983371,0.00015649915,0.0005787496,0.00038413098,0.00020114331],"domain_scores_gemma":[0.99258035,0.005195033,0.00035592745,0.0011579469,0.00049122435,0.00021961959],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005615817,0.0013766551,0.0026025863,0.0016496277,0.0009040818,0.0020973254,0.004633442,0.0026293183,0.0026976448],"category_scores_gemma":[0.014697812,0.0015016561,0.0025361136,0.0023595698,0.0014432459,0.0035778827,0.0038080798,0.0048676855,0.0025130466],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008413196,0.0005197024,0.0033588805,0.00039657982,0.00035245268,0.00020173327,0.00054328435,0.42220932,0.0057883165,0.05886771,0.014749818,0.49217096],"study_design_scores_gemma":[0.00001413941,0.000016765107,0.00016211926,0.000010998361,0.00001719348,0.000026376827,0.000010909733,0.9786397,0.000435227,0.02012766,0.0005269134,0.000011984774],"about_ca_topic_score_codex":0.0046228296,"about_ca_topic_score_gemma":0.007267885,"teacher_disagreement_score":0.005615817,"about_ca_system_score_codex":0.0013352317,"about_ca_system_score_gemma":0.0011391324,"threshold_uncertainty_score":0.029699624},"labels":[],"label_agreement":null},{"id":"W2054808906","doi":"10.1145/2494266.2494279","title":"Interactive text document clustering using feature labeling","year":2013,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Cluster analysis; Term (time); Discriminative model; Document clustering; Heuristic; Selection (genetic algorithm); Artificial intelligence; Cluster (spacecraft); Information retrieval; Data mining; Pattern recognition (psychology)","score_opus":0.019989052617821218,"score_gpt":0.2722645220177291,"score_spread":0.25227546939990786,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2054808906","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00955676,0.00023979416,0.9796544,0.00012231695,0.000058156507,0.000212994,0.00043650297,0.008440433,0.0012787137],"genre_scores_gemma":[0.052502874,0.00012059249,0.9412844,0.00009332077,0.00007919517,0.00039959946,0.0018665488,0.00068828627,0.0029652952],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99801826,0.00038127365,0.00014697235,0.00057739095,0.0007564991,0.00011958276],"domain_scores_gemma":[0.9963355,0.0013334652,0.00030802292,0.0006992617,0.0011734723,0.00015033486],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00128084,0.0012375142,0.001091844,0.0043681106,0.001245937,0.0015772757,0.0024055715,0.001177389,0.004436443],"category_scores_gemma":[0.005074704,0.00043528416,0.0011542081,0.0046583414,0.00066220463,0.0025185067,0.0015849198,0.0011911665,0.0033369719],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00048906315,0.0003649002,0.0021004677,0.00043542933,0.0001243542,0.00022899413,0.00062454044,0.01412402,0.08649924,0.0065202015,0.02316175,0.86532706],"study_design_scores_gemma":[0.00023343961,0.00032316303,0.003149117,0.000078847166,0.00017002474,0.0011216198,0.0004306094,0.7407502,0.1496813,0.02961799,0.074222535,0.00022111084],"about_ca_topic_score_codex":0.0030411237,"about_ca_topic_score_gemma":0.0051339455,"teacher_disagreement_score":0.004436443,"about_ca_system_score_codex":0.00094739924,"about_ca_system_score_gemma":0.001130521,"threshold_uncertainty_score":0.014841378},"labels":[],"label_agreement":null},{"id":"W2055849934","doi":"10.1111/j.1467-8640.2010.00357.x","title":"AN EFFICIENT MODEL FOR ENHANCING TEXT CATEGORIZATION USING SENTENCE SEMANTICS","year":2010,"lang":"en","type":"article","venue":"Computational Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":13,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Natural language processing; Categorization; Computer science; Sentence; Phrase; Artificial intelligence; Term (time); Meaning (existential); Semantics (computer science); Set (abstract data type); Word (group theory); Linguistics; Psychology","score_opus":0.050186321382605814,"score_gpt":0.33345492317476794,"score_spread":0.2832686017921621,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2055849934","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011208439,0.00023088191,0.98562443,0.00026041566,0.00008077394,0.00016469965,0.00030032633,0.0013442804,0.00078582315],"genre_scores_gemma":[0.24624375,0.0005369655,0.7453707,0.0003366738,0.00020992536,0.0011297903,0.0018042072,0.00017222465,0.0041958415],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9993637,0.00015256317,0.000060678718,0.00015541159,0.000227983,0.000039618484],"domain_scores_gemma":[0.99898237,0.0004283587,0.00007120575,0.00008491247,0.00040220184,0.00003097868],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013310012,0.0008535059,0.0009180296,0.0014950209,0.0004261447,0.0009968873,0.00155373,0.0010091364,0.0019032675],"category_scores_gemma":[0.003019782,0.0002955026,0.0010992059,0.0012355921,0.0004004305,0.0031179592,0.0006472496,0.00086483516,0.0014249452],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00044440618,0.00066734524,0.0029254907,0.0005928369,0.00021243237,0.00036296638,0.000532882,0.17198156,0.040539127,0.049711604,0.015675852,0.71635354],"study_design_scores_gemma":[0.000019619209,0.00007909678,0.00033341523,0.000014515924,0.0000367769,0.00009696013,0.00002740387,0.9810636,0.0032459463,0.012223769,0.0028425436,0.00001635795],"about_ca_topic_score_codex":0.0026261879,"about_ca_topic_score_gemma":0.003002922,"teacher_disagreement_score":0.0026261879,"about_ca_system_score_codex":0.0008615638,"about_ca_system_score_gemma":0.0013254661,"threshold_uncertainty_score":0.00703907},"labels":[],"label_agreement":null},{"id":"W2061074565","doi":"10.1109/iciinfs.2013.6732014","title":"A term weighting method for identifying emotions from text content","year":2013,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"University of Ottawa","keywords":"Weighting; Computer science; tf–idf; Classifier (UML); Term (time); Support vector machine; Vector space model; Artificial intelligence; The Internet; Information retrieval; Natural language processing; Feature vector; Social media; Oracle; Machine learning; World Wide Web","score_opus":0.11414390337789153,"score_gpt":0.3319322388719783,"score_spread":0.21778833549408677,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2061074565","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.032665852,0.0019747098,0.9576078,0.00020944078,0.00034844616,0.0004570992,0.0014313225,0.0027085007,0.0025968512],"genre_scores_gemma":[0.15280682,0.0012500341,0.83167225,0.00011770094,0.00023115381,0.000892405,0.0040781624,0.00038114892,0.008570393],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9986351,0.00019641318,0.00022550582,0.00032197923,0.000534893,0.00008614733],"domain_scores_gemma":[0.9981426,0.0006643139,0.00015952201,0.00012074967,0.0008611335,0.000051633626],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0015228167,0.0009664181,0.0008129067,0.004304864,0.00066151866,0.0014059913,0.0008155505,0.00085678074,0.0034285805],"category_scores_gemma":[0.0053525646,0.0002331174,0.0010513439,0.0045020394,0.00039526177,0.0020643764,0.0006233898,0.0009233574,0.0029717179],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00043413555,0.00013213404,0.0018329871,0.00043520378,0.00009885818,0.00015270812,0.00031446203,0.0029804371,0.052289832,0.0026690399,0.006789974,0.9318701],"study_design_scores_gemma":[0.00020824424,0.001204333,0.032001738,0.0003710022,0.00069111685,0.0029119924,0.0012354499,0.7176073,0.12976885,0.01792889,0.0957617,0.00030931024],"about_ca_topic_score_codex":0.0032646025,"about_ca_topic_score_gemma":0.0035724654,"teacher_disagreement_score":0.004304864,"about_ca_system_score_codex":0.0006171565,"about_ca_system_score_gemma":0.0009288861,"threshold_uncertainty_score":0.011469722},"labels":[],"label_agreement":null},{"id":"W2066207574","doi":"10.1109/memb.2007.335581","title":"Multilabel associative classification categorization of MEDLINE aticles into MeSH keywords","year":2007,"lang":"en","type":"article","venue":"IEEE Engineering in Medicine and Biology Magazine","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":20,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Categorization; Classifier (UML); Associative property; Document classification; Data mining; Macro; Scalability; Artificial intelligence; Information retrieval; Pattern recognition (psychology); Machine learning; Database; Mathematics","score_opus":0.03913872556567612,"score_gpt":0.3145223526739983,"score_spread":0.2753836271083222,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2066207574","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5007584,0.0020805986,0.47165486,0.0005524919,0.0002991578,0.0007575191,0.0029943623,0.010116581,0.010785992],"genre_scores_gemma":[0.63748217,0.00035813442,0.353899,0.00012660795,0.00011114756,0.00031454815,0.0029297129,0.00016264786,0.0046160533],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9987979,0.0002100827,0.00020671978,0.00025307867,0.000420374,0.00011182772],"domain_scores_gemma":[0.9953134,0.0021497146,0.0004833275,0.0006201091,0.0012518831,0.0001814493],"candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.0014685596,0.00053229474,0.0007472183,0.006486994,0.00060328975,0.0010810884,0.0009979412,0.0006908963,0.0033098892],"category_scores_gemma":[0.0076162745,0.00013419449,0.0004646068,0.0029917506,0.00031333105,0.0015446175,0.0011711183,0.0004147022,0.0014411673],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004606004,0.00026028516,0.012497209,0.0004279757,0.000087624634,0.0002319468,0.00027279052,0.0038608431,0.053017046,0.001751067,0.0045751072,0.92255753],"study_design_scores_gemma":[0.00012191439,0.00096137304,0.06372374,0.00018568659,0.00037791004,0.0024494892,0.0012618644,0.51198894,0.3713656,0.020267693,0.02707286,0.00022293026],"about_ca_topic_score_codex":0.0014394781,"about_ca_topic_score_gemma":0.0035599251,"teacher_disagreement_score":0.993513,"about_ca_system_score_codex":0.0005862005,"about_ca_system_score_gemma":0.0007875602,"threshold_uncertainty_score":0.011072636},"labels":[],"label_agreement":null},{"id":"W2071505781","doi":"10.1007/s10766-013-0245-x","title":"Parallel Training of An Improved Neural Network for Text Categorization","year":2013,"lang":"en","type":"article","venue":"International Journal of Parallel Programming","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"St. Francis Xavier University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Speedup; Computer science; Categorization; Correctness; Artificial neural network; The Internet; Artificial intelligence; Text categorization; Process (computing); Machine learning; Data mining; Parallel computing; Algorithm; World Wide Web","score_opus":0.03387168784162624,"score_gpt":0.2973515778122583,"score_spread":0.26347988997063204,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2071505781","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.13327079,0.0010185192,0.85275716,0.0005303498,0.0007086726,0.00018603094,0.00032670755,0.0056585344,0.005543217],"genre_scores_gemma":[0.58512765,0.00034222507,0.39837885,0.00031301568,0.00026910732,0.00024771265,0.0010854244,0.00026558206,0.013970335],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99945575,0.000082570485,0.00004302936,0.0001934421,0.00013704573,0.000088218636],"domain_scores_gemma":[0.99888915,0.0003077669,0.000050944596,0.00023560923,0.0004592554,0.00005720638],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0010156846,0.0007554996,0.0010942364,0.00081203185,0.00058135425,0.0007993101,0.0016746944,0.0010106917,0.0054253815],"category_scores_gemma":[0.0025307357,0.0004527317,0.0006641573,0.0011788674,0.00034112704,0.0014839196,0.0009293712,0.0013569515,0.001729221],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005583989,0.00037926823,0.0013158284,0.00010530779,0.0001231807,0.00011470103,0.00007068392,0.16080011,0.019274846,0.002141251,0.0069577917,0.8081587],"study_design_scores_gemma":[0.000021690028,0.00006054752,0.0002765729,0.0000035575506,0.000023627594,0.000027780115,0.000010159098,0.9933503,0.00406111,0.0013797833,0.0007802737,0.000004639611],"about_ca_topic_score_codex":0.009839626,"about_ca_topic_score_gemma":0.012253845,"teacher_disagreement_score":0.009839626,"about_ca_system_score_codex":0.00077379216,"about_ca_system_score_gemma":0.0012930551,"threshold_uncertainty_score":0.019564688},"labels":[],"label_agreement":null},{"id":"W2077512673","doi":"10.1214/07-ba209","title":"Improving classification when a class hierarchy is available using a hierarchy-based prior","year":2007,"lang":"en","type":"article","venue":"Bayesian Analysis","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":33,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Hierarchy; Multinomial logistic regression; Class hierarchy; Computer science; Class (philosophy); Machine learning; Artificial intelligence; Multinomial distribution; Bayesian probability; Tree (set theory); Data mining; Mathematics; Statistics","score_opus":0.03222386111863169,"score_gpt":0.2757000272695841,"score_spread":0.2434761661509524,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2077512673","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02513021,0.0004353309,0.9697622,0.0006038241,0.00004494441,0.00007052,0.0002442473,0.0017018977,0.002006726],"genre_scores_gemma":[0.34250122,0.00042454293,0.6512994,0.00046255067,0.00022094192,0.00019433565,0.0012848023,0.0003733022,0.0032388673],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99581075,0.0012946279,0.00019617658,0.0008479599,0.0015470475,0.0003034296],"domain_scores_gemma":[0.98554194,0.009237544,0.0008422449,0.0024804012,0.0015233053,0.00037453673],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0055492986,0.0011444363,0.0017033508,0.0033213291,0.001146953,0.0019885397,0.0021892106,0.0019149903,0.003505332],"category_scores_gemma":[0.022922028,0.00089768437,0.0016122129,0.0025410373,0.0011850264,0.0060608904,0.0024148182,0.004192213,0.0021739637],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004801848,0.0005965664,0.012625728,0.00024739336,0.00024443655,0.000112759255,0.0008138675,0.105898224,0.010878226,0.025474021,0.014930385,0.82769823],"study_design_scores_gemma":[0.000043028525,0.000074844036,0.0028608833,0.00004952322,0.00005930132,0.000088977955,0.000080062404,0.9521767,0.003221023,0.037636742,0.0036676154,0.00004143557],"about_ca_topic_score_codex":0.013530259,"about_ca_topic_score_gemma":0.019875906,"teacher_disagreement_score":0.013530259,"about_ca_system_score_codex":0.0015814834,"about_ca_system_score_gemma":0.0019465516,"threshold_uncertainty_score":0.029347837},"labels":[],"label_agreement":null},{"id":"W2079238049","doi":"10.1007/s13042-013-0152-x","title":"Bayesian Citation-KNN with distance weighting","year":2013,"lang":"en","type":"article","venue":"International Journal of Machine Learning and Cybernetics","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":41,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of New Brunswick","funders":"National Natural Science Foundation of China","keywords":"Computer science; Artificial intelligence; Bayesian probability; Machine learning; Benchmark (surveying); k-nearest neighbors algorithm; Weighting; Computational intelligence; Field (mathematics); Naive Bayes classifier; Pattern recognition (psychology); Overhead (engineering); Supervised learning; Data mining; Mathematics; Support vector machine; Artificial neural network","score_opus":0.0059464137161801146,"score_gpt":0.23471035493506628,"score_spread":0.22876394121888616,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2079238049","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.048294857,0.0040758075,0.9306629,0.0017870223,0.00079456286,0.00039688492,0.0028663557,0.0022447663,0.008876915],"genre_scores_gemma":[0.5781449,0.002474668,0.369456,0.0007148728,0.001390764,0.000809592,0.0090657305,0.00041787216,0.037525583],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99397117,0.0020765674,0.0006319299,0.0013391774,0.0015741078,0.00040704448],"domain_scores_gemma":[0.9861239,0.0071712276,0.0009575634,0.0018949101,0.003445163,0.0004071667],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0070793745,0.0012220942,0.0032863973,0.010780672,0.0018710035,0.0033458236,0.005201856,0.0052889423,0.0078090983],"category_scores_gemma":[0.03516333,0.0008688503,0.001918924,0.012085841,0.0011195659,0.006248127,0.0030700571,0.0030277541,0.0039891396],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006468562,0.0006759435,0.011032592,0.00055805343,0.00058590045,0.00018875823,0.00016508879,0.28279522,0.0009357083,0.05138329,0.027642334,0.62339026],"study_design_scores_gemma":[0.00004981102,0.000046265126,0.001070658,0.00005983579,0.000093209695,0.000089150046,0.000030050389,0.91744334,0.00046606807,0.076634094,0.0039798417,0.000037767517],"about_ca_topic_score_codex":0.014482092,"about_ca_topic_score_gemma":0.016148705,"teacher_disagreement_score":0.014482092,"about_ca_system_score_codex":0.0019513699,"about_ca_system_score_gemma":0.0031439029,"threshold_uncertainty_score":0.037439764},"labels":[],"label_agreement":null},{"id":"W2089870669","doi":"10.1016/j.eswa.2011.09.160","title":"Comparison of term frequency and document frequency based feature selection metrics in text categorization","year":2011,"lang":"en","type":"article","venue":"Expert Systems with Applications","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":152,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"Faculty of Graduate Studies and Research, University of Alberta; Natural Sciences and Engineering Research Council of Canada; University of Regina","keywords":"Feature selection; Discriminative model; Computer science; Term (time); Text categorization; Categorization; Word lists by frequency; Feature (linguistics); Frequency; Artificial intelligence; Selection (genetic algorithm); Pattern recognition (psychology); tf–idf; Data mining; Mathematics; Statistics","score_opus":0.031047475942438254,"score_gpt":0.28638712605760935,"score_spread":0.2553396501151711,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2089870669","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8060538,0.019004213,0.16512007,0.00082113635,0.0005060783,0.0003177764,0.0023924846,0.0019093723,0.0038748714],"genre_scores_gemma":[0.8899647,0.0022261976,0.1014041,0.00009452019,0.00031522717,0.00022253304,0.0039830194,0.00015741252,0.0016323052],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9952807,0.0013815538,0.0006418823,0.000368515,0.0020991517,0.00022827652],"domain_scores_gemma":[0.9680778,0.024027443,0.0013362637,0.0008269638,0.0051425,0.0005889791],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0073694726,0.00073620223,0.0017147885,0.008694715,0.0006183662,0.0022877357,0.0008298984,0.001058735,0.0009872641],"category_scores_gemma":[0.021530889,0.00016018402,0.0009252518,0.0060653593,0.00038910387,0.003035834,0.0007324978,0.00073282485,0.00041179056],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0037412317,0.0007666025,0.041271944,0.0012111277,0.0008361935,0.00011324833,0.00038352542,0.012963916,0.017147318,0.0025033206,0.006852606,0.9122091],"study_design_scores_gemma":[0.0006886059,0.006505141,0.2174399,0.00032482677,0.0014314353,0.0013437187,0.0015172681,0.72197956,0.029113404,0.009271628,0.009999031,0.0003855258],"about_ca_topic_score_codex":0.002635662,"about_ca_topic_score_gemma":0.0030270736,"teacher_disagreement_score":0.008694715,"about_ca_system_score_codex":0.0009292995,"about_ca_system_score_gemma":0.0010072835,"threshold_uncertainty_score":0.038973987},"labels":[],"label_agreement":null},{"id":"W2091876488","doi":"10.1007/3-540-45665-1_5","title":"A Fast SVM Training Algorithm","year":2002,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":23,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"MNIST database; Computer science; Support vector machine; Kernel (algebra); Scalability; Artificial intelligence; Principal component analysis; Algorithm; Scheme (mathematics); Pattern recognition (psychology); Machine learning; Digit recognition; Deep learning; Artificial neural network; Mathematics; Database","score_opus":0.03404040626412898,"score_gpt":0.24908833323087898,"score_spread":0.21504792696675,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2091876488","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0028756172,0.00044047128,0.9901334,0.00012554556,0.00032208575,0.000068440844,0.00018643936,0.0035843563,0.0022635432],"genre_scores_gemma":[0.041494343,0.00039833886,0.9392182,0.0002065335,0.00019730018,0.00020403662,0.0014159201,0.00040858024,0.016456757],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9993611,0.00009890838,0.000043031356,0.00015571162,0.00028857024,0.00005280288],"domain_scores_gemma":[0.99925894,0.00018357039,0.000028046921,0.00013899422,0.0003556688,0.000034848745],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00081063877,0.0009755373,0.0011118614,0.00086983305,0.00072051253,0.0012022881,0.0012662767,0.00126338,0.014994297],"category_scores_gemma":[0.0016599052,0.00065932516,0.000839222,0.001096143,0.00018944933,0.0014730296,0.0012552823,0.001803023,0.012825843],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012391512,0.000062211715,0.00018083391,0.000066592365,0.000045068795,0.000029899198,0.000013707033,0.014016988,0.0121159395,0.0038633444,0.01839111,0.9510904],"study_design_scores_gemma":[0.000063485815,0.00012021334,0.00079665624,0.000033823148,0.00005577659,0.00026580683,0.000018887402,0.9251733,0.02073711,0.011924168,0.04077753,0.000033334734],"about_ca_topic_score_codex":0.0014498872,"about_ca_topic_score_gemma":0.0024206836,"teacher_disagreement_score":0.014994297,"about_ca_system_score_codex":0.0003533471,"about_ca_system_score_gemma":0.0009807298,"threshold_uncertainty_score":0.050160885},"labels":[],"label_agreement":null},{"id":"W2095998031","doi":"10.1109/hicss.2007.98","title":"Automatic Web Page Categorization using Principal Component Analysis","year":2007,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Computer science; Information retrieval; Web page; World Wide Web; Categorization; Static web page; Web search engine; Web query classification; Web search query; Task (project management); Web navigation; Search engine; Artificial intelligence; Engineering","score_opus":0.030735769628593958,"score_gpt":0.2876970805385032,"score_spread":0.2569613109099092,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2095998031","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.115071364,0.0016460151,0.8555176,0.0004091069,0.00020222394,0.0008142796,0.0019523756,0.020193739,0.004193178],"genre_scores_gemma":[0.3418174,0.0009137819,0.6436865,0.000092824936,0.00015325584,0.00054206647,0.007475111,0.0005666577,0.004752324],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99780554,0.0005911747,0.00016572769,0.00042239585,0.00075796794,0.00025731127],"domain_scores_gemma":[0.99637645,0.0012830637,0.00024913673,0.0003899641,0.0016046766,0.00009669042],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014875648,0.0012359122,0.001458816,0.011563119,0.0009060558,0.0021512131,0.0009480223,0.0010379184,0.002952721],"category_scores_gemma":[0.005886842,0.00037040937,0.0010453012,0.0066527086,0.00045755666,0.0018232681,0.0008464379,0.0010675367,0.0039621857],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00034300613,0.00041987214,0.006697768,0.00026829346,0.0001180619,0.00014808138,0.00018344194,0.007468277,0.029331977,0.0024919354,0.013300268,0.9392291],"study_design_scores_gemma":[0.000075226744,0.0002783872,0.039652113,0.00008036083,0.00020917552,0.00062675896,0.0004191346,0.87781405,0.046357185,0.01805068,0.016252233,0.00018456772],"about_ca_topic_score_codex":0.005889399,"about_ca_topic_score_gemma":0.0039710854,"teacher_disagreement_score":0.011563119,"about_ca_system_score_codex":0.00056052586,"about_ca_system_score_gemma":0.0011482359,"threshold_uncertainty_score":0.011710227},"labels":[],"label_agreement":null},{"id":"W2096794280","doi":"10.1109/ccece.2011.6030580","title":"Classifying the Arabic web — A pilot study","year":2011,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Computer science; World Wide Web; Arabic; Web crawler; Web page; Globe; Categorization; The Internet; Information retrieval; Artificial intelligence; Linguistics","score_opus":0.15256397385339876,"score_gpt":0.27215516938871803,"score_spread":0.11959119553531927,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2096794280","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9966235,0.00005909163,0.000755977,0.000120915596,0.000018512492,0.00021288524,0.0003429549,0.00003313842,0.0018329222],"genre_scores_gemma":[0.9918321,0.00016067838,0.004170998,0.00011186467,0.000040479397,0.00017618077,0.0013703429,0.000016785118,0.0021207281],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9990409,0.00044234417,0.00011231145,0.00012211657,0.00020172076,0.00008056662],"domain_scores_gemma":[0.98821414,0.0064048604,0.00038891422,0.0008361148,0.0034376218,0.00071837584],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001993297,0.00046583032,0.00040514948,0.0013396397,0.0011473015,0.0010970216,0.0003647338,0.00064184266,0.0028389439],"category_scores_gemma":[0.010079647,0.00013175473,0.00036806328,0.0011447346,0.00051499926,0.0017434815,0.00059641886,0.0007178252,0.0014516189],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0055842916,0.023864333,0.5178056,0.00093258516,0.00024909645,0.0037095374,0.03183269,0.006235559,0.03379695,0.0017766173,0.012177107,0.36203557],"study_design_scores_gemma":[0.0005775592,0.009255174,0.78465897,0.00021618293,0.0003457781,0.0025103025,0.06259117,0.059985515,0.036278572,0.0022552542,0.041161254,0.00016428773],"about_ca_topic_score_codex":0.006669807,"about_ca_topic_score_gemma":0.0065609016,"teacher_disagreement_score":0.006669807,"about_ca_system_score_codex":0.00054388813,"about_ca_system_score_gemma":0.00041626944,"threshold_uncertainty_score":0.013261974},"labels":[],"label_agreement":null},{"id":"W2098465658","doi":"10.1136/amiajnl-2012-001072","title":"Direct comparison between support vector machine and multinomial naive Bayes algorithms for medical abstract classification","year":2012,"lang":"en","type":"letter","venue":"Journal of the American Medical Informatics Association","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Support vector machine; Computer science; Machine learning; Naive Bayes classifier; Artificial intelligence; Algorithm; Bayesian probability; Relevance vector machine; Multinomial distribution; Task (project management); Bayes' theorem; Structured support vector machine; Data mining; Mathematics; Statistics; Engineering","score_opus":0.030097218431528877,"score_gpt":0.3180617413496284,"score_spread":0.2879645229180995,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2098465658","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09110195,0.082090095,0.7072254,0.06710758,0.011142186,0.0017631766,0.0031933521,0.0027668772,0.033609446],"genre_scores_gemma":[0.46459606,0.013810736,0.49321067,0.012894868,0.005379591,0.0017364316,0.002780863,0.00053383963,0.0050569875],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.92879695,0.045099284,0.005417681,0.0032291485,0.016885402,0.000571454],"domain_scores_gemma":[0.7060374,0.25307602,0.0040044216,0.0076330495,0.028101858,0.0011472369],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.06655764,0.0010443098,0.0024658788,0.0053108446,0.0008261494,0.0039568483,0.0020317673,0.0036565633,0.007355015],"category_scores_gemma":[0.3191024,0.00047129317,0.0016146278,0.004039453,0.0008105437,0.0059969975,0.0014579333,0.003407169,0.0041987575],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0050361394,0.00030956205,0.0075112507,0.0014147471,0.00079980714,0.00008103134,0.00021315715,0.005624972,0.00074501825,0.012785972,0.026236525,0.9392419],"study_design_scores_gemma":[0.0031791432,0.0059627243,0.023316428,0.0035736603,0.0011641145,0.0031829749,0.00064148195,0.66128117,0.007383578,0.21881716,0.070950754,0.0005468128],"about_ca_topic_score_codex":0.0017490983,"about_ca_topic_score_gemma":0.0027148924,"teacher_disagreement_score":0.93344235,"about_ca_system_score_codex":0.0026928305,"about_ca_system_score_gemma":0.00229458,"threshold_uncertainty_score":0.35199463},"labels":[],"label_agreement":null},{"id":"W2099126842","doi":"10.1109/icdm.2001.989592","title":"A simple KNN algorithm for text categorization","year":2002,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":225,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval","funders":"","keywords":"Computer science; Interpretability; Artificial intelligence; Text categorization; Feature (linguistics); Context (archaeology); Vocabulary; Feature selection; Word (group theory); Categorization; Simple (philosophy); Class (philosophy); k-nearest neighbors algorithm; Process (computing); Machine learning; Natural language processing; Pattern recognition (psychology); Mathematics","score_opus":0.030164978776939248,"score_gpt":0.25378029008612923,"score_spread":0.22361531130919,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2099126842","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.002073414,0.0010050241,0.9890928,0.0002647378,0.00035867648,0.0004822347,0.0006074676,0.0027094472,0.0034061547],"genre_scores_gemma":[0.022067556,0.00074117014,0.9652344,0.00033109044,0.00021617385,0.0005842369,0.0015181986,0.00021485578,0.009092454],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99646854,0.00054968655,0.00035920052,0.0009805036,0.0014726771,0.00016948978],"domain_scores_gemma":[0.99815553,0.00053367903,0.00015435394,0.0003339213,0.00075706077,0.00006551814],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0021839475,0.0020206084,0.0015273634,0.0048185186,0.0019207075,0.0021001648,0.0027030716,0.0026848172,0.009330341],"category_scores_gemma":[0.007986929,0.0005954772,0.0014644202,0.0051679346,0.0010014791,0.003672694,0.0015649222,0.002167924,0.012959958],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00010946793,0.000114350136,0.0006807648,0.00040516295,0.00012436809,0.000082213584,0.00010178585,0.020141946,0.006105151,0.0105268825,0.022198388,0.93940943],"study_design_scores_gemma":[0.00015938081,0.00032175748,0.002698133,0.00033998254,0.0001823433,0.0013698976,0.00023589058,0.61798745,0.020858238,0.1748949,0.1806987,0.00025334966],"about_ca_topic_score_codex":0.0047657522,"about_ca_topic_score_gemma":0.0065796687,"teacher_disagreement_score":0.009330341,"about_ca_system_score_codex":0.0011230786,"about_ca_system_score_gemma":0.002013379,"threshold_uncertainty_score":0.031213045},"labels":[],"label_agreement":null},{"id":"W2099994538","doi":"","title":"Structured ranking learning using cumulative distribution networks","year":2008,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":18,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Learning to rank; Computer science; Ranking (information retrieval); Pairwise comparison; Benchmark (surveying); Rank (graph theory); Machine learning; Probabilistic logic; Object (grammar); Artificial intelligence; Independence (probability theory); Cumulative distribution function; Class (philosophy); Data mining; Graphical model; Mathematics; Statistics","score_opus":0.037738564434568356,"score_gpt":0.26599140352394024,"score_spread":0.22825283908937188,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2099994538","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.029901586,0.0006309747,0.96530026,0.00068942923,0.000040410443,0.000068741916,0.00025133195,0.00058085774,0.0025364098],"genre_scores_gemma":[0.8527337,0.00080075476,0.13757321,0.00042010334,0.00018548233,0.00031986917,0.0010511047,0.00010701509,0.0068087284],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9986626,0.000676568,0.00004439092,0.00022982282,0.00028961673,0.00009692891],"domain_scores_gemma":[0.9939387,0.0045781205,0.0004914919,0.00030354506,0.000525818,0.00016228919],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002674967,0.0009035156,0.0013988747,0.0022352769,0.0005762447,0.0015490361,0.0016251688,0.0015877124,0.0026927975],"category_scores_gemma":[0.012645991,0.00043022435,0.0006351446,0.0017163124,0.0012384404,0.0031982926,0.0011756854,0.001478202,0.00059380464],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006488877,0.000061245744,0.0014634052,0.00007572503,0.000044809494,0.000057289704,0.000046068795,0.87954086,0.0003547261,0.051181477,0.0024932562,0.06461628],"study_design_scores_gemma":[0.000007453741,0.000016094877,0.000121014375,0.000006118336,0.00000390938,0.000008863117,0.000004443058,0.9625602,0.000085117455,0.03691658,0.00026463953,0.0000055981027],"about_ca_topic_score_codex":0.004851186,"about_ca_topic_score_gemma":0.0071687866,"teacher_disagreement_score":0.004851186,"about_ca_system_score_codex":0.0021792203,"about_ca_system_score_gemma":0.0010357142,"threshold_uncertainty_score":0.015811443},"labels":[],"label_agreement":null},{"id":"W2102282930","doi":"10.1007/978-3-642-31368-4_22","title":"Features’ Weight Learning towards Improved Query Classification","year":2012,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Weighting; Support vector machine; Naive Bayes classifier; k-nearest neighbors algorithm; Artificial intelligence; Data mining; Entropy (arrow of time); Machine learning; Pattern recognition (psychology); Scheme (mathematics); Mathematics","score_opus":0.021257727760830295,"score_gpt":0.25452082845845103,"score_spread":0.23326310069762074,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2102282930","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07683186,0.0019458837,0.91317457,0.00042392968,0.0002397223,0.00011648531,0.0005268979,0.0048511233,0.0018895039],"genre_scores_gemma":[0.5195877,0.0008807993,0.46757764,0.00027868376,0.00040579005,0.00015241439,0.002714593,0.0006396574,0.0077627627],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9987846,0.00020547856,0.00009699587,0.0002978926,0.0004585076,0.00015651078],"domain_scores_gemma":[0.99809617,0.00066751445,0.00011670226,0.00042580126,0.0006237874,0.00006996519],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011770884,0.0008914245,0.0012612735,0.0016815107,0.00041160497,0.0013836622,0.0015484779,0.0010589992,0.0033278512],"category_scores_gemma":[0.005249849,0.000348207,0.000799039,0.0022382075,0.00040419854,0.0023757515,0.0012234581,0.0016033386,0.0018926106],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005379433,0.00024672778,0.0017195941,0.00015679353,0.000076415796,0.000056805595,0.00007854685,0.015042257,0.056064744,0.003320725,0.010757503,0.911942],"study_design_scores_gemma":[0.000047595164,0.00016722419,0.0019186971,0.000020168614,0.00008516932,0.00019255407,0.00004355594,0.9451007,0.03884761,0.0072929263,0.0062582297,0.00002541817],"about_ca_topic_score_codex":0.0031774594,"about_ca_topic_score_gemma":0.0031575896,"teacher_disagreement_score":0.0033278512,"about_ca_system_score_codex":0.0006023225,"about_ca_system_score_gemma":0.0007492037,"threshold_uncertainty_score":0.011132777},"labels":[],"label_agreement":null},{"id":"W2106388373","doi":"10.1016/j.ipm.2006.07.006","title":"Contextual feature selection for text classification","year":2006,"lang":"en","type":"article","venue":"Information Processing & Management","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":10,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Bigram; Computer science; Feature selection; Selection (genetic algorithm); Set (abstract data type); Filter (signal processing); Feature (linguistics); Information retrieval; Artificial intelligence; Data set; Simple (philosophy); Data mining","score_opus":0.013551666440469857,"score_gpt":0.24842697285509144,"score_spread":0.2348753064146216,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2106388373","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1589049,0.0057204184,0.8163757,0.0004884315,0.00053920364,0.0003377647,0.004424477,0.008764171,0.004444972],"genre_scores_gemma":[0.69416684,0.0011107672,0.2893232,0.00019124342,0.00057694095,0.00053213077,0.009777974,0.00033987514,0.003980978],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99919766,0.00018626991,0.00008601011,0.00021555288,0.00020682873,0.00010778585],"domain_scores_gemma":[0.9988298,0.00050148496,0.00008632385,0.00018841166,0.00032239693,0.00007157345],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008478424,0.00070320774,0.0013655456,0.002415389,0.00075412315,0.00095406966,0.0007813594,0.0006689111,0.0039591305],"category_scores_gemma":[0.0027326127,0.00019636792,0.0008535962,0.0026352296,0.00027247006,0.0011532464,0.0007002558,0.0006428215,0.0015363832],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010417912,0.00035678403,0.004841818,0.00034545836,0.00013281063,0.00022172785,0.00010329196,0.008087556,0.042860392,0.0025557098,0.018358093,0.92109466],"study_design_scores_gemma":[0.0002324321,0.0007368704,0.021829544,0.00013575824,0.0005516116,0.00075948355,0.0003610538,0.8686979,0.057548054,0.016319422,0.03271049,0.00011733331],"about_ca_topic_score_codex":0.002351315,"about_ca_topic_score_gemma":0.004303399,"teacher_disagreement_score":0.0039591305,"about_ca_system_score_codex":0.0003058565,"about_ca_system_score_gemma":0.00088710774,"threshold_uncertainty_score":0.013244569},"labels":[],"label_agreement":null},{"id":"W2108345839","doi":"10.1177/0165551508092257","title":"A hidden Markov model-based text classification of medical documents","year":2008,"lang":"en","type":"article","venue":"Journal of Information Science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":55,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Hidden Markov model; Computer science; Categorization; Artificial intelligence; Markov model; Subject (documents); Natural language processing; Machine learning; Markov chain; World Wide Web","score_opus":0.029640633799022778,"score_gpt":0.2983874154971723,"score_spread":0.26874678169814953,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2108345839","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1538474,0.001187647,0.82596165,0.0012069913,0.00041105694,0.0008215813,0.0031791918,0.0099822655,0.0034022876],"genre_scores_gemma":[0.6417464,0.00060133083,0.3455542,0.0003325453,0.00014537101,0.00049564376,0.0057531856,0.00015474354,0.005216562],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99881387,0.00032753305,0.000102336024,0.0003121675,0.00035461862,0.00008958808],"domain_scores_gemma":[0.9956735,0.0029061993,0.0001960138,0.0002544122,0.00083953596,0.00013045933],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0017955755,0.0005354066,0.00084641366,0.0017244074,0.00047130624,0.0011651242,0.0010569325,0.0010681481,0.002199278],"category_scores_gemma":[0.0069673285,0.0002602147,0.00087811897,0.0012161371,0.00031786528,0.0017735882,0.0004139399,0.0010567694,0.00179488],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017447547,0.00091964134,0.015904132,0.0006540463,0.00029463295,0.00036481163,0.00037039333,0.11346572,0.02445914,0.003963219,0.012936366,0.82492316],"study_design_scores_gemma":[0.00004598331,0.00019299988,0.0034381545,0.000033163615,0.00006103074,0.00014870599,0.00004238893,0.9867159,0.0061818273,0.0016232107,0.0014889169,0.000027693759],"about_ca_topic_score_codex":0.014833982,"about_ca_topic_score_gemma":0.010696295,"teacher_disagreement_score":0.014833982,"about_ca_system_score_codex":0.0011601395,"about_ca_system_score_gemma":0.0013765864,"threshold_uncertainty_score":0.029495299},"labels":[],"label_agreement":null},{"id":"W2110295586","doi":"10.1109/cec.2006.1688611","title":"Evolving Recurrent Linear-GP for Document Classification and Word Tracking","year":2006,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Computer science; Word (group theory); Document classification; Artificial intelligence; Benchmark (surveying); Genetic programming; Set (abstract data type); Encoding (memory); Sequence (biology); Natural language processing; Data mining; Pattern recognition (psychology); Mathematics","score_opus":0.035148514533766856,"score_gpt":0.29023778707385306,"score_spread":0.2550892725400862,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2110295586","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.033000086,0.0004078672,0.96301436,0.00017989792,0.00005224614,0.000044976066,0.000084150175,0.0020753383,0.0011411351],"genre_scores_gemma":[0.47752357,0.00036600506,0.51490194,0.000277537,0.00008553855,0.00018421038,0.0004906003,0.00019787207,0.00597269],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99942255,0.00014456609,0.00003882744,0.00018206621,0.00015052005,0.00006155994],"domain_scores_gemma":[0.9990576,0.0004909033,0.00009475136,0.00009865595,0.00022531117,0.000032729895],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011321979,0.0006201418,0.0008597804,0.00079330493,0.0003094238,0.0008169117,0.0014646867,0.0011875824,0.0012897367],"category_scores_gemma":[0.0032142787,0.00029675107,0.00058107363,0.0013188098,0.00043143984,0.0013529564,0.00054080586,0.0011801011,0.0007850897],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018439106,0.00018054098,0.0018114625,0.00013000172,0.00011722776,0.00023613793,0.00014652255,0.43925083,0.015727667,0.009276599,0.0025664624,0.53037214],"study_design_scores_gemma":[0.0000048249262,0.000021776174,0.00010243776,0.0000027188137,0.0000090484455,0.000019289733,0.0000040257946,0.9963916,0.0014524222,0.0016485307,0.0003388128,0.0000045245915],"about_ca_topic_score_codex":0.0077037425,"about_ca_topic_score_gemma":0.0060579698,"teacher_disagreement_score":0.0077037425,"about_ca_system_score_codex":0.0009569788,"about_ca_system_score_gemma":0.000735508,"threshold_uncertainty_score":0.015317798},"labels":[],"label_agreement":null},{"id":"W2111476725","doi":"10.1016/j.neucom.2014.12.041","title":"Multiview self-learning","year":2014,"lang":"en","type":"article","venue":"Neurocomputing","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"National Research Council Canada","funders":"Agence Nationale de la Recherche","keywords":"Computer science; Artificial intelligence; Margin (machine learning); Classifier (UML); Pattern recognition (psychology); Labeled data; Naive Bayes classifier; Majority rule; Contextual image classification; Machine learning; Bounding overwatch; Image (mathematics); Support vector machine","score_opus":0.007415373750483025,"score_gpt":0.21862130427967286,"score_spread":0.21120593052918984,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2111476725","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020206355,0.00039532498,0.97688043,0.00020513317,0.00009720459,0.00002411038,0.00009808738,0.00049522816,0.001598167],"genre_scores_gemma":[0.7360867,0.00042465556,0.25216943,0.00034755896,0.00036576646,0.00008095417,0.00068730494,0.0002214326,0.009616139],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9995975,0.00007389952,0.000025339446,0.00017282531,0.00008616114,0.000044278248],"domain_scores_gemma":[0.99894196,0.00037558368,0.00011817944,0.00023454199,0.0002639092,0.0000659427],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0010419536,0.0005338284,0.0011769723,0.0006654353,0.00032822235,0.001011926,0.00090575585,0.001136464,0.00330066],"category_scores_gemma":[0.0028454564,0.00039516264,0.00068085344,0.00081361074,0.0004999974,0.0014011238,0.0013234729,0.0008122056,0.0009557574],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00031528622,0.00017819188,0.0021677336,0.00015446066,0.00018897827,0.00008284409,0.00008694422,0.35730374,0.014276281,0.018041516,0.008500832,0.59870327],"study_design_scores_gemma":[0.0000039842653,0.00002339821,0.0002066643,0.0000034752009,0.000008437739,0.00002303754,0.000004929694,0.9942624,0.0013750339,0.0035563868,0.0005278085,0.000004453293],"about_ca_topic_score_codex":0.0013388227,"about_ca_topic_score_gemma":0.001238033,"teacher_disagreement_score":0.00330066,"about_ca_system_score_codex":0.000401701,"about_ca_system_score_gemma":0.000450169,"threshold_uncertainty_score":0.01104182},"labels":[],"label_agreement":null},{"id":"W2114811742","doi":"10.1145/383952.384075","title":"Construction of a hierarchical classifier schema using a combination of text-based and image-based approaches","year":2001,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Classifier (UML); Hierarchy; Information retrieval; Schema (genetic algorithms); Artificial intelligence; Contextual image classification; Web page; Hierarchical database model; Pattern recognition (psychology); Image (mathematics); Data mining; World Wide Web","score_opus":0.06165531021782302,"score_gpt":0.2653097024452505,"score_spread":0.20365439222742746,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2114811742","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0093381405,0.00015704936,0.9815854,0.00021933636,0.00006117371,0.00057626463,0.0008967252,0.0041232486,0.0030427238],"genre_scores_gemma":[0.042406067,0.00014157662,0.9511545,0.0001716752,0.000040757543,0.0004122754,0.0033762362,0.0002046864,0.002092312],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9978904,0.00025684838,0.00033413997,0.0004593047,0.00091958937,0.00013975463],"domain_scores_gemma":[0.99582183,0.0007739976,0.00023725527,0.0005815152,0.0024058837,0.00017944648],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0024787923,0.00044808362,0.00077895884,0.0037247173,0.0009642849,0.002136817,0.0016885509,0.0011547854,0.0030739987],"category_scores_gemma":[0.0057462486,0.00044745702,0.0014549972,0.0028581645,0.00057900546,0.0034819944,0.0011282822,0.0012518413,0.0034035954],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018375948,0.00045899252,0.009614546,0.0004090708,0.000182478,0.00038821978,0.00058061676,0.015994912,0.034098774,0.03266793,0.029372077,0.87604874],"study_design_scores_gemma":[0.00008183537,0.00031320096,0.006650213,0.00030342094,0.00038699657,0.00085019163,0.0005071691,0.77963465,0.06632331,0.049984496,0.094820775,0.00014373627],"about_ca_topic_score_codex":0.007893015,"about_ca_topic_score_gemma":0.009887,"teacher_disagreement_score":0.007893015,"about_ca_system_score_codex":0.0010567785,"about_ca_system_score_gemma":0.0024922262,"threshold_uncertainty_score":0.015694141},"labels":[],"label_agreement":null},{"id":"W2120020585","doi":"10.5591/978-1-57735-516-8/ijcai11-410","title":"A new search engine integrating hierarchical browsing and keyword search","year":2011,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Computer science; Information retrieval; Search engine indexing; Search engine; Hierarchy; Web page; Organic search; Search analytics; World Wide Web; Metasearch engine; Keyword search; Web search engine; Index (typography); Web search query","score_opus":0.05883367762615484,"score_gpt":0.27393613419027013,"score_spread":0.2151024565641153,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2120020585","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.018413825,0.005506574,0.771248,0.0010115374,0.001303319,0.0012515461,0.00911016,0.17077729,0.0213778],"genre_scores_gemma":[0.06225265,0.0028478678,0.83216554,0.0019338316,0.00068678206,0.0006883394,0.0336853,0.005927564,0.059812143],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99789494,0.00021842845,0.00027367973,0.0003622621,0.0011117219,0.00013905251],"domain_scores_gemma":[0.9973455,0.000550955,0.00010065672,0.00057106675,0.0011446474,0.00028715507],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0018719708,0.0010151569,0.0020342274,0.004788884,0.0007106964,0.0021875727,0.0019238831,0.0012482265,0.01099351],"category_scores_gemma":[0.0035527756,0.0010348858,0.00094342185,0.0043812008,0.00043410648,0.007707454,0.0026952662,0.0012020688,0.012626845],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011133675,0.0006765656,0.0019551665,0.0011962246,0.00037520277,0.00046574348,0.00017486548,0.0020086002,0.06393913,0.009202481,0.1840567,0.73483604],"study_design_scores_gemma":[0.0011984189,0.0011946898,0.006156093,0.00034440053,0.0010533873,0.005333608,0.00021867226,0.24183547,0.1107889,0.02002079,0.6109912,0.0008644512],"about_ca_topic_score_codex":0.0037684094,"about_ca_topic_score_gemma":0.0073839105,"teacher_disagreement_score":0.01099351,"about_ca_system_score_codex":0.0005066572,"about_ca_system_score_gemma":0.0015347389,"threshold_uncertainty_score":0.03677696},"labels":[],"label_agreement":null},{"id":"W2122560301","doi":"10.5539/cis.v6n4p125","title":"Abstract Sentence Classification for Scientific Papers Based on Transductive SVM","year":2013,"lang":"en","type":"article","venue":"Computer and Information Science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Fundamental Research Funds for the Central Universities; Ministry of Education, India","keywords":"Computer science; Sentence; Support vector machine; Artificial intelligence; Natural language processing; Machine learning; Pattern recognition (psychology)","score_opus":0.024695993654702143,"score_gpt":0.2510553728594687,"score_spread":0.22635937920476656,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2122560301","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.30261454,0.0027259812,0.678721,0.0010390839,0.0009761174,0.00045284987,0.0014634975,0.0055597234,0.006447227],"genre_scores_gemma":[0.8059157,0.00057996076,0.18516125,0.00018887098,0.0005338316,0.0003492934,0.0038763292,0.00011763445,0.003277025],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99851555,0.00047889282,0.0002067735,0.00024513944,0.000450638,0.00010296124],"domain_scores_gemma":[0.996467,0.0015463259,0.00025228827,0.00022554582,0.0013719941,0.00013676524],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019279794,0.00072793773,0.0010069036,0.0027944404,0.00044062326,0.0017150023,0.0008094724,0.000759878,0.0018259544],"category_scores_gemma":[0.0055922475,0.00017983328,0.00085137045,0.0017142474,0.00025321817,0.0013817904,0.00049846986,0.0010083921,0.0011915279],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009147817,0.00075020065,0.008985237,0.00050000666,0.00018474356,0.00027185967,0.00032973167,0.028096246,0.03130165,0.0030623267,0.011957367,0.9136458],"study_design_scores_gemma":[0.000027252454,0.00024433914,0.0042080493,0.000026778485,0.00006830129,0.0000837359,0.0001409089,0.9801931,0.00956129,0.0031500426,0.002271286,0.000024956675],"about_ca_topic_score_codex":0.0006974942,"about_ca_topic_score_gemma":0.0006499407,"teacher_disagreement_score":0.0027944404,"about_ca_system_score_codex":0.00056525035,"about_ca_system_score_gemma":0.00057904876,"threshold_uncertainty_score":0.010196269},"labels":[],"label_agreement":null},{"id":"W2124567055","doi":"10.1109/waina.2009.50","title":"SVM Fuzzy Hierarchical Classification Method for Multi-class Problems","year":2009,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Sherbrooke","funders":"","keywords":"Support vector machine; Artificial intelligence; Multiclass classification; Computer science; Fuzzy logic; Pattern recognition (psychology); Structured support vector machine; Fuzzy classification; Data mining; Transitive closure; Machine learning; Class (philosophy); Binary classification; Hierarchy; Fuzzy set; Mathematics","score_opus":0.08314315804154464,"score_gpt":0.3518369244207198,"score_spread":0.26869376637917514,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2124567055","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.003077181,0.00019246005,0.9955081,0.000063843996,0.00005009787,0.000042253316,0.00003441302,0.00039788542,0.00063378375],"genre_scores_gemma":[0.14478368,0.0002876752,0.85120624,0.0001100228,0.0001759706,0.0002449021,0.0003139119,0.00012240335,0.0027551358],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99789965,0.0005018996,0.0001593573,0.0003350301,0.0009796661,0.00012436078],"domain_scores_gemma":[0.9985165,0.00059156556,0.00011911761,0.00020068984,0.000505217,0.00006693423],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0020381557,0.00074350514,0.001155264,0.0021338756,0.0007872994,0.00086602475,0.0014801705,0.0011029588,0.0041477676],"category_scores_gemma":[0.0040991623,0.00027760502,0.0011260154,0.0012325605,0.00057307753,0.0017614579,0.0007382284,0.001559313,0.0012360623],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020229648,0.00016518564,0.0013281391,0.00033610687,0.00012526567,0.00016039608,0.00021626758,0.14687306,0.012866003,0.04325836,0.008205974,0.78626305],"study_design_scores_gemma":[0.000016520537,0.000031407748,0.00032095102,0.0000138542655,0.000015909964,0.000058754893,0.000017015525,0.9818392,0.0026452185,0.01147049,0.0035564278,0.000014254515],"about_ca_topic_score_codex":0.003177926,"about_ca_topic_score_gemma":0.0031704092,"teacher_disagreement_score":0.0041477676,"about_ca_system_score_codex":0.0010951333,"about_ca_system_score_gemma":0.0012034092,"threshold_uncertainty_score":0.013875663},"labels":[],"label_agreement":null},{"id":"W2125811916","doi":"10.1109/icsmc.2007.4414079","title":"Learning social networks using multiple resampling method","year":2007,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Undersampling; Computer science; Resampling; Oversampling; Artificial intelligence; Relation (database); Classifier (UML); Machine learning; Support vector machine; Class (philosophy); Social network (sociolinguistics); Set (abstract data type); Data mining; Social media; World Wide Web","score_opus":0.05936525729498046,"score_gpt":0.3507767445331882,"score_spread":0.29141148723820776,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2125811916","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.049335353,0.00030411474,0.9485614,0.00023705154,0.00006505863,0.000121970865,0.00010253849,0.0006629983,0.0006095383],"genre_scores_gemma":[0.57349426,0.00021021042,0.4234971,0.00015453143,0.00019951636,0.000356821,0.0008791572,0.000067000256,0.0011414967],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99800235,0.0010209098,0.00010316342,0.00041532674,0.00034690814,0.00011131692],"domain_scores_gemma":[0.9957533,0.0025605953,0.00040213595,0.00064104993,0.0005455544,0.00009736962],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0040804087,0.0009474001,0.0014274286,0.002296465,0.0007180298,0.0008056455,0.0012330484,0.0011325162,0.0006919842],"category_scores_gemma":[0.008794658,0.0003767697,0.0011592204,0.00083078415,0.0006283566,0.001608196,0.00078824075,0.00086091546,0.00033000638],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004660538,0.00039499492,0.009644105,0.00014439313,0.00045170082,0.00033056893,0.0003391506,0.5111174,0.008202195,0.014486063,0.004743894,0.4496794],"study_design_scores_gemma":[0.000010184757,0.000031049512,0.00046009984,0.0000036228776,0.000011802037,0.000028781382,0.00001437927,0.9938471,0.001123481,0.004092909,0.00037036862,0.0000063465345],"about_ca_topic_score_codex":0.0033727733,"about_ca_topic_score_gemma":0.0037838088,"teacher_disagreement_score":0.0040804087,"about_ca_system_score_codex":0.0007436784,"about_ca_system_score_gemma":0.0005343151,"threshold_uncertainty_score":0.021579564},"labels":[],"label_agreement":null},{"id":"W2128133607","doi":"","title":"Semi-supervised Document Classification with a Mislabeling Error Model","year":2009,"lang":"en","type":"article","venue":"NPARC","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"National Research Council Canada","funders":"","keywords":"Probabilistic latent semantic analysis; Computer science; Artificial intelligence; Extension (predicate logic); Probabilistic logic; Machine learning; Set (abstract data type); Multiclass classification; Topic model; Document classification; Pattern recognition (psychology); Supervised learning; Data mining; Support vector machine; Artificial neural network","score_opus":0.03335914134963362,"score_gpt":0.2681762081773369,"score_spread":0.23481706682770326,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2128133607","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02784203,0.00022558955,0.9702728,0.00029563645,0.000058478574,0.000065995926,0.00011340282,0.00059301365,0.0005330304],"genre_scores_gemma":[0.5977376,0.00019895229,0.39690623,0.00025765595,0.0002861549,0.00028373636,0.00066829723,0.00015213406,0.0035092325],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99067944,0.0049260664,0.0005066583,0.0016570326,0.0019881139,0.00024279134],"domain_scores_gemma":[0.9587018,0.02449038,0.0039707776,0.007777976,0.0046596033,0.00039951538],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010098252,0.00094058836,0.0021515633,0.0017012456,0.0009686743,0.0020690784,0.0033910626,0.00219867,0.0010797015],"category_scores_gemma":[0.020875813,0.0007002385,0.0012200426,0.0019225221,0.0019922727,0.003907328,0.0016506589,0.003112118,0.000879602],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00087832846,0.000709913,0.011433431,0.00048539028,0.0004931672,0.0002746798,0.0006597488,0.471712,0.008337335,0.026908675,0.007340147,0.4707672],"study_design_scores_gemma":[0.00001173764,0.000037582875,0.00043665268,0.00001005382,0.000018355006,0.00006363943,0.000014482417,0.99069476,0.0018833628,0.006361332,0.0004540043,0.000013986462],"about_ca_topic_score_codex":0.0015984001,"about_ca_topic_score_gemma":0.002051048,"teacher_disagreement_score":0.010098252,"about_ca_system_score_codex":0.0014454748,"about_ca_system_score_gemma":0.0014008485,"threshold_uncertainty_score":0.053405285},"labels":[],"label_agreement":null},{"id":"W2128866918","doi":"10.1109/icsmc.2007.4414080","title":"Combining feature ranking for text classification","year":2007,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Artificial intelligence; Computer science; Ranking (information retrieval); Pattern recognition (psychology); Classifier (UML); Feature (linguistics); Curse of dimensionality; Majority rule; Dimensionality reduction; Support vector machine; Ranking SVM; Data mining; Feature extraction; Feature vector; Machine learning; Feature selection","score_opus":0.03615333796315819,"score_gpt":0.298108691432085,"score_spread":0.26195535346892684,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2128866918","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.027461503,0.0013556302,0.96641546,0.00013198651,0.0001278479,0.0001893866,0.00030413768,0.0018757056,0.002138301],"genre_scores_gemma":[0.3742747,0.00079686387,0.62020516,0.0001131112,0.00027832572,0.00036919155,0.0014321585,0.00018166988,0.0023487476],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99600214,0.0013164296,0.00027581997,0.0005472168,0.0016353369,0.00022307226],"domain_scores_gemma":[0.99662244,0.0015922599,0.00027673342,0.00044397006,0.0009886925,0.00007592785],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032016414,0.0015653328,0.002057677,0.0044802786,0.0006506323,0.0013024774,0.0008569501,0.0007339078,0.002308264],"category_scores_gemma":[0.006966484,0.00031570796,0.0017119461,0.004587094,0.00041000635,0.0019800428,0.00073132286,0.00078740856,0.0020612539],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017591823,0.0001232325,0.0024094319,0.00022009082,0.00023595303,0.000089694855,0.000060087714,0.020212464,0.016647324,0.0018355207,0.0050726603,0.9529176],"study_design_scores_gemma":[0.00009248187,0.0010558402,0.012450185,0.00006568568,0.00044362474,0.0008078171,0.00017722553,0.9018812,0.04292249,0.02225663,0.017620599,0.00022632522],"about_ca_topic_score_codex":0.0011717041,"about_ca_topic_score_gemma":0.0017042422,"teacher_disagreement_score":0.0044802786,"about_ca_system_score_codex":0.00040433116,"about_ca_system_score_gemma":0.000528071,"threshold_uncertainty_score":0.01693213},"labels":[],"label_agreement":null},{"id":"W2129206444","doi":"10.1007/978-3-540-37256-1_136","title":"Support Vector Machine for String Vectors","year":2006,"lang":"en","type":"book-chapter","venue":"Lecture notes in control and information sciences","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"String kernel; String (physics); Artificial intelligence; Computer science; String metric; Cluster analysis; Support vector machine; Word (group theory); Pattern recognition (psychology); String searching algorithm; Similarity (geometry); Kernel (algebra); Kernel method; Mathematics; Pattern matching; Radial basis function kernel; Discrete mathematics","score_opus":0.013755027824435629,"score_gpt":0.23965021536354505,"score_spread":0.22589518753910942,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2129206444","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0037813361,0.0010889078,0.9855236,0.00020953559,0.00018428425,0.000065857006,0.0011886564,0.0060662627,0.0018915788],"genre_scores_gemma":[0.09778145,0.0014182433,0.87425876,0.00016997491,0.00025410426,0.00041548768,0.007812366,0.00060372846,0.017285911],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9992225,0.0001510164,0.000070227674,0.00020108261,0.0002879675,0.000067069646],"domain_scores_gemma":[0.998672,0.0005818663,0.000098630575,0.0002591771,0.0003533859,0.000035082565],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00064858526,0.00093151437,0.0010967577,0.001264952,0.00040345732,0.0013698693,0.0015635266,0.0012193338,0.012174171],"category_scores_gemma":[0.0050190585,0.00035479502,0.0006664441,0.0019362109,0.0003745613,0.0027027812,0.0010518372,0.0017290349,0.01088798],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002013376,0.000093037175,0.00030724882,0.00029468458,0.000042028987,0.00010413966,0.00003820569,0.0327532,0.0066897296,0.030809153,0.028940244,0.899727],"study_design_scores_gemma":[0.000035325473,0.000084628824,0.00032808306,0.000057754627,0.000018860279,0.00014704342,0.000029202902,0.9025514,0.0075215255,0.07036926,0.018828925,0.000027961038],"about_ca_topic_score_codex":0.0015446078,"about_ca_topic_score_gemma":0.0015387235,"teacher_disagreement_score":0.012174171,"about_ca_system_score_codex":0.00036750635,"about_ca_system_score_gemma":0.0006715953,"threshold_uncertainty_score":0.040726602},"labels":[],"label_agreement":null},{"id":"W2130734227","doi":"10.1109/ccece.2004.1344986","title":"Evaluation of three dimensionality reduction techniques for document classification","year":2004,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Dimensionality reduction; Computer science; Curse of dimensionality; Reduction (mathematics); Artificial intelligence; Latent semantic analysis; Categorization; Document classification; Search engine indexing; Machine learning; Data mining; Representation (politics); Measure (data warehouse); Pattern recognition (psychology); Information retrieval; Mathematics","score_opus":0.09872650376107284,"score_gpt":0.34840919105193274,"score_spread":0.2496826872908599,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2130734227","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.4726829,0.010042879,0.48653418,0.0014341932,0.0005333087,0.0020167343,0.0020248827,0.009526306,0.015204677],"genre_scores_gemma":[0.3932874,0.0026939376,0.5953243,0.00012502955,0.00016257876,0.00086214877,0.0038060106,0.00025996813,0.0034786302],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99019194,0.0028241584,0.0008475025,0.0008733671,0.0048798365,0.0003831124],"domain_scores_gemma":[0.9837684,0.009154175,0.00061583077,0.0014511952,0.0046811886,0.00032919642],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009171806,0.0015187612,0.0015827151,0.004267805,0.0008014128,0.001592565,0.0012342023,0.001172866,0.0011752744],"category_scores_gemma":[0.019367928,0.00026195345,0.0016439556,0.004426398,0.00061573973,0.0022410215,0.0011153575,0.0010821007,0.0008124893],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010603848,0.00080425886,0.0049602618,0.0005321591,0.00046037362,0.000042779946,0.00022539031,0.025770374,0.007948123,0.0025910703,0.0053252545,0.95027953],"study_design_scores_gemma":[0.00047583232,0.003475967,0.019514091,0.000089673,0.0004387232,0.00045364996,0.0004319628,0.91904145,0.04305643,0.0040495205,0.00882796,0.00014473917],"about_ca_topic_score_codex":0.0044510243,"about_ca_topic_score_gemma":0.0031306841,"teacher_disagreement_score":0.009171806,"about_ca_system_score_codex":0.0016087474,"about_ca_system_score_gemma":0.0012605859,"threshold_uncertainty_score":0.048505664},"labels":[],"label_agreement":null},{"id":"W2130987418","doi":"10.1109/wi.2005.79","title":"Integrating Compound Terms in Bayesian Text Classification","year":2005,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Smoothing; Word (group theory); Artificial intelligence; Natural language processing; Bayesian probability; Term (time); Representation (politics); Naive Bayes classifier; Compound; Component (thermodynamics); Machine learning; Mathematics; Support vector machine","score_opus":0.024132435082527756,"score_gpt":0.2743366962494589,"score_spread":0.2502042611669311,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2130987418","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02250407,0.0009862477,0.9749288,0.0001617689,0.000046011668,0.000076842385,0.000066636196,0.0005954515,0.0006341831],"genre_scores_gemma":[0.23362128,0.001056565,0.7612415,0.00015389294,0.0002588639,0.00028913846,0.00057869207,0.00019982914,0.0026002233],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99562943,0.001580949,0.00035010837,0.0007215118,0.0015474336,0.00017049274],"domain_scores_gemma":[0.9851537,0.0097824475,0.0011018375,0.0015993343,0.002130877,0.0002319324],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007293961,0.0010397597,0.002070152,0.005302378,0.00092897157,0.0019586121,0.0014389149,0.0019003059,0.0015989337],"category_scores_gemma":[0.021784464,0.00069982617,0.0013576018,0.005728565,0.0012416135,0.008228926,0.0021640356,0.0020852934,0.0013571817],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004250541,0.00021257946,0.0065766587,0.00036337203,0.00033130884,0.00017323444,0.00045319973,0.082823455,0.016261142,0.02764584,0.002368418,0.8623657],"study_design_scores_gemma":[0.000038942737,0.00023160451,0.002444368,0.000060741586,0.00022513507,0.00020997768,0.000068662186,0.8870021,0.008967646,0.09545397,0.0051842807,0.00011255942],"about_ca_topic_score_codex":0.0028793802,"about_ca_topic_score_gemma":0.0064895237,"teacher_disagreement_score":0.007293961,"about_ca_system_score_codex":0.00086870085,"about_ca_system_score_gemma":0.0014197134,"threshold_uncertainty_score":0.038574576},"labels":[],"label_agreement":null},{"id":"W2131912994","doi":"10.1109/icdew.2007.4401066","title":"Document Representation and Dimension Reduction for Text Clustering","year":2007,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":44,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Cluster analysis; Dimensionality reduction; Computer science; Document clustering; Artificial intelligence; Pattern recognition (psychology); Representation (politics); Context (archaeology); Benchmark (surveying); Word (group theory); Dimension (graph theory); Natural language processing; Mathematics","score_opus":0.02785592813353458,"score_gpt":0.3078267137122061,"score_spread":0.2799707855786715,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2131912994","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015816804,0.0018444736,0.975069,0.0005475485,0.00017861904,0.00035783768,0.0015136219,0.0026626599,0.0020095487],"genre_scores_gemma":[0.071376264,0.00090334687,0.92197645,0.00008674904,0.0001702403,0.00061397825,0.0030928038,0.0001503311,0.0016298807],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99761677,0.0009675795,0.00023870081,0.0003712818,0.0007036518,0.0001019902],"domain_scores_gemma":[0.9972253,0.0011152836,0.00022600351,0.00059620535,0.0007885131,0.000048750248],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00209821,0.00095007435,0.0012775535,0.0043618996,0.0009551603,0.0017970582,0.0010065857,0.00077632326,0.0023351526],"category_scores_gemma":[0.009199312,0.00026919256,0.0012287473,0.0062580826,0.0004582229,0.0014677969,0.0008825315,0.0010289693,0.002324112],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019423838,0.00015131284,0.0012326443,0.00048345907,0.00015707372,0.00008418165,0.0003218447,0.03769486,0.011591731,0.016605616,0.016468324,0.91501474],"study_design_scores_gemma":[0.00010771435,0.0002868542,0.005146157,0.00014626117,0.00020454086,0.0006515923,0.0004957599,0.857314,0.024510318,0.06671607,0.044251163,0.00016960282],"about_ca_topic_score_codex":0.0024383639,"about_ca_topic_score_gemma":0.0022416944,"teacher_disagreement_score":0.0043618996,"about_ca_system_score_codex":0.0009154171,"about_ca_system_score_gemma":0.0013401947,"threshold_uncertainty_score":0.0110964775},"labels":[],"label_agreement":null},{"id":"W2133411495","doi":"10.1109/ideas.2007.11","title":"An Approach for Text Categorization in Digital Library","year":2007,"lang":"en","type":"article","venue":"International Database Engineering and Applications Symposium","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Categorization; Computer science; Hierarchy; Digital library; Text categorization; Information retrieval; Library classification; Document classification; Artificial intelligence; Data mining; Machine learning; World Wide Web","score_opus":0.0074841454346884365,"score_gpt":0.23153515328483412,"score_spread":0.22405100785014567,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2133411495","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009111605,0.00072721054,0.9822813,0.00065524294,0.00015783464,0.00069010194,0.000361927,0.0016782763,0.0043364004],"genre_scores_gemma":[0.043218408,0.00033845784,0.94725406,0.00027568935,0.00009602368,0.00057313015,0.00067057967,0.00007013193,0.007503653],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9976318,0.000494449,0.00017478716,0.0004918276,0.0010688463,0.00013834702],"domain_scores_gemma":[0.9987214,0.00036117205,0.00009889929,0.00022324952,0.0005125651,0.00008260831],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011859525,0.0006201764,0.0005632873,0.004509604,0.0019813068,0.0019944669,0.0016445905,0.0013254838,0.003182222],"category_scores_gemma":[0.003379587,0.00030568213,0.0012507912,0.00441367,0.0009178765,0.0020784738,0.0015780997,0.0013890134,0.0023529879],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00009987411,0.00027584174,0.0020921181,0.00031742683,0.000066229426,0.00021504756,0.000910478,0.006869336,0.019724376,0.02791458,0.014140511,0.92737424],"study_design_scores_gemma":[0.00010740918,0.00046301237,0.009511322,0.00024880574,0.00028414128,0.0022379463,0.0017713923,0.56343454,0.04426388,0.1346319,0.24286205,0.00018363114],"about_ca_topic_score_codex":0.008264404,"about_ca_topic_score_gemma":0.011893624,"teacher_disagreement_score":0.008264404,"about_ca_system_score_codex":0.001607101,"about_ca_system_score_gemma":0.0018629459,"threshold_uncertainty_score":0.016432583},"labels":[],"label_agreement":null},{"id":"W2133885011","doi":"10.1109/wi.2006.109","title":"Learning Social Networks from Web Documents Using Support Vector Classifiers","year":2006,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Support vector machine; Classifier (UML); Social network (sociolinguistics); Artificial intelligence; Class (philosophy); Machine learning; Data mining; Social media; World Wide Web","score_opus":0.019507911583515523,"score_gpt":0.2566065554475822,"score_spread":0.23709864386406668,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2133885011","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.3279004,0.0014368292,0.65804905,0.00097064814,0.00021487391,0.0005177101,0.0025113258,0.0053272974,0.0030718877],"genre_scores_gemma":[0.73075235,0.0004470393,0.26079324,0.00009474518,0.0002443978,0.00034781374,0.0052803895,0.00006628766,0.0019737189],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9984004,0.00047135568,0.00016859295,0.0003948068,0.00043151688,0.00013323897],"domain_scores_gemma":[0.99501884,0.0031201807,0.0005244957,0.00039101305,0.00080579333,0.00013961866],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002170338,0.0013451262,0.0013135199,0.005132823,0.00061605143,0.0015132683,0.0011116957,0.0013905447,0.0013488168],"category_scores_gemma":[0.007697584,0.00030427804,0.00083186064,0.002426457,0.00030910654,0.0025564656,0.0006597642,0.0012433005,0.0014664083],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00040260548,0.00072424294,0.01351727,0.0001808288,0.00019160408,0.00022976597,0.000137682,0.13774545,0.0038734463,0.0021623322,0.0072874534,0.83354735],"study_design_scores_gemma":[0.000010062977,0.00003450123,0.0009571218,0.000009381855,0.000011106391,0.000026105383,0.00003761467,0.99456525,0.0012474945,0.0026189697,0.00047622828,0.0000061164164],"about_ca_topic_score_codex":0.0034777548,"about_ca_topic_score_gemma":0.0031475783,"teacher_disagreement_score":0.005132823,"about_ca_system_score_codex":0.0008385945,"about_ca_system_score_gemma":0.0006367696,"threshold_uncertainty_score":0.011478007},"labels":[],"label_agreement":null},{"id":"W2135420268","doi":"10.1109/grc.2007.40","title":"Na&amp;#x0EF;ve Bayes Text Classifier","year":2007,"lang":"en","type":"article","venue":"2007 IEEE International Conference on Granular Computing (GRC 2007)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":98,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Acadia University","funders":"","keywords":"Naive Bayes classifier; Computer science; Bayes' theorem; Support vector machine; Artificial intelligence; Machine learning; Detector; Classifier (UML); Bayesian probability; Information retrieval; Data mining","score_opus":0.07050096873332103,"score_gpt":0.32941739982444823,"score_spread":0.2589164310911272,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2135420268","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015550004,0.0019353416,0.92205316,0.001211342,0.00073663745,0.00041131087,0.0019024102,0.0079911845,0.048208587],"genre_scores_gemma":[0.21167336,0.0017021246,0.70005757,0.0008921443,0.0005368983,0.00054928515,0.0032756382,0.00056643604,0.08074653],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9978637,0.00027798774,0.00018863771,0.00037079863,0.0011385514,0.00016037805],"domain_scores_gemma":[0.9975968,0.0008626677,0.0001709323,0.0003415672,0.00095630594,0.000071767754],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0018849837,0.00075814425,0.0013851646,0.0027270878,0.0011071359,0.0034271914,0.0017052735,0.0020223034,0.020243585],"category_scores_gemma":[0.0077551953,0.0004214859,0.00067241245,0.0019726953,0.0008148871,0.0033786702,0.00089365634,0.0010833963,0.01736278],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027121083,0.00017445897,0.0046653748,0.00035809324,0.000055785225,0.00024403515,0.0001362161,0.008869835,0.011789218,0.046494428,0.039208375,0.887733],"study_design_scores_gemma":[0.00008832236,0.00016495142,0.0045398297,0.0003481882,0.000090929476,0.0014985839,0.00023132781,0.6756578,0.040659327,0.110635445,0.16596735,0.00011793336],"about_ca_topic_score_codex":0.0035130156,"about_ca_topic_score_gemma":0.003807526,"teacher_disagreement_score":0.020243585,"about_ca_system_score_codex":0.0010349408,"about_ca_system_score_gemma":0.001144075,"threshold_uncertainty_score":0.067721546},"labels":[],"label_agreement":null},{"id":"W2135718742","doi":"10.1109/icdmw.2007.21","title":"Learning Term Dependency Links Using Information Theoretic Inclusion Measure","year":2007,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Dependency (UML); Computer science; Dependency graph; Redundancy (engineering); Term (time); Data mining; Feature selection; Support vector machine; Artificial intelligence; Pattern recognition (psychology); Graph; Theoretical computer science","score_opus":0.015203971713335993,"score_gpt":0.260510980564972,"score_spread":0.24530700885163603,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2135718742","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025474384,0.00042754426,0.97111917,0.00016978841,0.000036928905,0.00014105611,0.00022497494,0.0011446268,0.0012615336],"genre_scores_gemma":[0.34544998,0.0004120542,0.64813775,0.00014290346,0.00016020249,0.000524973,0.0017901756,0.00020074814,0.0031812536],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9981193,0.0003624961,0.00016013089,0.00027783206,0.00093914644,0.00014110249],"domain_scores_gemma":[0.99554574,0.0023354874,0.0005076805,0.0003620281,0.0011464567,0.00010263563],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019775832,0.0010097105,0.0017345136,0.0073265363,0.0010385315,0.0014271493,0.0016238465,0.0009819692,0.0014620535],"category_scores_gemma":[0.007768526,0.00040196395,0.0010868752,0.004422907,0.00070345844,0.0030270908,0.0012460598,0.0011663896,0.0010194305],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021544583,0.00034808504,0.005605237,0.00026448962,0.00019480695,0.00026169157,0.0002041102,0.06247534,0.01291757,0.0156029165,0.0078676,0.8940426],"study_design_scores_gemma":[0.00002621297,0.0001485488,0.002185637,0.000027706226,0.000090284084,0.00022835871,0.000058729303,0.9585968,0.009472823,0.025186015,0.00393787,0.000040955973],"about_ca_topic_score_codex":0.0020344965,"about_ca_topic_score_gemma":0.002592731,"teacher_disagreement_score":0.0073265363,"about_ca_system_score_codex":0.000815594,"about_ca_system_score_gemma":0.0017007694,"threshold_uncertainty_score":0.010458529},"labels":[],"label_agreement":null},{"id":"W2137320444","doi":"","title":"Linear Text Segmentation Using Affinity Propagation","year":2011,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":44,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Affinity propagation; Segmentation; Computer science; Cluster analysis; Pairwise comparison; Graph; Image segmentation; Set (abstract data type); Algorithm; Artificial intelligence; Pattern recognition (psychology); Theoretical computer science; Correlation clustering; Canopy clustering algorithm","score_opus":0.10355150825609499,"score_gpt":0.28873001400381515,"score_spread":0.18517850574772016,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2137320444","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0034943502,0.0001898734,0.99010897,0.00010308844,0.000050554423,0.0000911537,0.00012468909,0.004366174,0.0014712808],"genre_scores_gemma":[0.077301204,0.00025481172,0.9092598,0.00024754502,0.00013973827,0.0002767697,0.0012398622,0.0011713159,0.010108928],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9979253,0.00031826095,0.00012633712,0.0007417654,0.00071292685,0.00017535072],"domain_scores_gemma":[0.9970855,0.0012362777,0.0002489887,0.00053338154,0.00078868575,0.0001072231],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011194304,0.0016333837,0.0014444125,0.003622498,0.0015002076,0.0020483385,0.0030397477,0.002228359,0.00836444],"category_scores_gemma":[0.0049584466,0.0009543838,0.001521515,0.004258817,0.0013250951,0.0032501593,0.0020256282,0.0018614766,0.00717466],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00033310766,0.00015082059,0.00093420746,0.0002968357,0.00014331331,0.00017488774,0.0004973929,0.0889039,0.02862635,0.013977569,0.018235398,0.84772635],"study_design_scores_gemma":[0.000051702056,0.00008048434,0.0004710501,0.000021988906,0.000051137733,0.00019685942,0.00009662606,0.9342556,0.021170937,0.029787933,0.013769884,0.000045841844],"about_ca_topic_score_codex":0.0106294295,"about_ca_topic_score_gemma":0.013162959,"teacher_disagreement_score":0.0106294295,"about_ca_system_score_codex":0.0014924351,"about_ca_system_score_gemma":0.0015839549,"threshold_uncertainty_score":0.027981818},"labels":[],"label_agreement":null},{"id":"W2139676742","doi":"10.48550/arxiv.1307.2669","title":"Text Categorization via Similarity Search: An Efficient and Effective Novel Algorithm","year":2013,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Computer science; Similarity (geometry); Centroid; Cluster analysis; Categorization; Artificial intelligence; Outlier; Preprocessor; Metric (unit); Text categorization; Class (philosophy); Point (geometry); Similarity measure; Measure (data warehouse); Nearest neighbor search; Pattern recognition (psychology); Data mining; Mathematics; Image (mathematics)","score_opus":0.06421189842904142,"score_gpt":0.20263899289794898,"score_spread":0.13842709446890755,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2139676742","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006250342,0.00053211796,0.9889832,0.00026943354,0.00013092314,0.00021588997,0.00016775297,0.0021763209,0.0012739884],"genre_scores_gemma":[0.055678792,0.00028980183,0.9386085,0.00020189276,0.00019231426,0.00034146383,0.00096349075,0.0001679293,0.003555779],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99721813,0.000502413,0.0002430893,0.0006209747,0.0012720434,0.00014335307],"domain_scores_gemma":[0.9983296,0.0005405246,0.00012807414,0.00031495735,0.0006152509,0.000071660244],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013805612,0.001136058,0.0020886997,0.004363592,0.0009899433,0.0017899565,0.0025883326,0.0020385426,0.0042128763],"category_scores_gemma":[0.004893463,0.00048025118,0.0010325629,0.0055642226,0.0007982156,0.0039799497,0.002199961,0.0014797617,0.004687806],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021835469,0.0002977453,0.00081286364,0.00018018876,0.00007199611,0.00011207995,0.0001042252,0.015327793,0.013565906,0.009165956,0.014004338,0.9461385],"study_design_scores_gemma":[0.00019640097,0.00025967165,0.0008001449,0.000035291454,0.000062388994,0.0007754479,0.00012950238,0.9257344,0.01290311,0.03725848,0.021792788,0.000052473704],"about_ca_topic_score_codex":0.0018267966,"about_ca_topic_score_gemma":0.0019846966,"teacher_disagreement_score":0.004363592,"about_ca_system_score_codex":0.00080380053,"about_ca_system_score_gemma":0.001783521,"threshold_uncertainty_score":0.014093518},"labels":[],"label_agreement":null},{"id":"W2141501959","doi":"10.1109/icdew.2007.4401067","title":"Incorporating Temporal Information for Document Classification","year":2007,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Document classification; Feature selection; Artificial intelligence; Feature (linguistics); Set (abstract data type); Genetic programming; Sequence (biology); Word (group theory); Selection (genetic algorithm); Data mining; Pattern recognition (psychology); Mathematics","score_opus":0.025939784521459976,"score_gpt":0.28465698527073685,"score_spread":0.2587172007492769,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2141501959","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.041108545,0.0013175424,0.95170754,0.00028943742,0.00023030298,0.000108845226,0.00032498685,0.002180184,0.0027326788],"genre_scores_gemma":[0.44241917,0.0012060379,0.5501705,0.00019134754,0.00035878248,0.00017846748,0.0011370225,0.00016102065,0.004177568],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9993999,0.0001229625,0.00006451324,0.00015451455,0.0002052382,0.000052761738],"domain_scores_gemma":[0.9988176,0.00044131358,0.00014629979,0.00014435146,0.00040769338,0.00004268678],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0010135005,0.00046955553,0.00048211066,0.0018219001,0.00042528132,0.0009183725,0.0007663132,0.0006374272,0.0012341788],"category_scores_gemma":[0.0030930599,0.00017518677,0.0005842925,0.0020868806,0.00030185186,0.0020503395,0.00042931712,0.00070232165,0.0009928079],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017566653,0.000165353,0.002523162,0.00018077258,0.00007885328,0.000110301175,0.00010852723,0.031279746,0.027795691,0.0051533403,0.0030118478,0.92941666],"study_design_scores_gemma":[0.000016399083,0.00015453564,0.0017635772,0.000041239913,0.00010801071,0.00019243243,0.00005453396,0.9667497,0.0155455945,0.007491576,0.007842293,0.000040135576],"about_ca_topic_score_codex":0.0033110583,"about_ca_topic_score_gemma":0.0044896356,"teacher_disagreement_score":0.0033110583,"about_ca_system_score_codex":0.0004896265,"about_ca_system_score_gemma":0.0006565127,"threshold_uncertainty_score":0.0065835714},"labels":[],"label_agreement":null},{"id":"W2142742813","doi":"","title":"Learning from multiple partially observed views - an application to multilingual text categorization","year":2009,"lang":"en","type":"preprint","venue":"NPARC","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":274,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Artificial intelligence; Leverage (statistics); Categorization; Machine learning; Natural language processing; Generalization; Text categorization; Set (abstract data type); Training set; Supervised learning; Artificial neural network; Mathematics","score_opus":0.0694166084151494,"score_gpt":0.29874234639495834,"score_spread":0.22932573797980893,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2142742813","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02946595,0.0005994254,0.9681234,0.00051931187,0.000035471876,0.00004889567,0.00019099005,0.00044213107,0.000574526],"genre_scores_gemma":[0.5818497,0.0006119032,0.41294444,0.00029253037,0.00029649705,0.00020725395,0.0018026475,0.00015672887,0.0018382368],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99682343,0.0015486133,0.0001582067,0.00068573904,0.000615775,0.0001682928],"domain_scores_gemma":[0.98195845,0.012082469,0.0012982937,0.0030364436,0.0012506965,0.0003737239],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004723601,0.00080281694,0.001922352,0.0016956207,0.0009681313,0.0020456947,0.0021673506,0.0020098523,0.0012768813],"category_scores_gemma":[0.021303179,0.00056618155,0.0016415181,0.002484338,0.0014176597,0.0039356127,0.0027880112,0.002574,0.00052336743],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00057381357,0.00029709045,0.013493353,0.00038464146,0.0005663804,0.0010176532,0.0011633303,0.31690437,0.00836513,0.051576793,0.006719757,0.59893775],"study_design_scores_gemma":[0.000021692433,0.000076962046,0.0013245355,0.0000275074,0.000047518828,0.00024529966,0.00010971902,0.92446905,0.0031727427,0.068455555,0.0020178773,0.00003153715],"about_ca_topic_score_codex":0.0021979723,"about_ca_topic_score_gemma":0.0022172893,"teacher_disagreement_score":0.004723601,"about_ca_system_score_codex":0.0013118202,"about_ca_system_score_gemma":0.0007067282,"threshold_uncertainty_score":0.024981022},"labels":[],"label_agreement":null},{"id":"W2143765837","doi":"10.1109/icmla.2005.47","title":"Multi-label Associative Classification of Medical Documents from MEDLINE","year":2006,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":28,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Associative property; Information retrieval; Document classification; Point (geometry); Multi-label classification; Data mining; Artificial intelligence; Machine learning","score_opus":0.03854488586979353,"score_gpt":0.3163884499854844,"score_spread":0.27784356411569083,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2143765837","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.84322286,0.0016287797,0.14418817,0.00040650522,0.00017156132,0.000491654,0.002043374,0.0027922834,0.0050547137],"genre_scores_gemma":[0.76640683,0.0005936916,0.22632873,0.00006350687,0.00015401904,0.0001990926,0.003768997,0.00007352187,0.002411578],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99913365,0.0002026873,0.00015975747,0.00010609806,0.00034174646,0.000056139386],"domain_scores_gemma":[0.9916831,0.004651818,0.00092893705,0.0008308067,0.0016811785,0.00022410475],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012363808,0.0003293765,0.00046715478,0.0063630426,0.00052654307,0.0009897943,0.0006285281,0.00056710944,0.0021327243],"category_scores_gemma":[0.0076850066,0.00007727937,0.00033389957,0.0036388102,0.00025255582,0.0012864775,0.00057950895,0.00034919183,0.0010172491],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00095174444,0.00042984687,0.026130985,0.00047224393,0.000070185095,0.0003583646,0.00034502163,0.0046523386,0.029829107,0.0014399907,0.0021321652,0.933188],"study_design_scores_gemma":[0.00022790431,0.0021001787,0.10773389,0.00024086417,0.0005003179,0.0036802348,0.001728801,0.59782165,0.26144838,0.008967546,0.015381866,0.00016840064],"about_ca_topic_score_codex":0.00091980124,"about_ca_topic_score_gemma":0.0018235546,"teacher_disagreement_score":0.0063630426,"about_ca_system_score_codex":0.00032727057,"about_ca_system_score_gemma":0.0007733282,"threshold_uncertainty_score":0.0071346164},"labels":[],"label_agreement":null},{"id":"W2145753452","doi":"10.1109/ccece.2007.203","title":"Document Classification with ACM Subject Hierarchy","year":2007,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Computer science; Categorization; Information retrieval; Hierarchy; Classifier (UML); Document classification; Text categorization; Digital library; Classification scheme; Library classification; Subject (documents); Focus (optics); Context (archaeology); Artificial intelligence; World Wide Web; Natural language processing","score_opus":0.02711306376552129,"score_gpt":0.28022091107257885,"score_spread":0.25310784730705754,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2145753452","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007820886,0.010899984,0.74173146,0.0026568184,0.002774178,0.010860726,0.10471112,0.0778316,0.0407132],"genre_scores_gemma":[0.0502894,0.0039917994,0.81733114,0.00056991976,0.0014629362,0.0061245807,0.08523712,0.0017590428,0.033234026],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99047816,0.0016802802,0.0022651744,0.0018044517,0.003114268,0.0006576383],"domain_scores_gemma":[0.9894302,0.0027241223,0.0010232517,0.002810913,0.0035943706,0.0004171287],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0056414832,0.0019999195,0.0024250448,0.02550891,0.0025144587,0.0077956626,0.0024577614,0.0020440533,0.04946832],"category_scores_gemma":[0.02269102,0.0007242068,0.0030769987,0.02986802,0.00092418166,0.0052230433,0.0034177678,0.0025900824,0.048497193],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020654751,0.00018904223,0.0022729111,0.0012978929,0.00019918112,0.00021467938,0.00023299606,0.003398157,0.0030978804,0.011903231,0.19785713,0.77913034],"study_design_scores_gemma":[0.00032248994,0.00051044737,0.00888156,0.00079240947,0.0003068435,0.0016948942,0.0004485116,0.14681222,0.009973961,0.07713405,0.7529047,0.00021803206],"about_ca_topic_score_codex":0.011486098,"about_ca_topic_score_gemma":0.010852425,"teacher_disagreement_score":0.04946832,"about_ca_system_score_codex":0.001833902,"about_ca_system_score_gemma":0.0062909424,"threshold_uncertainty_score":0.165488},"labels":[],"label_agreement":null},{"id":"W2146327010","doi":"10.5539/cis.v1n4p79","title":"Text Document Pre-Processing Using the Bayes Formula for Classification Based on the Vector Space Model","year":2008,"lang":"en","type":"article","venue":"Computer and Information Science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Naive Bayes classifier; Bayes' theorem; Support vector machine; Bayes classifier; Document classification; Artificial intelligence; Dimensionality reduction; Curse of dimensionality; Classifier (UML); Vector space model; Pattern recognition (psychology); Bayes error rate; Range (aeronautics); Set (abstract data type); Probability distribution; Machine learning; Data mining; Bayesian probability; Mathematics; Statistics","score_opus":0.052435184597413045,"score_gpt":0.2869064813885296,"score_spread":0.23447129679111656,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2146327010","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005420018,0.0008783138,0.9897754,0.00019734516,0.00020942593,0.00021439478,0.00015656077,0.0012773998,0.0018710889],"genre_scores_gemma":[0.094394065,0.001596506,0.8976692,0.00016025023,0.00036592895,0.00044156302,0.00069221365,0.00020243834,0.004477813],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.996896,0.00069434976,0.0003590987,0.0004382867,0.001483518,0.00012868718],"domain_scores_gemma":[0.9945721,0.0029261701,0.0002697459,0.00038657582,0.0017869502,0.00005850122],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0037588547,0.00092028204,0.0014846185,0.0043351497,0.00081637857,0.003118766,0.0010029676,0.0010814051,0.0044732294],"category_scores_gemma":[0.014509749,0.00040883428,0.0009247252,0.0030510472,0.000715765,0.0034531595,0.000609863,0.0015569422,0.0033987146],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002294961,0.00011665955,0.002514596,0.00043332644,0.00012706874,0.00016776529,0.0002764811,0.022429528,0.01136287,0.031933047,0.0088085625,0.92160076],"study_design_scores_gemma":[0.00008621113,0.00031291283,0.0045270007,0.00030479618,0.00020640483,0.00090202293,0.00025995052,0.84884924,0.02808665,0.081697814,0.034579363,0.00018773865],"about_ca_topic_score_codex":0.0032475004,"about_ca_topic_score_gemma":0.0026916054,"teacher_disagreement_score":0.0044732294,"about_ca_system_score_codex":0.0008880241,"about_ca_system_score_gemma":0.0013605608,"threshold_uncertainty_score":0.019878924},"labels":[],"label_agreement":null},{"id":"W2146466957","doi":"10.1109/icmlc.2004.1382026","title":"Combining word based and word co-occurrence based sequence analysis for text categorization","year":2005,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Categorization; Computer science; Word (group theory); Artificial intelligence; Classifier (UML); Text categorization; Curse of dimensionality; Natural language processing; Encoding (memory); Set (abstract data type); Sequence (biology); Data set; Pattern recognition (psychology); Mathematics","score_opus":0.04847486091432971,"score_gpt":0.3054395120498646,"score_spread":0.25696465113553485,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2146466957","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.032536186,0.0006706958,0.9594708,0.00013358534,0.00021539659,0.00026755815,0.0003942644,0.0032421364,0.0030693442],"genre_scores_gemma":[0.14964283,0.00044729176,0.8458198,0.00007905295,0.00011400628,0.00017966965,0.0007342685,0.00013533571,0.0028478368],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9990656,0.0002336721,0.000093147995,0.00022247828,0.00033227692,0.000052837273],"domain_scores_gemma":[0.99858654,0.00058242556,0.00010901214,0.00012405192,0.0005216335,0.00007629691],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011929503,0.00071447657,0.0006746186,0.00381598,0.00045954695,0.0008615132,0.00056852226,0.0004638521,0.0024479423],"category_scores_gemma":[0.0034564638,0.00018620749,0.0005266914,0.0036035413,0.00040816216,0.0017041619,0.0005263647,0.0004738471,0.0023844491],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024332984,0.00012201821,0.0015947584,0.00029779263,0.00009966133,0.000094814335,0.00015652155,0.0049918923,0.0564281,0.0017295732,0.0020136654,0.9322278],"study_design_scores_gemma":[0.00006919579,0.00058989663,0.0085369,0.00013546625,0.00026549527,0.00085472787,0.00036598116,0.8576839,0.0894872,0.020995095,0.020860666,0.00015565194],"about_ca_topic_score_codex":0.0030738001,"about_ca_topic_score_gemma":0.004895307,"teacher_disagreement_score":0.00381598,"about_ca_system_score_codex":0.00043750307,"about_ca_system_score_gemma":0.0007475537,"threshold_uncertainty_score":0.008189142},"labels":[],"label_agreement":null},{"id":"W2146849021","doi":"10.1109/icdmw.2009.88","title":"Document Clustering Using Semantic Kernels Based on Term-Term Correlations","year":2009,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Term (time); Computer science; Cluster analysis; Artificial intelligence; Information retrieval; Natural language processing; Physics","score_opus":0.03233434636012254,"score_gpt":0.29052140675123816,"score_spread":0.2581870603911156,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2146849021","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.034373187,0.0005906987,0.9630045,0.0000869491,0.000034309807,0.0000782023,0.00014934332,0.00097504054,0.000707757],"genre_scores_gemma":[0.40844074,0.0006916514,0.5879416,0.00005049951,0.00009252237,0.00018042761,0.0010541285,0.00021032897,0.0013381741],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99741286,0.0007028649,0.00024399367,0.0005737708,0.0009345716,0.0001319243],"domain_scores_gemma":[0.99601954,0.0014507809,0.000658106,0.00071135495,0.0010574907,0.00010272954],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0023139247,0.00097608485,0.0019477069,0.0056372825,0.0009842073,0.002523417,0.0014768795,0.0012029851,0.0006945477],"category_scores_gemma":[0.009008387,0.00044179964,0.0016139223,0.0070310053,0.0008122841,0.0041624676,0.0013710108,0.001129017,0.00087257376],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00054250367,0.00036648483,0.007914921,0.00051562645,0.00064001576,0.00016123941,0.0005232856,0.2497593,0.02300919,0.036316726,0.0049583293,0.6752924],"study_design_scores_gemma":[0.00001814207,0.00007187764,0.0018951249,0.000020911824,0.00006477584,0.00015464763,0.000058866695,0.9778243,0.0058612237,0.012577034,0.0014009776,0.00005202414],"about_ca_topic_score_codex":0.004300952,"about_ca_topic_score_gemma":0.0034382867,"teacher_disagreement_score":0.0056372825,"about_ca_system_score_codex":0.0015534519,"about_ca_system_score_gemma":0.0017020645,"threshold_uncertainty_score":0.01223737},"labels":[],"label_agreement":null},{"id":"W2148972377","doi":"10.1145/1571941.1572114","title":"Reciprocal rank fusion outperforms condorcet and individual rank learning methods","year":2009,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":568,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Reciprocal; Condorcet method; Rank (graph theory); Computer science; Simple (philosophy); Mean reciprocal rank; Fusion; Fuse (electrical); Artificial intelligence; Learning to rank; Machine learning; Mathematics; Ranking (information retrieval); Combinatorics; Engineering; Voting","score_opus":0.04029236246797672,"score_gpt":0.32614302800545814,"score_spread":0.2858506655374814,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2148972377","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.14581089,0.016803151,0.7205831,0.002949137,0.001442351,0.00088060077,0.0047203205,0.05194733,0.05486314],"genre_scores_gemma":[0.5817881,0.0023586731,0.37919524,0.0006820528,0.0007266329,0.00029133764,0.009000432,0.0022268072,0.023730682],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9846497,0.00431429,0.00076552696,0.0023118807,0.0070437645,0.00091480353],"domain_scores_gemma":[0.9879893,0.004027053,0.00069107075,0.0038321745,0.0030337886,0.00042658972],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01554707,0.0027947314,0.0027377764,0.0052515427,0.0022884705,0.003396012,0.0027629328,0.0025552195,0.0064952383],"category_scores_gemma":[0.020999733,0.00045637658,0.0020993485,0.0041458476,0.0012446844,0.00568732,0.0027561213,0.0033642775,0.005738601],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00131588,0.0006315913,0.005160831,0.0005821103,0.00087794784,0.0000958363,0.00020956261,0.047004156,0.009096009,0.00690101,0.054604553,0.8735205],"study_design_scores_gemma":[0.00034295916,0.0018448543,0.0067935027,0.00017066386,0.0007020358,0.0008692479,0.00034704406,0.8564595,0.053482663,0.031508673,0.04719779,0.00028100706],"about_ca_topic_score_codex":0.008063242,"about_ca_topic_score_gemma":0.0125384545,"teacher_disagreement_score":0.01554707,"about_ca_system_score_codex":0.0019959898,"about_ca_system_score_gemma":0.002802499,"threshold_uncertainty_score":0.08222175},"labels":[],"label_agreement":null},{"id":"W2150409896","doi":"10.1007/s10044-006-0044-8","title":"On poem recognition","year":2006,"lang":"en","type":"article","venue":"Pattern Analysis and Applications","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Poetry; Lyrics; Computer science; Fuzzy logic; Field (mathematics); Artificial intelligence; Literature; Art; Mathematics","score_opus":0.014736266615565718,"score_gpt":0.24381536547690044,"score_spread":0.22907909886133473,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2150409896","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.050142024,0.014835378,0.7303215,0.0065053524,0.0069664936,0.00033802583,0.001233918,0.0034076017,0.18624964],"genre_scores_gemma":[0.48903465,0.009301351,0.30144206,0.0019631756,0.0028411595,0.00029287377,0.0055043395,0.00047189125,0.18914843],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99946123,0.00012317802,0.000037546477,0.00017601498,0.00014310394,0.000058977144],"domain_scores_gemma":[0.9993831,0.00018204271,0.000022558852,0.00018996887,0.00018053979,0.000041908654],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00045831836,0.0005276899,0.0008254302,0.001941853,0.0012209621,0.0025816162,0.001085527,0.0009205267,0.019270886],"category_scores_gemma":[0.0025837584,0.00021671425,0.00066045945,0.0017745536,0.0009939976,0.0032237712,0.0012781413,0.000993948,0.006116183],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015991853,0.0001315336,0.001405118,0.00015989809,0.000041148927,0.00021084299,0.0001997604,0.0042835926,0.0055272826,0.12183828,0.057049625,0.8089931],"study_design_scores_gemma":[0.0000371097,0.00017091077,0.004549665,0.00024644245,0.00008525612,0.0014116266,0.00073487026,0.23462324,0.015568265,0.39790437,0.3446025,0.00006573258],"about_ca_topic_score_codex":0.0022173917,"about_ca_topic_score_gemma":0.0022606612,"teacher_disagreement_score":0.019270886,"about_ca_system_score_codex":0.0004640018,"about_ca_system_score_gemma":0.0004461822,"threshold_uncertainty_score":0.06446755},"labels":[],"label_agreement":null},{"id":"W2151849342","doi":"10.1109/hicss.2003.1174243","title":"Support vector machines for text categorization","year":2003,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":146,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Computer science; Categorization; Text categorization; Sorting; Set (abstract data type); Support vector machine; Artificial intelligence; Vocabulary; Feature (linguistics); Natural language processing; Information retrieval; Process (computing); Feature vector","score_opus":0.019827147917964055,"score_gpt":0.2626373654355585,"score_spread":0.24281021751759443,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2151849342","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005207237,0.035590768,0.9315372,0.0030766798,0.001297556,0.00074990536,0.003380095,0.0075852405,0.011575401],"genre_scores_gemma":[0.11165411,0.021153081,0.83783406,0.0007252376,0.0022044142,0.0017670827,0.008144868,0.0004492958,0.016068004],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9962812,0.0013651556,0.00031244208,0.0005207862,0.0013757262,0.00014460014],"domain_scores_gemma":[0.9953393,0.002940573,0.00030914386,0.00048469414,0.0008327913,0.000093480354],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0027802205,0.0016279023,0.002087573,0.0034160095,0.00064232113,0.0026147582,0.0021071858,0.0020613375,0.01038901],"category_scores_gemma":[0.013155665,0.00043527587,0.0009464442,0.005999781,0.0006826837,0.0031115704,0.0013073059,0.0026984634,0.011023225],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015797008,0.00015050944,0.0010339741,0.001125599,0.00021557383,0.00015845502,0.00013913942,0.04124416,0.0016932781,0.04085144,0.04819452,0.8650354],"study_design_scores_gemma":[0.00011994841,0.00015624333,0.0022812595,0.0005549477,0.00009367596,0.00038438512,0.00022078221,0.54901105,0.003298292,0.29311383,0.15062465,0.00014084036],"about_ca_topic_score_codex":0.002385283,"about_ca_topic_score_gemma":0.0017865323,"teacher_disagreement_score":0.01038901,"about_ca_system_score_codex":0.0008936721,"about_ca_system_score_gemma":0.0011200017,"threshold_uncertainty_score":0.034754694},"labels":[],"label_agreement":null},{"id":"W2154923335","doi":"10.1109/compsac.2005.128","title":"Recovering \"Lack of Words\" in Text Categorization for Item Banks","year":2006,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Categorization; Computer science; Phrase; Text categorization; Feature selection; Artificial intelligence; Classifier (UML); Natural language processing; Support vector machine; Selection (genetic algorithm); Sample (material); Machine learning","score_opus":0.03400157365506067,"score_gpt":0.27748418577074196,"score_spread":0.24348261211568129,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2154923335","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.22310625,0.0005553079,0.7706384,0.00039726094,0.000115034985,0.00040526272,0.0010938385,0.002303565,0.0013851059],"genre_scores_gemma":[0.69601214,0.00031515807,0.2958396,0.00020309816,0.0002078467,0.0006571011,0.0046313773,0.00020368045,0.0019299046],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9972174,0.0008021333,0.00044591574,0.00050659047,0.00082925486,0.0001986455],"domain_scores_gemma":[0.9892097,0.006058687,0.0012365243,0.0015021578,0.0017820968,0.0002109054],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0028899754,0.0011056461,0.0014041153,0.0028185411,0.0007792525,0.0010716665,0.0010158278,0.0010652681,0.0013478076],"category_scores_gemma":[0.014506518,0.00033286028,0.00095050305,0.003791409,0.0007908631,0.0034079382,0.001426781,0.0013913977,0.0014838475],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00077098695,0.00037110376,0.021422055,0.00061949296,0.00015422488,0.0005978536,0.00077418383,0.009474849,0.047058348,0.0022047253,0.0075020595,0.9090501],"study_design_scores_gemma":[0.00019790302,0.0023759769,0.066306844,0.00020255598,0.00045477794,0.003403597,0.0024599114,0.7359308,0.13046925,0.040781185,0.017198283,0.00021901981],"about_ca_topic_score_codex":0.0010281844,"about_ca_topic_score_gemma":0.00093998195,"teacher_disagreement_score":0.0028899754,"about_ca_system_score_codex":0.0003967909,"about_ca_system_score_gemma":0.0008257,"threshold_uncertainty_score":0.015283823},"labels":[],"label_agreement":null},{"id":"W21569900","doi":"","title":"A self-training method for learning to rank with unlabeled data","year":2009,"lang":"en","type":"preprint","venue":"NPARC","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Ranking (information retrieval); Rank (graph theory); Artificial intelligence; Machine learning; Learning to rank; Extension (predicate logic); Scalability; Process (computing); Labeled data; Training set; Pattern recognition (psychology); Bipartite graph; Co-training; Data mining; Semi-supervised learning; Mathematics; Theoretical computer science","score_opus":0.08011453989954655,"score_gpt":0.34640857441247885,"score_spread":0.2662940345129323,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W21569900","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.004782136,0.00031731094,0.99013036,0.00016227366,0.00018441121,0.000105161256,0.00028102918,0.003203569,0.00083386706],"genre_scores_gemma":[0.07639628,0.00026555883,0.90405387,0.00047049884,0.0005642361,0.000409561,0.0025171745,0.0005340096,0.014788782],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99669385,0.0009819056,0.0002595008,0.0008287918,0.0010286769,0.00020725705],"domain_scores_gemma":[0.991764,0.0032440985,0.00032520358,0.0020443362,0.0022987544,0.00032362383],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0044874684,0.0018131792,0.0023426865,0.0028980428,0.0013582142,0.0017144539,0.0036377094,0.0033592116,0.009164668],"category_scores_gemma":[0.011120629,0.00095408247,0.0015147813,0.0026488677,0.0012545675,0.0028144952,0.0022510448,0.0029982592,0.0073305643],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00028463468,0.0003447203,0.001145562,0.00018099383,0.00013878761,0.00008220894,0.00007963755,0.041759152,0.01019125,0.005528332,0.025668638,0.91459614],"study_design_scores_gemma":[0.000055276974,0.0001410975,0.0003918545,0.000023425526,0.000039938634,0.00016037935,0.000025076786,0.97546834,0.009235983,0.009262608,0.005164475,0.000031556963],"about_ca_topic_score_codex":0.0037225005,"about_ca_topic_score_gemma":0.008352203,"teacher_disagreement_score":0.009164668,"about_ca_system_score_codex":0.0007124066,"about_ca_system_score_gemma":0.0017211459,"threshold_uncertainty_score":0.030658841},"labels":[],"label_agreement":null},{"id":"W2159620282","doi":"10.1142/s0218001411009019","title":"IMPACT OF TERM DEPENDENCY AND CLASS IMBALANCE ON THE PERFORMANCE OF FEATURE RANKING METHODS","year":2011,"lang":"en","type":"article","venue":"International Journal of Pattern Recognition and Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Ranking (information retrieval); Feature selection; Computer science; Artificial intelligence; Feature (linguistics); Univariate; Pattern recognition (psychology); Data mining; Curse of dimensionality; Machine learning; Classifier (UML); Ranking SVM; Class (philosophy); Multivariate statistics","score_opus":0.1304311421720087,"score_gpt":0.3653728841263023,"score_spread":0.2349417419542936,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2159620282","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.79204917,0.010075869,0.18374771,0.0012814343,0.0007222374,0.0003489204,0.0010689802,0.0034591814,0.0072465073],"genre_scores_gemma":[0.9494008,0.00073774887,0.04550244,0.0001379911,0.00017814015,0.0001413408,0.0016459042,0.00023822628,0.0020175492],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9894036,0.0042873193,0.001024007,0.000972407,0.0036188923,0.00069370837],"domain_scores_gemma":[0.93329835,0.05069328,0.0027434677,0.006009714,0.006436875,0.00081833417],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0162104,0.0013186346,0.0023187932,0.0021601534,0.0012870646,0.0020280916,0.0012157562,0.0013230395,0.0013081135],"category_scores_gemma":[0.059009045,0.00036391502,0.0008065888,0.0021548376,0.0006739637,0.002717949,0.0010955939,0.0012948582,0.0013470703],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.004184435,0.0009856313,0.029393157,0.0005327411,0.0005190782,0.00035190082,0.0002614808,0.14184633,0.022150079,0.0016821151,0.011488425,0.7866046],"study_design_scores_gemma":[0.00020209474,0.0017200413,0.033446543,0.00005593118,0.00020572312,0.00061832555,0.000294793,0.92978007,0.02670773,0.0037647772,0.0030782814,0.00012567762],"about_ca_topic_score_codex":0.0033187193,"about_ca_topic_score_gemma":0.0023669808,"teacher_disagreement_score":0.0162104,"about_ca_system_score_codex":0.0008533762,"about_ca_system_score_gemma":0.0011041993,"threshold_uncertainty_score":0.08572978},"labels":[],"label_agreement":null},{"id":"W2159694214","doi":"10.1007/s10618-005-0013-7","title":"Discovering Classification from Data of Multiple Sources","year":2006,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":12,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"Hong Kong University of Science and Technology","keywords":"Computer science; Class (philosophy); Artificial intelligence; Perspective (graphical); Machine learning; Supervised learning; Test data; Labeled data; Semi-supervised learning; Data mining; Artificial neural network","score_opus":0.09401072320475932,"score_gpt":0.3028926707297767,"score_spread":0.20888194752501738,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2159694214","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.33147538,0.0069714915,0.6293526,0.004597206,0.000682692,0.0009879175,0.014682208,0.004189003,0.0070615206],"genre_scores_gemma":[0.49210402,0.003294614,0.47946036,0.00047030137,0.0007005545,0.00082449045,0.020048274,0.00034839913,0.0027488966],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9932795,0.0010633039,0.00071283267,0.0013522609,0.0032175577,0.00037459575],"domain_scores_gemma":[0.9758523,0.013391276,0.002098589,0.003943132,0.00429087,0.00042386737],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005624347,0.0014092891,0.002243691,0.018309854,0.0014826265,0.0063368645,0.0023861625,0.0026655027,0.0016372373],"category_scores_gemma":[0.025800465,0.0008612662,0.0021229773,0.017204832,0.0010490472,0.008512229,0.002439776,0.0025159854,0.0021084924],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011666843,0.0013170308,0.15553445,0.0019444618,0.00129095,0.0026521862,0.0019203635,0.0076748533,0.026878253,0.006253668,0.012799397,0.7805677],"study_design_scores_gemma":[0.00045286698,0.0012624696,0.15156224,0.0022500523,0.0072406153,0.0065847,0.010087838,0.4500056,0.11694818,0.17147556,0.08161869,0.00051130186],"about_ca_topic_score_codex":0.0024273584,"about_ca_topic_score_gemma":0.0030262507,"teacher_disagreement_score":0.018309854,"about_ca_system_score_codex":0.0010287919,"about_ca_system_score_gemma":0.0018959047,"threshold_uncertainty_score":0.029744804},"labels":[],"label_agreement":null},{"id":"W2162987981","doi":"","title":"A characterization of wordnet features in Boolean models for text classification","year":2006,"lang":"en","type":"article","venue":"Australasian Data Mining Conference","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":18,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"","keywords":"WordNet; Computer science; Artificial intelligence; Naive Bayes classifier; Natural language processing; Classifier (UML); Support vector machine; Weighting; Machine learning; Information retrieval","score_opus":0.08786756615368328,"score_gpt":0.2996306411300966,"score_spread":0.21176307497641328,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2162987981","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.058104277,0.00039876637,0.9370002,0.0006399466,0.00006673665,0.00016300524,0.0004368623,0.0008689995,0.0023211883],"genre_scores_gemma":[0.7763625,0.00047919512,0.21759209,0.00034330584,0.0001782597,0.00056856434,0.0009798359,0.00017969498,0.003316609],"study_design_codex":"simulation_or_modeling","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99833703,0.0006174144,0.00012732563,0.00031920525,0.0004800511,0.00011887946],"domain_scores_gemma":[0.98888385,0.008735802,0.000800522,0.0007328872,0.00069943594,0.00014744641],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0034588103,0.001159865,0.001044076,0.0016834866,0.00071390386,0.0018691941,0.0011962525,0.001274838,0.0026157983],"category_scores_gemma":[0.01821428,0.00044771362,0.0009100479,0.0019226319,0.0011060707,0.0060060774,0.00078019797,0.0015654772,0.000879532],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008311489,0.000488301,0.014026112,0.000584554,0.00014930875,0.0004527931,0.00069826044,0.41183332,0.02222948,0.14396217,0.004971245,0.3997733],"study_design_scores_gemma":[0.0000120672885,0.00008919649,0.000695685,0.000023090784,0.00001710281,0.00012570039,0.000025140005,0.9544361,0.0016204813,0.0419467,0.0009937567,0.0000150306205],"about_ca_topic_score_codex":0.0024896623,"about_ca_topic_score_gemma":0.0046288944,"teacher_disagreement_score":0.0034588103,"about_ca_system_score_codex":0.0011986352,"about_ca_system_score_gemma":0.00074346765,"threshold_uncertainty_score":0.018292189},"labels":[],"label_agreement":null},{"id":"W2170505850","doi":"10.1016/j.ipm.2009.03.002","title":"A systematic analysis of performance measures for classification tasks","year":2009,"lang":"en","type":"article","venue":"Information Processing & Management","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":6477,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Computer Research Institute of Montréal; Université de Montréal; Children's Hospital of Eastern Ontario","funders":"McGill University","keywords":"Confusion matrix; Confusion; Computer science; Artificial intelligence; Classifier (UML); Measure (data warehouse); Binary classification; Machine learning; Binary number; Natural language processing; Set (abstract data type); Class (philosophy); Data mining; Pattern recognition (psychology); Mathematics; Support vector machine; Arithmetic","score_opus":0.022728055734086046,"score_gpt":0.26836196947551794,"score_spread":0.2456339137414319,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2170505850","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.18478328,0.1278953,0.6584609,0.0018855344,0.0007137501,0.0031078313,0.010215504,0.003477837,0.00946],"genre_scores_gemma":[0.5946142,0.02094457,0.36563382,0.0005874314,0.00052824,0.0032795789,0.01132626,0.00087290787,0.002212978],"study_design_codex":"design_other","study_design_gemma":"systematic_review","domain_scores_codex":[0.94347024,0.02278243,0.009944817,0.005848186,0.017060786,0.0008935057],"domain_scores_gemma":[0.6392259,0.25891215,0.021550544,0.024737272,0.05435722,0.001216923],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.042960856,0.0023080627,0.0032856287,0.016425982,0.0012768541,0.0041701454,0.0023224487,0.0016613805,0.001398087],"category_scores_gemma":[0.21218443,0.0006902757,0.0030328208,0.014461499,0.0011543257,0.0064859465,0.0016658795,0.001895476,0.00088119594],"study_design_candidate":"systematic_review","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011235157,0.00071435265,0.038517624,0.008708969,0.0022750446,0.00006682261,0.00044665314,0.0073896623,0.007306534,0.004905843,0.0058946693,0.92265016],"study_design_scores_gemma":[0.0012103515,0.023242274,0.43633896,0.015383287,0.021252748,0.0035640872,0.0035853877,0.23214294,0.111346014,0.0676584,0.08259093,0.0016845787],"about_ca_topic_score_codex":0.0021971997,"about_ca_topic_score_gemma":0.0025733907,"teacher_disagreement_score":0.9570391,"about_ca_system_score_codex":0.0029289452,"about_ca_system_score_gemma":0.005282739,"threshold_uncertainty_score":0.2272014},"labels":[],"label_agreement":null},{"id":"W2171392923","doi":"10.1109/icdm.2007.26","title":"A Text Classification Framework with a Local Feature Ranking for Learning Social Networks","year":2007,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Classifier (UML); Artificial intelligence; Ranking (information retrieval); Feature extraction; Machine learning; Feature (linguistics); Pattern recognition (psychology); Data mining","score_opus":0.0181700594687985,"score_gpt":0.2756677619089408,"score_spread":0.2574977024401423,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2171392923","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010190817,0.0002681511,0.9876695,0.00023167295,0.000050557428,0.000084011284,0.00020953454,0.00054590235,0.0007498084],"genre_scores_gemma":[0.34375766,0.00032982766,0.6480809,0.00030276473,0.00044335824,0.0006349499,0.0019439438,0.000112052556,0.0043945685],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99888796,0.00031206926,0.00006061716,0.0003442574,0.0002935819,0.00010161867],"domain_scores_gemma":[0.99878305,0.0005221744,0.00017262489,0.00015221095,0.00029015794,0.00007976048],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0015789294,0.0009501686,0.0014174087,0.0032307259,0.00092120626,0.00095372845,0.0019112289,0.0014938555,0.0018989571],"category_scores_gemma":[0.0030562894,0.00023077939,0.0011583593,0.002364516,0.000547431,0.002334585,0.0007236725,0.0010882341,0.0010091729],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00028263344,0.00069509627,0.005688483,0.0002500884,0.00019719407,0.0003618676,0.0002039728,0.113537125,0.014165941,0.0332847,0.013395336,0.81793755],"study_design_scores_gemma":[0.000019262598,0.00009168382,0.0008612997,0.000011024361,0.000028051247,0.00007952058,0.000030791292,0.97693604,0.002037328,0.01738107,0.002502089,0.00002181076],"about_ca_topic_score_codex":0.0025108566,"about_ca_topic_score_gemma":0.0029981534,"teacher_disagreement_score":0.0032307259,"about_ca_system_score_codex":0.0008287501,"about_ca_system_score_gemma":0.0007061882,"threshold_uncertainty_score":0.008350253},"labels":[],"label_agreement":null},{"id":"W21952029","doi":"10.12927/hcpap.2011.22560","title":"Learnability of multi-instance multi-label learning","year":2012,"lang":"en","type":"article","venue":"中国科学通报：英文版","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Learnability; Artificial intelligence; Computer science; Machine learning; Mathematics","score_opus":0.06931332554607451,"score_gpt":0.3147405592998234,"score_spread":0.24542723375374892,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W21952029","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10181747,0.0073040803,0.8437601,0.013561038,0.002137105,0.0009522475,0.0063569527,0.012104015,0.012007044],"genre_scores_gemma":[0.765404,0.00083622313,0.2077745,0.002565802,0.0013069863,0.00068165525,0.013530967,0.00075362285,0.0071463464],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9685506,0.015761763,0.0026814514,0.0073126303,0.004591342,0.001102159],"domain_scores_gemma":[0.83466434,0.13747436,0.004113142,0.015106063,0.0069361366,0.0017059641],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.032940052,0.0026803573,0.0035231004,0.005819786,0.0032123115,0.0074359146,0.0067814155,0.007939692,0.007304946],"category_scores_gemma":[0.12352111,0.0008766735,0.003575716,0.0045864345,0.0032294441,0.016394695,0.00651765,0.0104538435,0.0037781259],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0020625372,0.0010662068,0.022935938,0.0015313908,0.001162987,0.0007594104,0.0008027033,0.15658845,0.0029565524,0.024725493,0.051529884,0.7338784],"study_design_scores_gemma":[0.00008514094,0.0001462975,0.0014038848,0.00012525046,0.00009613081,0.00020933397,0.00022207727,0.9225919,0.0032899522,0.0680232,0.0037599728,0.000046892565],"about_ca_topic_score_codex":0.008829059,"about_ca_topic_score_gemma":0.007078154,"teacher_disagreement_score":0.032940052,"about_ca_system_score_codex":0.0046008155,"about_ca_system_score_gemma":0.002771216,"threshold_uncertainty_score":0.17420566},"labels":[],"label_agreement":null},{"id":"W2214660060","doi":"10.1609/aaai.v25i1.7895","title":"Adaptive Large Margin Training for Multilabel Classification","year":2011,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":37,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Margin (machine learning); Computer science; Exploit; Scalability; Categorization; Machine learning; Generalization; Classifier (UML); Artificial intelligence; Training set; Data mining; Pattern recognition (psychology); Mathematics","score_opus":0.3253993417235344,"score_gpt":0.3314708791762336,"score_spread":0.006071537452699172,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2214660060","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011308233,0.00021378182,0.9859719,0.00029197862,0.00003284857,0.00004585216,0.00009055045,0.0011391105,0.0009057312],"genre_scores_gemma":[0.41721284,0.00029350587,0.57312375,0.0006985712,0.00023300224,0.00048591202,0.0015882258,0.0007897108,0.0055744904],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99643743,0.0017565149,0.00015201882,0.0007965035,0.0006197404,0.00023779234],"domain_scores_gemma":[0.9933971,0.0037197697,0.0005121395,0.0013779791,0.0007355163,0.0002574342],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0051879683,0.0014806174,0.0016476865,0.0010344653,0.00104788,0.0012593145,0.0034278443,0.0021811519,0.003645554],"category_scores_gemma":[0.015016617,0.00064114714,0.0010726199,0.0013428759,0.0018198219,0.004583553,0.00408839,0.004162673,0.0020691287],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007034817,0.0005782457,0.0026883192,0.00025709678,0.00012715608,0.0001716279,0.00031393193,0.5211056,0.008927869,0.038945958,0.015743112,0.41043755],"study_design_scores_gemma":[0.000013753921,0.00004035873,0.00015481975,0.000009455988,0.0000058480427,0.00002773537,0.000020770773,0.96722275,0.0018371138,0.029669916,0.0009883652,0.000009138029],"about_ca_topic_score_codex":0.0014689909,"about_ca_topic_score_gemma":0.002302049,"teacher_disagreement_score":0.0051879683,"about_ca_system_score_codex":0.0012328217,"about_ca_system_score_gemma":0.0011396935,"threshold_uncertainty_score":0.027436972},"labels":[],"label_agreement":null},{"id":"W2237248385","doi":"10.1007/978-3-642-33460-3_48","title":"Learning and Inference in Probabilistic Classifier Chains with Beam Search","year":2012,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":38,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Inference; Classifier (UML); Probabilistic logic; Artificial intelligence; Machine learning; Beam search; Binary classification; Flexibility (engineering); sort; Algorithm; Search algorithm; Mathematics; Support vector machine; Information retrieval","score_opus":0.02746902263249762,"score_gpt":0.2691181450713802,"score_spread":0.2416491224388826,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2237248385","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0042819213,0.00030102683,0.9937896,0.0002778428,0.00002392229,0.000055095017,0.00010864917,0.00056310295,0.00059890916],"genre_scores_gemma":[0.12737338,0.00052597,0.8648536,0.00052166235,0.00025291924,0.0005752939,0.0013884517,0.000395199,0.004113509],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99147964,0.004816509,0.0005948519,0.0013974782,0.00119837,0.0005131058],"domain_scores_gemma":[0.92706954,0.06483648,0.0014376441,0.0038478838,0.0021994254,0.0006089656],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0149951475,0.0015502224,0.004875774,0.003343147,0.0024544985,0.0040085623,0.0062545286,0.0049407883,0.010394728],"category_scores_gemma":[0.05001458,0.004856129,0.0038096576,0.005949952,0.0046541006,0.010724529,0.006081265,0.007489037,0.0035666402],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006678761,0.00029493164,0.0027955796,0.000347475,0.00034589312,0.00020256655,0.00055731466,0.60657936,0.0009928923,0.14744538,0.009013185,0.2307575],"study_design_scores_gemma":[0.00003661502,0.000021781476,0.00005324666,0.00002401835,0.000020272384,0.000020738074,0.000014953195,0.9011373,0.00026244437,0.0979967,0.00040133565,0.0000106417365],"about_ca_topic_score_codex":0.012367297,"about_ca_topic_score_gemma":0.014495615,"teacher_disagreement_score":0.0149951475,"about_ca_system_score_codex":0.002497848,"about_ca_system_score_gemma":0.003160084,"threshold_uncertainty_score":0.07930285},"labels":[],"label_agreement":null},{"id":"W2263083451","doi":"","title":"Bi-parameter space partition for cost-sensitive SVM","year":2015,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":54,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Support vector machine; Partition (number theory); Hyperparameter optimization; Regularization (linguistics); Algorithm; Invariant (physics); Parameter space; Piecewise; Grid; Model selection; Computer science; Mathematical optimization; Mathematics; Generalization; Artificial intelligence; Statistics; Combinatorics; Mathematical analysis; Geometry","score_opus":0.08266643554195872,"score_gpt":0.30656398751736963,"score_spread":0.2238975519754109,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2263083451","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011532238,0.00020238056,0.98719853,0.00008827046,0.000014708475,0.00005099065,0.000029862269,0.0004167906,0.00046615076],"genre_scores_gemma":[0.5100931,0.0003564492,0.48571706,0.00021672006,0.000059921185,0.0005107263,0.00064211077,0.00040916845,0.001994727],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9986399,0.00053616223,0.000104228835,0.00028189571,0.0003347537,0.00010298054],"domain_scores_gemma":[0.9982988,0.0008677303,0.00019149418,0.00023119367,0.00034191518,0.0000688691],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0024331422,0.0017006699,0.0015029794,0.0016583471,0.00074311625,0.0016621486,0.0017478474,0.0015766488,0.0019227699],"category_scores_gemma":[0.0064970665,0.0007112158,0.0010619164,0.0010905791,0.0009967738,0.0023356692,0.0020110635,0.002323167,0.0005625646],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021511028,0.00012468913,0.0014912147,0.00016221018,0.00011288966,0.00011149595,0.00020984151,0.7665601,0.009225172,0.019015327,0.002890868,0.19988109],"study_design_scores_gemma":[0.000004679604,0.00002464035,0.000095509946,0.0000051116767,0.0000059860977,0.00001703293,0.0000118645075,0.9943824,0.00085082406,0.004280955,0.00031503633,0.0000058570968],"about_ca_topic_score_codex":0.0025460736,"about_ca_topic_score_gemma":0.0016557651,"teacher_disagreement_score":0.0025460736,"about_ca_system_score_codex":0.0009880724,"about_ca_system_score_gemma":0.00123136,"threshold_uncertainty_score":0.012867808},"labels":[],"label_agreement":null},{"id":"W2293405082","doi":"10.1007/s13748-015-0064-y","title":"Multi-label learning in classification of patients’ quasi-identifiers","year":2015,"lang":"en","type":"article","venue":"Progress in Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Identifier; Artificial intelligence; Classifier (UML); Machine learning; Decision tree; Medical diagnosis; Multi-label classification; Demographics; Identification (biology); Class (philosophy); Data mining; Medicine","score_opus":0.13588836037341057,"score_gpt":0.3607449239924772,"score_spread":0.22485656361906664,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2293405082","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.48816824,0.0047586765,0.48874125,0.0046565034,0.0010556079,0.000476415,0.005622689,0.0012880354,0.0052326573],"genre_scores_gemma":[0.8739284,0.00043687772,0.1173575,0.00036874865,0.000405673,0.0002316798,0.00468725,0.00005153193,0.0025324165],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99532396,0.0022952321,0.00039873517,0.0009485828,0.0006563144,0.00037724385],"domain_scores_gemma":[0.98025435,0.014673556,0.0014823093,0.001350748,0.0016445055,0.00059447513],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006897287,0.00053615245,0.0011348358,0.0029228218,0.0010957333,0.002035931,0.0018413847,0.0015836427,0.0021739171],"category_scores_gemma":[0.01630738,0.00022862435,0.0010060766,0.0020517032,0.00076346216,0.002459908,0.0015557914,0.0020697096,0.0008841492],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00209809,0.0017355427,0.18985234,0.00066748064,0.0004446581,0.00038630355,0.0012522695,0.032549664,0.0040902207,0.012270188,0.020968119,0.733685],"study_design_scores_gemma":[0.00015255768,0.0004380058,0.027447449,0.00022138831,0.00028795336,0.00046713284,0.0008398318,0.91805506,0.0053362907,0.038865127,0.007805301,0.00008379745],"about_ca_topic_score_codex":0.0031445243,"about_ca_topic_score_gemma":0.004262669,"teacher_disagreement_score":0.006897287,"about_ca_system_score_codex":0.0011320324,"about_ca_system_score_gemma":0.0017971077,"threshold_uncertainty_score":0.03647679},"labels":[],"label_agreement":null},{"id":"W2340990333","doi":"10.1177/0165551515625030","title":"The impact of indexing approaches on Arabic text classification","year":2016,"lang":"en","type":"article","venue":"Journal of Information Science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of New Brunswick","funders":"","keywords":"Computer science; Classifier (UML); Search engine indexing; Arabic; Artificial intelligence; Naive Bayes classifier; Natural language processing; Pattern recognition (psychology); Word (group theory); Mathematics; Support vector machine","score_opus":0.06173573844272501,"score_gpt":0.3028807703285067,"score_spread":0.24114503188578168,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2340990333","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9017443,0.015490905,0.060929265,0.0012025469,0.00082778325,0.0006419016,0.0011665882,0.0026184004,0.015378213],"genre_scores_gemma":[0.89593595,0.003308946,0.09432859,0.00027720208,0.00035151746,0.00018833039,0.0028837174,0.00023851439,0.0024874066],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9861135,0.005568518,0.0020864366,0.0015809593,0.004045274,0.00060534844],"domain_scores_gemma":[0.96253335,0.026161594,0.0018322057,0.002572795,0.0063634613,0.0005366582],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010020923,0.0016636613,0.001440257,0.0041199694,0.0019640126,0.0040692547,0.0012035846,0.0013312072,0.0012625819],"category_scores_gemma":[0.042682238,0.000314755,0.0010788018,0.0045880717,0.0010079406,0.005105977,0.001754612,0.0014162234,0.0020711785],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0022946452,0.00093632494,0.038834028,0.00093038037,0.0003842525,0.0002083059,0.0008870443,0.011061503,0.025340075,0.0009733319,0.0044887415,0.91366136],"study_design_scores_gemma":[0.00043338872,0.00944893,0.1683647,0.0010475666,0.0021564916,0.0039228476,0.009303888,0.54811424,0.2160703,0.010915835,0.02953406,0.00068771077],"about_ca_topic_score_codex":0.0060927323,"about_ca_topic_score_gemma":0.00605629,"teacher_disagreement_score":0.010020923,"about_ca_system_score_codex":0.0012828044,"about_ca_system_score_gemma":0.0014868467,"threshold_uncertainty_score":0.052996337},"labels":[],"label_agreement":null},{"id":"W2368869429","doi":"","title":"Forestry information text classification algorithm based on GMM model","year":2014,"lang":"en","type":"article","venue":"Zhongnan Linye Keji Daxue xuebao","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Science North","funders":"","keywords":"Mixture model; Computer science; Artificial intelligence; Decision tree; Naive Bayes classifier; Gaussian; Classifier (UML); Pattern recognition (psychology); tf–idf; Statistical classification; Algorithm; Data mining; Machine learning; Support vector machine","score_opus":0.015718890916683177,"score_gpt":0.23350094354469378,"score_spread":0.2177820526280106,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2368869429","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.021011159,0.00060430274,0.9697768,0.0003628509,0.00025473084,0.0002472098,0.0004100816,0.0041189156,0.0032140065],"genre_scores_gemma":[0.34958845,0.0013332209,0.6281397,0.00031895132,0.0003571244,0.0006466626,0.0024604013,0.00039827437,0.016757274],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9987771,0.00015866106,0.00010323307,0.00040492264,0.00043199182,0.00012416828],"domain_scores_gemma":[0.9992423,0.0001857418,0.00004363001,0.000053040916,0.00044023464,0.000035087538],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0010181279,0.0010116503,0.001150432,0.0031122686,0.0009368419,0.0014407055,0.0011938564,0.0010899393,0.0027587714],"category_scores_gemma":[0.00282507,0.00027773107,0.001327203,0.0020969722,0.00047410035,0.002544415,0.0007424315,0.0010241229,0.00240521],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021136181,0.00010645509,0.0035299074,0.00019730681,0.00010527517,0.00017655916,0.000361022,0.04416392,0.013474393,0.009181205,0.014892792,0.9135997],"study_design_scores_gemma":[0.000027460039,0.00006910554,0.0031880557,0.000031482097,0.00006556829,0.00027911726,0.00017748607,0.96452636,0.010885699,0.011220949,0.009469366,0.000059328057],"about_ca_topic_score_codex":0.012539168,"about_ca_topic_score_gemma":0.0062969066,"teacher_disagreement_score":0.012539168,"about_ca_system_score_codex":0.00102247,"about_ca_system_score_gemma":0.0014359443,"threshold_uncertainty_score":0.024932384},"labels":[],"label_agreement":null},{"id":"W2389044726","doi":"","title":"A Method for Web News-Text Classification with Four-dimensional Vector Space Model","year":2010,"lang":"en","type":"article","venue":"Microcomputer applications","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Vector space model; Support vector machine; Space (punctuation); Data mining; Information retrieval; Vector space; Hot spot (computer programming); Feature vector; Artificial intelligence; Pattern recognition (psychology); Mathematics","score_opus":0.024163686633332647,"score_gpt":0.28113672520326266,"score_spread":0.25697303856993003,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2389044726","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0069771875,0.00051704096,0.9893059,0.00015295029,0.00017668468,0.00011358336,0.000149855,0.0017344502,0.0008722416],"genre_scores_gemma":[0.23710786,0.0011635002,0.7468076,0.00023594021,0.00046113538,0.00070581166,0.0020898501,0.00024671748,0.011181618],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9981641,0.0003886272,0.0002068151,0.00043473634,0.00067982747,0.00012594783],"domain_scores_gemma":[0.99902403,0.00024941788,0.000062108695,0.00010761716,0.000511759,0.000044980516],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001199023,0.0009959514,0.0011880146,0.0033272235,0.0008364334,0.0013368661,0.0016032998,0.0011981507,0.0033303401],"category_scores_gemma":[0.002498707,0.0003797229,0.0015311743,0.0030204265,0.0005170215,0.0027014744,0.00079288695,0.001488585,0.0021201828],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00023861771,0.00018420685,0.002614603,0.00022215159,0.00018832466,0.000083107756,0.00013071769,0.03397837,0.0071913926,0.0089941425,0.00887869,0.9372957],"study_design_scores_gemma":[0.000044862667,0.00008356086,0.0013052153,0.00001807058,0.00006294885,0.00014950773,0.00005576725,0.98339224,0.0043297573,0.004472874,0.0060352054,0.000050031744],"about_ca_topic_score_codex":0.009935884,"about_ca_topic_score_gemma":0.0047440715,"teacher_disagreement_score":0.009935884,"about_ca_system_score_codex":0.0007926936,"about_ca_system_score_gemma":0.001258782,"threshold_uncertainty_score":0.019756079},"labels":[],"label_agreement":null},{"id":"W2396310706","doi":"","title":"Recommender Systems from “Words of Few Mouths”","year":2012,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Helpfulness; Phenomenon; Computer science; Probabilistic logic; Recommender system; Context (archaeology); Artificial intelligence; Machine learning; Epistemology; Psychology","score_opus":0.0388953647681684,"score_gpt":0.26215804294752787,"score_spread":0.22326267817935946,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2396310706","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.15601294,0.0052277176,0.82628304,0.0029706424,0.00039405146,0.00036964318,0.0011779242,0.0012939903,0.0062699923],"genre_scores_gemma":[0.8187914,0.0016401191,0.16730615,0.0009057218,0.0009013781,0.0003520664,0.0018698425,0.00015152508,0.008081723],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9968755,0.0012157152,0.00019673053,0.00081390806,0.0007779441,0.0001202897],"domain_scores_gemma":[0.98390436,0.011785835,0.0013376471,0.0013236577,0.0014244524,0.00022392391],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0042204848,0.0010835615,0.0024336884,0.0019811983,0.0008830101,0.0021141225,0.0018212021,0.0020696535,0.002944677],"category_scores_gemma":[0.027514828,0.0010880833,0.001090927,0.0017613432,0.00067428115,0.005673073,0.0017724136,0.0025485575,0.0016019624],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0020049096,0.00069950306,0.029762847,0.0018158215,0.0012046925,0.0012462368,0.0021052512,0.20306759,0.019235693,0.08182599,0.030410044,0.62662137],"study_design_scores_gemma":[0.000083947045,0.00022365755,0.0041801697,0.00007420279,0.00010969849,0.00033312835,0.00013823327,0.94967127,0.001603894,0.038350217,0.005156504,0.00007514551],"about_ca_topic_score_codex":0.0033747274,"about_ca_topic_score_gemma":0.005761899,"teacher_disagreement_score":0.0042204848,"about_ca_system_score_codex":0.000744546,"about_ca_system_score_gemma":0.00055306614,"threshold_uncertainty_score":0.02232033},"labels":[],"label_agreement":null},{"id":"W2397694745","doi":"10.63317/5agbhnncc4sh","title":"Experiments in Topic Detection","year":2002,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Lethbridge","funders":"","keywords":"WordNet; Computer science; Thesaurus; Information retrieval; Natural language processing; Precision and recall; Implementation; Artificial intelligence; Recall; Domain (mathematical analysis); Linguistics; Mathematics","score_opus":0.04286456784919886,"score_gpt":0.2522528984422731,"score_spread":0.20938833059307424,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2397694745","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7959289,0.007562851,0.13991429,0.0020919302,0.0011711915,0.0048767687,0.009299017,0.013299788,0.025855277],"genre_scores_gemma":[0.6062749,0.0018018017,0.3505795,0.0009996048,0.00052529114,0.0029099123,0.018543037,0.0011075126,0.01725848],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99187404,0.0037189596,0.0009891171,0.0018069017,0.0010963229,0.00051473244],"domain_scores_gemma":[0.97182244,0.021959363,0.00049558654,0.0023836696,0.0025864681,0.0007524819],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0075385994,0.0014118791,0.0017988434,0.0021977685,0.0022471598,0.002223591,0.0018515816,0.0029365693,0.0061646053],"category_scores_gemma":[0.025131145,0.0005907062,0.0011799093,0.0037039013,0.00085652154,0.0029370177,0.0015205801,0.0015604597,0.0032154524],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0109008765,0.014035554,0.026131328,0.005045076,0.00088120444,0.0032603184,0.006707224,0.051087312,0.0811077,0.007079313,0.06605441,0.7277097],"study_design_scores_gemma":[0.0059305765,0.012612259,0.04952969,0.0005440509,0.0012892816,0.0070840265,0.0066489936,0.561979,0.17563254,0.023509836,0.1546112,0.00062848115],"about_ca_topic_score_codex":0.0043772426,"about_ca_topic_score_gemma":0.0028512,"teacher_disagreement_score":0.0075385994,"about_ca_system_score_codex":0.00094451505,"about_ca_system_score_gemma":0.0008361509,"threshold_uncertainty_score":0.039868414},"labels":[],"label_agreement":null},{"id":"W2403597675","doi":"","title":"How Well Do We Know Bernoulli","year":2012,"lang":"en","type":"book-chapter","venue":"Research Padua  Archive (University of Padua)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Smoothing; Artificial intelligence; Machine learning; Bernoulli's principle; Estimator; Naive Bayes classifier; Bayes' theorem; Bayesian probability; Bernoulli distribution; Visualization; Pattern recognition (psychology); Data mining; Mathematics; Statistics; Random variable; Support vector machine; Computer vision; Engineering","score_opus":0.06880657876078805,"score_gpt":0.2736206561234766,"score_spread":0.20481407736268853,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2403597675","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04549403,0.022225473,0.74830556,0.051604904,0.0024983499,0.00013068823,0.0014914913,0.0018183284,0.12643124],"genre_scores_gemma":[0.64740425,0.021189969,0.26985276,0.014390004,0.0038647396,0.00037230283,0.0017475937,0.0010827982,0.040095583],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.995379,0.0016053787,0.00020424626,0.0013128322,0.0013043785,0.0001941611],"domain_scores_gemma":[0.9765509,0.017587673,0.0010992064,0.0021466287,0.00204102,0.0005746885],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006798372,0.00091056956,0.0014181567,0.0019063397,0.001480029,0.0064071836,0.0015601981,0.0029138043,0.0108655365],"category_scores_gemma":[0.057276282,0.00057651475,0.0007862224,0.0018398409,0.0032640067,0.01798284,0.0011887709,0.0031799718,0.009180048],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027305825,0.0001137843,0.015080465,0.0006877665,0.00020369599,0.00021023817,0.0029898842,0.008782815,0.0017149724,0.30060345,0.053463146,0.6158768],"study_design_scores_gemma":[0.000023108176,0.00007689888,0.0050965883,0.00047434279,0.00007655854,0.00088010303,0.0009026835,0.037628524,0.0015320416,0.88812286,0.065044336,0.00014202301],"about_ca_topic_score_codex":0.0034453033,"about_ca_topic_score_gemma":0.0023630722,"teacher_disagreement_score":0.0108655365,"about_ca_system_score_codex":0.0013482089,"about_ca_system_score_gemma":0.0010262267,"threshold_uncertainty_score":0.03634888},"labels":[],"label_agreement":null},{"id":"W2513020503","doi":"","title":"Combining relevance feedback and genetic algorithms in an internet information filtering engine","year":2000,"lang":"en","type":"article","venue":"RIAO Conference","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Montréal","funders":"","keywords":"Relevance (law); Computer science; The Internet; Humanities; Algorithm; Philosophy; Political science; World Wide Web","score_opus":0.021462505151121615,"score_gpt":0.24084826020443992,"score_spread":0.2193857550533183,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2513020503","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.21011837,0.0015435576,0.77707803,0.00072271854,0.00016233594,0.00029494212,0.000058797043,0.0038653654,0.0061558653],"genre_scores_gemma":[0.54922575,0.000407335,0.44448385,0.0002590613,0.00010294014,0.00015810768,0.00009399544,0.00013645549,0.0051325136],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9989089,0.00033560218,0.000070834176,0.00020025317,0.00035984468,0.00012450805],"domain_scores_gemma":[0.9975127,0.0015904695,0.0001155106,0.00014415283,0.0005556684,0.00008150005],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003130565,0.00082668604,0.0012483585,0.0022074748,0.0007647947,0.0015377934,0.0013664757,0.0017610908,0.0010901889],"category_scores_gemma":[0.0063423105,0.0005181373,0.0007057609,0.0014864362,0.0006111646,0.001748926,0.0006975304,0.00073220505,0.00047802608],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00041060816,0.00040671672,0.004405046,0.0001723989,0.00022323143,0.00024129845,0.00033254342,0.2952668,0.016326869,0.004877962,0.0015543256,0.67578226],"study_design_scores_gemma":[0.000083886334,0.00021371071,0.0011313995,0.00002234228,0.00011974738,0.00011266962,0.00006183113,0.983869,0.0084531,0.00379736,0.0021029776,0.00003200881],"about_ca_topic_score_codex":0.013517809,"about_ca_topic_score_gemma":0.016101861,"teacher_disagreement_score":0.013517809,"about_ca_system_score_codex":0.001278366,"about_ca_system_score_gemma":0.0013403025,"threshold_uncertainty_score":0.026878238},"labels":[],"label_agreement":null},{"id":"W2517886881","doi":"10.1109/sai.2016.7555963","title":"VENCE: A new machine learning method enhanced by ontological knowledge to extract summaries","year":2016,"lang":"en","type":"article","venue":"2016 SAI Computing Conference (SAI)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval","funders":"","keywords":"Computer science; Ontology; Set (abstract data type); Jaccard index; Process (computing); Information retrieval; Function (biology); Domain (mathematical analysis); Artificial intelligence; Quality (philosophy); Space (punctuation); Natural language processing; Machine learning; Data mining; Pattern recognition (psychology); Mathematics","score_opus":0.0349061431540296,"score_gpt":0.31863610081922245,"score_spread":0.2837299576651928,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2517886881","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012345551,0.00066832756,0.97885656,0.00010670329,0.00008069057,0.00014573016,0.0007415699,0.0054432615,0.0016116742],"genre_scores_gemma":[0.111556694,0.0005035115,0.87901455,0.00007612519,0.00008017879,0.00021963574,0.0038962322,0.00046322373,0.004189839],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9991239,0.00021924017,0.00010627363,0.0002265137,0.00026790798,0.000056253903],"domain_scores_gemma":[0.99822265,0.00085721293,0.00012290213,0.00030133186,0.00044071497,0.00005515127],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013570025,0.00090138795,0.0008460685,0.0057436284,0.0005287706,0.0012794458,0.0010089307,0.0007309441,0.002661395],"category_scores_gemma":[0.006069756,0.0002247502,0.00096733007,0.0030308692,0.00035708005,0.0021443754,0.00097005087,0.00089673855,0.0011404755],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013539562,0.00007786321,0.0018028971,0.00030755933,0.00010911295,0.00011062984,0.00018696823,0.011352641,0.00692225,0.0068416432,0.0053624418,0.9667906],"study_design_scores_gemma":[0.0000710713,0.00043896114,0.006090099,0.00018369226,0.0001848373,0.00083309883,0.0004857356,0.86597323,0.031991843,0.032083403,0.06154941,0.000114776856],"about_ca_topic_score_codex":0.002128829,"about_ca_topic_score_gemma":0.003555547,"teacher_disagreement_score":0.0057436284,"about_ca_system_score_codex":0.000529235,"about_ca_system_score_gemma":0.0009469751,"threshold_uncertainty_score":0.008903265},"labels":[],"label_agreement":null},{"id":"W2552791835","doi":"10.5555/3192424.3192606","title":"Spectral graph-based semi-supervised learning for imbalanced classes","year":2016,"lang":"en","type":"article","venue":"Advances in Social Networks Analysis and Mining","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"","keywords":"Embedding; Graph; Computer science; Semi-supervised learning; Graph embedding; Theoretical computer science; Pattern recognition (psychology); Artificial intelligence; Mathematics; Algorithm; Combinatorics","score_opus":0.012703246983670374,"score_gpt":0.28063595725781043,"score_spread":0.26793271027414006,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2552791835","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.032326855,0.00018106817,0.9644924,0.00033852743,0.0000465242,0.00010279899,0.00016694357,0.001617596,0.0007273211],"genre_scores_gemma":[0.5486781,0.00018642521,0.44644493,0.0003209095,0.00013203337,0.00035908533,0.0013985805,0.00031949836,0.0021603801],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9975821,0.0010069073,0.00014871825,0.0005630111,0.00057983777,0.00011931547],"domain_scores_gemma":[0.9868471,0.00774755,0.0014059563,0.002015272,0.0016016159,0.00038256365],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0044229617,0.0011419567,0.0015787309,0.0026157894,0.001111377,0.0012555867,0.0027725326,0.0016221135,0.0016240737],"category_scores_gemma":[0.016469132,0.00048208795,0.0009196023,0.0019118721,0.0018916217,0.003545056,0.0020940755,0.0020063824,0.00096815306],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00049256254,0.0004184616,0.0046915873,0.00023829902,0.0001876414,0.00017014441,0.00041136856,0.52549535,0.0052705943,0.020155063,0.00822632,0.4342427],"study_design_scores_gemma":[0.000008177118,0.000017616263,0.0001380975,0.0000048136953,0.0000038070168,0.000020888354,0.000023965202,0.9852777,0.00070055056,0.013550669,0.0002477299,0.0000059723952],"about_ca_topic_score_codex":0.002424981,"about_ca_topic_score_gemma":0.004172927,"teacher_disagreement_score":0.0044229617,"about_ca_system_score_codex":0.0014391752,"about_ca_system_score_gemma":0.00142886,"threshold_uncertainty_score":0.023391128},"labels":[],"label_agreement":null},{"id":"W2556044468","doi":"10.5430/air.v6n1p59","title":"Re-ranking Google search returned web documents using document classification scores","year":2016,"lang":"en","type":"article","venue":"Artificial Intelligence Research","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Information retrieval; Ranking (information retrieval); Computer science; Search engine; World Wide Web; Web page; Learning to rank; Web search engine; Web search query","score_opus":0.3126960264625327,"score_gpt":0.44704871815383274,"score_spread":0.13435269169130004,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2556044468","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.79510415,0.018890979,0.14671332,0.0010375804,0.0011709334,0.0014142242,0.0063795983,0.012019482,0.017269673],"genre_scores_gemma":[0.8725692,0.0026095563,0.10748673,0.00013239801,0.0003702704,0.0002162496,0.006562289,0.00047975717,0.009573569],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99483454,0.000663437,0.00039304796,0.0004038304,0.003317606,0.0003874772],"domain_scores_gemma":[0.99367696,0.0012661739,0.000573552,0.00076471333,0.0034428695,0.00027564357],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002177247,0.0020844312,0.002613525,0.014150165,0.0010437155,0.0030201294,0.00089637376,0.0007415737,0.0016836285],"category_scores_gemma":[0.007157785,0.0002833493,0.0011449526,0.008151489,0.0003761273,0.0022088008,0.00070908904,0.0007997677,0.0020799886],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012884157,0.00091277657,0.037336856,0.0009945253,0.00048794874,0.00034925327,0.0002511133,0.0076764934,0.04282876,0.0011890486,0.020925002,0.88575983],"study_design_scores_gemma":[0.0004424992,0.0034289777,0.19165693,0.00028503,0.0017325338,0.0025771162,0.0019124344,0.5387188,0.21030772,0.006907361,0.041350543,0.00068008364],"about_ca_topic_score_codex":0.012247804,"about_ca_topic_score_gemma":0.02367995,"teacher_disagreement_score":0.014150165,"about_ca_system_score_codex":0.0009796917,"about_ca_system_score_gemma":0.001708074,"threshold_uncertainty_score":0.024353027},"labels":[],"label_agreement":null},{"id":"W2560620367","doi":"10.29173/cais341","title":"A Comparative Study on Feature Selection of Text Categorization for Hidden Markov Models","year":2013,"lang":"fr","type":"article","venue":"Proceedings of the Annual Conference of CAIS / Actes du congrès annuel de l ACSI","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Selection (genetic algorithm); Feature selection; Categorization; Context (archaeology); Artificial intelligence; Computer science; Humanities; Natural language processing; Geography; Philosophy","score_opus":0.05343692366918243,"score_gpt":0.2833853176220592,"score_spread":0.22994839395287678,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2560620367","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.53450423,0.014979958,0.43784887,0.0014407731,0.00023471689,0.0003639737,0.00059074844,0.0026434176,0.0073933024],"genre_scores_gemma":[0.9213942,0.0016155979,0.07461892,0.00009399039,0.000099562436,0.00012487831,0.00079655193,0.000110733796,0.0011455098],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99626046,0.0023816528,0.00023768301,0.00039233372,0.00057057553,0.00015734672],"domain_scores_gemma":[0.96525294,0.03152576,0.00048902887,0.0008345313,0.0017203921,0.0001773554],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008279926,0.0008673027,0.0009543406,0.0020184931,0.00048211275,0.0012898657,0.0007398373,0.0009830531,0.0015749556],"category_scores_gemma":[0.026843337,0.00025551533,0.0010323102,0.0016772697,0.00034791286,0.0026480616,0.0005168521,0.00078177796,0.00050010486],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0028645284,0.0006088385,0.028328588,0.0007536192,0.0005319939,0.00030421378,0.00082389906,0.09208485,0.010244912,0.005061903,0.0034201036,0.8549726],"study_design_scores_gemma":[0.00007783564,0.0011565882,0.022808306,0.000117866046,0.00021434289,0.00026116028,0.0005749819,0.9603394,0.00669812,0.004623089,0.003068874,0.000059422866],"about_ca_topic_score_codex":0.0059798765,"about_ca_topic_score_gemma":0.004510527,"teacher_disagreement_score":0.008279926,"about_ca_system_score_codex":0.0010589532,"about_ca_system_score_gemma":0.0005297998,"threshold_uncertainty_score":0.04378891},"labels":[],"label_agreement":null},{"id":"W2565143233","doi":"10.82308/24058","title":"Text classification using a hidden Markov model","year":2005,"lang":"en","type":"article","venue":"Open MIND","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Hidden Markov model; Computer science; Artificial intelligence; Categorization; Natural language processing; Naive Bayes classifier; Test set; Machine learning; Bayesian probability; Pattern recognition (psychology); Data mining; Support vector machine","score_opus":0.1071301472310728,"score_gpt":0.3418787696192839,"score_spread":0.2347486223882111,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2565143233","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.035013676,0.00068984524,0.9572354,0.0005995274,0.00015210806,0.00019105243,0.0006661327,0.0035031892,0.0019490276],"genre_scores_gemma":[0.6791013,0.0010119277,0.30891612,0.00046353647,0.00024915842,0.00055174716,0.0020489807,0.00018333948,0.0074739754],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99899584,0.00031685887,0.000078919504,0.00030986054,0.0002184095,0.00008007138],"domain_scores_gemma":[0.9972562,0.0019962667,0.00016066687,0.00016388636,0.00036298178,0.000060059956],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001433453,0.0006481193,0.0008869658,0.0014208015,0.000631158,0.0012307655,0.0014751625,0.001239894,0.0024969128],"category_scores_gemma":[0.00480981,0.0003755238,0.0010985511,0.0011844587,0.00047747252,0.00199629,0.00054661685,0.0011779638,0.0019538882],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006303106,0.00042013917,0.008972483,0.00039313012,0.00023983128,0.0004233718,0.00050233555,0.40364504,0.0118468525,0.024638688,0.008554343,0.53973347],"study_design_scores_gemma":[0.000008750714,0.000028201166,0.00043535826,0.0000097413795,0.000017737282,0.000027015734,0.000011550667,0.99358106,0.0006627971,0.0045373007,0.00067073904,0.000009726971],"about_ca_topic_score_codex":0.012458326,"about_ca_topic_score_gemma":0.009555318,"teacher_disagreement_score":0.012458326,"about_ca_system_score_codex":0.0011252719,"about_ca_system_score_gemma":0.0010099505,"threshold_uncertainty_score":0.02477163},"labels":[],"label_agreement":null},{"id":"W2577161492","doi":"","title":"Semisupervised text classification using unsupervised topic information","year":2016,"lang":"en","type":"article","venue":"The Florida AI Research Society","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"École de Technologie Supérieure","funders":"","keywords":"Computer science; Artificial intelligence; Natural language processing; Information retrieval","score_opus":0.1233472750172762,"score_gpt":0.36867560219509704,"score_spread":0.24532832717782083,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2577161492","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0599585,0.0019081867,0.9194388,0.0010825016,0.0005725827,0.00042149858,0.00296324,0.006655153,0.0069995816],"genre_scores_gemma":[0.41544056,0.0010689148,0.5453008,0.00046386552,0.0013238511,0.00090042554,0.016947564,0.00070306624,0.017850919],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99766254,0.00062201853,0.00024821263,0.0007533121,0.00056413235,0.00014988058],"domain_scores_gemma":[0.99462223,0.002197743,0.0005489685,0.0009023846,0.001535858,0.00019283367],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0017255816,0.001022245,0.0012208045,0.0041807904,0.0012107746,0.0021565466,0.0014052504,0.0012625987,0.0029339264],"category_scores_gemma":[0.005717349,0.00038989735,0.0013433791,0.0034015647,0.00058255566,0.0031735876,0.0014778994,0.0015310292,0.004764907],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005395934,0.0007199184,0.0049021253,0.00045672397,0.00022018109,0.00022998522,0.0004490062,0.0073634367,0.051726103,0.0060651684,0.034175158,0.8931527],"study_design_scores_gemma":[0.000108538276,0.0003295618,0.009004703,0.00015818,0.00030737015,0.00096797204,0.0005384697,0.8552759,0.0610702,0.037134226,0.03499794,0.0001069114],"about_ca_topic_score_codex":0.0011637295,"about_ca_topic_score_gemma":0.003209844,"teacher_disagreement_score":0.0041807904,"about_ca_system_score_codex":0.00056040514,"about_ca_system_score_gemma":0.001261908,"threshold_uncertainty_score":0.009814918},"labels":[],"label_agreement":null},{"id":"W2578515274","doi":"10.3233/978-1-61499-672-9-1336","title":"Improved Multi-Label Classification Using Inter-Dependence Structure via a Generative Mixture Model","year":2016,"lang":"en","type":"book-chapter","venue":"Frontiers in artificial intelligence and applications","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"","keywords":"Generative grammar; Generative model; Artificial intelligence; Pattern recognition (psychology); Materials science; Computer science; Biological system; Biology","score_opus":0.08005437587493122,"score_gpt":0.30664518401851915,"score_spread":0.22659080814358792,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2578515274","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008616792,0.00061406236,0.98620427,0.00030611214,0.00010113354,0.000042634456,0.00012916343,0.0025717448,0.0014140611],"genre_scores_gemma":[0.27245137,0.0006039862,0.7082921,0.0006401335,0.00034344144,0.00019141802,0.0023600652,0.0011123699,0.014005194],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9975594,0.00079562434,0.00011202497,0.00059284695,0.00073732494,0.00020271758],"domain_scores_gemma":[0.99461585,0.0030557462,0.00022784052,0.0010427635,0.0008838596,0.00017392571],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0036709479,0.0012015909,0.001827201,0.0020675736,0.0009608178,0.00258486,0.0043433676,0.0025158704,0.0043257927],"category_scores_gemma":[0.0064341747,0.0009045316,0.0025593208,0.0022796872,0.0010793076,0.0039832406,0.0032563042,0.0046302103,0.0037964946],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00042132058,0.0003390199,0.0027277437,0.00017702633,0.00028927918,0.00020794409,0.00041689182,0.20818086,0.010887971,0.033291686,0.019464782,0.72359544],"study_design_scores_gemma":[0.0000075833027,0.00001127016,0.00017395351,0.000006327844,0.000021079943,0.00003371223,0.0000072054636,0.9880562,0.0012170677,0.009559134,0.0008937936,0.000012611848],"about_ca_topic_score_codex":0.0071610324,"about_ca_topic_score_gemma":0.009200699,"teacher_disagreement_score":0.0071610324,"about_ca_system_score_codex":0.0015804899,"about_ca_system_score_gemma":0.001223978,"threshold_uncertainty_score":0.019414067},"labels":[],"label_agreement":null},{"id":"W2587209668","doi":"10.29173/cais195","title":"Boosting for Text Classification with Subject Headings","year":2013,"lang":"fr","type":"article","venue":"Proceedings of the Annual Conference of CAIS / Actes du congrès annuel de l ACSI","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Computer science; Classifier (UML); Subject (documents); Boosting (machine learning); Information retrieval; Natural language processing; Artificial intelligence; Library science","score_opus":0.04504300598340083,"score_gpt":0.26069526964263856,"score_spread":0.21565226365923773,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2587209668","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12911439,0.008348484,0.83636975,0.0012314037,0.001430816,0.00063525996,0.0017568498,0.010027203,0.011085922],"genre_scores_gemma":[0.61508286,0.0020341894,0.3607881,0.00045883266,0.0016015887,0.0004059405,0.0051993714,0.00040584354,0.014023306],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99857485,0.00043026934,0.000102377126,0.00024364669,0.0005030392,0.00014580588],"domain_scores_gemma":[0.9941262,0.003247528,0.0003444091,0.0005562352,0.0015645982,0.00016106707],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0033124147,0.0007028386,0.0011662362,0.0037546325,0.0007456913,0.0012470073,0.0008980467,0.0008009021,0.0037412825],"category_scores_gemma":[0.009224035,0.00028589956,0.0009889158,0.0025819417,0.00036759692,0.0013284606,0.00074584456,0.0011070204,0.004371911],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00063793786,0.00024305192,0.008467483,0.0004698546,0.00014091122,0.00015388105,0.0002606711,0.024546446,0.031197581,0.0046596704,0.014531318,0.91469115],"study_design_scores_gemma":[0.000103162674,0.00070100726,0.01518029,0.00014644959,0.00029291664,0.0003923104,0.0002102763,0.8829074,0.04346993,0.016359353,0.04018129,0.000055595807],"about_ca_topic_score_codex":0.0036155854,"about_ca_topic_score_gemma":0.0033435172,"teacher_disagreement_score":0.0037546325,"about_ca_system_score_codex":0.0008325962,"about_ca_system_score_gemma":0.0013449283,"threshold_uncertainty_score":0.017517924},"labels":[],"label_agreement":null},{"id":"W2587810790","doi":"10.7717/peerj-cs.242","title":"Nearest labelset using double distances for multi-label classification","year":2019,"lang":"en","type":"preprint","venue":"PeerJ Computer Science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo; Western University","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Multi-label classification; Pattern recognition (psychology); Benchmark (surveying); Hamming code; Feature (linguistics); Mathematics; Function (biology); Hamming distance; Computer science; Artificial intelligence; Measure (data warehouse); k-nearest neighbors algorithm; Binomial (polynomial); Space (punctuation); Algorithm; Statistics; Data mining","score_opus":0.2164557323099007,"score_gpt":0.38397517742362325,"score_spread":0.16751944511372255,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2587810790","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.028640905,0.0010397988,0.9650097,0.0004229141,0.00021119174,0.0001238754,0.00057278044,0.002167129,0.0018117421],"genre_scores_gemma":[0.44330776,0.00050721737,0.54284006,0.0003827646,0.00034369814,0.00036373004,0.004539646,0.0005084177,0.0072066756],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99390996,0.001729886,0.00040361498,0.0016411435,0.001989407,0.0003259377],"domain_scores_gemma":[0.9919682,0.0034631027,0.0008482466,0.0020943014,0.0013095877,0.0003165057],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004429074,0.0016787626,0.0025060389,0.0049836906,0.0013245455,0.002321705,0.003935131,0.0035319186,0.002621381],"category_scores_gemma":[0.012507079,0.00047602196,0.0013392136,0.003826939,0.0013190416,0.0044508427,0.0028829256,0.0039086924,0.0023147208],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00076181325,0.0005233482,0.007115774,0.00030383372,0.00023909405,0.00021257244,0.0002396578,0.24027818,0.0044277143,0.023868384,0.013944193,0.70808554],"study_design_scores_gemma":[0.000024629904,0.00007400936,0.00049135805,0.000026016249,0.000014126684,0.00010209853,0.000053966327,0.95864797,0.0027117454,0.0352251,0.002594237,0.00003470807],"about_ca_topic_score_codex":0.0024523104,"about_ca_topic_score_gemma":0.0030136497,"teacher_disagreement_score":0.0049836906,"about_ca_system_score_codex":0.0016030493,"about_ca_system_score_gemma":0.001477198,"threshold_uncertainty_score":0.023423433},"labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low"},{"model":"gpt","categories":[],"domain":null,"study_design":"theoretical_or_conceptual","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"medium"}],"label_agreement":"split"},{"id":"W2590184703","doi":"10.29173/cais539","title":"A Text Categorization Model Based on Hidden Markov Models","year":2013,"lang":"en","type":"article","venue":"Proceedings of the Annual Conference of CAIS / Actes du congrès annuel de l ACSI","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Hidden Markov model; Categorization; Computer science; Artificial intelligence; Speech recognition; Scheme (mathematics); Natural language processing; Pattern recognition (psychology); Markov model; Markov chain; Machine learning; Mathematics","score_opus":0.024126278370148094,"score_gpt":0.23203053909746876,"score_spread":0.20790426072732066,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2590184703","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.034966115,0.0013717702,0.95126796,0.0011403885,0.0004132038,0.00040535684,0.0020837358,0.0038120085,0.0045394893],"genre_scores_gemma":[0.56682795,0.0019360458,0.3984977,0.00083396875,0.0005006903,0.001020857,0.006551279,0.00032572963,0.023505853],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99912375,0.0001992771,0.00008226368,0.00029294126,0.000231632,0.00007010297],"domain_scores_gemma":[0.9986313,0.00085024536,0.00009031452,0.00008929946,0.00029002753,0.00004881661],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00135378,0.00060753344,0.00093798287,0.0021599238,0.000663975,0.0014183329,0.0015367651,0.0011092778,0.0035859412],"category_scores_gemma":[0.0033744387,0.00031691333,0.0012121225,0.0017555025,0.00042861848,0.0025807961,0.0005593568,0.0010809066,0.0030612636],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007975027,0.000714256,0.00960764,0.00066629844,0.00043761474,0.0006016377,0.0009052191,0.1868027,0.016855666,0.054793805,0.027195768,0.7006219],"study_design_scores_gemma":[0.000030466075,0.00012991353,0.0018145029,0.000043606353,0.00008123712,0.00016557853,0.000045569115,0.9713082,0.0022876821,0.018369602,0.0056828274,0.000040858566],"about_ca_topic_score_codex":0.010839666,"about_ca_topic_score_gemma":0.010601119,"teacher_disagreement_score":0.010839666,"about_ca_system_score_codex":0.0010627877,"about_ca_system_score_gemma":0.0012588666,"threshold_uncertainty_score":0.021553159},"labels":[],"label_agreement":null},{"id":"W2605893001","doi":"10.1007/978-3-319-57351-9_24","title":"Design and Implementation of a Smart Quotation System","year":2017,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Computer science; Context (archaeology); Process (computing); Order (exchange); Software engineering; Software; Operations research; Industrial engineering; Database; Operating system","score_opus":0.02868893627742745,"score_gpt":0.2842081918926632,"score_spread":0.25551925561523575,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2605893001","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.022235628,0.00019785794,0.9098867,0.0004390543,0.00032228592,0.0012836629,0.0003992478,0.056319013,0.008916524],"genre_scores_gemma":[0.19903226,0.00014823547,0.76700306,0.0006463027,0.00011528702,0.0012212957,0.0011105865,0.0028254106,0.02789764],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99773526,0.00041594822,0.00028121658,0.00052871567,0.00085417664,0.00018467168],"domain_scores_gemma":[0.99633837,0.0011627082,0.00025684029,0.00081765745,0.0010419755,0.00038255574],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0021436908,0.0006598586,0.0010087072,0.0012414497,0.00094320753,0.0028241326,0.003353968,0.0014026266,0.029763455],"category_scores_gemma":[0.0057973354,0.0008817465,0.0005198858,0.00091900537,0.0009333565,0.0025605506,0.0021790254,0.0009631279,0.011801503],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002400802,0.0009980461,0.004904801,0.0015475411,0.00021526631,0.001164317,0.0025612912,0.007992643,0.21386331,0.038544774,0.03698217,0.6888251],"study_design_scores_gemma":[0.0007983218,0.001385639,0.0051272684,0.00024567585,0.0003066573,0.0012818414,0.00094117614,0.3738348,0.34089932,0.016600274,0.25826776,0.00031127696],"about_ca_topic_score_codex":0.0014826194,"about_ca_topic_score_gemma":0.0014338734,"teacher_disagreement_score":0.029763455,"about_ca_system_score_codex":0.00079266675,"about_ca_system_score_gemma":0.0018167669,"threshold_uncertainty_score":0.099568665},"labels":[],"label_agreement":null},{"id":"W2609579487","doi":"10.1007/s11280-017-0460-2","title":"Collaborative text categorization via exploiting sparse coefficients","year":2017,"lang":"en","type":"article","venue":"World Wide Web","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":35,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Sherbrooke","funders":"","keywords":"Computer science; Sparse approximation; Pattern recognition (psychology); Categorization; Artificial intelligence; Classifier (UML); Sparse matrix; Representation (politics); Information retrieval; Data mining","score_opus":0.019044466667129008,"score_gpt":0.2666869600097453,"score_spread":0.2476424933426163,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2609579487","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.043226283,0.00056076533,0.95172644,0.00036775763,0.00016914333,0.000109063105,0.00036224534,0.001467447,0.002010853],"genre_scores_gemma":[0.5059493,0.00060783373,0.48047844,0.0003417723,0.0004967255,0.00024925885,0.0030686525,0.00020542697,0.008602547],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99880624,0.00023916713,0.000074669544,0.0002542822,0.0004995948,0.000126082],"domain_scores_gemma":[0.996905,0.001509002,0.0002799237,0.00048147002,0.0006754043,0.00014924993],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0010392754,0.0007729222,0.0014078731,0.0040754215,0.00081843877,0.0014519582,0.0013010721,0.0012226967,0.00219616],"category_scores_gemma":[0.0048069987,0.00039582528,0.00096619804,0.0035270199,0.0004805933,0.0028118922,0.00176868,0.0011701275,0.0016962361],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00055256154,0.0006493763,0.0030174577,0.00019985808,0.00018096893,0.00019684235,0.0002231165,0.043604884,0.046749096,0.010063734,0.014745412,0.8798166],"study_design_scores_gemma":[0.000034244338,0.00008110131,0.00073654845,0.000011748668,0.000053489075,0.00011062877,0.00007466516,0.9734312,0.008777551,0.014013892,0.0026568838,0.0000179988],"about_ca_topic_score_codex":0.0034036702,"about_ca_topic_score_gemma":0.005892926,"teacher_disagreement_score":0.0040754215,"about_ca_system_score_codex":0.0004194613,"about_ca_system_score_gemma":0.000844189,"threshold_uncertainty_score":0.0073468685},"labels":[],"label_agreement":null},{"id":"W2617799745","doi":"10.29173/cais355","title":"Les méthodes de classification non supervisées appliquées aux textes : mesure de la performance des résultats de clustering de documents","year":2013,"lang":"fr","type":"article","venue":"Proceedings of the Annual Conference of CAIS / Actes du congrès annuel de l ACSI","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Humanities; Mathematics; Philosophy","score_opus":0.05746759106833514,"score_gpt":0.30748540977171873,"score_spread":0.2500178187033836,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2617799745","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.36740842,0.004795213,0.61611265,0.00039992743,0.00036917216,0.0007228909,0.001463998,0.0056021474,0.0031254883],"genre_scores_gemma":[0.5082659,0.00096821465,0.481932,0.00008912044,0.00015740843,0.0007419238,0.0020049154,0.0005397199,0.0053008674],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9878841,0.0037046638,0.0010081246,0.0022578593,0.0047113826,0.00043387106],"domain_scores_gemma":[0.9628062,0.020394633,0.0028243768,0.0032821572,0.010234596,0.00045801635],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009541055,0.0018918127,0.00216576,0.006357004,0.0013848552,0.0034520174,0.0018308485,0.0024576003,0.0012776374],"category_scores_gemma":[0.030791624,0.00062678475,0.0016743221,0.0037170297,0.0010654696,0.0017436369,0.0009379145,0.0014613896,0.0015720826],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0023120285,0.00039598305,0.022679089,0.0009792929,0.0008570626,0.00012698512,0.00082543807,0.03011246,0.049275097,0.0009654864,0.0023929253,0.88907814],"study_design_scores_gemma":[0.00038473232,0.0024717103,0.093176395,0.00028034457,0.0008316802,0.0011729774,0.0008216589,0.66214323,0.22294582,0.0038742286,0.011503871,0.00039332206],"about_ca_topic_score_codex":0.007966727,"about_ca_topic_score_gemma":0.009925537,"teacher_disagreement_score":0.009541055,"about_ca_system_score_codex":0.0013923091,"about_ca_system_score_gemma":0.0014084076,"threshold_uncertainty_score":0.05045849},"labels":[],"label_agreement":null},{"id":"W2738173662","doi":"","title":"Semi-supervised learning and opinion-oriented information extraction","year":2010,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of New Brunswick","funders":"","keywords":"Computer science; Machine learning; Artificial intelligence; Co-training; Classifier (UML); Graph; Semi-supervised learning; Naive Bayes classifier; Bottleneck; Information extraction; Supervised learning; Decision tree; Algorithm; Data mining; Theoretical computer science; Support vector machine","score_opus":0.008705654857859608,"score_gpt":0.260067979323589,"score_spread":0.25136232446572937,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2738173662","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007720132,0.00026883557,0.9899158,0.0002527115,0.000036467838,0.00008867015,0.00014000217,0.0004464336,0.0011310021],"genre_scores_gemma":[0.3250152,0.0005988371,0.66926247,0.00036309008,0.00029397232,0.00048608423,0.0015502966,0.00017347546,0.002256615],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9933334,0.0030436737,0.00062589825,0.0013918219,0.001414852,0.00019037025],"domain_scores_gemma":[0.97657585,0.015605918,0.0022466446,0.0018993323,0.0034574918,0.00021475417],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006709149,0.0010852064,0.0015024171,0.0037464916,0.00072824606,0.002039872,0.0022391374,0.0013702341,0.0016614787],"category_scores_gemma":[0.022247544,0.00059770554,0.0015797655,0.0025640577,0.0016873964,0.003536651,0.0016818822,0.001800901,0.0010784459],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025981784,0.00037827037,0.0049923956,0.0011224629,0.00050164614,0.00032960184,0.0010642635,0.22454537,0.008910583,0.08378337,0.011442371,0.6626699],"study_design_scores_gemma":[0.000016804737,0.000040037456,0.0006357171,0.000048368922,0.00003019924,0.00007313819,0.00006340053,0.9318822,0.0033386033,0.061585717,0.0022620365,0.000023822746],"about_ca_topic_score_codex":0.0009629146,"about_ca_topic_score_gemma":0.0012141527,"teacher_disagreement_score":0.006709149,"about_ca_system_score_codex":0.0011585773,"about_ca_system_score_gemma":0.000999676,"threshold_uncertainty_score":0.03548175},"labels":[],"label_agreement":null},{"id":"W2740468505","doi":"10.24963/ijcai.2017/443","title":"Incomplete Label Distribution Learning","year":2017,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":52,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Novelis (Canada)","funders":"National Natural Science Foundation of China","keywords":"Computer science; Artificial intelligence; Relevance (law); Minification; Exploit; Annotation; Machine learning; Algorithm","score_opus":0.041912464323893436,"score_gpt":0.2960959009144437,"score_spread":0.25418343659055026,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2740468505","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0053697834,0.00016657053,0.99239844,0.0003345247,0.000038649647,0.00004604569,0.00015840719,0.00063033495,0.0008572649],"genre_scores_gemma":[0.27032608,0.0005615058,0.7173388,0.0007642113,0.00041211353,0.0003790739,0.0030237068,0.0003508667,0.0068436987],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9970386,0.0010423857,0.00011728706,0.0009068191,0.0006857255,0.00020920846],"domain_scores_gemma":[0.9935463,0.0031523337,0.00059182657,0.001282242,0.0011423815,0.00028489702],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0035708246,0.00109261,0.0020216068,0.0017359921,0.0009825404,0.0018206916,0.003499474,0.0024127502,0.0032059695],"category_scores_gemma":[0.010158667,0.00062400533,0.0010222943,0.0021273901,0.0018777326,0.0040764012,0.0026080045,0.0031694784,0.0014913618],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00035568644,0.00034942976,0.0038354578,0.0004008995,0.00015854226,0.00026020265,0.0003219795,0.29276425,0.0049937475,0.09621532,0.02543266,0.5749118],"study_design_scores_gemma":[0.000028220284,0.000036142617,0.0002480063,0.00002025133,0.000015101917,0.000056300658,0.000030299396,0.9301171,0.0019254376,0.06409354,0.0034135412,0.000016085813],"about_ca_topic_score_codex":0.0022167324,"about_ca_topic_score_gemma":0.002862428,"teacher_disagreement_score":0.0035708246,"about_ca_system_score_codex":0.001614664,"about_ca_system_score_gemma":0.0023238058,"threshold_uncertainty_score":0.01888454},"labels":[],"label_agreement":null},{"id":"W2756654724","doi":"10.18653/v1/d17-1202","title":"Shortest-Path Graph Kernels for Document Similarity","year":2017,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":54,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Polytechnique Montréal","funders":"","keywords":"Computer science; Graph; Similarity measure; Shortest path problem; Kernel (algebra); Similarity (geometry); Macro; Data mining; Artificial intelligence; Pattern recognition (psychology); Theoretical computer science; Mathematics; Combinatorics","score_opus":0.04094903064209897,"score_gpt":0.31369760833261384,"score_spread":0.27274857769051486,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2756654724","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.033255145,0.0014348305,0.96224165,0.00010946509,0.00007016034,0.0000899673,0.00026528034,0.0011943644,0.0013391449],"genre_scores_gemma":[0.6163772,0.0010704217,0.37853616,0.00008578769,0.000141903,0.00019677432,0.0012586539,0.00029621331,0.002036894],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9973346,0.00065556477,0.00022914847,0.0005704549,0.0010825193,0.00012780186],"domain_scores_gemma":[0.99505925,0.0021299084,0.00065285485,0.0009255527,0.0010730948,0.00015938468],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013665434,0.0007786215,0.0011814602,0.004747808,0.00048981135,0.0015960505,0.0013004966,0.0011060217,0.0015358126],"category_scores_gemma":[0.009130389,0.00022461457,0.0007870893,0.00552367,0.0008999269,0.0050891163,0.0012974303,0.0012777963,0.0010311136],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00061558274,0.00037329775,0.005890562,0.0007464065,0.0003382791,0.00024503886,0.0003933897,0.14022002,0.030082626,0.077716134,0.0061296825,0.73724896],"study_design_scores_gemma":[0.000023062248,0.00022531503,0.003655941,0.00003942317,0.000061904815,0.0005177412,0.00012857288,0.9097321,0.011229523,0.06648511,0.007823278,0.0000779541],"about_ca_topic_score_codex":0.001821679,"about_ca_topic_score_gemma":0.0011867287,"teacher_disagreement_score":0.004747808,"about_ca_system_score_codex":0.0011470366,"about_ca_system_score_gemma":0.00075589673,"threshold_uncertainty_score":0.008322358},"labels":[],"label_agreement":null},{"id":"W2763406350","doi":"10.1017/s1351324917000389","title":"Emerging trends: A tribute to Charles Wayne","year":2017,"lang":"en","type":"article","venue":"Natural Language Engineering","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Alberta-Pacific Forest Industries","keywords":"Tribute; Order (exchange); Government (linguistics); Computer science; sort; Management; Law; Political science; Economics; Finance; Philosophy; Linguistics","score_opus":0.007743718129550689,"score_gpt":0.2627037147876462,"score_spread":0.2549599966580955,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2763406350","genre_codex":"commentary","genre_gemma":"commentary","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"commentary","genre_consensus":"commentary","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00019490285,0.0067819655,0.0003568605,0.96973026,0.01812965,0.0000036173444,0.000024968795,0.00003502002,0.004742795],"genre_scores_gemma":[0.020199949,0.020470206,0.0017356803,0.83595127,0.047266953,0.000061929946,0.00010024365,0.00047202577,0.07374173],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.98769814,0.0030154504,0.00075471,0.0025050486,0.0048552626,0.0011713794],"domain_scores_gemma":[0.93989766,0.02688215,0.0016461777,0.002938163,0.016641326,0.011994595],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01575915,0.0008568791,0.0012961156,0.0029757172,0.0073018204,0.01879287,0.002249162,0.013699069,0.013052971],"category_scores_gemma":[0.061651226,0.00056502223,0.00067744823,0.002038947,0.015903145,0.020904101,0.005554382,0.036342714,0.007030458],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000075341695,0.000012684683,0.0001305125,0.000025320795,0.000007557543,0.00008738761,0.0005173594,0.00003871291,0.00004627972,0.0289161,0.9585378,0.011672742],"study_design_scores_gemma":[0.0000053023687,0.0000066878556,0.00010618967,0.00020265137,0.0000029021987,0.000084668005,0.0006347001,0.000057756683,0.00006543404,0.01618713,0.9826272,0.00001930467],"about_ca_topic_score_codex":0.011673778,"about_ca_topic_score_gemma":0.015602261,"teacher_disagreement_score":0.01879287,"about_ca_system_score_codex":0.0070314147,"about_ca_system_score_gemma":0.010078143,"threshold_uncertainty_score":0.08334339},"labels":[],"label_agreement":null},{"id":"W2783366437","doi":"10.1109/bigdata.2017.8258136","title":"Semi-supervised learning and social media text analysis towards multi-labeling categorization","year":2017,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Montréal","funders":"","keywords":"Computer science; Artificial intelligence; WordNet; Categorization; Machine learning; Natural language processing; Supervised learning; Annotation; Graph; Task (project management); Labeled data; Pattern recognition (psychology); Artificial neural network","score_opus":0.045480703077475496,"score_gpt":0.2997944648698337,"score_spread":0.2543137617923582,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2783366437","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013702534,0.00040245723,0.98234034,0.00035647117,0.00007146792,0.00019803226,0.00022130832,0.0011074517,0.0015998456],"genre_scores_gemma":[0.25053075,0.0003587266,0.74365026,0.00028450286,0.00030841466,0.0005171366,0.0013770412,0.00023645007,0.0027367328],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99044234,0.0050004325,0.00055928045,0.0016086402,0.0021427579,0.0002465355],"domain_scores_gemma":[0.98150533,0.01025221,0.0019724364,0.002451085,0.0034646762,0.0003542993],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0053755655,0.0014805631,0.0013653791,0.0074725095,0.0010748503,0.0026450586,0.002279222,0.001810479,0.0017783782],"category_scores_gemma":[0.012391485,0.00044909667,0.0016398317,0.003819257,0.002438277,0.0037177396,0.002279427,0.0018859359,0.0015842484],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00043249902,0.0011471652,0.006029953,0.0009107896,0.00043009527,0.00040263968,0.0014439902,0.12853824,0.019774394,0.03815074,0.012767358,0.7899721],"study_design_scores_gemma":[0.000020418936,0.000065809756,0.0015189457,0.000056774476,0.0000324479,0.00013556884,0.000252802,0.92704034,0.007983442,0.057766564,0.0050831703,0.000043630283],"about_ca_topic_score_codex":0.0015806096,"about_ca_topic_score_gemma":0.0018675544,"teacher_disagreement_score":0.0074725095,"about_ca_system_score_codex":0.0012999412,"about_ca_system_score_gemma":0.0011609863,"threshold_uncertainty_score":0.028429031},"labels":[],"label_agreement":null},{"id":"W2799784710","doi":"","title":"Learning Activation Functions in Deep Neural Networks","year":2017,"lang":"en","type":"article","venue":"PolyPublie (École Polytechnique de Montréal)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":17,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Mitacs","keywords":"Humanities; Art","score_opus":0.015045228808938172,"score_gpt":0.24236834086929476,"score_spread":0.2273231120603566,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2799784710","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05668009,0.0038176032,0.93024254,0.0012399375,0.0001948259,0.000055962737,0.00014844009,0.0014525941,0.0061679957],"genre_scores_gemma":[0.7514306,0.002817445,0.22727983,0.0003746279,0.00018082594,0.00019573326,0.00042943232,0.00032217178,0.016969342],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99972445,0.00010180973,0.000018137807,0.000049316466,0.000058714286,0.00004759991],"domain_scores_gemma":[0.9991394,0.0005750244,0.000052440668,0.000059794045,0.00014213992,0.000031210482],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011169018,0.0007245761,0.00050885644,0.0004912782,0.0002616417,0.0009524236,0.00080650154,0.0010846644,0.0025734762],"category_scores_gemma":[0.0044367993,0.00044146142,0.00034116508,0.00054663094,0.00047857227,0.0019040058,0.00082948286,0.0018053391,0.0007562501],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00016103215,0.00006389163,0.0011872583,0.00014916592,0.000052948733,0.000079387275,0.00010415794,0.69383496,0.0062550274,0.029062206,0.003189019,0.26586097],"study_design_scores_gemma":[0.0000036069005,0.000012357695,0.00009939924,0.0000142001445,0.0000037671484,0.0000078277335,0.000007936177,0.9890265,0.001206509,0.00897654,0.0006379167,0.00000344339],"about_ca_topic_score_codex":0.005424388,"about_ca_topic_score_gemma":0.005888877,"teacher_disagreement_score":0.005424388,"about_ca_system_score_codex":0.0009988905,"about_ca_system_score_gemma":0.0005847901,"threshold_uncertainty_score":0.010785639},"labels":[],"label_agreement":null},{"id":"W2806223921","doi":"","title":"NEC and Tokyo Institute of Technology in TAC KBP 2017: Multichannel Encoding and Stochastic Voting for Event Detection Model.","year":2017,"lang":"en","type":"article","venue":"Theory and applications of categories","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Voting; Event (particle physics); Computer science; Encoding (memory); Artificial intelligence; Political science; Law; Physics","score_opus":0.02043233040435181,"score_gpt":0.28750442671107534,"score_spread":0.2670720963067235,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2806223921","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017976295,0.007822665,0.9068448,0.01902779,0.020814424,0.0003138471,0.003980492,0.0049225967,0.01829707],"genre_scores_gemma":[0.26136652,0.006891438,0.57685435,0.0029743027,0.006828066,0.00069131696,0.020558499,0.0035774817,0.120258085],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.996253,0.0013525123,0.00027405118,0.00087678985,0.00092539925,0.00031817763],"domain_scores_gemma":[0.9925487,0.0021929648,0.00021617935,0.0014918437,0.0028165823,0.0007337124],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005831968,0.0016161074,0.002172235,0.0012246561,0.0010326678,0.0028654253,0.0024243654,0.0020000527,0.01783597],"category_scores_gemma":[0.020223752,0.0008126248,0.0010260292,0.0020671112,0.000881028,0.0062621706,0.003818401,0.004029076,0.0055504353],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013632235,0.00035274954,0.0021971297,0.00045373032,0.0002529801,0.0008350624,0.0006927326,0.052366186,0.006885568,0.17500786,0.40356946,0.3560233],"study_design_scores_gemma":[0.00020562121,0.00019459918,0.0017066622,0.0001537455,0.00018894217,0.0007573582,0.00039322075,0.39848223,0.013423275,0.17451896,0.40974706,0.0002283518],"about_ca_topic_score_codex":0.0076052537,"about_ca_topic_score_gemma":0.009916858,"teacher_disagreement_score":0.01783597,"about_ca_system_score_codex":0.0019436466,"about_ca_system_score_gemma":0.0037308552,"threshold_uncertainty_score":0.05966729},"labels":[],"label_agreement":null},{"id":"W2808417254","doi":"10.24963/ijcai.2018/395","title":"Does Tail Label Help for Large-Scale Multi-Label Learning","year":2018,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":26,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Novelis (Canada)","funders":"Fundamental Research Funds for the Central Universities; National Natural Science Foundation of China","keywords":"Trimming; Computer science; Multi-label classification; Artificial intelligence; Scale (ratio); Machine learning; Learning to rank; Fraction (chemistry); Pattern recognition (psychology); Ranking (information retrieval)","score_opus":0.03686393115797922,"score_gpt":0.30143857486617326,"score_spread":0.26457464370819406,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2808417254","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06298198,0.0010588822,0.9164935,0.0044187005,0.00043739902,0.00020481767,0.0004834638,0.0104609495,0.003460334],"genre_scores_gemma":[0.6224774,0.000560612,0.36687264,0.002116123,0.00048111295,0.00025918454,0.0018874634,0.00096835464,0.0043771006],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99737775,0.0008822563,0.000110430585,0.0008374783,0.0005242245,0.000267818],"domain_scores_gemma":[0.9853855,0.0063017732,0.0007373775,0.0053335354,0.001562023,0.00067978614],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005124908,0.0015648014,0.001777216,0.0008514889,0.0014536378,0.0026327767,0.003533649,0.0033688338,0.0052438714],"category_scores_gemma":[0.024067728,0.000694151,0.0011573622,0.0013588868,0.0017323656,0.008874291,0.003147439,0.0040141386,0.004972439],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017311973,0.0011800501,0.009881847,0.00040133542,0.00018544371,0.00022175876,0.0005384138,0.2116773,0.01012794,0.026756033,0.0428654,0.6944333],"study_design_scores_gemma":[0.00007838062,0.000098964054,0.00044758554,0.00003396541,0.00002962004,0.00005634356,0.0001298098,0.94558436,0.0036313115,0.046482373,0.003401369,0.000025886011],"about_ca_topic_score_codex":0.00482297,"about_ca_topic_score_gemma":0.007432547,"teacher_disagreement_score":0.0052438714,"about_ca_system_score_codex":0.0014639659,"about_ca_system_score_gemma":0.0024203877,"threshold_uncertainty_score":0.027103424},"labels":[],"label_agreement":null},{"id":"W2887261712","doi":"10.1007/978-981-13-2122-1_4","title":"Learning Safe Graph Construction from Multiple Graphs","year":2018,"lang":"en","type":"book-chapter","venue":"Communications in computer and information science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Novelis (Canada)","funders":"","keywords":"Computer science; Graph; Information retrieval; Theoretical computer science","score_opus":0.03168101659383128,"score_gpt":0.2651982043060919,"score_spread":0.23351718771226065,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2887261712","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009482013,0.00029243273,0.9848579,0.00035929985,0.00006326805,0.000071591116,0.00039284365,0.0024345075,0.0020461965],"genre_scores_gemma":[0.1659554,0.0007071159,0.814748,0.00042156302,0.00013797307,0.00025168216,0.006453526,0.00175091,0.0095738685],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99836797,0.00046580334,0.000073878335,0.00058269943,0.00040187742,0.0001077701],"domain_scores_gemma":[0.99305093,0.0038563795,0.00029485763,0.0019094907,0.0006612757,0.00022700957],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014370278,0.0015522268,0.0013547821,0.0023751503,0.0010425017,0.0017844118,0.0033917092,0.0019172681,0.0063683633],"category_scores_gemma":[0.009866901,0.0012291594,0.0020773,0.0019308002,0.0018057335,0.0049956716,0.0045005903,0.0042530783,0.0032722296],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002319022,0.00019368195,0.0019385306,0.0006552303,0.00019250267,0.00032014563,0.0003981853,0.17486621,0.0068917014,0.12298676,0.033410978,0.65791416],"study_design_scores_gemma":[0.000027089804,0.000050274884,0.0002719175,0.00008190241,0.000050897204,0.0001285186,0.0001025763,0.5604442,0.0040771854,0.4268046,0.00794268,0.000018254152],"about_ca_topic_score_codex":0.0025102203,"about_ca_topic_score_gemma":0.0051922714,"teacher_disagreement_score":0.0063683633,"about_ca_system_score_codex":0.001089127,"about_ca_system_score_gemma":0.001609925,"threshold_uncertainty_score":0.02130431},"labels":[],"label_agreement":null},{"id":"W2892021372","doi":"10.1111/exsy.12520","title":"A supervised learning approach for heading detection","year":2020,"lang":"en","type":"preprint","venue":"Expert Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Lakehead University","funders":"","keywords":"Computer science; Classifier (UML); Popularity; Artificial intelligence; Heading (navigation); Supervised learning; Automation; Variety (cybernetics); Field (mathematics); Machine learning; Feature extraction; Data mining; Pattern recognition (psychology); Engineering; Artificial neural network; Mathematics","score_opus":0.07321958308784908,"score_gpt":0.2929786932019226,"score_spread":0.2197591101140735,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2892021372","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.032740224,0.00030586266,0.9615755,0.00027765124,0.00010191673,0.00023450542,0.0003487506,0.0028362037,0.0015793825],"genre_scores_gemma":[0.4442546,0.00020584074,0.5482119,0.00024747397,0.00028820196,0.00041732588,0.0020210943,0.00017568862,0.004177938],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99761885,0.00093907677,0.00019646797,0.0005241565,0.0005856507,0.00013566848],"domain_scores_gemma":[0.9888587,0.006528745,0.0007020873,0.0008114654,0.0028986842,0.00020032913],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0030941807,0.0008417664,0.0011041721,0.0031951563,0.00077207346,0.0011617673,0.0016633731,0.0012692641,0.0023559346],"category_scores_gemma":[0.011118548,0.00034236428,0.0008000447,0.0017141667,0.00056681683,0.0011164518,0.0007156125,0.0017186105,0.0016585902],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00031147132,0.0007142546,0.00713648,0.00021315011,0.0001520559,0.00015262773,0.00015220852,0.1485787,0.0073392955,0.0041497997,0.010788478,0.8203115],"study_design_scores_gemma":[0.000011967156,0.00004178195,0.00049513555,0.000010771258,0.000012501432,0.000029134166,0.000022630715,0.99353963,0.002235268,0.0028255435,0.00076792313,0.00000772872],"about_ca_topic_score_codex":0.0035222585,"about_ca_topic_score_gemma":0.0034051377,"teacher_disagreement_score":0.0035222585,"about_ca_system_score_codex":0.00090299494,"about_ca_system_score_gemma":0.0015227805,"threshold_uncertainty_score":0.0163638},"labels":[],"label_agreement":null},{"id":"W2898491562","doi":"10.1109/icde.2018.00271","title":"Enhancing Binary Classification by Modeling Uncertain Boundary in Three-Way Decisions (Extended Abstract)","year":2018,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"","keywords":"Computer science; Scalability; Class (philosophy); Set (abstract data type); Boundary (topology); Artificial intelligence; Binary classification; Machine learning; Training set; Subject (documents); Information retrieval; Support vector machine; World Wide Web; Database; Mathematics","score_opus":0.0552643509655733,"score_gpt":0.3070639071558011,"score_spread":0.2517995561902278,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2898491562","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.059758052,0.0009951803,0.9278461,0.0018169382,0.00036394288,0.00008617099,0.00027624305,0.00088657177,0.007970821],"genre_scores_gemma":[0.86670923,0.0004526944,0.12338749,0.00055173325,0.00025580334,0.00015589803,0.00037411475,0.00015803443,0.007955053],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9991111,0.00023781724,0.00003697017,0.00027130896,0.00019376325,0.0001490569],"domain_scores_gemma":[0.9967939,0.0020788999,0.00032287338,0.00018647438,0.00047377578,0.00014412771],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019454678,0.00068267726,0.0010779107,0.00062315515,0.0006229586,0.002120754,0.0015105775,0.0017053653,0.006150902],"category_scores_gemma":[0.007725322,0.00039834407,0.00081792386,0.00067579583,0.0012703205,0.0019226092,0.0014235373,0.0022016973,0.0012297789],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004035206,0.000153185,0.0029224567,0.00017056166,0.000052968,0.0003451396,0.00028004285,0.78690183,0.003292398,0.048584696,0.0076231863,0.14926997],"study_design_scores_gemma":[0.0000054786447,0.000016972834,0.00012055846,0.000009167778,0.000005252146,0.000015117489,0.000005983421,0.9877559,0.00047296594,0.011029672,0.00055763114,0.000005298915],"about_ca_topic_score_codex":0.005995929,"about_ca_topic_score_gemma":0.0038374346,"teacher_disagreement_score":0.006150902,"about_ca_system_score_codex":0.0013408784,"about_ca_system_score_gemma":0.00080203085,"threshold_uncertainty_score":0.020576835},"labels":[],"label_agreement":null},{"id":"W2906685695","doi":"10.1007/s10115-018-1278-7","title":"Combining semantic and term frequency similarities for text clustering","year":2019,"lang":"en","type":"article","venue":"Knowledge and Information Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"Fundação de Amparo à Pesquisa do Estado de Minas Gerais; Conselho Nacional de Desenvolvimento Científico e Tecnológico; Natural Sciences and Engineering Research Council of Canada; Coordenação de Aperfeiçoamento de Pessoal de Nível Superior; Fundação de Amparo à Pesquisa do Estado de São Paulo","keywords":"Cluster analysis; Semantic similarity; Computer science; Document clustering; Similarity (geometry); Measure (data warehouse); Information retrieval; Similarity measure; Natural language processing; Term (time); Artificial intelligence; Word (group theory); Data mining; Mathematics","score_opus":0.01570786528100131,"score_gpt":0.24286185679499328,"score_spread":0.22715399151399196,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2906685695","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.123882644,0.0036071506,0.86066514,0.0003190131,0.00040587352,0.00032091964,0.0021774264,0.0033271585,0.0052945637],"genre_scores_gemma":[0.56906706,0.0013717745,0.41879496,0.000112664195,0.0006654824,0.00032991607,0.005411552,0.00042164724,0.0038249388],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9970804,0.0005349146,0.00035498446,0.00052632333,0.0013171491,0.00018626063],"domain_scores_gemma":[0.9957747,0.0017542881,0.00034760684,0.00048206936,0.0015053789,0.00013603213],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00211578,0.00063412817,0.0012625848,0.014377883,0.0011301856,0.0021374961,0.0010457116,0.0012252686,0.0026668238],"category_scores_gemma":[0.009617088,0.00028983626,0.001536634,0.0117167495,0.0005454635,0.003095946,0.0011834403,0.00066196517,0.00218431],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000933483,0.00042562053,0.010976605,0.000657147,0.0006392734,0.0001525617,0.0003585493,0.015423425,0.03027804,0.0074733747,0.0064370353,0.92624485],"study_design_scores_gemma":[0.00021910647,0.00067473133,0.03179697,0.00021953083,0.0012676757,0.0013484521,0.0008799106,0.84382343,0.03290542,0.06828828,0.01831172,0.00026477472],"about_ca_topic_score_codex":0.0032486923,"about_ca_topic_score_gemma":0.0054411558,"teacher_disagreement_score":0.014377883,"about_ca_system_score_codex":0.00065730495,"about_ca_system_score_gemma":0.0013432731,"threshold_uncertainty_score":0.011189461},"labels":[],"label_agreement":null},{"id":"W2914754426","doi":"10.1007/978-3-030-12598-1_44","title":"Opposition-Based Multi-objective Binary Differential Evolution for Multi-label Feature Selection","year":2019,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":18,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ontario Tech University","funders":"","keywords":"Feature selection; Computer science; Artificial intelligence; Differential evolution; Binary number; Preprocessor; Binary classification; Pattern recognition (psychology); Machine learning; Feature (linguistics); Pareto principle; Optimization problem; Mathematical optimization; Algorithm; Support vector machine; Mathematics","score_opus":0.030661377136293477,"score_gpt":0.2787367194164769,"score_spread":0.2480753422801834,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2914754426","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01061148,0.0002488335,0.9866174,0.0000867628,0.000057865644,0.000042397307,0.00002956311,0.0001743388,0.002131398],"genre_scores_gemma":[0.53938836,0.00030284523,0.45157284,0.00024961476,0.000084645035,0.0005097916,0.00026082477,0.00015325993,0.007477817],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99955577,0.00015487622,0.000025461466,0.00007179056,0.00014574021,0.000046368357],"domain_scores_gemma":[0.99908614,0.00061633403,0.000052760864,0.000037245132,0.00017783257,0.000029726087],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001476779,0.0006893681,0.0014318764,0.00076697953,0.00038185756,0.00079687726,0.0015390482,0.0013704371,0.0025028798],"category_scores_gemma":[0.0023438036,0.00042144934,0.0009560739,0.00094461907,0.00055741897,0.00060424936,0.0013560563,0.0012560269,0.00043690065],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015103437,0.00014961997,0.00054421736,0.00016902309,0.000101779864,0.00009636369,0.000115695875,0.74160284,0.007050744,0.012819057,0.0022662557,0.23493333],"study_design_scores_gemma":[0.000004843985,0.000019679379,0.000042915228,0.0000036191275,0.000004697303,0.000009352782,0.0000023732327,0.99874604,0.00025913896,0.0007197289,0.00018495168,0.0000025567158],"about_ca_topic_score_codex":0.0027817609,"about_ca_topic_score_gemma":0.0024015137,"teacher_disagreement_score":0.0027817609,"about_ca_system_score_codex":0.00076514354,"about_ca_system_score_gemma":0.00053455296,"threshold_uncertainty_score":0.008373022},"labels":[],"label_agreement":null},{"id":"W2914990229","doi":"","title":"Proceedings of the fourth workshop on Analytics for noisy unstructured text data","year":2010,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Computer science; Listing (finance); Analytics; Key (lock); Data science; Library science; World Wide Web; Information retrieval","score_opus":0.04627194771488053,"score_gpt":0.28945382929743696,"score_spread":0.24318188158255644,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2914990229","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015727993,0.03915793,0.82267064,0.047966186,0.0265269,0.0012886022,0.012924361,0.009514093,0.024223287],"genre_scores_gemma":[0.084471054,0.029339474,0.67468697,0.010049239,0.014004116,0.0017363005,0.062383227,0.0055143745,0.117815256],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9896492,0.003800069,0.0009080088,0.0015841399,0.0035667922,0.00049175747],"domain_scores_gemma":[0.9720282,0.013822685,0.000855536,0.0048563923,0.006386313,0.0020509183],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01648703,0.0017740314,0.0028695082,0.0040312964,0.0012947601,0.011675004,0.0033912172,0.002408459,0.019002207],"category_scores_gemma":[0.03337491,0.0012219499,0.0022917828,0.0044817613,0.0020622704,0.0094694635,0.0041685514,0.0057160067,0.010510617],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004684456,0.0002912295,0.0020837095,0.0008059537,0.0003309164,0.0005421496,0.0010757037,0.0050641317,0.0036970722,0.0096201645,0.6282569,0.3477636],"study_design_scores_gemma":[0.000119427015,0.00024222527,0.006888452,0.0010822716,0.00020059131,0.0010618671,0.0019406308,0.05323349,0.006874395,0.07139579,0.85672444,0.00023638723],"about_ca_topic_score_codex":0.0042526964,"about_ca_topic_score_gemma":0.0063088317,"teacher_disagreement_score":0.019002207,"about_ca_system_score_codex":0.0016447697,"about_ca_system_score_gemma":0.0034777927,"threshold_uncertainty_score":0.087192774},"labels":[],"label_agreement":null},{"id":"W2918429485","doi":"","title":"A Best Match KNN-based Approach for Large-scale Product Categorization.","year":2018,"lang":"en","type":"article","venue":"International ACM SIGIR Conference on Research and Development in Information Retrieval","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Trent University; York University","funders":"","keywords":"Categorization; Computer science; Scale (ratio); Product (mathematics); Artificial intelligence; Data mining; Pattern recognition (psychology); Mathematics; Cartography; Geography","score_opus":0.09819718700532777,"score_gpt":0.35379098916930884,"score_spread":0.2555938021639811,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2918429485","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.048744116,0.005751807,0.90658545,0.0010267536,0.00096996874,0.001745456,0.007196938,0.014738317,0.013241159],"genre_scores_gemma":[0.22569254,0.0007192221,0.74273074,0.0007827271,0.00030449906,0.0005813919,0.013881759,0.0005544599,0.0147527],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9958288,0.0006380704,0.00040429065,0.0012731589,0.001453079,0.00040260045],"domain_scores_gemma":[0.9973404,0.0007613832,0.00017811552,0.00052515825,0.001013276,0.00018166735],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0028842937,0.0019218725,0.002536625,0.008502367,0.0021719527,0.0026472267,0.005112526,0.0037881648,0.00950366],"category_scores_gemma":[0.0075694206,0.0007619867,0.0023445182,0.008130332,0.00084193726,0.003727709,0.0028413879,0.0020545197,0.008303275],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00088940776,0.0010923538,0.005861633,0.00046970113,0.0006429152,0.00031441302,0.00019192831,0.02693512,0.007303566,0.0038737948,0.058068175,0.8943569],"study_design_scores_gemma":[0.0001259539,0.00030293272,0.004248111,0.00011268424,0.0003103124,0.0004999885,0.00057331263,0.9394288,0.0055147107,0.029966386,0.0188444,0.00007234551],"about_ca_topic_score_codex":0.018274348,"about_ca_topic_score_gemma":0.034314822,"teacher_disagreement_score":0.018274348,"about_ca_system_score_codex":0.0015886736,"about_ca_system_score_gemma":0.002714912,"threshold_uncertainty_score":0.036335945},"labels":[],"label_agreement":null},{"id":"W2922481072","doi":"10.48550/arxiv.1903.08351","title":"Distributed Maximization of Submodular plus Diversity Functions for Multi-label Feature Selection on Huge Datasets","year":2019,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Submodular set function; Feature selection; Redundancy (engineering); Computer science; Automatic summarization; Feature (linguistics); Greedy algorithm; Maximization; Function (biology); Data mining; Mathematical optimization; Optimization problem; Minimum redundancy feature selection; Selection (genetic algorithm); Artificial intelligence; Machine learning; Algorithm; Mathematics","score_opus":0.12415862055537509,"score_gpt":0.22536086640708697,"score_spread":0.10120224585171188,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2922481072","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012506561,0.00031684974,0.98544645,0.00046376244,0.000024965313,0.000055028842,0.000091212794,0.00037467387,0.0007205802],"genre_scores_gemma":[0.5424305,0.00045113047,0.45063892,0.0005648852,0.00031268358,0.00057645893,0.0008818695,0.00023140374,0.0039121252],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.998002,0.0010149233,0.00005502981,0.0003823529,0.0003726471,0.00017300474],"domain_scores_gemma":[0.99380493,0.004638604,0.00038618094,0.0004529038,0.0005379099,0.00017948466],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004344011,0.0013153659,0.0024643466,0.0009324752,0.0008619135,0.0012401238,0.0018774475,0.0016935604,0.0020324984],"category_scores_gemma":[0.008792123,0.00054707815,0.0009189309,0.0020711392,0.0011719269,0.002301404,0.0016019805,0.0018092273,0.00065398915],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025256412,0.00021620245,0.0008439865,0.00015415806,0.000091132715,0.00011831618,0.00009107486,0.8477446,0.0028804513,0.012648749,0.005902754,0.12905605],"study_design_scores_gemma":[0.000025505009,0.000030896903,0.00013569598,0.00000383689,0.000005465248,0.000017619052,0.000011369804,0.98678595,0.00040458117,0.012301473,0.00027270152,0.0000049108935],"about_ca_topic_score_codex":0.002183266,"about_ca_topic_score_gemma":0.0028879698,"teacher_disagreement_score":0.004344011,"about_ca_system_score_codex":0.0017243105,"about_ca_system_score_gemma":0.0013283968,"threshold_uncertainty_score":0.022973657},"labels":[],"label_agreement":null},{"id":"W2938956725","doi":"10.1016/j.eswa.2019.04.020","title":"Empirical evaluation of feature projection algorithms for multi-view text classification","year":2019,"lang":"en","type":"article","venue":"Expert Systems with Applications","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":18,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Feature (linguistics); Projection (relational algebra); Artificial intelligence; Pattern recognition (psychology); Algorithm","score_opus":0.13574058111207438,"score_gpt":0.39200477001377315,"score_spread":0.2562641889016988,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2938956725","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.30614197,0.005924289,0.6796139,0.0005531218,0.0003540104,0.0004865506,0.00086570176,0.0021969136,0.0038636243],"genre_scores_gemma":[0.7001795,0.00063597725,0.29535443,0.00007007726,0.0001260216,0.00025789265,0.002369666,0.00014989659,0.00085643446],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.98894286,0.005380802,0.00076617143,0.0013492084,0.0031529146,0.000408092],"domain_scores_gemma":[0.95742255,0.033013023,0.001414418,0.002843234,0.0045671863,0.00073956884],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.016324753,0.0014634012,0.0016401442,0.004698036,0.0007339641,0.0024041154,0.0016083646,0.0019850007,0.0015817712],"category_scores_gemma":[0.050016906,0.00031946693,0.0014656285,0.0031317405,0.0008275467,0.0036318034,0.0018127399,0.0021856274,0.0008206724],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013927938,0.0007706114,0.019120902,0.00068651856,0.00080032315,0.000118979304,0.00032383826,0.14171933,0.0043102796,0.0037080664,0.0041655283,0.8228829],"study_design_scores_gemma":[0.000044876164,0.0007047926,0.0076036486,0.00005490655,0.00009795547,0.00017573398,0.00021219185,0.98292935,0.0046808347,0.0026934599,0.0007615023,0.00004085791],"about_ca_topic_score_codex":0.0018821536,"about_ca_topic_score_gemma":0.0011756422,"teacher_disagreement_score":0.016324753,"about_ca_system_score_codex":0.0012517321,"about_ca_system_score_gemma":0.0009518738,"threshold_uncertainty_score":0.086334586},"labels":[],"label_agreement":null},{"id":"W2941695365","doi":"10.48550/arxiv.1904.10403","title":"Optimizing Search API Queries for Twitter Topic Classifiers Using a Maximum Set Coverage Approach","year":2019,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Classifier (UML); Information retrieval; Set (abstract data type); Precision and recall; Data mining; Training set; Machine learning; Artificial intelligence","score_opus":0.2023589357258472,"score_gpt":0.2432152504124623,"score_spread":0.0408563146866151,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2941695365","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10458783,0.0023484814,0.8830528,0.0013141789,0.000072693234,0.0004772372,0.0011493949,0.004145332,0.0028519798],"genre_scores_gemma":[0.664034,0.0007238157,0.3250329,0.00065546384,0.00046093483,0.00088752457,0.0036934458,0.0006957386,0.0038161597],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9967817,0.0010676159,0.00029892995,0.00066993124,0.0008449484,0.00033678274],"domain_scores_gemma":[0.9911265,0.00674269,0.0005135478,0.0006213846,0.00079664565,0.00019919637],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0042089135,0.002017071,0.0033418473,0.0030858724,0.0010379045,0.0025137914,0.0025512753,0.0023130092,0.0023312664],"category_scores_gemma":[0.016548807,0.0008017229,0.0018221585,0.003374843,0.0009890514,0.0036240472,0.0020950583,0.0018198184,0.0010403258],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001394598,0.0009421638,0.010678569,0.00069937325,0.0003012606,0.00038199595,0.0008447371,0.4070549,0.016052853,0.008797629,0.018170826,0.53468114],"study_design_scores_gemma":[0.0000326678,0.00010285366,0.00063035224,0.0000128471165,0.00003413381,0.000062688654,0.00011761837,0.9905794,0.0022000205,0.005263858,0.0009506859,0.000012862207],"about_ca_topic_score_codex":0.006529189,"about_ca_topic_score_gemma":0.007223125,"teacher_disagreement_score":0.006529189,"about_ca_system_score_codex":0.0021945492,"about_ca_system_score_gemma":0.001928587,"threshold_uncertainty_score":0.022259116},"labels":[],"label_agreement":null},{"id":"W2942010367","doi":"","title":"تطوير خوارزمية جينية لتحديد الخصائص الهامة من صور الرنين المغناطيسي للدماغ للحصول على مصنف أسرع وأدق","year":2019,"lang":"ar","type":"article","venue":"DOAJ (DOAJ: Directory of Open Access Journals)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Artificial intelligence; Pattern recognition (psychology); Computer science; Feature selection; Preprocessor; Feature (linguistics); Gaussian filter; Image (mathematics)","score_opus":0.28700696101328854,"score_gpt":0.5599785983457948,"score_spread":0.27297163733250623,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2942010367","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020216208,0.0051198564,0.018097952,0.014398937,0.0042823777,0.00037921802,0.0008436476,0.0010036167,0.9356581],"genre_scores_gemma":[0.12988804,0.011617181,0.028822403,0.0050823847,0.0012323647,0.0009349104,0.0016015954,0.0023054548,0.8185156],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9958788,0.0006625156,0.000307332,0.00050502777,0.0021195102,0.0005267763],"domain_scores_gemma":[0.9946672,0.0009521645,0.0005015925,0.0005237812,0.0026710865,0.000684223],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002555387,0.0011057626,0.0005829561,0.0017466705,0.0039069084,0.010757583,0.0011827874,0.00263582,0.2163448],"category_scores_gemma":[0.008632246,0.0008070462,0.00076426356,0.0021844048,0.004629617,0.005180214,0.0039472776,0.005025666,0.18466146],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010107732,0.0004562806,0.0049398574,0.002811743,0.00009933382,0.0024495544,0.01994305,0.0009258095,0.03527111,0.2761261,0.26636583,0.38960055],"study_design_scores_gemma":[0.000024386494,0.00007892955,0.004357648,0.00057198055,0.000022260383,0.00062642747,0.009011619,0.00019630197,0.007035058,0.014640998,0.96336114,0.00007320816],"about_ca_topic_score_codex":0.005735286,"about_ca_topic_score_gemma":0.0062008398,"teacher_disagreement_score":0.2163448,"about_ca_system_score_codex":0.0037004189,"about_ca_system_score_gemma":0.00918183,"threshold_uncertainty_score":0.72374547},"labels":[],"label_agreement":null},{"id":"W2943818116","doi":"10.5539/mas.v13n5p88","title":"Arabic Text Classification: A Review","year":2019,"lang":"en","type":"review","venue":"Modern Applied Science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":28,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Arabic; Weighting; Artificial intelligence; Classifier (UML); Decision tree; Natural language processing; Naive Bayes classifier; Support vector machine; Set (abstract data type); Data mining; Information retrieval; Machine learning; Linguistics","score_opus":0.126081744370099,"score_gpt":0.36112822664570676,"score_spread":0.23504648227560776,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2943818116","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0015894945,0.9751058,0.0065383045,0.0033236484,0.0017539654,0.00010581856,0.0005355269,0.00025414757,0.010793307],"genre_scores_gemma":[0.009669708,0.97096485,0.008230756,0.0010904575,0.002586032,0.00010395504,0.0012873162,0.00006329266,0.0060036834],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9991779,0.00010519697,0.00015444854,0.00016044141,0.00035856088,0.000043414446],"domain_scores_gemma":[0.99522144,0.0024606688,0.0003445951,0.00012428373,0.0017313925,0.00011754709],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001426114,0.00095568324,0.0011262133,0.009377225,0.000739789,0.0025643676,0.0016689141,0.0010599646,0.0074619143],"category_scores_gemma":[0.0057556718,0.00036462117,0.00081524014,0.008854106,0.00080866285,0.00460763,0.0006940776,0.0010896024,0.0060397596],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00003341746,0.000041597144,0.00055143406,0.0048098727,0.00003213989,0.00006754653,0.00007119864,0.00020162495,0.00038206542,0.0012829594,0.04130991,0.9512163],"study_design_scores_gemma":[0.0000131705,0.00009912159,0.004391262,0.00550977,0.00014296013,0.0014170929,0.00036398397,0.0016540026,0.0017541795,0.0037790837,0.9808235,0.00005189379],"about_ca_topic_score_codex":0.0027907342,"about_ca_topic_score_gemma":0.0026279395,"teacher_disagreement_score":0.009377225,"about_ca_system_score_codex":0.00088054454,"about_ca_system_score_gemma":0.0014792772,"threshold_uncertainty_score":0.024962544},"labels":[],"label_agreement":null},{"id":"W2950347869","doi":"10.17863/cam.32314","title":"The 3rd Joint Symposium of the International and National Neurotrauma Societies and AANS/CNS Section on Neurotrauma and Critical Care August 11–16, 2018 Toronto, Canada","year":2018,"lang":"en","type":"article","venue":"Apollo (University of Cambridge)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Cluster analysis; Class (philosophy); Trajectory; Artificial intelligence; Computer science; Latent class model; Biomarker; Machine learning; Biology","score_opus":0.020113545867294417,"score_gpt":0.22458285838546932,"score_spread":0.2044693125181749,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2950347869","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008235445,0.2055456,0.008823235,0.13280691,0.28450358,0.0007573539,0.0078994855,0.0014381998,0.34999028],"genre_scores_gemma":[0.032384314,0.15256394,0.0066119805,0.007933688,0.03459444,0.00034717342,0.0053826068,0.0006990873,0.7594828],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99875677,0.00015365651,0.00010955906,0.00017311213,0.000505408,0.00030146146],"domain_scores_gemma":[0.99457234,0.00022750834,0.0001356575,0.00013027577,0.0030919996,0.0018422166],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0021235773,0.0015263938,0.0009910861,0.001505648,0.002030014,0.0032591857,0.0014631789,0.0025445132,0.1509228],"category_scores_gemma":[0.0032803332,0.0004899951,0.0006567793,0.00081665325,0.0013225757,0.0009057304,0.0023895,0.0028555184,0.04924661],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001284696,0.00003869272,0.0014192956,0.00032372898,0.000023191857,0.00024897288,0.00011894442,0.00015890165,0.00047857253,0.00087151746,0.894563,0.10162675],"study_design_scores_gemma":[0.000014877234,0.000035182977,0.003360484,0.0007556075,0.000016599652,0.0003998935,0.00019135523,0.00012397087,0.00018928465,0.00043741096,0.9944569,0.000018486364],"about_ca_topic_score_codex":0.24481884,"about_ca_topic_score_gemma":0.4809043,"teacher_disagreement_score":0.7551812,"about_ca_system_score_codex":0.007999838,"about_ca_system_score_gemma":0.024588343,"threshold_uncertainty_score":0.5048871},"labels":[],"label_agreement":null},{"id":"W2958588221","doi":"","title":"Specifying Distinct Groups in Multivariate Data using Machine Learning","year":2019,"lang":"en","type":"article","venue":"MacEwan University Student Research Proceedings","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"MacEwan University","funders":"","keywords":"Multivariate statistics; Computer science; Artificial intelligence; Machine learning","score_opus":0.21457271135770284,"score_gpt":0.3929637549346773,"score_spread":0.17839104357697444,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2958588221","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014873055,0.000058492977,0.98257565,0.00040848003,0.000027620194,0.00010100542,0.0005012081,0.000887989,0.00056645053],"genre_scores_gemma":[0.15039286,0.00008423817,0.84558856,0.0002728359,0.000064462976,0.00041442408,0.002077782,0.00027444397,0.00083037675],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99043405,0.0039786957,0.0011835783,0.0021913832,0.0017165402,0.0004958786],"domain_scores_gemma":[0.96307015,0.026285686,0.0019721207,0.0062042456,0.0017684721,0.0006992302],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0074890438,0.0010947775,0.0013283816,0.0021488797,0.0014258682,0.00394465,0.0023296436,0.0023996204,0.0041697235],"category_scores_gemma":[0.031995926,0.0009256997,0.0025516138,0.0020765578,0.002234119,0.0073285797,0.0036885976,0.004598037,0.0010550523],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015151971,0.0007063225,0.023072656,0.000789954,0.00020291934,0.001194364,0.0030095084,0.08336266,0.013809299,0.41617316,0.012949874,0.44321412],"study_design_scores_gemma":[0.00013662109,0.00013890193,0.0012353776,0.00012160849,0.00006340276,0.00030986723,0.0006215649,0.43733662,0.0072145853,0.5419378,0.010818786,0.00006491517],"about_ca_topic_score_codex":0.0017041537,"about_ca_topic_score_gemma":0.0027798212,"teacher_disagreement_score":0.0074890438,"about_ca_system_score_codex":0.001305741,"about_ca_system_score_gemma":0.0021028665,"threshold_uncertainty_score":0.039606333},"labels":[],"label_agreement":null},{"id":"W2962851649","doi":"","title":"Distributed Maximization of \"Submodular plus Diversity\" Functions for Multi-label Feature Selection on Huge Datasets","year":2019,"lang":"en","type":"article","venue":"International Conference on Artificial Intelligence and Statistics","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Submodular set function; Feature selection; Computer science; Redundancy (engineering); Automatic summarization; Feature (linguistics); Greedy algorithm; Maximization; Optimization problem; Mathematical optimization; Data mining; Function (biology); Artificial intelligence; Machine learning; Algorithm; Mathematics","score_opus":0.14797393125353175,"score_gpt":0.3478739285134115,"score_spread":0.19989999725987972,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2962851649","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013374245,0.00025960655,0.98478717,0.00040957416,0.000024033976,0.00005362656,0.00007094493,0.00030285012,0.000718007],"genre_scores_gemma":[0.57053417,0.00034698014,0.42361504,0.0005126413,0.00027359556,0.00049922365,0.0006399414,0.00017405525,0.003404437],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9982639,0.0008531419,0.000046375517,0.00033925188,0.00033094906,0.00016633548],"domain_scores_gemma":[0.9949517,0.0037037686,0.00035483245,0.00035050994,0.00047211137,0.00016709276],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0038143147,0.001215982,0.00217921,0.00077403703,0.000797946,0.0011259865,0.0018355893,0.0017084675,0.0019618324],"category_scores_gemma":[0.00704412,0.0005119257,0.0008652164,0.0016921198,0.0011425877,0.0020372372,0.0015098009,0.0016102361,0.00052633457],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00023891547,0.00019807884,0.0007658927,0.00013699783,0.00008433851,0.000110789646,0.00008399056,0.8548027,0.0031376812,0.010679232,0.005122012,0.124639355],"study_design_scores_gemma":[0.000024925139,0.000036253205,0.00013332313,0.000003569556,0.000005464669,0.000017941453,0.000010706886,0.990409,0.00042171852,0.008691688,0.000240697,0.0000047380613],"about_ca_topic_score_codex":0.0018963838,"about_ca_topic_score_gemma":0.0028123201,"teacher_disagreement_score":0.0038143147,"about_ca_system_score_codex":0.0015613389,"about_ca_system_score_gemma":0.0013417387,"threshold_uncertainty_score":0.020172238},"labels":[],"label_agreement":null},{"id":"W2963381796","doi":"","title":"Text Categorization via Similarity Search - An Efficient and Effective Novel Algorithm.","year":2013,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Computer science; Similarity (geometry); Artificial intelligence; Centroid; Cluster analysis; Preprocessor; Outlier; Metric (unit); Categorization; Text categorization; Point (geometry); Class (philosophy); Similarity measure; Pattern recognition (psychology); Algorithm; Mathematics; Image (mathematics)","score_opus":0.013069408635282848,"score_gpt":0.24933238222463994,"score_spread":0.23626297358935708,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2963381796","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009021591,0.0015457101,0.98085666,0.00043222145,0.00024463612,0.0004397533,0.00053287874,0.0042761536,0.0026504148],"genre_scores_gemma":[0.060158834,0.0004734429,0.9304464,0.00023322564,0.0001797242,0.00039857646,0.0023648872,0.00017205361,0.0055727754],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9977671,0.00038755292,0.00020292847,0.0005165889,0.0010178727,0.00010792487],"domain_scores_gemma":[0.9987207,0.00037178255,0.00012899899,0.0002816681,0.0004372186,0.00005954551],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001154257,0.0010052746,0.0016060859,0.005112691,0.0009622465,0.0016659398,0.0020941931,0.0016611749,0.0037039293],"category_scores_gemma":[0.0042116465,0.00041004684,0.0010063334,0.0057421555,0.00068470684,0.003933484,0.0017969846,0.0012549732,0.005335423],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015106739,0.0002963168,0.00117113,0.00021837532,0.00010440378,0.00010200676,0.00011064633,0.0072918087,0.012068863,0.0072196894,0.019506264,0.95175946],"study_design_scores_gemma":[0.00021960202,0.00037684522,0.0027604077,0.00009331626,0.000114834605,0.0016790065,0.00034878956,0.84609336,0.026020741,0.06087798,0.061329473,0.00008564097],"about_ca_topic_score_codex":0.0021222087,"about_ca_topic_score_gemma":0.0030906629,"teacher_disagreement_score":0.005112691,"about_ca_system_score_codex":0.000782432,"about_ca_system_score_gemma":0.0016527089,"threshold_uncertainty_score":0.012390852},"labels":[],"label_agreement":null},{"id":"W2967878674","doi":"10.1109/cec.2019.8790287","title":"A Novel Multi-objective Binary Differential Evolution Algorithm for Multi-label Feature Selection","year":2019,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":18,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ontario Tech University","funders":"","keywords":"Feature selection; Computer science; Differential evolution; Artificial intelligence; Multi-label classification; Pattern recognition (psychology); Binary number; Evolutionary algorithm; Feature (linguistics); Machine learning; Binary classification; Data mining; Algorithm; Support vector machine; Mathematics","score_opus":0.030288772619659343,"score_gpt":0.2836045411106485,"score_spread":0.25331576849098913,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2967878674","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012680204,0.0002930339,0.9848066,0.00012705775,0.00004725162,0.00005399506,0.000031003503,0.00021398558,0.0017468643],"genre_scores_gemma":[0.4302527,0.00034538703,0.5628436,0.0003093901,0.00005522051,0.00053408387,0.0003050193,0.00011327779,0.0052413475],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99958354,0.00010917614,0.000025547184,0.000065646054,0.00017542498,0.000040732233],"domain_scores_gemma":[0.9996131,0.00018634558,0.000041838823,0.000022887336,0.00011619158,0.000019717776],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00077800924,0.00069498003,0.00101958,0.0007987474,0.0003646575,0.0007503011,0.0012229518,0.0009771409,0.0015907207],"category_scores_gemma":[0.0015207902,0.00031608532,0.0008076764,0.0008571237,0.00036160316,0.0006401437,0.0008394371,0.00088406156,0.0002444728],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000105156265,0.000115487375,0.0015537183,0.00014852126,0.00011669279,0.00015944234,0.00017367091,0.6440605,0.013525149,0.01031685,0.0029085586,0.32681623],"study_design_scores_gemma":[0.000013384951,0.000034016073,0.00014326438,0.000006073891,0.000007410527,0.000027320408,0.0000058088067,0.99708205,0.0006903344,0.0010134692,0.0009719701,0.000004899162],"about_ca_topic_score_codex":0.0027127208,"about_ca_topic_score_gemma":0.002118271,"teacher_disagreement_score":0.0027127208,"about_ca_system_score_codex":0.0005975048,"about_ca_system_score_gemma":0.0007000123,"threshold_uncertainty_score":0.0053938627},"labels":[],"label_agreement":null},{"id":"W2969546362","doi":"10.1177/0894439319869210","title":"Automatic Classification of Open-Ended Questions: Check-All-That-Apply Questions","year":2019,"lang":"en","type":"article","venue":"Social Science Computer Review","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":22,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University; University of Waterloo","funders":"","keywords":"Computer science; Bivariate analysis; Code (set theory); Classifier (UML); Artificial intelligence; Natural language processing; Open data; Relevance (law); Information retrieval; Machine learning; Set (abstract data type); World Wide Web","score_opus":0.07185242578354825,"score_gpt":0.36881044594546614,"score_spread":0.29695802016191786,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2969546362","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.4548325,0.00097632833,0.46439818,0.0017986777,0.0011426932,0.007841569,0.014482301,0.037951782,0.016575953],"genre_scores_gemma":[0.54577196,0.00018119413,0.41101333,0.0009730368,0.00028318688,0.006373592,0.023538679,0.001218065,0.010646979],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9807648,0.010763008,0.0013125301,0.0029377278,0.003377155,0.0008447792],"domain_scores_gemma":[0.8996104,0.07050169,0.0066951746,0.008708668,0.012671146,0.0018128814],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014404874,0.0014699153,0.0013780685,0.0037637022,0.0010336963,0.0017083308,0.0025181642,0.002740496,0.008999622],"category_scores_gemma":[0.07551589,0.0004353547,0.001018257,0.0020915172,0.0008921368,0.0026115086,0.0038569332,0.0024518045,0.007953134],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0027840773,0.0026716145,0.060153812,0.0019496912,0.00016161118,0.0002870409,0.004290761,0.006507992,0.021297608,0.0052322764,0.058279876,0.8363835],"study_design_scores_gemma":[0.0009323637,0.0018445201,0.15821129,0.00097077,0.00016290878,0.00085186335,0.0075351708,0.5871253,0.10045341,0.038296998,0.10316898,0.00044640686],"about_ca_topic_score_codex":0.0019434227,"about_ca_topic_score_gemma":0.0028966472,"teacher_disagreement_score":0.014404874,"about_ca_system_score_codex":0.0011863383,"about_ca_system_score_gemma":0.0016842585,"threshold_uncertainty_score":0.07618117},"labels":[],"label_agreement":null},{"id":"W2971394479","doi":"10.1109/codit.2019.8820298","title":"An Improved K-medoids Algorithm Based on Binary Sequences Similarity Measures","year":2019,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"Agence Nationale de la Recherche","keywords":"Cluster analysis; Computer science; Medoid; Similarity (geometry); Binary number; Euclidean distance; Data mining; k-medoids; Binary data; Algorithm; Fuzzy clustering; CURE data clustering algorithm; Artificial intelligence; Mathematics","score_opus":0.018019523491294175,"score_gpt":0.26179368937266595,"score_spread":0.24377416588137177,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2971394479","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0042828806,0.0004125761,0.99380845,0.0001108743,0.00008534918,0.000056942936,0.00006682589,0.00027528597,0.000900758],"genre_scores_gemma":[0.12488199,0.00064995256,0.8701501,0.0001664161,0.00011821585,0.0002410226,0.0004962447,0.00014635205,0.003149697],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99766916,0.00063618773,0.00021470877,0.000591421,0.0007696602,0.000118992015],"domain_scores_gemma":[0.9984653,0.0005301878,0.00014713917,0.00014971007,0.00063789997,0.000069905676],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0017544935,0.0011651136,0.0022809806,0.002429611,0.0010239615,0.0016506049,0.002517302,0.0018570618,0.00245804],"category_scores_gemma":[0.0051300917,0.0006530779,0.0018813906,0.0029492767,0.0008611021,0.002345693,0.001622064,0.00163891,0.0019037186],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005304398,0.00012851703,0.0017956153,0.00047743792,0.00024100416,0.00013899582,0.0005316601,0.42152584,0.013300765,0.022988902,0.006871986,0.5314688],"study_design_scores_gemma":[0.000041752526,0.00010356402,0.00041809646,0.000036501307,0.00003559501,0.00015276067,0.00008980893,0.98018813,0.0036617762,0.009295193,0.0059188376,0.000058081136],"about_ca_topic_score_codex":0.007868059,"about_ca_topic_score_gemma":0.0044438145,"teacher_disagreement_score":0.007868059,"about_ca_system_score_codex":0.0009576739,"about_ca_system_score_gemma":0.0016156429,"threshold_uncertainty_score":0.01564449},"labels":[],"label_agreement":null},{"id":"W2979091142","doi":"10.5539/mas.v13n11p31","title":"Application of Naïve Bayes, Decision Tree, and K-Nearest Neighbors for Automated Text Classification","year":2019,"lang":"en","type":"article","venue":"Modern Applied Science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":27,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Naive Bayes classifier; Decision tree; k-nearest neighbors algorithm; Artificial intelligence; Precision and recall; Data mining; Tree (set theory); Process (computing); Arabic; Bayes' theorem; Machine learning; The Internet; Translation (biology); Pattern recognition (psychology); Bayesian probability; Mathematics; Support vector machine; World Wide Web","score_opus":0.012841370283785819,"score_gpt":0.26464840268583656,"score_spread":0.2518070324020507,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2979091142","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.20747922,0.013002485,0.75578463,0.0018245352,0.0014814471,0.0011725288,0.0029041574,0.004196327,0.01215464],"genre_scores_gemma":[0.50891536,0.0020235898,0.48189086,0.00027435413,0.0003671884,0.00039936838,0.002538235,0.000094837545,0.003496186],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99218315,0.0022949255,0.0011186879,0.0012517703,0.0028167833,0.00033464993],"domain_scores_gemma":[0.9918207,0.0041959854,0.0005923699,0.00041465054,0.0027500093,0.00022635135],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005361391,0.0013698492,0.0018460231,0.008593534,0.001432429,0.0019385832,0.0013748215,0.0012178168,0.001649656],"category_scores_gemma":[0.013326816,0.00036375842,0.0012056121,0.0043954984,0.0004975968,0.0026525827,0.0006058095,0.0008904252,0.0010642096],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005047006,0.0005561052,0.017684245,0.000611816,0.00040815579,0.00022481754,0.00028716263,0.03871,0.0024864015,0.004024577,0.0100151645,0.9244869],"study_design_scores_gemma":[0.00008943775,0.00024390033,0.006524532,0.00018427479,0.00021072355,0.00036449268,0.00044031162,0.9667809,0.005709525,0.011365596,0.0079959985,0.000090314505],"about_ca_topic_score_codex":0.017700514,"about_ca_topic_score_gemma":0.0151667455,"teacher_disagreement_score":0.017700514,"about_ca_system_score_codex":0.0014597289,"about_ca_system_score_gemma":0.0023985615,"threshold_uncertainty_score":0.035194993},"labels":[],"label_agreement":null},{"id":"W2980905101","doi":"10.1016/j.knosys.2019.105066","title":"Granular structure-based incremental updating for multi-label classification","year":2019,"lang":"en","type":"article","venue":"Knowledge-Based Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":23,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"National Key Research and Development Program of China; Ministry of Public Security of the People's Republic of China; National Natural Science Foundation of China","keywords":"Computer science; Artificial intelligence; Feature (linguistics); Machine learning; Computation; Mechanism (biology); Data mining; Granular computing; Ensemble learning; Incremental learning; Pattern recognition (psychology); Algorithm; Rough set","score_opus":0.059306806226372834,"score_gpt":0.3079401080915744,"score_spread":0.24863330186520158,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2980905101","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04949847,0.00090242253,0.9376604,0.0004747319,0.00037146683,0.0002909259,0.0007604604,0.0074927122,0.0025485368],"genre_scores_gemma":[0.45393604,0.00042641762,0.5378481,0.00031403097,0.0002446863,0.00023559711,0.0021896325,0.0004937007,0.00431176],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9977501,0.0003100159,0.00026785972,0.0005753782,0.000883138,0.00021349796],"domain_scores_gemma":[0.99120843,0.0033524756,0.0006595416,0.002439849,0.0020454992,0.0002941952],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0023957426,0.00081649335,0.001994127,0.003856602,0.001469093,0.002945415,0.0038634497,0.0017539674,0.0043096514],"category_scores_gemma":[0.013222803,0.00083212304,0.0009220313,0.004288939,0.00089279504,0.0046202503,0.0025804243,0.002329463,0.0016567287],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00041240753,0.00037866845,0.002334074,0.00017033842,0.000092719034,0.00014151183,0.00027329588,0.03638876,0.008437069,0.0062652356,0.008705758,0.9364002],"study_design_scores_gemma":[0.00006018432,0.00008991167,0.0012286245,0.000046437966,0.00009922953,0.00013470414,0.000091356844,0.9654408,0.007855099,0.020896161,0.0040215035,0.000035982557],"about_ca_topic_score_codex":0.012923843,"about_ca_topic_score_gemma":0.0189932,"teacher_disagreement_score":0.012923843,"about_ca_system_score_codex":0.0013285151,"about_ca_system_score_gemma":0.002106982,"threshold_uncertainty_score":0.025697231},"labels":[],"label_agreement":null},{"id":"W2994962128","doi":"10.1007/978-981-15-1922-2_26","title":"Hybrid Machine Learning Models of Classifying Residential Requests for Smart Dispatching","year":2019,"lang":"en","type":"book-chapter","venue":"Communications in computer and information science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Computer science; Artificial intelligence; Machine learning; Naive Bayes classifier; Classifier (UML); Perceptron; Word embedding; Cluster analysis; Convolutional neural network; Benchmarking; Artificial neural network; Multilayer perceptron; Embedding; Support vector machine","score_opus":0.0672727803263816,"score_gpt":0.29967899170562595,"score_spread":0.23240621137924433,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2994962128","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.41010937,0.0031529341,0.5668667,0.0022336722,0.0007146081,0.00014708588,0.0016213501,0.0020106733,0.013143606],"genre_scores_gemma":[0.9135001,0.0006765356,0.061978333,0.0002423741,0.00028736287,0.00014703185,0.0013453977,0.00009097415,0.021731995],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9997067,0.00009873051,0.000022089733,0.00007073408,0.000056834368,0.000044963846],"domain_scores_gemma":[0.9980599,0.0014646532,0.00008190015,0.000072963216,0.0002905795,0.000030034826],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012621358,0.00066999346,0.0007993947,0.0009245939,0.00039531128,0.0014673588,0.0013750087,0.0011344835,0.0032163179],"category_scores_gemma":[0.0026750814,0.00036401284,0.00073987077,0.0011548833,0.00027809988,0.0012086418,0.00031328207,0.0012408993,0.001092048],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020248753,0.00021445009,0.0028168175,0.000052421463,0.00007713006,0.000051504558,0.00005121767,0.8702838,0.00090589764,0.0037981118,0.0040331003,0.11751311],"study_design_scores_gemma":[0.0000014642286,0.0000060496486,0.000156494,0.0000017878601,0.00000393956,0.0000028816387,0.0000037991483,0.9989728,0.00009587667,0.0006770874,0.00007589562,0.000001857705],"about_ca_topic_score_codex":0.021754857,"about_ca_topic_score_gemma":0.018912144,"teacher_disagreement_score":0.021754857,"about_ca_system_score_codex":0.0012973574,"about_ca_system_score_gemma":0.000786116,"threshold_uncertainty_score":0.04325646},"labels":[],"label_agreement":null},{"id":"W2997205428","doi":"10.1609/aaai.v34i04.5822","title":"Nonlinear Mixup: Out-Of-Manifold Data Augmentation for Text Classification","year":2020,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":81,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"National Research Council Canada","funders":"","keywords":"Nonlinear system; Mixing (physics); Manifold (fluid mechanics); Computer science; Regularization (linguistics); Scalar (mathematics); Interpolation (computer graphics); Benchmark (surveying); Mathematics; Artificial intelligence; Pattern recognition (psychology); Algorithm; Machine learning","score_opus":0.2956569575793979,"score_gpt":0.36300084100343927,"score_spread":0.06734388342404135,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2997205428","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.030946244,0.00051476946,0.96021914,0.00033507042,0.000105647465,0.00017324206,0.00036986303,0.005567543,0.0017684768],"genre_scores_gemma":[0.41724506,0.00035647638,0.5690773,0.0007831632,0.00017460657,0.00072570663,0.0026157836,0.00093619793,0.008085658],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99879056,0.00043824274,0.00006426145,0.00036769122,0.00023490329,0.00010434244],"domain_scores_gemma":[0.9982742,0.0006533727,0.00013539844,0.00058632327,0.00023538942,0.00011522115],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0020161662,0.0021763605,0.0014799464,0.0012253596,0.0009773485,0.0013706275,0.002649165,0.0019887716,0.0047440645],"category_scores_gemma":[0.00595257,0.0007946804,0.0014849268,0.001318619,0.0015975329,0.0035018357,0.0051032575,0.0035772808,0.002813751],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00087318907,0.00055636454,0.0041001122,0.00039032853,0.00021010188,0.00027885786,0.0006943284,0.19843094,0.025450852,0.02385407,0.01790032,0.72726053],"study_design_scores_gemma":[0.00002732424,0.00013631809,0.00025492845,0.000019750236,0.000017591554,0.00007585284,0.00005772798,0.97252107,0.009211336,0.014044344,0.0036104014,0.000023432478],"about_ca_topic_score_codex":0.0013194185,"about_ca_topic_score_gemma":0.00271347,"teacher_disagreement_score":0.0047440645,"about_ca_system_score_codex":0.000826434,"about_ca_system_score_gemma":0.0008967377,"threshold_uncertainty_score":0.015870452},"labels":[],"label_agreement":null},{"id":"W2997669297","doi":"10.1609/aaai.v34i04.6034","title":"Hierarchically Clustered Representation Learning","year":2020,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Kootenay Association for Science & Technology","funders":"National Research Foundation of Korea; National Research Foundation","keywords":"Cluster analysis; Embedding; Representation (politics); Feature learning; Artificial intelligence; Computer science; Abstraction; Hierarchy; Focus (optics); Pattern recognition (psychology); Space (punctuation); Hierarchical clustering; Machine learning","score_opus":0.12446907518370981,"score_gpt":0.31134846949460937,"score_spread":0.18687939431089956,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2997669297","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.01765343,0.00041798083,0.977234,0.00025648362,0.000036823745,0.00009179264,0.00027185775,0.0021607697,0.0018767917],"genre_scores_gemma":[0.40909275,0.0005290569,0.5785244,0.000602188,0.000101027086,0.0003074866,0.003996459,0.0005528529,0.006293711],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9974566,0.0007018608,0.00011009009,0.00093824556,0.00053041166,0.00026271684],"domain_scores_gemma":[0.9975957,0.00070101005,0.00023336972,0.000713034,0.0006273383,0.00012955096],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0018668808,0.0016340293,0.0014175511,0.0016902897,0.00069976755,0.001653166,0.0028217058,0.0020423322,0.002893978],"category_scores_gemma":[0.006413823,0.00062397565,0.0014814755,0.002123929,0.0011241646,0.0041437712,0.0026125258,0.0025043197,0.0015355984],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020938565,0.00029507955,0.0024233342,0.0003121593,0.0002102575,0.00011046357,0.0003681803,0.35800663,0.011179332,0.06010599,0.01999485,0.54678434],"study_design_scores_gemma":[0.000013736164,0.00006785601,0.00018300883,0.000015241249,0.000017283875,0.000035528632,0.000034740948,0.96769273,0.002689136,0.02771224,0.0015244085,0.000014213127],"about_ca_topic_score_codex":0.005982845,"about_ca_topic_score_gemma":0.007948838,"teacher_disagreement_score":0.005982845,"about_ca_system_score_codex":0.001991119,"about_ca_system_score_gemma":0.001956419,"threshold_uncertainty_score":0.014446676},"labels":[],"label_agreement":null},{"id":"W2998605053","doi":"10.1609/aaai.v34i04.6132","title":"Partial Label Learning with Batch Label Correction","year":2020,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":50,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"China Scholarship Council; Natural Sciences and Engineering Research Council of Canada; Canada Research Chairs","keywords":"Computer science; Consistency (knowledge bases); Artificial intelligence; Machine learning; Set (abstract data type); Multi-label classification; Stability (learning theory)","score_opus":0.1001122140207756,"score_gpt":0.2912905940668809,"score_spread":0.19117838004610532,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2998605053","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.032132626,0.00040115404,0.958631,0.00029708171,0.00014414791,0.00015181136,0.00019460384,0.0065717865,0.0014757634],"genre_scores_gemma":[0.42534533,0.0002055575,0.5644311,0.00065904297,0.00018306094,0.00032431513,0.0015017877,0.0006497108,0.0067000873],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.997988,0.00045529378,0.00007506773,0.000810423,0.00048958196,0.00018163455],"domain_scores_gemma":[0.99333453,0.0020958744,0.0005122162,0.002260242,0.0015120641,0.00028500668],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0025253764,0.0016526483,0.002014742,0.0008515705,0.0011875196,0.0014958391,0.00551633,0.001959894,0.0024403958],"category_scores_gemma":[0.007624056,0.0006431843,0.001006114,0.0011552315,0.0017330223,0.004541608,0.0029256719,0.0036268614,0.0016158021],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009523591,0.0004455413,0.00566482,0.00025254177,0.0001302139,0.00019423325,0.00037754065,0.15394068,0.02074547,0.008697346,0.013776615,0.79482263],"study_design_scores_gemma":[0.000045422177,0.00011147783,0.00038389658,0.000012683776,0.000026214659,0.00008414788,0.000045353092,0.97881925,0.009954377,0.008324006,0.0021655732,0.000027725931],"about_ca_topic_score_codex":0.0069118333,"about_ca_topic_score_gemma":0.011026843,"teacher_disagreement_score":0.0069118333,"about_ca_system_score_codex":0.0013284208,"about_ca_system_score_gemma":0.0026218686,"threshold_uncertainty_score":0.013743222},"labels":[],"label_agreement":null},{"id":"W3008638314","doi":"10.1016/j.ijar.2020.02.003","title":"Label distribution learning: A local collaborative mechanism","year":2020,"lang":"en","type":"article","venue":"International Journal of Approximate Reasoning","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":41,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"National Natural Science Foundation of China","keywords":"Robustness (evolution); Ambiguity; Computer science; Artificial intelligence; Machine learning; Feature learning; Representation (politics); Pattern recognition (psychology)","score_opus":0.016666892514749204,"score_gpt":0.26690031547458176,"score_spread":0.25023342295983253,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3008638314","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0067384695,0.00014441555,0.989838,0.00036070903,0.00005443379,0.000099919984,0.000086528395,0.0012488676,0.0014287048],"genre_scores_gemma":[0.3171343,0.00021278318,0.6692164,0.0005201558,0.00035037383,0.0004141781,0.0006568087,0.0004442349,0.011050755],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99161595,0.0027736533,0.0004938073,0.0019770046,0.002586063,0.00055355957],"domain_scores_gemma":[0.97732985,0.008463179,0.0010559746,0.009253772,0.0029939348,0.0009031407],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011236172,0.0012301865,0.0026225469,0.0030920058,0.0036194955,0.004811798,0.009424263,0.004842258,0.011719003],"category_scores_gemma":[0.027759388,0.001037653,0.001937623,0.0047019436,0.0024371915,0.009820425,0.012426476,0.00408987,0.0036385134],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001585966,0.0015358082,0.004174915,0.00028059044,0.00035202788,0.00021777368,0.0008456961,0.060081486,0.012836234,0.07498785,0.017416153,0.82568544],"study_design_scores_gemma":[0.00023577032,0.00018712968,0.00062430924,0.00003528003,0.00014630936,0.0001997961,0.00016396627,0.8668132,0.014241222,0.10952213,0.007769173,0.000061709645],"about_ca_topic_score_codex":0.0044829166,"about_ca_topic_score_gemma":0.0070334855,"teacher_disagreement_score":0.011719003,"about_ca_system_score_codex":0.0019189708,"about_ca_system_score_gemma":0.0029649916,"threshold_uncertainty_score":0.059423268},"labels":[],"label_agreement":null},{"id":"W3009458272","doi":"10.7717/peerj-cs.261","title":"An evolutionary decomposition-based multi-objective feature selection for multi-label classification","year":2020,"lang":"en","type":"article","venue":"PeerJ Computer Science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":26,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ontario Tech University","funders":"","keywords":"Computer science; Feature selection; Multi-label classification; Artificial intelligence; Feature (linguistics); Data mining; Selection (genetic algorithm); Field (mathematics); Machine learning; Evolutionary algorithm; Genetic algorithm; Pattern recognition (psychology); Optimization problem; Mathematics; Algorithm","score_opus":0.0639818680707189,"score_gpt":0.33944606510245007,"score_spread":0.2754641970317312,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3009458272","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.026230514,0.00026537915,0.971686,0.00015555922,0.000044901233,0.00007689248,0.000033745448,0.00023708778,0.0012698899],"genre_scores_gemma":[0.39952406,0.00025011753,0.5964759,0.00022072153,0.000048685346,0.00045214326,0.00028528576,0.00008645084,0.002656749],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.999419,0.00016909617,0.00003032971,0.00011526872,0.00019720707,0.000069079455],"domain_scores_gemma":[0.9995541,0.00017734124,0.000048367918,0.000029808838,0.00016156238,0.000028784927],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012748629,0.0010888454,0.0011552332,0.001258896,0.0005462952,0.00073122844,0.0011630617,0.0011616378,0.0012684665],"category_scores_gemma":[0.0020199153,0.00039894774,0.0011043887,0.0010406723,0.00043094635,0.0008185589,0.000754634,0.00093880366,0.00020376747],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000093720926,0.00017623359,0.0019071548,0.00010312116,0.00011524881,0.00016061454,0.00011126951,0.738354,0.010967239,0.004978894,0.002362756,0.24066971],"study_design_scores_gemma":[0.000010034166,0.00004063279,0.00021570807,0.0000057791635,0.000009373391,0.000022716935,0.0000069852167,0.99804986,0.0007590796,0.0005223913,0.0003523447,0.0000051687034],"about_ca_topic_score_codex":0.0032915256,"about_ca_topic_score_gemma":0.002516288,"teacher_disagreement_score":0.0032915256,"about_ca_system_score_codex":0.000655686,"about_ca_system_score_gemma":0.0010058547,"threshold_uncertainty_score":0.006742239},"labels":[],"label_agreement":null},{"id":"W3022446017","doi":"10.1007/978-3-030-47358-7_26","title":"Partial Label Learning by Entropy Minimization","year":2020,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"","keywords":"Computer science; Ground truth; Training set; Minification; Artificial intelligence; Entropy (arrow of time); Machine learning; Set (abstract data type)","score_opus":0.018584185021082743,"score_gpt":0.243421951344673,"score_spread":0.22483776632359026,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3022446017","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0035993734,0.00024230056,0.99353045,0.00019036588,0.00004472882,0.000031188607,0.000121234014,0.00070771144,0.0015326175],"genre_scores_gemma":[0.19064388,0.00060475076,0.7842734,0.0004760799,0.00031085566,0.0003449965,0.0022074722,0.0010142477,0.020124337],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9986689,0.0005342525,0.00006122954,0.00029781405,0.000340126,0.00009775629],"domain_scores_gemma":[0.99760085,0.0013833015,0.00010446951,0.00055949256,0.00027063186,0.0000812595],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0016232915,0.0010000604,0.0019918801,0.0011931345,0.0008744636,0.0018529482,0.0022294184,0.0016462895,0.0067550987],"category_scores_gemma":[0.003937634,0.00080307096,0.0014827593,0.0016040762,0.0014461743,0.0032961816,0.0035634213,0.0025274686,0.0026365886],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002064868,0.00012542897,0.0007038669,0.0002474234,0.00013947873,0.00007047626,0.00011865051,0.15757117,0.007843136,0.072110035,0.020738922,0.74012494],"study_design_scores_gemma":[0.0000116292085,0.000040076313,0.00016497502,0.00001828912,0.000020120508,0.00005455277,0.000016119986,0.90794146,0.00273263,0.08666488,0.0023218018,0.00001347803],"about_ca_topic_score_codex":0.0017097164,"about_ca_topic_score_gemma":0.0028155365,"teacher_disagreement_score":0.0067550987,"about_ca_system_score_codex":0.0010175175,"about_ca_system_score_gemma":0.001105673,"threshold_uncertainty_score":0.022598028},"labels":[],"label_agreement":null},{"id":"W3035531049","doi":"10.1145/3397271.3401135","title":"Coding Electronic Health Records with Adversarial Reinforcement Path Generation","year":2020,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":20,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"National Natural Science Foundation of China; Tencent","keywords":"Computer science; Coding (social sciences); ENCODE; Reinforcement learning; Path (computing); Encoder; Adversarial system; Artificial intelligence; Computer network","score_opus":0.03366987630125309,"score_gpt":0.2511299121722091,"score_spread":0.217460035870956,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3035531049","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09423132,0.0006328828,0.8947357,0.0015508115,0.00017127597,0.0003758247,0.0010940195,0.0045656106,0.002642476],"genre_scores_gemma":[0.8082781,0.00023793477,0.18302438,0.0006390938,0.00007456004,0.00033869813,0.002508929,0.00017220239,0.0047261952],"study_design_codex":"simulation_or_modeling","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99892944,0.00039862702,0.00004901286,0.00030635847,0.00021541322,0.00010103554],"domain_scores_gemma":[0.99503446,0.0034016964,0.00032053178,0.00063975924,0.00044095315,0.00016264795],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0018998429,0.0008891108,0.0006512105,0.0006116072,0.0003670487,0.0005915321,0.0020630872,0.0013778252,0.0021891731],"category_scores_gemma":[0.009090014,0.0003850442,0.00058449275,0.0005819951,0.000872745,0.0012594722,0.0016101695,0.0021414184,0.0005681558],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001989437,0.00010750052,0.0026510856,0.000051347462,0.000029501893,0.00014228663,0.00008540923,0.8990216,0.0011725802,0.005459228,0.0053904187,0.0856901],"study_design_scores_gemma":[0.000013056624,0.00002487777,0.000108241424,0.0000045318016,0.0000031775683,0.000021381875,0.0000051303678,0.99525344,0.0006387246,0.0035018001,0.00042156066,0.000004131915],"about_ca_topic_score_codex":0.006108634,"about_ca_topic_score_gemma":0.005460885,"teacher_disagreement_score":0.006108634,"about_ca_system_score_codex":0.0013870378,"about_ca_system_score_gemma":0.0013170902,"threshold_uncertainty_score":0.012146175},"labels":[],"label_agreement":null},{"id":"W3037074101","doi":"10.5539/cis.v13n3p66","title":"Improvements of Automatic Extraction of FA Words Tendency using Non_linear Approach","year":2020,"lang":"en","type":"article","venue":"Computer and Information Science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Field (mathematics); Measure (data warehouse); Subject (documents); Artificial intelligence; Data mining; Natural language processing; Mathematics; World Wide Web","score_opus":0.033079219552338515,"score_gpt":0.2794702536111031,"score_spread":0.2463910340587646,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3037074101","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.17839895,0.002394071,0.7907145,0.00036412806,0.00029496456,0.00040357152,0.004113725,0.017226774,0.0060892724],"genre_scores_gemma":[0.44766334,0.0009486886,0.52551925,0.0001395282,0.00019807348,0.000433938,0.010497126,0.0007213375,0.013878622],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9981989,0.00028387236,0.00021573517,0.00054478995,0.00058749027,0.0001691938],"domain_scores_gemma":[0.99708945,0.0009705938,0.00025216438,0.0002398094,0.0013813172,0.00006678212],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009969681,0.0009494247,0.0007823454,0.005614933,0.0006690842,0.0012827574,0.0008494346,0.000553807,0.0038379745],"category_scores_gemma":[0.003674928,0.00023913536,0.0008931881,0.0036456266,0.00028992194,0.001787832,0.00072388246,0.0005833513,0.003610662],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00030553545,0.00014123876,0.0075481264,0.0003587489,0.00007093916,0.00024038012,0.00029252152,0.0021425993,0.054958336,0.0009452215,0.005184314,0.927812],"study_design_scores_gemma":[0.00014643659,0.0007919406,0.12014891,0.0001829583,0.0004665375,0.0027219832,0.002131448,0.57598794,0.21793771,0.007399615,0.07183167,0.00025285574],"about_ca_topic_score_codex":0.006244176,"about_ca_topic_score_gemma":0.0075047542,"teacher_disagreement_score":0.006244176,"about_ca_system_score_codex":0.0004222522,"about_ca_system_score_gemma":0.0009885248,"threshold_uncertainty_score":0.012839317},"labels":[],"label_agreement":null},{"id":"W3037796656","doi":"10.1007/978-3-030-51517-1_31","title":"Machine Learning Classification Models with SPD/ED Dataset: Comparative Study of Abstract Versus Full Article Approach","year":2020,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Moncton","funders":"","keywords":"Computer science; Artificial intelligence; Boosting (machine learning); Machine learning; Support vector machine; Decision tree; Gradient boosting; Random forest; Precision and recall; Context (archaeology); Recall","score_opus":0.08655538543899494,"score_gpt":0.2932814416779184,"score_spread":0.20672605623892348,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3037796656","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6964497,0.021417152,0.029991306,0.0039456496,0.0022519638,0.00092377135,0.21443444,0.012975018,0.01761102],"genre_scores_gemma":[0.37456438,0.0045736656,0.09151069,0.00061664626,0.00060692866,0.00054157083,0.5193835,0.00040204942,0.007800572],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99655485,0.0008843585,0.00052836095,0.00059953786,0.0012069271,0.00022595217],"domain_scores_gemma":[0.9913783,0.0041034403,0.00050297164,0.0016965698,0.0019441245,0.0003746031],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004497274,0.0018889983,0.0018013761,0.007901989,0.00079768145,0.0023469622,0.0022726043,0.001720304,0.0033823135],"category_scores_gemma":[0.009341957,0.00027918085,0.0016583242,0.0058605303,0.0004769301,0.0027215625,0.0011629874,0.0015423101,0.0035945708],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0039051853,0.006224681,0.058945905,0.0041598636,0.0011424482,0.00092422945,0.00024053399,0.058080602,0.0056200484,0.002189207,0.26003736,0.59852993],"study_design_scores_gemma":[0.0009274848,0.0023493594,0.070297845,0.00056031375,0.00073494646,0.0017496777,0.0013693933,0.80000013,0.020694578,0.0046190256,0.09637091,0.0003264241],"about_ca_topic_score_codex":0.0126004955,"about_ca_topic_score_gemma":0.016057977,"teacher_disagreement_score":0.0126004955,"about_ca_system_score_codex":0.0014658239,"about_ca_system_score_gemma":0.0013226495,"threshold_uncertainty_score":0.025054276},"labels":[],"label_agreement":null},{"id":"W3085586451","doi":"10.5281/zenodo.3993874","title":"Multi-label Pathway Prediction based on Active Dataset Subsampling","year":2020,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Computer science; Artificial intelligence; Pattern recognition (psychology)","score_opus":0.0849203007829528,"score_gpt":0.2799977735206358,"score_spread":0.195077472737683,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3085586451","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.077357,0.0049729417,0.058534104,0.0013687012,0.0009620387,0.0011541107,0.83356875,0.015492779,0.006589635],"genre_scores_gemma":[0.059143834,0.00064216834,0.053202063,0.00068667455,0.000099221616,0.0010062393,0.8815635,0.000637153,0.003019058],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99790895,0.0004297424,0.00012544244,0.0009301803,0.00041090432,0.00019493698],"domain_scores_gemma":[0.99679774,0.0014847148,0.00015440499,0.00085504854,0.0005034823,0.00020473741],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0031757078,0.002289822,0.0017724042,0.0031331927,0.0011879569,0.002037147,0.0025125388,0.0025313774,0.008988117],"category_scores_gemma":[0.0079789385,0.00051713415,0.003572423,0.002271772,0.00079232804,0.0014516236,0.0016845891,0.002205217,0.0059553324],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.004275444,0.0017906302,0.04065736,0.005795487,0.0022403998,0.0011987851,0.0002525351,0.034696016,0.027733937,0.009432495,0.66777456,0.20415242],"study_design_scores_gemma":[0.0043391814,0.0018296192,0.055038936,0.0011507191,0.003221188,0.0030835057,0.00058641884,0.3319479,0.061864976,0.06805498,0.46837765,0.0005048615],"about_ca_topic_score_codex":0.0075323153,"about_ca_topic_score_gemma":0.012781388,"teacher_disagreement_score":0.008988117,"about_ca_system_score_codex":0.001014495,"about_ca_system_score_gemma":0.0022241264,"threshold_uncertainty_score":0.030068219},"labels":[],"label_agreement":null},{"id":"W3086863200","doi":"10.1002/ett.3977","title":"Digital Hadith authentication: Recent advances, open challenges, and future directions","year":2020,"lang":"en","type":"article","venue":"Transactions on Emerging Telecommunications Technologies","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":28,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Northern British Columbia","funders":"Deanship of Scientific Research, King Saud University","keywords":"Authentication (law); Islam; Computer science; Field (mathematics); Legislation; Task (project management); Computer security; Political science; Law; History; Engineering; Systems engineering; Mathematics; Archaeology","score_opus":0.04322460988914023,"score_gpt":0.2839163424881219,"score_spread":0.2406917325989817,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3086863200","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.016359953,0.87691176,0.04598714,0.026745519,0.002211248,0.0001707032,0.00017926891,0.00049709,0.030937314],"genre_scores_gemma":[0.22964445,0.7005264,0.049198132,0.004258942,0.004148817,0.00015097609,0.000701284,0.00006680587,0.011304116],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99711263,0.00082017615,0.00025664625,0.00049987907,0.0010099439,0.00030064993],"domain_scores_gemma":[0.9872351,0.006483432,0.00068408065,0.00095001416,0.004083202,0.000564147],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0053727776,0.0006707694,0.00077175605,0.0030807573,0.0011476207,0.004511557,0.0021621634,0.0027599037,0.0067820065],"category_scores_gemma":[0.0076785046,0.00046056134,0.00063107384,0.0035123795,0.0024008306,0.014583188,0.0021066854,0.0022454432,0.0031171415],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013549338,0.00019113788,0.0028294306,0.003352088,0.000039321545,0.00018014024,0.0006313021,0.0015067395,0.0019180758,0.03671008,0.017365787,0.9351403],"study_design_scores_gemma":[0.000046573645,0.00078911433,0.0060757217,0.0056693745,0.0001875583,0.0029084207,0.011030591,0.038492,0.008148319,0.095577054,0.83081484,0.00026043964],"about_ca_topic_score_codex":0.0013324242,"about_ca_topic_score_gemma":0.0011078217,"teacher_disagreement_score":0.0067820065,"about_ca_system_score_codex":0.0011124203,"about_ca_system_score_gemma":0.0020600175,"threshold_uncertainty_score":0.028414309},"labels":[],"label_agreement":null},{"id":"W3093607642","doi":"10.18280/ria.340418","title":"Text Sentiment Classification Based on Feature Fusion","year":2020,"lang":"en","type":"article","venue":"Revue d intelligence artificielle","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"National Social Science Fund of China; National Science Foundation","keywords":"Softmax function; Computer science; Artificial intelligence; Convolutional neural network; Classifier (UML); Pattern recognition (psychology); Deep learning; Sentiment analysis; Artificial neural network; Feature (linguistics); Natural language processing; Machine learning","score_opus":0.05547955289847228,"score_gpt":0.27746885442471153,"score_spread":0.22198930152623925,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3093607642","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.38489679,0.0015721177,0.58714974,0.0006415371,0.00075253047,0.0003796395,0.0016532674,0.0063128113,0.016641524],"genre_scores_gemma":[0.9304815,0.00044907405,0.06190373,0.00012656946,0.00019123653,0.0001232551,0.0017902788,0.00007904404,0.004855415],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9996605,0.000029423076,0.000031779604,0.000099241646,0.00011790183,0.000061172206],"domain_scores_gemma":[0.9996517,0.00004811205,0.000046879763,0.000026139815,0.00020791573,0.000019250334],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00049047224,0.0008830724,0.00074083,0.0014907435,0.00031462807,0.0006558035,0.00044677575,0.00048797668,0.0021123497],"category_scores_gemma":[0.0010547286,0.00017436619,0.00079042354,0.00086447515,0.00020099037,0.0013447355,0.00058952393,0.0005270909,0.0011154206],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008035429,0.0002787053,0.009065054,0.00020976017,0.00017972632,0.00028649496,0.0001342259,0.023767142,0.10058868,0.0019059372,0.012494394,0.85028636],"study_design_scores_gemma":[0.000029020108,0.0001850128,0.009301232,0.000028778788,0.0001319073,0.00015627213,0.00008627344,0.9521011,0.03105467,0.0029831543,0.0039100237,0.000032467982],"about_ca_topic_score_codex":0.0017754228,"about_ca_topic_score_gemma":0.001782238,"teacher_disagreement_score":0.0021123497,"about_ca_system_score_codex":0.0004687821,"about_ca_system_score_gemma":0.00036726188,"threshold_uncertainty_score":0.007066548},"labels":[],"label_agreement":null},{"id":"W3095042565","doi":"10.1007/978-3-030-63128-4_52","title":"Binary Text Representation for Feature Selection","year":2020,"lang":"en","type":"book-chapter","venue":"Advances in intelligent systems and computing","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Redundancy (engineering); Feature selection; Computer science; Binary number; Relevance (law); Minimum redundancy feature selection; Mutual information; Selection (genetic algorithm); Representation (politics); Feature (linguistics); Filter (signal processing); Artificial intelligence; Binary classification; Data mining; Machine learning; Pattern recognition (psychology); Mathematics; Support vector machine","score_opus":0.03133614524783514,"score_gpt":0.2986975766940242,"score_spread":0.26736143144618907,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3095042565","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006155416,0.0021416766,0.97407144,0.0004067527,0.0007008559,0.0001208101,0.0027454016,0.004962872,0.008694733],"genre_scores_gemma":[0.13514,0.0026830786,0.8021126,0.0005015498,0.0007519474,0.0006638831,0.01578329,0.0008074746,0.0415562],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99958795,0.00009052389,0.000043731437,0.00009098277,0.00014984596,0.00003695168],"domain_scores_gemma":[0.9994868,0.00017259568,0.000043742773,0.00010862369,0.00017112879,0.000017094277],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00042447695,0.0007712576,0.0006740219,0.0015856337,0.0003652798,0.0011371862,0.001085905,0.00068657077,0.01628674],"category_scores_gemma":[0.0018976134,0.00018134805,0.00051458564,0.0030241106,0.00021336287,0.001323582,0.0006157822,0.00082686765,0.01081627],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022583986,0.00007981715,0.00014865166,0.0002823437,0.000025795349,0.000073690084,0.000034595767,0.005466037,0.02483721,0.014508731,0.05546206,0.89885527],"study_design_scores_gemma":[0.00010670144,0.000335128,0.002241496,0.00024411324,0.00014200744,0.0010603392,0.0001144902,0.6535805,0.07962575,0.067238845,0.19519788,0.00011281499],"about_ca_topic_score_codex":0.0009593528,"about_ca_topic_score_gemma":0.00084788894,"teacher_disagreement_score":0.01628674,"about_ca_system_score_codex":0.00028225922,"about_ca_system_score_gemma":0.0003783532,"threshold_uncertainty_score":0.054484546},"labels":[],"label_agreement":null},{"id":"W310827894","doi":"","title":"Identification of Web Information using Concept Hierarchies and On-line Updates of Concept Importance","year":2009,"lang":"en","type":"article","venue":"European Society for Fuzzy Logic and Technology Conference","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Hierarchy; Computer science; Identification (biology); Domain (mathematical analysis); Information retrieval; Ontology; Semantic Web; Web page; The Internet; Term (time); Social Semantic Web; World Wide Web; Mathematics","score_opus":0.030330483356404314,"score_gpt":0.26653893821362384,"score_spread":0.23620845485721953,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W310827894","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.11485487,0.00066232623,0.8783998,0.00025943673,0.000082978084,0.00037987542,0.00027899776,0.0012236175,0.0038581933],"genre_scores_gemma":[0.3944261,0.0002547084,0.6030996,0.000045481935,0.000064372245,0.00016656527,0.0003640865,0.000107884676,0.0014711744],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9969567,0.00069815066,0.0002493051,0.0004415039,0.0015177429,0.00013650049],"domain_scores_gemma":[0.9932481,0.003079005,0.0008737727,0.00065240625,0.0018960916,0.0002505751],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0035724912,0.00052524655,0.000558108,0.008183605,0.0011186656,0.0021375916,0.0011147679,0.00053689216,0.0014262635],"category_scores_gemma":[0.019354777,0.00035978877,0.00056662096,0.005268956,0.0006908338,0.0049868436,0.001420125,0.0010338032,0.00032526243],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00036330114,0.0002858281,0.0143388,0.00036387742,0.00014633393,0.00029485123,0.0046258345,0.017267855,0.026784342,0.028292837,0.0034493748,0.9037868],"study_design_scores_gemma":[0.00008046013,0.00038161906,0.02867014,0.00026155842,0.00029039566,0.0008984742,0.0020985918,0.7867008,0.0424638,0.11211623,0.025848141,0.00018969839],"about_ca_topic_score_codex":0.006280199,"about_ca_topic_score_gemma":0.0064808996,"teacher_disagreement_score":0.008183605,"about_ca_system_score_codex":0.0012975377,"about_ca_system_score_gemma":0.0012357844,"threshold_uncertainty_score":0.018893361},"labels":[],"label_agreement":null},{"id":"W3108841339","doi":"10.1109/tcyb.2020.3032707","title":"Semisupervised Learning via Axiomatic Fuzzy Set Theory and SVM","year":2020,"lang":"en","type":"article","venue":"IEEE Transactions on Cybernetics","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":25,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"National Key Research and Development Program of China; National Natural Science Foundation of China","keywords":"Interpretability; Artificial intelligence; Computer science; Support vector machine; Machine learning; Fuzzy logic; Exploit; Classifier (UML); Schema (genetic algorithms); Set (abstract data type); Frame (networking); Natural language processing; Data mining","score_opus":0.022938232563160438,"score_gpt":0.2413329743429583,"score_spread":0.21839474177979787,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3108841339","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.004282734,0.00012790624,0.99469405,0.00012532136,0.000015330486,0.000025221689,0.000024961602,0.000093770555,0.0006106045],"genre_scores_gemma":[0.37395787,0.00040713156,0.6230053,0.00026053138,0.00017170093,0.00026094765,0.00037294885,0.000062212166,0.0015013937],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99694604,0.0016123045,0.00018946295,0.0004301519,0.0007467609,0.00007531976],"domain_scores_gemma":[0.99465203,0.0031699555,0.0005667828,0.00046007743,0.0010657769,0.00008540127],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032571154,0.0006852608,0.00092021713,0.0015059585,0.0005634181,0.0010359634,0.0015231494,0.0009944248,0.0010319774],"category_scores_gemma":[0.00873274,0.0003057273,0.0007710488,0.0011206138,0.0013429986,0.0023622606,0.0012365092,0.0013831774,0.00031559815],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001716878,0.00019364596,0.0026649947,0.00053377054,0.00021208287,0.0002489141,0.00052429637,0.39231998,0.0069835605,0.24566828,0.005324566,0.34515417],"study_design_scores_gemma":[0.000007251058,0.00003210093,0.00013692549,0.00001415566,0.000009553942,0.00006104276,0.000023201745,0.942792,0.0011515431,0.054888938,0.00087193574,0.000011380023],"about_ca_topic_score_codex":0.00094704865,"about_ca_topic_score_gemma":0.0011300338,"teacher_disagreement_score":0.0032571154,"about_ca_system_score_codex":0.00084435556,"about_ca_system_score_gemma":0.0009804743,"threshold_uncertainty_score":0.017225444},"labels":[],"label_agreement":null},{"id":"W3109675915","doi":"10.1109/iccit-144147971.2020.9213733","title":"Performance Comparison of Qur’anic Search Engines","year":2020,"lang":"en","type":"article","venue":"2020 International Conference on Computing and Information Technology (ICCIT-1441)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Northern British Columbia","funders":"","keywords":"Computer science; Arabic; The Internet; Meaning (existential); Reading (process); Search engine; Information retrieval; Islam; World Wide Web; Natural language processing; Linguistics; History","score_opus":0.04188735145897918,"score_gpt":0.30084940025285617,"score_spread":0.25896204879387696,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3109675915","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9372648,0.023734283,0.0055037974,0.0009997927,0.0005472188,0.00032074781,0.007872496,0.0040681423,0.019688778],"genre_scores_gemma":[0.9412695,0.0055994275,0.021411138,0.00030391733,0.00023256062,0.000116875824,0.019644707,0.00020794754,0.0112138],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9948597,0.0009392249,0.001021919,0.0006119594,0.0020154228,0.00055171724],"domain_scores_gemma":[0.9892217,0.005538567,0.0007005201,0.0006113595,0.0034999014,0.00042805358],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0035329205,0.0010075705,0.0020675706,0.008539929,0.0009705856,0.0035980532,0.001207007,0.0014235942,0.003290284],"category_scores_gemma":[0.012635356,0.00029800305,0.00087341934,0.0086998865,0.00034690864,0.003305346,0.0008640091,0.00040795814,0.0022789934],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.011696548,0.0033214828,0.13487896,0.0073667974,0.0020928183,0.0013137955,0.0011474459,0.040697504,0.030275004,0.007117356,0.07358828,0.686504],"study_design_scores_gemma":[0.0008234602,0.006281905,0.14897612,0.0005096258,0.0016505172,0.0043765604,0.004039156,0.70505637,0.06562604,0.003696747,0.058465853,0.0004975826],"about_ca_topic_score_codex":0.015838038,"about_ca_topic_score_gemma":0.014288762,"teacher_disagreement_score":0.015838038,"about_ca_system_score_codex":0.0014800697,"about_ca_system_score_gemma":0.0018025142,"threshold_uncertainty_score":0.031491697},"labels":[],"label_agreement":null},{"id":"W3109677655","doi":"10.1109/tfuzz.2020.3036848","title":"Editorial: Fuzzy Logic and Artificial Intelligence: A Special Issue on Emerging Techniques and Their Applications","year":2020,"lang":"en","type":"editorial","venue":"IEEE Transactions on Fuzzy Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"National Taiwan University of Science and Technology; National Taiwan University; Universidad de Granada; University of Alberta","keywords":"Fuzzy logic; Computer science; Artificial intelligence","score_opus":0.02130487360459542,"score_gpt":0.27736873287886427,"score_spread":0.25606385927426883,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3109677655","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000027399255,0.0033592097,0.00016322527,0.01673621,0.97740227,0.000019952307,0.00003765566,0.000051758907,0.002202262],"genre_scores_gemma":[0.0002187785,0.0026097216,0.00009626461,0.0058469884,0.98253006,0.0000152758,0.00002907545,0.000037654358,0.008616239],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9937163,0.0007499858,0.0005430991,0.0006857436,0.0039463206,0.00035854196],"domain_scores_gemma":[0.97839123,0.006487569,0.0012208341,0.00059339136,0.0098406505,0.0034663149],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0059218383,0.0047490974,0.0042891363,0.0067816563,0.004331475,0.011327999,0.0034346078,0.010819398,0.022467183],"category_scores_gemma":[0.018505797,0.0011614719,0.0032810632,0.0029939273,0.0027416982,0.006315226,0.0016914561,0.014183769,0.022479486],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000017270633,0.000013203823,0.000019175153,0.00009095862,0.000008464004,0.000047780115,0.000007706828,0.000026536181,0.000041488976,0.00024181722,0.9954379,0.0040476588],"study_design_scores_gemma":[0.000032593016,0.00002876952,0.00023648703,0.0002794109,0.000027057644,0.00023347035,0.000039109535,0.00022946284,0.00009387697,0.0014313603,0.99735224,0.000016204876],"about_ca_topic_score_codex":0.0014998963,"about_ca_topic_score_gemma":0.004656416,"teacher_disagreement_score":0.022467183,"about_ca_system_score_codex":0.0032289973,"about_ca_system_score_gemma":0.0032774906,"threshold_uncertainty_score":0.075160265},"labels":[],"label_agreement":null},{"id":"W3110889378","doi":"10.1109/smc42975.2020.9283208","title":"Binary Hybrid Differential Evolution Algorithm for Multi-label Feature Selection","year":2020,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ontario Tech University","funders":"","keywords":"Feature selection; Computer science; Artificial intelligence; Feature (linguistics); Metaheuristic; Differential evolution; Machine learning; Pattern recognition (psychology); Field (mathematics); Selection (genetic algorithm); Algorithm; Data mining; Mathematics","score_opus":0.04131484145864265,"score_gpt":0.2767897758277696,"score_spread":0.23547493436912695,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3110889378","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011865473,0.000271327,0.986347,0.00013542791,0.000029219487,0.000041113683,0.000023978106,0.00019424479,0.0010921769],"genre_scores_gemma":[0.49852884,0.0003006685,0.49562526,0.0002880703,0.000051705374,0.00045652318,0.000252133,0.00008305552,0.004413756],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99939597,0.00018098325,0.000034899425,0.00009813058,0.00023539674,0.000054620083],"domain_scores_gemma":[0.99942374,0.00032335467,0.000053100448,0.0000338505,0.00014644094,0.00001953665],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012315583,0.0005850872,0.0010654113,0.00091731077,0.00037037831,0.00066843565,0.001338639,0.0009482313,0.0014145203],"category_scores_gemma":[0.0019888387,0.00031717902,0.0007048344,0.00096550887,0.00043405354,0.0006437899,0.0008088902,0.0008315758,0.0002842826],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014802141,0.00012135036,0.0018406259,0.00012904625,0.00011881929,0.00013810975,0.00015099674,0.68415284,0.011048439,0.014469287,0.0021456217,0.28553683],"study_design_scores_gemma":[0.000010333578,0.000022260772,0.00013585336,0.000004122784,0.000005944576,0.000019251815,0.000004193403,0.9971623,0.0006897394,0.0014123499,0.00052992575,0.000003722682],"about_ca_topic_score_codex":0.0025376943,"about_ca_topic_score_gemma":0.0018273394,"teacher_disagreement_score":0.0025376943,"about_ca_system_score_codex":0.00070510653,"about_ca_system_score_gemma":0.0005755792,"threshold_uncertainty_score":0.0065131187},"labels":[],"label_agreement":null},{"id":"W3117033303","doi":"10.5539/elt.v14n1p74","title":"A Methodological Review of Machine Learning in Applied Linguistics","year":2020,"lang":"en","type":"review","venue":"English Language Teaching","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Software; Applied linguistics; Artificial intelligence; Computational linguistics; Normality; Natural language processing; Machine learning; Linguistics; Programming language; Mathematics; Statistics","score_opus":0.10015196501792106,"score_gpt":0.38367126546512764,"score_spread":0.2835193004472066,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3117033303","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00009180214,0.99285567,0.0015445593,0.0022128497,0.0005593434,0.00001964438,0.00006939556,0.000011969334,0.0026348163],"genre_scores_gemma":[0.0011880214,0.99487865,0.001875219,0.0008730592,0.0004984598,0.00004316268,0.00008353957,0.00000703476,0.0005527651],"study_design_codex":"design_other","study_design_gemma":"systematic_review","domain_scores_codex":[0.99786574,0.00084322476,0.000399095,0.00026095493,0.0005682308,0.000062770225],"domain_scores_gemma":[0.99169356,0.0061977534,0.00043222622,0.00019422302,0.0013606453,0.00012153495],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0042033056,0.0009355753,0.0015819616,0.009909313,0.0008550252,0.002433348,0.0012861572,0.0016726499,0.0056345756],"category_scores_gemma":[0.011411866,0.00051980803,0.0010253618,0.011944514,0.0013338736,0.003817608,0.00127251,0.0022269164,0.0023734325],"study_design_candidate":"systematic_review","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000035853143,0.00005857039,0.00049021776,0.06981855,0.00024126544,0.00018568402,0.0005975519,0.0005545312,0.0005588111,0.047090426,0.07611693,0.8042517],"study_design_scores_gemma":[0.000006495036,0.00003908194,0.0010572433,0.032032374,0.00018709521,0.00033500316,0.00023297682,0.00015859527,0.00018750051,0.012050004,0.95368904,0.000024694415],"about_ca_topic_score_codex":0.0029053686,"about_ca_topic_score_gemma":0.0056895986,"teacher_disagreement_score":0.009909313,"about_ca_system_score_codex":0.0021339932,"about_ca_system_score_gemma":0.006379673,"threshold_uncertainty_score":0.022229493},"labels":[{"model":"gemma","categories":["metaresearch"],"domain":"methods","study_design":"not_applicable","genre":"review","about_ca_system":false,"about_ca_topic":false,"confidence":"high"},{"model":"gpt","categories":[],"domain":null,"study_design":"design_other","genre":"review","about_ca_system":false,"about_ca_topic":false,"confidence":"low"}],"label_agreement":"split"},{"id":"W3121217868","doi":"10.1016/j.is.2021.101718","title":"Multi-label legal document classification: A deep learning-based approach with label-attention and domain-specific pre-training","year":2021,"lang":"en","type":"article","venue":"Information Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":73,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Thomson Reuters (Canada)","funders":"","keywords":"Computer science; Artificial intelligence; Multi-label classification; Domain (mathematical analysis); Training (meteorology); Machine learning; Training set","score_opus":0.03582749930198761,"score_gpt":0.2545681606306928,"score_spread":0.2187406613287052,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3121217868","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0714076,0.0022949874,0.89361596,0.0022497433,0.0008290017,0.00051508995,0.0028568418,0.017464759,0.008766009],"genre_scores_gemma":[0.391906,0.0009645445,0.5704145,0.0011218663,0.0005521409,0.0003537508,0.010529829,0.0006387031,0.023518821],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99872607,0.00017825315,0.00008935053,0.00041624374,0.000323773,0.00026642595],"domain_scores_gemma":[0.9975689,0.00076993345,0.00018411057,0.00043387405,0.000845594,0.00019749884],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0016477808,0.0015950319,0.0015471566,0.00306448,0.0012964087,0.0020419678,0.0036974521,0.0028441916,0.0055184257],"category_scores_gemma":[0.0030750483,0.0006066195,0.0013401596,0.0026552747,0.00066708017,0.0031446218,0.002437753,0.004677767,0.0039038365],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00036307293,0.0010443057,0.0021973834,0.00017916733,0.00010451057,0.00012943149,0.00011945673,0.017444525,0.01337623,0.003505846,0.03213159,0.9294044],"study_design_scores_gemma":[0.000031882497,0.00007231294,0.0007225749,0.00003942103,0.00005807085,0.00007363729,0.000078434496,0.976003,0.011433428,0.0067452984,0.0047168587,0.000025116911],"about_ca_topic_score_codex":0.0187812,"about_ca_topic_score_gemma":0.03737109,"teacher_disagreement_score":0.0187812,"about_ca_system_score_codex":0.0019930769,"about_ca_system_score_gemma":0.0029349322,"threshold_uncertainty_score":0.03734374},"labels":[],"label_agreement":null},{"id":"W3153416049","doi":"10.1007/s13042-021-01291-y","title":"A novel binary many-objective feature selection algorithm for multi-label data classification","year":2021,"lang":"en","type":"article","venue":"International Journal of Machine Learning and Cybernetics","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ontario Tech University","funders":"","keywords":"Feature selection; Computer science; Multi-label classification; Feature (linguistics); Pattern recognition (psychology); Artificial intelligence; Computational intelligence; Data mining; Computational complexity theory; Binary number; Benchmarking; Binary classification; Selection (genetic algorithm); Machine learning; Algorithm; Mathematics; Support vector machine","score_opus":0.05021316710036461,"score_gpt":0.3376043278010533,"score_spread":0.2873911607006887,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3153416049","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0111856535,0.0004708752,0.9861709,0.0001996197,0.0001301049,0.000085130785,0.00010092692,0.00097330724,0.0006834331],"genre_scores_gemma":[0.19014482,0.00035260955,0.80110085,0.00041630157,0.00021244137,0.00043577462,0.00094707153,0.00020654974,0.0061836117],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9986823,0.0002497371,0.0000989239,0.00025547371,0.0005895487,0.00012392888],"domain_scores_gemma":[0.99912494,0.0002885675,0.00006716992,0.00007126633,0.00040120338,0.00004695544],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014902701,0.0009800494,0.0020499572,0.0015755,0.00087756105,0.0012904941,0.002132225,0.0013137289,0.0024510813],"category_scores_gemma":[0.00203382,0.0004079605,0.0009630003,0.0019162192,0.00037193796,0.001155039,0.0012019789,0.0012832052,0.0010065649],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00029152524,0.0002770863,0.0012917044,0.00013024021,0.00013714362,0.00008083807,0.000047609527,0.035149336,0.01494027,0.002525701,0.0075486414,0.93757993],"study_design_scores_gemma":[0.00005256781,0.0001031597,0.001133506,0.000012542006,0.000036830952,0.0000965509,0.00001991559,0.99011326,0.0045314236,0.0018259616,0.002054196,0.000020105375],"about_ca_topic_score_codex":0.0034609425,"about_ca_topic_score_gemma":0.0043263417,"teacher_disagreement_score":0.0034609425,"about_ca_system_score_codex":0.0004859519,"about_ca_system_score_gemma":0.0012325499,"threshold_uncertainty_score":0.008199692},"labels":[],"label_agreement":null},{"id":"W3160128317","doi":"10.3233/jifs-210336","title":"From granulation-degranulation mechanisms to fuzzy rule-based models: Augmentation of granular-based models with a double fuzzy clustering","year":2021,"lang":"en","type":"article","venue":"Journal of Intelligent & Fuzzy Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Granulation; Degranulation; Cluster analysis; Fuzzy logic; Data mining; Fuzzy clustering; Computer science; Granular computing; Artificial intelligence; Mathematics; Engineering; Chemistry; Rough set","score_opus":0.048718047028115774,"score_gpt":0.27044402099357323,"score_spread":0.22172597396545746,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3160128317","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014514652,0.00027047785,0.9836174,0.00009279632,0.000030364867,0.000053169457,0.00002503751,0.00017409271,0.0012219287],"genre_scores_gemma":[0.55379987,0.00056898745,0.44340158,0.00009357558,0.000052657302,0.00014462507,0.00010353448,0.000060737853,0.0017743093],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9989108,0.0002369942,0.00009763293,0.00022687308,0.0004457236,0.00008202409],"domain_scores_gemma":[0.9987406,0.00041283708,0.00016395992,0.00037618665,0.0002495112,0.000056926485],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0016369333,0.00070001895,0.00082388014,0.0009404356,0.00039840292,0.001896447,0.0012889127,0.00085627305,0.0010859558],"category_scores_gemma":[0.0039828545,0.00040928545,0.001177842,0.000996695,0.0010253843,0.0026308931,0.0012449358,0.0011025171,0.00032634928],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027417208,0.00010799885,0.0014102542,0.00032814775,0.00015137589,0.0003338676,0.0004983178,0.64413714,0.027263675,0.1784601,0.0012824979,0.14575247],"study_design_scores_gemma":[0.000012936504,0.000058901354,0.00018993944,0.000016922628,0.000025545438,0.00006287579,0.000024823394,0.97101474,0.004046928,0.022455739,0.0020694302,0.000021315087],"about_ca_topic_score_codex":0.002273026,"about_ca_topic_score_gemma":0.0012886832,"teacher_disagreement_score":0.002273026,"about_ca_system_score_codex":0.0008330303,"about_ca_system_score_gemma":0.0007723685,"threshold_uncertainty_score":0.008657038},"labels":[],"label_agreement":null},{"id":"W3165295356","doi":"10.48550/arxiv.2105.12364","title":"Basic and Depression Specific Emotion Identification in Tweets: Multi-label Classification Experiments","year":2021,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Identification (biology); Depression (economics); Multi-label classification; Psychology; Emotion classification; Computer science; Cognitive psychology; Artificial intelligence; Biology; Economics","score_opus":0.1548741197765774,"score_gpt":0.24150600543745362,"score_spread":0.08663188566087623,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3165295356","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.983462,0.00084379665,0.008950314,0.00063601724,0.0003480728,0.00039860336,0.0025588854,0.0004729692,0.0023292464],"genre_scores_gemma":[0.96802795,0.00022232291,0.021013064,0.0003574682,0.00021743662,0.00037144162,0.0075035742,0.000084118554,0.0022026054],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.996506,0.0015500378,0.0003331845,0.0006578591,0.00062049035,0.00033243702],"domain_scores_gemma":[0.9879736,0.008380864,0.00068071095,0.0011101788,0.001153997,0.00070063013],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005846021,0.0013132736,0.0011985833,0.0011720485,0.0011523524,0.0010876972,0.0010972321,0.0024557717,0.001894484],"category_scores_gemma":[0.012297918,0.00026677095,0.0009759752,0.0009543311,0.00081855466,0.0018865068,0.0015790119,0.0024599277,0.0014591097],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.027201902,0.031189373,0.2680006,0.0027546103,0.0018431636,0.0019970846,0.0038366795,0.06763826,0.058536015,0.002307499,0.05227505,0.48241988],"study_design_scores_gemma":[0.0012383274,0.007455713,0.20974125,0.00025038948,0.0006713998,0.001471076,0.004560534,0.70708704,0.049239453,0.006933954,0.011067073,0.00028373793],"about_ca_topic_score_codex":0.0021920416,"about_ca_topic_score_gemma":0.00292443,"teacher_disagreement_score":0.005846021,"about_ca_system_score_codex":0.0006363801,"about_ca_system_score_gemma":0.0005310078,"threshold_uncertainty_score":0.030917108},"labels":[],"label_agreement":null},{"id":"W3176185023","doi":"10.1609/aaai.v35i12.17264","title":"Adversarial Partial Multi-Label Learning with Label Disambiguation","year":2021,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":24,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"China Scholarship Council; Natural Sciences and Engineering Research Council of Canada; Canada Research Chairs","keywords":"Computer science; Artificial intelligence; Machine learning; Feature (linguistics); Encoder; Minimax; Generative adversarial network; Feature vector; Adversarial system; Deep learning; Pattern recognition (psychology); Mathematics","score_opus":0.1163529464583123,"score_gpt":0.3151711112700287,"score_spread":0.19881816481171644,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3176185023","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02691586,0.00047691757,0.96907324,0.0004960708,0.00007052853,0.00005063689,0.00021751807,0.0010747596,0.0016244411],"genre_scores_gemma":[0.83069414,0.0002773875,0.16170083,0.0007668305,0.0001205034,0.00017474766,0.0011875517,0.00021977503,0.0048581404],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9984896,0.0006809551,0.000039708833,0.000433644,0.00023001058,0.00012599648],"domain_scores_gemma":[0.9969152,0.0018651033,0.00027519537,0.00060555607,0.00021368542,0.00012517716],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002372571,0.0015110617,0.0014922069,0.00054166093,0.00049272174,0.0010298477,0.0023226088,0.0016419315,0.0017723123],"category_scores_gemma":[0.004858369,0.00055924087,0.0009794221,0.00074492896,0.002079836,0.0023958506,0.0026682168,0.0029044019,0.0005550367],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00026566876,0.00008465877,0.0012408257,0.00009985854,0.00007210528,0.00014499058,0.0001185543,0.9063198,0.0031681515,0.019778829,0.004398352,0.064308256],"study_design_scores_gemma":[0.0000065840172,0.000017923005,0.000061408165,0.0000052068413,0.0000047484896,0.000019498944,0.000005143231,0.98871815,0.0006422682,0.010195956,0.0003178444,0.0000052469636],"about_ca_topic_score_codex":0.0019042487,"about_ca_topic_score_gemma":0.0026688334,"teacher_disagreement_score":0.002372571,"about_ca_system_score_codex":0.0009560935,"about_ca_system_score_gemma":0.0008104363,"threshold_uncertainty_score":0.012547553},"labels":[],"label_agreement":null},{"id":"W3180937499","doi":"10.5220/0011532400003318","title":"Multi-label Emotion Classification using Machine Learning and Deep Learning Methods","year":2022,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Laurentian University","funders":"","keywords":"Computer science; Artificial intelligence; Machine learning; Deep learning","score_opus":0.08875717388121936,"score_gpt":0.36689611242939263,"score_spread":0.2781389385481733,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3180937499","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0554819,0.0017986664,0.9298035,0.0014864132,0.000648105,0.00024371989,0.00080757524,0.004298237,0.005431912],"genre_scores_gemma":[0.6166049,0.00088847295,0.3641705,0.0009789247,0.00060405297,0.0004634731,0.00397597,0.00032549628,0.011988184],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99838066,0.0003796904,0.00011919003,0.0004993921,0.00033387684,0.00028726592],"domain_scores_gemma":[0.99817586,0.0007264775,0.00018648554,0.00021501129,0.00058244984,0.00011374699],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0020840357,0.0015880073,0.0011107975,0.0020967058,0.000677714,0.0022205506,0.0020794848,0.0018149717,0.0034269437],"category_scores_gemma":[0.0040979167,0.00047220313,0.0018371816,0.0013025556,0.0005291591,0.002252576,0.0018717617,0.0030830721,0.0020265384],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00037259606,0.00084330555,0.005093168,0.00020714138,0.00022124103,0.00018480973,0.00025146396,0.08825773,0.0086255185,0.0052204398,0.016479943,0.8742426],"study_design_scores_gemma":[0.000007030544,0.000028006021,0.0005155366,0.000018640241,0.000015533073,0.000015560905,0.000056579003,0.9912971,0.0017961996,0.0051969606,0.0010417136,0.000011160229],"about_ca_topic_score_codex":0.0039069215,"about_ca_topic_score_gemma":0.0044676354,"teacher_disagreement_score":0.0039069215,"about_ca_system_score_codex":0.0013948034,"about_ca_system_score_gemma":0.00077974156,"threshold_uncertainty_score":0.011464238},"labels":[],"label_agreement":null},{"id":"W3194282644","doi":"10.1186/s10033-021-00598-9","title":"ML-ANet: A Transfer Learning Approach Using Adaptation Network for Multi-label Image Classification in Autonomous Driving","year":2021,"lang":"en","type":"article","venue":"Chinese Journal of Mechanical Engineering","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":31,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Shenzhen Fundamental Research and Discipline Layout project; National Natural Science Foundation of China","keywords":"Reproducing kernel Hilbert space; Artificial intelligence; Computer science; Pattern recognition (psychology); Transfer of learning; Kernel (algebra); Embedding; Image (mathematics); Domain adaptation; Feature (linguistics); Adaptation (eye); Matching (statistics); Mathematics; Hilbert space; Statistics","score_opus":0.04901093335217047,"score_gpt":0.28099182056678207,"score_spread":0.2319808872146116,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3194282644","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.11293054,0.00081806764,0.8789112,0.0005131982,0.00033513224,0.00013001237,0.00018149163,0.002588996,0.0035914243],"genre_scores_gemma":[0.88133514,0.00027775168,0.10829971,0.00042242717,0.00015626855,0.00015430163,0.0006104896,0.00011343534,0.008630419],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9994025,0.000143646,0.000030445623,0.00022150666,0.00011356574,0.00008823598],"domain_scores_gemma":[0.99907,0.0002972409,0.00007608369,0.00010262031,0.00039128034,0.00006287752],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012541183,0.0009482982,0.0008369309,0.0007640582,0.00066294667,0.00074983755,0.001945328,0.0013641508,0.0019210579],"category_scores_gemma":[0.0020834724,0.00034943878,0.00080504845,0.00069204456,0.00057731895,0.0018316165,0.0012695186,0.0016739864,0.00058085273],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00038604508,0.00044560077,0.0036413542,0.000108633125,0.0001496897,0.00019677842,0.00014581664,0.4790505,0.009766749,0.0037500847,0.0063665705,0.49599227],"study_design_scores_gemma":[0.0000034848356,0.000023875473,0.00017240841,0.0000024709773,0.000006015333,0.0000106579855,0.00001128598,0.99769044,0.00083071593,0.0009780895,0.00026577126,0.0000048031557],"about_ca_topic_score_codex":0.0064923465,"about_ca_topic_score_gemma":0.0052093086,"teacher_disagreement_score":0.0064923465,"about_ca_system_score_codex":0.00084985275,"about_ca_system_score_gemma":0.0007202801,"threshold_uncertainty_score":0.012909114},"labels":[],"label_agreement":null},{"id":"W3195874243","doi":"10.3390/bdcc5030035","title":"Deep Neural Network and Boosting Based Hybrid Quality Ranking for e-Commerce Product Search","year":2021,"lang":"en","type":"article","venue":"Big Data and Cognitive Computing","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Chicoutimi","funders":"","keywords":"Computer science; Search engine; Ranking (information retrieval); Metric (unit); Product (mathematics); Information retrieval; Quality (philosophy); Context (archaeology); Machine learning; Artificial intelligence; Artificial neural network; Data mining; Task (project management); Boosting (machine learning); Mathematics; Engineering","score_opus":0.17758062056518018,"score_gpt":0.35664461575547407,"score_spread":0.1790639951902939,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3195874243","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.36079422,0.0064319195,0.6139843,0.0010375944,0.0003647795,0.000186882,0.0007498163,0.0049482076,0.01150236],"genre_scores_gemma":[0.9438397,0.00045871697,0.04983939,0.00019308718,0.00009150335,0.00004480273,0.0006270064,0.00005594134,0.004849785],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99964964,0.000076095894,0.000022730768,0.00006597897,0.000111420195,0.0000741212],"domain_scores_gemma":[0.9993788,0.00018963608,0.00006455236,0.000048701084,0.00027672655,0.00004153391],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0010027646,0.00068736455,0.00095481315,0.0010649434,0.0002351468,0.00074163097,0.0010474708,0.00073731964,0.0020055682],"category_scores_gemma":[0.0019606769,0.00025812746,0.00051920663,0.0011150914,0.00024494104,0.0011564862,0.0004680286,0.00086100976,0.0006995421],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005729271,0.0007372174,0.004435062,0.00015316125,0.00016122007,0.00008629982,0.000037628535,0.49550456,0.005303151,0.0039805393,0.0072831563,0.48174503],"study_design_scores_gemma":[0.000006640965,0.000040626368,0.00030292865,0.0000028404747,0.000009153456,0.0000061955643,0.0000029864998,0.9982091,0.00046037728,0.0007571667,0.00019874619,0.0000032574744],"about_ca_topic_score_codex":0.010286247,"about_ca_topic_score_gemma":0.011381136,"teacher_disagreement_score":0.010286247,"about_ca_system_score_codex":0.0011138173,"about_ca_system_score_gemma":0.0007363201,"threshold_uncertainty_score":0.020452738},"labels":[],"label_agreement":null},{"id":"W3210819377","doi":"10.1109/tai.2021.3120043","title":"Smoothed Generalized Dirichlet: A Novel Count-Data Model for Detecting Emotional States","year":2021,"lang":"en","type":"article","venue":"IEEE Transactions on Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Dirichlet distribution; Burstiness; Count data; Generalized Dirichlet distribution; Mathematics; Computer science; Hierarchical Dirichlet process; Applied mathematics; Multinomial distribution; Cluster analysis; Algorithm; Artificial intelligence; Statistics; Dirichlet series; Mathematical analysis","score_opus":0.16196338292156895,"score_gpt":0.3418206002684397,"score_spread":0.17985721734687074,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3210819377","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008622046,0.0003847737,0.9889685,0.00030189127,0.00009010302,0.00007364529,0.00041172642,0.00048429234,0.0006630292],"genre_scores_gemma":[0.4321586,0.0013622631,0.55374795,0.0006518534,0.00064568367,0.00092099066,0.0034380658,0.0005105662,0.0065640546],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99566996,0.0019288755,0.00027161685,0.0010891616,0.0007581327,0.0002823542],"domain_scores_gemma":[0.99135876,0.005843722,0.00063451694,0.0010508883,0.0009008669,0.00021121469],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0052046697,0.0015173625,0.002534986,0.0034574217,0.0011377882,0.0029981493,0.0049808514,0.0022632042,0.00394162],"category_scores_gemma":[0.022871777,0.0011134375,0.0023180787,0.0041290848,0.001803363,0.0060586645,0.0025316929,0.003166581,0.0015993227],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010123852,0.0003338887,0.012305203,0.000710016,0.0005588939,0.00056824874,0.0015768048,0.42379618,0.0071453047,0.19832465,0.014170895,0.33949748],"study_design_scores_gemma":[0.000015671263,0.000025252213,0.00057359686,0.000024943263,0.000023978142,0.00008712392,0.0000611729,0.93144566,0.0006646499,0.064960435,0.0020872625,0.000030294535],"about_ca_topic_score_codex":0.005260356,"about_ca_topic_score_gemma":0.0063238824,"teacher_disagreement_score":0.005260356,"about_ca_system_score_codex":0.0016656116,"about_ca_system_score_gemma":0.00125074,"threshold_uncertainty_score":0.027525187},"labels":[],"label_agreement":null},{"id":"W4205732624","doi":"10.1007/s40747-021-00611-7","title":"Semi-supervised multi-label classification using an extended graph-based manifold regularization","year":2022,"lang":"en","type":"article","venue":"Complex & Intelligent Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Natural Sciences and Engineering Research Council of Canada; China Scholarship Council","keywords":"Semi-supervised learning; Artificial intelligence; Weighting; Regularization (linguistics); Pattern recognition (psychology); Graph; Labeled data; Manifold alignment; Benchmark (surveying); Computer science; Multi-label classification; Supervised learning; Manifold (fluid mechanics); Extension (predicate logic); Machine learning; Mathematics; Algorithm; Nonlinear dimensionality reduction; Artificial neural network; Theoretical computer science; Dimensionality reduction","score_opus":0.19632244367245735,"score_gpt":0.3285660267384981,"score_spread":0.13224358306604075,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4205732624","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0071815746,0.000107074564,0.9910773,0.00016308915,0.00002534793,0.000064146996,0.00003760736,0.00086587545,0.00047801956],"genre_scores_gemma":[0.20959201,0.00014849498,0.78624344,0.00031948893,0.00013974898,0.0002917395,0.00070099795,0.0002929164,0.002271179],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9968099,0.0013025813,0.00012993485,0.00081446354,0.00078577024,0.00015737346],"domain_scores_gemma":[0.99622834,0.0015615884,0.00040101254,0.00081008725,0.0008392551,0.00015970774],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032886474,0.0011231262,0.0018390749,0.0024103776,0.0010965478,0.0014635065,0.0029272512,0.0024197856,0.0014862147],"category_scores_gemma":[0.0065006004,0.00053246546,0.0015692322,0.001870011,0.0016862594,0.0026652908,0.0024015093,0.0027106174,0.0009969372],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021711008,0.00039471377,0.0025818027,0.00021105575,0.0002445319,0.00016264438,0.00039322893,0.31549215,0.014829097,0.03401486,0.011797977,0.6196608],"study_design_scores_gemma":[0.00000894517,0.00002463919,0.00014819863,0.0000070910805,0.0000073598435,0.00003993078,0.000014759784,0.98714346,0.0012669847,0.010583434,0.00074491743,0.000010277434],"about_ca_topic_score_codex":0.0025317855,"about_ca_topic_score_gemma":0.003683542,"teacher_disagreement_score":0.0032886474,"about_ca_system_score_codex":0.0008920208,"about_ca_system_score_gemma":0.0014034029,"threshold_uncertainty_score":0.017392218},"labels":[],"label_agreement":null},{"id":"W4206897013","doi":"10.1109/dasa53625.2021.9682402","title":"A Moroccan News Articles Dataset (MNAD) For Arabic Text Categorization","year":2021,"lang":"en","type":"article","venue":"2021 International Conference on Decision Aid Sciences and Application (DASA)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Chicoutimi","funders":"","keywords":"Computer science; Artificial intelligence; Natural language processing; Support vector machine; Naive Bayes classifier; Confusion matrix; Categorization; Context (archaeology); Arabic; Random forest; Gradient boosting; Confusion; Machine learning; Linguistics; Geography","score_opus":0.06935459005021938,"score_gpt":0.3509310044313946,"score_spread":0.2815764143811752,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4206897013","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.17433643,0.0049505588,0.005024823,0.0010670037,0.0008977282,0.0015132977,0.7842442,0.009101617,0.018864386],"genre_scores_gemma":[0.052367695,0.0007162977,0.01635966,0.00017078767,0.00014979903,0.0009089875,0.92253155,0.00015091433,0.006644269],"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9992436,0.0001448355,0.00012210429,0.00017658825,0.0002177926,0.00009510789],"domain_scores_gemma":[0.99864405,0.00027679594,0.00011552708,0.00021917773,0.0005789778,0.0001655201],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007786501,0.001841126,0.000824433,0.0074812607,0.0016018295,0.0010749,0.0009804047,0.0013822634,0.009086772],"category_scores_gemma":[0.002652671,0.00019816341,0.00077167887,0.0045946813,0.0003648844,0.00090872607,0.0010504534,0.0009571635,0.011835174],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017869266,0.0017626084,0.019722534,0.0050286273,0.00033073628,0.003161571,0.0012251742,0.0032861251,0.027352419,0.0015236011,0.67372286,0.26109675],"study_design_scores_gemma":[0.00041079693,0.0006379879,0.10191752,0.00055713835,0.00021874857,0.0023797231,0.0027057051,0.02406427,0.023022281,0.0011745332,0.8427247,0.00018665893],"about_ca_topic_score_codex":0.021417513,"about_ca_topic_score_gemma":0.03662929,"teacher_disagreement_score":0.021417513,"about_ca_system_score_codex":0.0012038386,"about_ca_system_score_gemma":0.0011478836,"threshold_uncertainty_score":0.04258567},"labels":[],"label_agreement":null},{"id":"W4211256381","doi":"10.1109/access.2022.3151048","title":"MLCM: Multi-Label Confusion Matrix","year":2022,"lang":"en","type":"article","venue":"IEEE Access","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":409,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University; Vector Institute; McMaster University","funders":"Ministère de la Défense Nationale","keywords":"Computer science; Confusion; Confusion matrix; Artificial intelligence; Classifier (UML); Class (philosophy); Ambiguity; Machine learning; Programming language","score_opus":0.08270770067299012,"score_gpt":0.36757054662201094,"score_spread":0.28486284594902084,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4211256381","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0024713948,0.0007961969,0.9293271,0.0008850894,0.00054811017,0.00077460456,0.01029852,0.049428184,0.0054708403],"genre_scores_gemma":[0.06476128,0.0006537208,0.8915112,0.0010080668,0.00045467558,0.0023351153,0.024719,0.0034360178,0.011120804],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9889236,0.0032546064,0.00096603995,0.0019221032,0.0043955315,0.0005382273],"domain_scores_gemma":[0.9861109,0.005012678,0.0012272528,0.0025003743,0.004664953,0.0004837859],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005264724,0.003701651,0.0018874849,0.008003796,0.0018620524,0.004771274,0.0053317724,0.0031758344,0.036268175],"category_scores_gemma":[0.027447516,0.0011172604,0.0020184058,0.0043768995,0.0013461873,0.0060206447,0.0050361445,0.004282397,0.027325362],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007385141,0.00034332142,0.0016449383,0.0015818077,0.00019410726,0.00042206686,0.0003862878,0.03430916,0.011061001,0.030983336,0.26154646,0.65678895],"study_design_scores_gemma":[0.00019039966,0.00035168912,0.0026545608,0.00045509412,0.00008576733,0.0008977198,0.00030396806,0.63710624,0.047765695,0.12044917,0.18925488,0.0004847844],"about_ca_topic_score_codex":0.0071917144,"about_ca_topic_score_gemma":0.008582709,"teacher_disagreement_score":0.036268175,"about_ca_system_score_codex":0.0022376422,"about_ca_system_score_gemma":0.0048525264,"threshold_uncertainty_score":0.12132913},"labels":[],"label_agreement":null},{"id":"W4213112533","doi":"10.3758/s13428-022-01801-y","title":"Machine learning to detect invalid text responses: Validation and comparison to existing detection methods","year":2022,"lang":"en","type":"article","venue":"Behavior Research Methods","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":17,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Natural language processing; Artificial intelligence; Coding (social sciences); Word (group theory); Machine learning; Code (set theory); Quality (philosophy); Information retrieval; Linguistics; Statistics","score_opus":0.421437191862916,"score_gpt":0.5856823952146699,"score_spread":0.1642452033517539,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4213112533","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.61498755,0.002327274,0.3637306,0.0006438135,0.00067270943,0.0020355296,0.0028040307,0.0063055595,0.006492964],"genre_scores_gemma":[0.8483266,0.0006065616,0.14284112,0.0002884029,0.00019512931,0.00082459813,0.0026999887,0.0002733419,0.003944223],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9872499,0.006348735,0.0012018725,0.0016495264,0.0031067887,0.00044327206],"domain_scores_gemma":[0.888906,0.08579237,0.0049608843,0.0069124154,0.012433184,0.0009950494],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014740348,0.0012825785,0.0012315835,0.0048763086,0.0007867283,0.0014963526,0.0021258956,0.001788404,0.0026610822],"category_scores_gemma":[0.056078736,0.00023186146,0.0007132619,0.0018369692,0.0006271202,0.0020752293,0.0011792284,0.0016254399,0.0022387507],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0037381537,0.0051403097,0.10165739,0.0012899712,0.0006364932,0.00023192246,0.00093884626,0.018702846,0.014048349,0.001685065,0.007489231,0.8444415],"study_design_scores_gemma":[0.00033462053,0.002258298,0.052063692,0.00025178154,0.0004196089,0.0007968134,0.00070583617,0.9087516,0.02681953,0.003375618,0.004108669,0.000113866925],"about_ca_topic_score_codex":0.0027526466,"about_ca_topic_score_gemma":0.0022743032,"teacher_disagreement_score":0.014740348,"about_ca_system_score_codex":0.00086031924,"about_ca_system_score_gemma":0.0015895729,"threshold_uncertainty_score":0.077955365},"labels":[],"label_agreement":null},{"id":"W4224262247","doi":"10.1007/s42488-022-00066-6","title":"Classifying multi-level product categories using dynamic masking and transformer models","year":2022,"lang":"en","type":"article","venue":"Journal of Data Information and Management","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":10,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Computer science; Categorization; Transformer; Generalizability theory; Machine learning; Artificial intelligence; Product (mathematics); Deep learning; Natural language processing; Engineering; Mathematics","score_opus":0.14411948755080517,"score_gpt":0.3142199106093222,"score_spread":0.17010042305851703,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4224262247","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.2877511,0.00052518875,0.70339185,0.00026946765,0.00009205692,0.00018543376,0.0011902075,0.0019041676,0.0046906383],"genre_scores_gemma":[0.8911952,0.00021417101,0.10420569,0.000049430393,0.000025867446,0.000075925986,0.0015231958,0.000098980454,0.0026115107],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99920815,0.00013652004,0.00006501114,0.00019976469,0.00025992852,0.00013067598],"domain_scores_gemma":[0.9984255,0.0006847619,0.00014783067,0.00025755903,0.0004100903,0.00007424352],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012289387,0.00068866776,0.0006048186,0.0027159655,0.00036899096,0.0018849013,0.0010684162,0.00066399656,0.0027904557],"category_scores_gemma":[0.002990953,0.000259446,0.001488792,0.0018817891,0.0004348035,0.0026633965,0.000978585,0.00076640776,0.0012723664],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017343651,0.00058636063,0.036253873,0.0002813386,0.00025374684,0.0003634524,0.00045172803,0.108253896,0.029697329,0.032024253,0.004560508,0.7855392],"study_design_scores_gemma":[0.000013097798,0.00011593979,0.004435488,0.000019178171,0.000074907985,0.00012638295,0.00011052601,0.97207737,0.004759914,0.01669646,0.0015495716,0.000021198824],"about_ca_topic_score_codex":0.0061382228,"about_ca_topic_score_gemma":0.0053412947,"teacher_disagreement_score":0.0061382228,"about_ca_system_score_codex":0.0008110413,"about_ca_system_score_gemma":0.0009601059,"threshold_uncertainty_score":0.012205005},"labels":[],"label_agreement":null},{"id":"W4225401927","doi":"10.32473/flairs.v35i.130667","title":"Integration of Multivariate Beta-based Hidden Markov Models and Support Vector Machines with Medical Applications","year":2022,"lang":"en","type":"article","venue":"Proceedings of the ... International Florida Artificial Intelligence Research Society Conference","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Hidden Markov model; Discriminative model; Support vector machine; Artificial intelligence; Computer science; Fisher kernel; Pattern recognition (psychology); Kernel (algebra); Generative model; Machine learning; Multivariate statistics; Decision boundary; Kernel method; Generative grammar; Mathematics; Kernel Fisher discriminant analysis","score_opus":0.11285070093023435,"score_gpt":0.3615773986869301,"score_spread":0.24872669775669576,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4225401927","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011583404,0.000756228,0.98611176,0.00026831942,0.00006110445,0.000016389675,0.000059326227,0.0003824762,0.00076087733],"genre_scores_gemma":[0.7935287,0.001526108,0.20007728,0.00028854425,0.0002297726,0.000101367514,0.00039883563,0.0001051055,0.003744278],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99926084,0.00025489603,0.000049254166,0.0001726836,0.00019262354,0.00006979636],"domain_scores_gemma":[0.99867564,0.00079842086,0.00013249593,0.00010764326,0.00022576372,0.000060084498],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001475452,0.0005971421,0.0008197559,0.00091794954,0.00020786347,0.0007060526,0.0010879366,0.0009144499,0.0010958089],"category_scores_gemma":[0.003815525,0.0004131337,0.00094400183,0.000920567,0.00038508972,0.0014626705,0.0007180835,0.0010969297,0.00060789863],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020015144,0.00018683985,0.009549574,0.00019412675,0.000251923,0.00026313512,0.00016999523,0.59177107,0.0053986646,0.040051483,0.0027626683,0.34920037],"study_design_scores_gemma":[0.0000027344431,0.000020620168,0.0003917675,0.000005960464,0.000012751444,0.000038030026,0.000005532215,0.99151707,0.00033040825,0.0070931613,0.00057522394,0.000006753176],"about_ca_topic_score_codex":0.0024932767,"about_ca_topic_score_gemma":0.002474468,"teacher_disagreement_score":0.0024932767,"about_ca_system_score_codex":0.0004492812,"about_ca_system_score_gemma":0.00054727576,"threshold_uncertainty_score":0.007803023},"labels":[],"label_agreement":null},{"id":"W4235920966","doi":"10.1007/978-1-4939-7131-2_101098","title":"Social Classification","year":2018,"lang":"en","type":"book-chapter","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Computer science","score_opus":0.069286367992859,"score_gpt":0.28920243843250193,"score_spread":0.21991607043964292,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4235920966","genre_codex":"other","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00898296,0.0039128372,0.16133663,0.008540761,0.002128892,0.0004317394,0.0025642167,0.0026207794,0.8094811],"genre_scores_gemma":[0.12934169,0.0054188934,0.08559676,0.0019273981,0.0032736128,0.0006267454,0.0081265755,0.00093576335,0.7647526],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99905604,0.0002067663,0.000039117767,0.00023469632,0.00039329057,0.00007014309],"domain_scores_gemma":[0.9988431,0.0003540373,0.00006912556,0.0003209125,0.00034179486,0.000070972455],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0010943433,0.0009634028,0.0005339536,0.0031389527,0.001738837,0.0034820887,0.0011003378,0.0010066916,0.06207945],"category_scores_gemma":[0.0034172025,0.00024113346,0.00070823607,0.0024493693,0.0009645343,0.003812592,0.0018707482,0.001175747,0.04404182],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000028388555,0.000090520465,0.0007552539,0.00016535645,0.000024914409,0.000039331677,0.00021026256,0.0008543974,0.0014849346,0.18207553,0.16313665,0.65113455],"study_design_scores_gemma":[0.000008807607,0.00003243407,0.0015694813,0.00015551852,0.000026214684,0.0002068882,0.0003009284,0.012558562,0.0029955902,0.16415593,0.8179651,0.000024680374],"about_ca_topic_score_codex":0.0018780563,"about_ca_topic_score_gemma":0.0031603465,"teacher_disagreement_score":0.06207945,"about_ca_system_score_codex":0.0016516399,"about_ca_system_score_gemma":0.0012120364,"threshold_uncertainty_score":0.20767641},"labels":[],"label_agreement":null},{"id":"W4236164787","doi":"10.1016/s1365-6937(09)70136-4","title":"Alfa Laval AB, Sweden","year":2009,"lang":"en","type":"article","venue":"Filtration Industry Analyst","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Computer science; Natural language processing; Knowledge base; Artificial intelligence; Sentence; Leverage (statistics); Text processing; Information retrieval; Task (project management); Set (abstract data type); Text graph; Question answering; Ranking (information retrieval); Noisy text analytics; Text mining","score_opus":0.027229634078762832,"score_gpt":0.2810259457960668,"score_spread":0.253796311717304,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4236164787","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.024979098,0.045749746,0.010544525,0.007861055,0.0033917832,0.0002965737,0.02358583,0.0066266367,0.87696475],"genre_scores_gemma":[0.056159712,0.024474723,0.0174492,0.00074988353,0.0004892603,0.00026740893,0.021544198,0.0027878603,0.8760777],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.997352,0.00020468878,0.00019430286,0.0011371609,0.0007268441,0.00038506914],"domain_scores_gemma":[0.99801826,0.0006697801,0.00021335647,0.0002852045,0.00051388197,0.00029960324],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0011704838,0.0034046052,0.0021379762,0.0036495724,0.0026218647,0.009792902,0.0025100447,0.0036721167,0.41938034],"category_scores_gemma":[0.003360168,0.0011190455,0.0011899683,0.002863144,0.0013556986,0.0037691146,0.004420514,0.0022531825,0.53195447],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015175468,0.0006051497,0.0039325515,0.0022240137,0.0001807968,0.0022234283,0.0005603337,0.0039643487,0.01035951,0.015159258,0.20021513,0.759058],"study_design_scores_gemma":[0.000112042115,0.00016706985,0.004373715,0.00083844597,0.000049356986,0.0011595585,0.00040371495,0.0017408621,0.0044658156,0.005992355,0.9806323,0.00006483437],"about_ca_topic_score_codex":0.0042717904,"about_ca_topic_score_gemma":0.004138879,"teacher_disagreement_score":0.41938034,"about_ca_system_score_codex":0.0018121247,"about_ca_system_score_gemma":0.0029375455,"threshold_uncertainty_score":0.8281835},"labels":[],"label_agreement":null},{"id":"W4238938492","doi":"10.31436/iiumej.v22i2.2108","title":"Editorial","year":2021,"lang":"en","type":"editorial","venue":"IIUM Engineering Journal","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Islam; Malay; Engineering; Library science; Management; Theology; Philosophy; Computer science","score_opus":0.00472315591617843,"score_gpt":0.21937804233084546,"score_spread":0.21465488641466704,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4238938492","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00029872384,0.013989425,0.0007881434,0.060233746,0.74299,0.00021142935,0.0015598781,0.0009638474,0.17896476],"genre_scores_gemma":[0.0044001616,0.017956773,0.0010095031,0.033315863,0.38297868,0.00018703322,0.0022438145,0.00081109366,0.5570971],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99617636,0.0005280636,0.00037531744,0.0006917795,0.001851515,0.00037706606],"domain_scores_gemma":[0.9801072,0.0020652616,0.0010100811,0.0013421173,0.011989012,0.0034863572],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0032225256,0.0018226373,0.0014587493,0.0034076564,0.0022926964,0.009491924,0.0024104535,0.0036768368,0.3972975],"category_scores_gemma":[0.024797132,0.00060100737,0.0011790532,0.0015892506,0.0010934522,0.004274454,0.0022144988,0.005084956,0.30780378],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000015500595,0.0000043410246,0.00003260849,0.00009869927,0.000002657842,0.000045331766,0.000011541145,0.000009084987,0.00003364376,0.00047708052,0.98592514,0.01334445],"study_design_scores_gemma":[0.000010098734,0.0000071391514,0.000084032494,0.00017308495,0.0000040890686,0.000103308026,0.00003747057,0.00001990049,0.00005206606,0.0004584786,0.9990458,0.000004469148],"about_ca_topic_score_codex":0.0013295796,"about_ca_topic_score_gemma":0.002041618,"teacher_disagreement_score":0.6027025,"about_ca_system_score_codex":0.002192638,"about_ca_system_score_gemma":0.0051558036,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W4242574039","doi":"10.1007/978-1-4614-6170-8_100825","title":"Friend Recommender System","year":2014,"lang":"en","type":"book-chapter","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Recommender system; Computer science; World Wide Web","score_opus":0.024773685038852206,"score_gpt":0.22016842015434493,"score_spread":0.1953947351154927,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4242574039","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.042992957,0.017635478,0.529309,0.003585687,0.0030954771,0.0009091972,0.0066932105,0.02819869,0.36758035],"genre_scores_gemma":[0.13366434,0.008052981,0.24135244,0.0010379301,0.001108306,0.0002684921,0.01025544,0.00097457663,0.6032855],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9996074,0.00007101768,0.000016780206,0.000111644484,0.00016068957,0.00003260033],"domain_scores_gemma":[0.9994905,0.00009350712,0.000018604671,0.00013991147,0.00020541642,0.0000520121],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005688583,0.00065878907,0.00082059065,0.0015101662,0.0013112812,0.0014912722,0.0012598118,0.0011993165,0.034525797],"category_scores_gemma":[0.0017292983,0.00030446405,0.00064296427,0.0014160696,0.00013459714,0.0024252718,0.0008033679,0.00089311245,0.03007234],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015043814,0.00025675204,0.0016108174,0.0003710951,0.000106636835,0.00016673277,0.00018291906,0.0017701611,0.004634568,0.015585245,0.28005266,0.69511205],"study_design_scores_gemma":[0.00007222248,0.00029444663,0.0033638505,0.00015416324,0.00025702317,0.0016358519,0.0002899621,0.12099123,0.012801826,0.015540287,0.84443897,0.00016028636],"about_ca_topic_score_codex":0.004425875,"about_ca_topic_score_gemma":0.012045117,"teacher_disagreement_score":0.034525797,"about_ca_system_score_codex":0.00044137702,"about_ca_system_score_gemma":0.00049545214,"threshold_uncertainty_score":0.11550027},"labels":[],"label_agreement":null},{"id":"W4245584151","doi":"10.1145/564437.564438","title":"Using self-supervised word segmentation in Chinese information retrieval","year":2002,"lang":"en","type":"article","venue":"Proceedings of the 25th annual international ACM SIGIR conference on Research and development in information retrieval - SIGIR '02","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Artificial intelligence; Character (mathematics); Word (group theory); Text segmentation; Natural language processing; Segmentation; Pattern recognition (psychology)","score_opus":0.08421405815381645,"score_gpt":0.335416479760529,"score_spread":0.2512024216067126,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4245584151","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.11168193,0.0011147794,0.8772833,0.00020180772,0.00010148459,0.00034057864,0.000153159,0.0043301843,0.0047927825],"genre_scores_gemma":[0.5077643,0.0005716217,0.4838929,0.00021863704,0.00018986406,0.00039377715,0.00093617867,0.00035619581,0.0056765433],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99895954,0.00025923172,0.00011739856,0.00027244643,0.0003073914,0.000083959545],"domain_scores_gemma":[0.99866784,0.00038632326,0.00016254683,0.0002460369,0.00048612538,0.00005126043],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00074244203,0.00057608244,0.0007279543,0.002303974,0.0007352203,0.000659795,0.0008049821,0.0005158972,0.001412224],"category_scores_gemma":[0.0022132883,0.00033381747,0.0006663745,0.0021502962,0.0008875207,0.001907928,0.0006458154,0.0003965546,0.0011780137],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025075878,0.00019680499,0.002881498,0.00037600205,0.000089278896,0.00018375444,0.0005113674,0.024408612,0.088473506,0.006318054,0.0049083293,0.8714019],"study_design_scores_gemma":[0.00008865576,0.0003773827,0.005164707,0.000027397853,0.0001364163,0.00040904267,0.00018138906,0.86793894,0.10606665,0.008310353,0.011198683,0.00010034294],"about_ca_topic_score_codex":0.005379335,"about_ca_topic_score_gemma":0.007238353,"teacher_disagreement_score":0.005379335,"about_ca_system_score_codex":0.0005862002,"about_ca_system_score_gemma":0.0013403625,"threshold_uncertainty_score":0.0106960535},"labels":[],"label_agreement":null},{"id":"W4245642361","doi":"10.1109/ideas.2007.4318085","title":"An Approach for Text Categorization in Digital Library","year":2007,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Categorization; Computer science; Hierarchy; Text categorization; Information retrieval; Digital library; Document classification; Library classification; Artificial intelligence; World Wide Web","score_opus":0.016244597061944043,"score_gpt":0.2479245301932853,"score_spread":0.23167993313134128,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4245642361","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009849273,0.0007096164,0.9818902,0.0006592786,0.0001497739,0.0006993561,0.0003421508,0.0016362884,0.0040640784],"genre_scores_gemma":[0.04568258,0.0003267803,0.94522464,0.00027174465,0.000097852324,0.0006047299,0.000651303,0.00006873927,0.0070715565],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9975745,0.00054372527,0.00017998255,0.00049999374,0.0010603626,0.00014145247],"domain_scores_gemma":[0.9986143,0.0004334453,0.00010721988,0.00023399551,0.00052492565,0.000086002954],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001251697,0.0006428411,0.0005883609,0.004402564,0.002038433,0.0019435246,0.0016885817,0.0013457861,0.0031751646],"category_scores_gemma":[0.0036706917,0.00030526918,0.0012615385,0.0043237293,0.0009845382,0.0022122366,0.0015779599,0.0014265085,0.0022859843],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00010789221,0.0002835893,0.0020013147,0.00031853103,0.000065625616,0.0002112584,0.0009430245,0.0072195027,0.019918341,0.026927434,0.012649372,0.92935413],"study_design_scores_gemma":[0.00012029266,0.00049239385,0.009036628,0.00023655414,0.00028716066,0.0020452433,0.0017413613,0.58688456,0.046184033,0.14178804,0.21099915,0.00018452288],"about_ca_topic_score_codex":0.008209468,"about_ca_topic_score_gemma":0.0115193995,"teacher_disagreement_score":0.008209468,"about_ca_system_score_codex":0.0016179619,"about_ca_system_score_gemma":0.0018449338,"threshold_uncertainty_score":0.016323388},"labels":[],"label_agreement":null},{"id":"W4245824053","doi":"10.1007/978-3-540-68636-1_62","title":"Maximum Entropy Modeling with Feature Selection for Text Categorization","year":2008,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Feature selection; Categorization; Principle of maximum entropy; Text categorization; Computer science; Artificial intelligence; Entropy (arrow of time); Pattern recognition (psychology); Feature (linguistics); Selection (genetic algorithm); Data mining; Machine learning; Natural language processing","score_opus":0.018386091831786494,"score_gpt":0.23345593499830458,"score_spread":0.2150698431665181,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4245824053","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010912959,0.00049322465,0.9870602,0.00014484607,0.00005584601,0.00004624872,0.00016356831,0.0006540855,0.0004689447],"genre_scores_gemma":[0.5628306,0.0008957451,0.42583218,0.00019621609,0.00036040068,0.0004819935,0.0017580639,0.00033604223,0.007308687],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99898046,0.00050464185,0.00006311217,0.00016951465,0.00020401637,0.00007818088],"domain_scores_gemma":[0.99767727,0.0018437017,0.00008095339,0.00018695708,0.00017827735,0.000032863583],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0022114518,0.00079753814,0.0014633532,0.0010741092,0.00056426635,0.0011140263,0.001347379,0.00091242633,0.0020559535],"category_scores_gemma":[0.0045665884,0.0004644288,0.001490588,0.001480532,0.00041548666,0.0020494969,0.0010534147,0.0013119839,0.0010985694],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00052609027,0.0002951717,0.0014946903,0.00022988454,0.00027913266,0.00020012794,0.0001565619,0.38858312,0.009732528,0.013811996,0.008851782,0.5758389],"study_design_scores_gemma":[0.000004965672,0.000021130822,0.0002603818,0.000004717073,0.0000130536655,0.00001895743,0.0000057884977,0.9903115,0.0011451753,0.007872181,0.00033433558,0.000007824043],"about_ca_topic_score_codex":0.0022214942,"about_ca_topic_score_gemma":0.0021506075,"teacher_disagreement_score":0.0022214942,"about_ca_system_score_codex":0.0005595272,"about_ca_system_score_gemma":0.0006030877,"threshold_uncertainty_score":0.011695385},"labels":[],"label_agreement":null},{"id":"W4248349546","doi":"10.1007/978-0-387-39940-9_3794","title":"Text Data Mining","year":2009,"lang":"en","type":"book-chapter","venue":"Encyclopedia of Database Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Information retrieval; Data science; Data mining","score_opus":0.046639542449223234,"score_gpt":0.26920340928072506,"score_spread":0.2225638668315018,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4248349546","genre_codex":"methods","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0076632174,0.01367898,0.6635272,0.004328174,0.002222514,0.002078664,0.05972769,0.043560445,0.20321317],"genre_scores_gemma":[0.027804686,0.011561713,0.6382696,0.0018700631,0.0009284393,0.0011679878,0.09304772,0.002831017,0.22251867],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9988661,0.00009050935,0.000115265066,0.00031126942,0.0005672236,0.00004963577],"domain_scores_gemma":[0.9984686,0.00044287357,0.00009099173,0.0003625884,0.0005655066,0.000069504385],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001171684,0.0013746069,0.0010256569,0.006269133,0.0008976233,0.0031933542,0.0019830123,0.0007449445,0.04529076],"category_scores_gemma":[0.0036555962,0.0005429095,0.0012268353,0.0066335513,0.0003687399,0.0028417015,0.0015597986,0.0011344353,0.07627813],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000040314688,0.000079392696,0.0006065623,0.0005260296,0.000046526835,0.00009099978,0.00007961903,0.00042999344,0.004368423,0.007789565,0.16771065,0.818232],"study_design_scores_gemma":[0.0000221357,0.000061973566,0.0019509051,0.0003517676,0.000076132455,0.00089397695,0.0001364366,0.009881438,0.022313384,0.026597928,0.9376697,0.00004413434],"about_ca_topic_score_codex":0.0008887131,"about_ca_topic_score_gemma":0.0015252852,"teacher_disagreement_score":0.04529076,"about_ca_system_score_codex":0.00045836027,"about_ca_system_score_gemma":0.0011628579,"threshold_uncertainty_score":0.15151274},"labels":[],"label_agreement":null},{"id":"W4250326346","doi":"10.1162/coli_r_00106","title":"Briefly Noted","year":2012,"lang":"en","type":"article","venue":"Computational Linguistics","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Computer science","score_opus":0.028066313871546286,"score_gpt":0.2845006114861258,"score_spread":0.25643429761457953,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4250326346","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0009761539,0.0069656773,0.011754706,0.011782077,0.017565561,0.00026357852,0.011206121,0.00380304,0.93568313],"genre_scores_gemma":[0.0045973603,0.0038592212,0.0052029975,0.0036989388,0.0017286413,0.00017510366,0.007398213,0.0015835712,0.97175604],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9977049,0.00036702753,0.00022926285,0.0006009305,0.0008299167,0.00026790382],"domain_scores_gemma":[0.99760145,0.00036091602,0.00017464004,0.0005522084,0.0009494567,0.00036130758],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0013804073,0.0014678815,0.001152048,0.0027471334,0.0027356967,0.009323098,0.0023482454,0.0028288027,0.61005485],"category_scores_gemma":[0.0070065884,0.00055365585,0.000996172,0.0044957073,0.0012422795,0.008018515,0.0045044012,0.0029058575,0.5779294],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000040068608,0.00001935639,0.00025137662,0.00024551482,0.000007899786,0.0000657247,0.00022639941,0.00006459303,0.00022988881,0.04176563,0.860777,0.09630644],"study_design_scores_gemma":[0.0000021088258,0.000005285101,0.00009324764,0.000054291984,0.0000016519626,0.00004794729,0.000065505876,0.000022704817,0.000057337147,0.0023176202,0.9973283,0.000004052216],"about_ca_topic_score_codex":0.003938876,"about_ca_topic_score_gemma":0.0074574063,"teacher_disagreement_score":0.38994515,"about_ca_system_score_codex":0.0022390096,"about_ca_system_score_gemma":0.0028998316,"threshold_uncertainty_score":0.55620944},"labels":[],"label_agreement":null},{"id":"W4252608527","doi":"10.1007/978-1-4939-7131-2_100956","title":"Recommendation System","year":2018,"lang":"en","type":"book-chapter","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Computer science","score_opus":0.031229254184842396,"score_gpt":0.23884589371208095,"score_spread":0.20761663952723855,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4252608527","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.026115406,0.0074405833,0.43983892,0.0023772123,0.0021063262,0.0033509636,0.047140215,0.15699463,0.31463572],"genre_scores_gemma":[0.08967659,0.00551136,0.3608639,0.0016635018,0.000671978,0.000984381,0.07633399,0.0019214487,0.46237287],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9994747,0.000041356107,0.000036678324,0.00018571095,0.00021282404,0.00004876618],"domain_scores_gemma":[0.9995442,0.000038821134,0.000014710045,0.00014903833,0.00021561117,0.000037595244],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00049800344,0.0009475558,0.001052898,0.002332742,0.0011023543,0.0018197665,0.0015827398,0.0010921276,0.05891863],"category_scores_gemma":[0.0011955041,0.0003652519,0.00093412737,0.002512633,0.0001469704,0.0016588538,0.0006696331,0.00081680494,0.079736724],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002767225,0.00024422494,0.0014554741,0.00041763374,0.00011270193,0.00016036576,0.000042209085,0.0016903034,0.014891659,0.0062880926,0.35454124,0.61987936],"study_design_scores_gemma":[0.00020854665,0.00024808053,0.0040309825,0.00016882856,0.00038786285,0.0010796941,0.000118860175,0.12018595,0.04972758,0.009681815,0.81400025,0.00016161546],"about_ca_topic_score_codex":0.010587634,"about_ca_topic_score_gemma":0.0134315975,"teacher_disagreement_score":0.05891863,"about_ca_system_score_codex":0.0006415589,"about_ca_system_score_gemma":0.0010650017,"threshold_uncertainty_score":0.19710243},"labels":[],"label_agreement":null},{"id":"W4254319338","doi":"10.1007/978-1-4939-7131-2_100396","title":"Friend Recommender System","year":2018,"lang":"en","type":"book-chapter","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Recommender system; Computer science; World Wide Web; Information retrieval","score_opus":0.03278790746785005,"score_gpt":0.23560029599278515,"score_spread":0.2028123885249351,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4254319338","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04673428,0.018118324,0.4906809,0.0040944014,0.0036828185,0.0010123159,0.008155544,0.032702226,0.39481917],"genre_scores_gemma":[0.14375247,0.008184279,0.22863957,0.0011662125,0.001286156,0.00029623223,0.0123433145,0.0010828205,0.6032489],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9996049,0.00007117291,0.000017427605,0.000115697694,0.00015725508,0.00003352979],"domain_scores_gemma":[0.9994467,0.000097372795,0.00002010584,0.0001546167,0.00022149552,0.00005970734],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005683245,0.000666058,0.00080822525,0.0015568458,0.0013683315,0.0015619991,0.0012286087,0.0012488485,0.0372014],"category_scores_gemma":[0.0018356424,0.0002997669,0.00068314257,0.0014257202,0.0001322731,0.0024665112,0.0008112511,0.0009305444,0.032452513],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017025133,0.00027935146,0.0017921946,0.00040299102,0.00011158617,0.00018308761,0.00018417336,0.0016882167,0.0049887556,0.015290954,0.31599465,0.6589138],"study_design_scores_gemma":[0.00007933146,0.0002996732,0.003348118,0.00015113704,0.00027622437,0.0015674148,0.00028731432,0.116036594,0.012450663,0.014293308,0.85105383,0.00015651333],"about_ca_topic_score_codex":0.004460568,"about_ca_topic_score_gemma":0.011988171,"teacher_disagreement_score":0.0372014,"about_ca_system_score_codex":0.0004466982,"about_ca_system_score_gemma":0.0005297612,"threshold_uncertainty_score":0.1244511},"labels":[],"label_agreement":null},{"id":"W4281675176","doi":"10.36227/techrxiv.19498769.v1","title":"Detecting Anomalies in Logs by Combining NLP features with Embedding or TF-IDF","year":2022,"lang":"en","type":"preprint","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Lakehead University","funders":"Lakehead University","keywords":"Categorization; Computer science; Artificial intelligence; Natural language processing; Sentence; Set (abstract data type); Focus (optics); Embedding; Text categorization; Information retrieval","score_opus":0.023159451330024405,"score_gpt":0.2890592490640066,"score_spread":0.2658997977339822,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4281675176","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.26887485,0.0013085281,0.70524204,0.00076284393,0.00044111788,0.00040907908,0.006313885,0.013517888,0.0031297635],"genre_scores_gemma":[0.6291465,0.00050292676,0.35936406,0.00011046781,0.00030031358,0.00027510035,0.008024781,0.00038359553,0.0018922569],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9985385,0.00022189973,0.00020330085,0.00035451024,0.00054286455,0.00013890806],"domain_scores_gemma":[0.9944213,0.002622419,0.0010242077,0.000643015,0.0011252175,0.0001638626],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0015040761,0.0011714424,0.0010781398,0.0073621552,0.00042013664,0.0015405165,0.00076432736,0.0010400866,0.0014566962],"category_scores_gemma":[0.007381566,0.00021704801,0.0007120852,0.0043771863,0.0004481246,0.003295289,0.000687081,0.0009508414,0.0021547987],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007294377,0.0007244693,0.05202716,0.0005684622,0.00015723033,0.0005433359,0.00046623964,0.0149006285,0.06837259,0.0015621958,0.008382332,0.8515659],"study_design_scores_gemma":[0.000049563685,0.0007512852,0.06458491,0.00010961685,0.00014575539,0.0015439838,0.00082762045,0.85802704,0.049719278,0.01179254,0.012290967,0.00015741306],"about_ca_topic_score_codex":0.0026071577,"about_ca_topic_score_gemma":0.0029138764,"teacher_disagreement_score":0.0073621552,"about_ca_system_score_codex":0.0004414319,"about_ca_system_score_gemma":0.00041174272,"threshold_uncertainty_score":0.007954419},"labels":[],"label_agreement":null},{"id":"W4281747386","doi":"10.3390/math10111871","title":"Robust Multi-Label Classification with Enhanced Global and Local Label Correlation","year":2022,"lang":"en","type":"article","venue":"Mathematics","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"National Natural Science Foundation of China","keywords":"Robustness (evolution); Correlation; Artificial intelligence; Subspace topology; Computer science; Pattern recognition (psychology); Missing data; Machine learning; Ambiguity; Feature learning; Mathematics","score_opus":0.061293310949191424,"score_gpt":0.27035612154802885,"score_spread":0.2090628105988374,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4281747386","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.041722357,0.00037768137,0.95505214,0.00037471222,0.000048631897,0.00006390683,0.0001643134,0.0011143854,0.0010818318],"genre_scores_gemma":[0.70012194,0.00030036303,0.29300326,0.00041631263,0.0002800073,0.00021765854,0.0015660987,0.0002801112,0.0038142547],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99606764,0.0012320142,0.000132442,0.0011016743,0.0010888632,0.00037738663],"domain_scores_gemma":[0.9928596,0.0027015589,0.0012187498,0.0018181708,0.001130972,0.00027097706],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004127566,0.0010851227,0.0020623754,0.0017969393,0.00093093055,0.0021370864,0.0024379548,0.0020304827,0.0011889322],"category_scores_gemma":[0.00916404,0.0003779365,0.0014242288,0.0026345907,0.0014732603,0.0038937721,0.0027405026,0.002836395,0.0010634728],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00075635524,0.00062297774,0.008907029,0.00025028584,0.00024528318,0.00032380657,0.0005045302,0.36807352,0.019944798,0.028227367,0.010334533,0.5618095],"study_design_scores_gemma":[0.0000143028665,0.00004347163,0.0004732619,0.000007695329,0.000014996983,0.000047537113,0.00003299602,0.98534065,0.0027620094,0.0105592115,0.0006862388,0.000017504644],"about_ca_topic_score_codex":0.002358029,"about_ca_topic_score_gemma":0.0028474336,"teacher_disagreement_score":0.004127566,"about_ca_system_score_codex":0.0011751552,"about_ca_system_score_gemma":0.0017521514,"threshold_uncertainty_score":0.02182889},"labels":[],"label_agreement":null},{"id":"W4281764099","doi":"10.36227/techrxiv.19498769","title":"Detecting Anomalies in Logs by Combining NLP features with Embedding or TF-IDF","year":2022,"lang":"en","type":"preprint","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Lakehead University","funders":"Lakehead University","keywords":"Categorization; Computer science; Artificial intelligence; Natural language processing; Set (abstract data type); Sentence; Focus (optics); Embedding; Information retrieval; Text categorization; Text mining; Meaning (existential); Psychology","score_opus":0.023159451330024405,"score_gpt":0.2890592490640066,"score_spread":0.2658997977339822,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4281764099","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.20289537,0.0011740384,0.7718983,0.00091811677,0.00040435622,0.00030334544,0.005315013,0.013573178,0.0035182028],"genre_scores_gemma":[0.6097371,0.00050389726,0.37753308,0.00013563209,0.00030042403,0.00021853125,0.008570049,0.0004155151,0.0025858104],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.998784,0.00020322132,0.0001596728,0.0003224575,0.00041668312,0.00011397226],"domain_scores_gemma":[0.9962626,0.0017691613,0.0006060736,0.000487807,0.00075813226,0.000116127936],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013039147,0.0009155361,0.0009038695,0.005964607,0.0004203129,0.0014958134,0.00073238154,0.0009859613,0.0018170798],"category_scores_gemma":[0.0059581534,0.00021192619,0.0006287939,0.0033869767,0.00039537667,0.0028805688,0.000634282,0.00084191683,0.0025223347],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00048786897,0.0005017424,0.029332848,0.00034238055,0.00011530427,0.00040018684,0.00029720648,0.014766386,0.05154327,0.001771332,0.010094608,0.89034677],"study_design_scores_gemma":[0.000033738208,0.00033136984,0.03393065,0.00007158786,0.000098499804,0.0009393088,0.00047168575,0.91029966,0.03155661,0.010855924,0.011317457,0.00009357855],"about_ca_topic_score_codex":0.0036260379,"about_ca_topic_score_gemma":0.00373132,"teacher_disagreement_score":0.005964607,"about_ca_system_score_codex":0.0005310863,"about_ca_system_score_gemma":0.0004395793,"threshold_uncertainty_score":0.007209897},"labels":[],"label_agreement":null},{"id":"W4283798078","doi":"10.1007/s11517-022-02604-1","title":"Modeling global and local label correlation with graph convolutional networks for multi-label chest X-ray image classification","year":2022,"lang":"en","type":"article","venue":"Medical & Biological Engineering & Computing","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":17,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"National Natural Science Foundation of China","keywords":"Computer science; Correlation; Convolutional neural network; Artificial intelligence; Multi-label classification; Graph; Machine learning; Pattern recognition (psychology); Task (project management); Representation (politics); Computer-aided diagnosis; Data mining; Theoretical computer science; Mathematics","score_opus":0.0392016277018329,"score_gpt":0.26747420164264885,"score_spread":0.22827257394081596,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4283798078","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.33372486,0.0014446662,0.65826917,0.0009924326,0.00019265559,0.00007262634,0.0007111442,0.0020772484,0.0025152953],"genre_scores_gemma":[0.94792336,0.00027020668,0.045802705,0.0002075856,0.00009202283,0.000045696277,0.000990892,0.00009253898,0.004574957],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99970764,0.00005550007,0.000011656412,0.000107096355,0.00004535035,0.00007269732],"domain_scores_gemma":[0.99906236,0.00049543154,0.00013984926,0.0000845773,0.00016785304,0.000049972998],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00076266885,0.00087539223,0.00070415094,0.00091292814,0.0003887411,0.0008555366,0.0013065626,0.0012377051,0.0010045876],"category_scores_gemma":[0.001897964,0.0004463075,0.000918523,0.0008837483,0.00046537296,0.0009733035,0.0007760363,0.0014469615,0.00040944683],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00045182853,0.00042833522,0.009888505,0.00010052845,0.00023488468,0.0001683848,0.00009713408,0.7392364,0.011212798,0.005579782,0.0049740714,0.22762734],"study_design_scores_gemma":[0.0000019784254,0.0000086241935,0.00030606968,0.0000020798482,0.000008375491,0.000005466767,0.0000026443754,0.9983364,0.00041498858,0.0008461509,0.00006506918,0.0000022349889],"about_ca_topic_score_codex":0.021276329,"about_ca_topic_score_gemma":0.033151217,"teacher_disagreement_score":0.021276329,"about_ca_system_score_codex":0.0012241562,"about_ca_system_score_gemma":0.0009406126,"threshold_uncertainty_score":0.042304993},"labels":[],"label_agreement":null},{"id":"W4284989007","doi":"10.48175/ijarsct-5715","title":"Study of Recommendation System","year":2022,"lang":"en","type":"article","venue":"International Journal of Advanced Research in Science Communication and Technology","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Computer science; Globe; Set (abstract data type); Point of interest; Data science; Quarter (Canadian coin); World Wide Web; Artificial intelligence; Geography; Psychology","score_opus":0.09041018752325591,"score_gpt":0.442330979164459,"score_spread":0.3519207916412031,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4284989007","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.62005854,0.041956574,0.21604972,0.013129636,0.00080297975,0.0009944113,0.0042163627,0.0008254269,0.10196626],"genre_scores_gemma":[0.9465278,0.0058765016,0.030484892,0.0003941654,0.00028238157,0.0001915327,0.0013918582,0.00005919378,0.014791597],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9938338,0.0018742671,0.0004489177,0.0016464727,0.0017389639,0.00045767816],"domain_scores_gemma":[0.98891675,0.0058460375,0.0007146997,0.00079246785,0.0034465545,0.0002834576],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0038749417,0.00051991676,0.00093834527,0.0033030563,0.0015297178,0.004430531,0.0013680441,0.0016028457,0.0065641184],"category_scores_gemma":[0.019820817,0.00027401934,0.0011717799,0.003966049,0.000833336,0.0072786375,0.00060737965,0.0014416855,0.0018391825],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00060105394,0.00088719267,0.20155455,0.003403733,0.0010215499,0.0021962305,0.0053214687,0.056277268,0.010964237,0.24711765,0.03830349,0.43235153],"study_design_scores_gemma":[0.00008394745,0.0008145274,0.121979624,0.00042921843,0.000490433,0.0031000578,0.0060113063,0.7036344,0.008110467,0.061802268,0.09330116,0.0002426699],"about_ca_topic_score_codex":0.020323746,"about_ca_topic_score_gemma":0.008127495,"teacher_disagreement_score":0.020323746,"about_ca_system_score_codex":0.0035255319,"about_ca_system_score_gemma":0.0018731002,"threshold_uncertainty_score":0.040410936},"labels":[],"label_agreement":null},{"id":"W4286449976","doi":"10.18280/ria.360307","title":"A New Supervised Term Weight Measure Based Approach for Text Classification","year":2022,"lang":"en","type":"article","venue":"Revue d intelligence artificielle","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Term (time); Computer science; Measure (data warehouse); Task (project management); Identification (biology); Support vector machine; tf–idf; Categorization; Text categorization; Artificial intelligence; Information retrieval; Document classification; Natural language processing; Pattern recognition (psychology); Data mining","score_opus":0.07099948823014113,"score_gpt":0.2729647282679941,"score_spread":0.201965240037853,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4286449976","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.040340647,0.0031130144,0.9488099,0.00035754283,0.00041655445,0.000380559,0.0010483995,0.002167991,0.0033654142],"genre_scores_gemma":[0.37908843,0.0015343681,0.60373473,0.0003393202,0.00077849743,0.0009518658,0.0050746524,0.00027175897,0.008226325],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99716765,0.00033418628,0.0003560357,0.0005366195,0.0014566355,0.00014887309],"domain_scores_gemma":[0.99772626,0.00065179705,0.00027210332,0.00015882187,0.0011070452,0.000083913175],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0017783366,0.0010308046,0.0015240075,0.007280501,0.0008315147,0.0014399079,0.0015650606,0.0012463743,0.001611121],"category_scores_gemma":[0.0056805452,0.00019741755,0.0012507705,0.00576262,0.0005989733,0.002911154,0.0007745085,0.0012620246,0.0013345852],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00037278415,0.00037306317,0.0044582975,0.0003506321,0.00018029657,0.0001293567,0.00016715737,0.012300606,0.024954094,0.004617457,0.008857758,0.9432386],"study_design_scores_gemma":[0.00008512935,0.0007265888,0.010147627,0.00011097255,0.0002079924,0.0009673075,0.00021742108,0.9256335,0.02662829,0.013618716,0.021522328,0.00013422749],"about_ca_topic_score_codex":0.0030670916,"about_ca_topic_score_gemma":0.0033153915,"teacher_disagreement_score":0.007280501,"about_ca_system_score_codex":0.0011997627,"about_ca_system_score_gemma":0.0013540237,"threshold_uncertainty_score":0.009404838},"labels":[],"label_agreement":null},{"id":"W4288075349","doi":"10.18280/ts.390319","title":"A Deep Learning-Based Cluster Analysis Method for Large-Scale Multi-Label Images","year":2022,"lang":"en","type":"article","venue":"Traitement du signal","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Artificial intelligence; Pattern recognition (psychology); Computer science; Image (mathematics); Graph; Feature extraction; Scale (ratio); Feature (linguistics); Theoretical computer science","score_opus":0.02557382948783619,"score_gpt":0.3002978727212843,"score_spread":0.27472404323344807,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4288075349","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008230708,0.00010601876,0.98832625,0.00013401963,0.000051548293,0.00006596542,0.0001204298,0.0023350168,0.0006300197],"genre_scores_gemma":[0.24581791,0.00021564674,0.7447325,0.00026251393,0.00009938855,0.00021455911,0.0011254221,0.0005824612,0.0069494983],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99928564,0.000073483396,0.00002962057,0.00028707754,0.00021351293,0.00011071677],"domain_scores_gemma":[0.99932635,0.00009988745,0.00007509968,0.00014838259,0.0002908273,0.000059595543],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00074650435,0.001046143,0.0009833566,0.002109477,0.0008550684,0.0009784121,0.0023788954,0.0010795019,0.0023419322],"category_scores_gemma":[0.0014481719,0.00043039583,0.0015791308,0.0018479895,0.0007410036,0.0015128504,0.001513014,0.00203286,0.0011459565],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024636346,0.00020322902,0.0023340688,0.0001351019,0.00018953292,0.00013066009,0.00020072883,0.12406104,0.034493778,0.013803266,0.012825338,0.81137687],"study_design_scores_gemma":[0.0000056032977,0.00001775254,0.0004487816,0.000004219865,0.00001534379,0.00002992662,0.000026492713,0.987146,0.00576821,0.005167398,0.0013562025,0.000014045773],"about_ca_topic_score_codex":0.017098801,"about_ca_topic_score_gemma":0.023006506,"teacher_disagreement_score":0.017098801,"about_ca_system_score_codex":0.0019062798,"about_ca_system_score_gemma":0.0016903847,"threshold_uncertainty_score":0.03399855},"labels":[],"label_agreement":null},{"id":"W4292837269","doi":"10.1016/j.ijar.2022.08.008","title":"Selective label enhancement for multi-label classification based on three-way decisions","year":2022,"lang":"en","type":"article","venue":"International Journal of Approximate Reasoning","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":17,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"China Postdoctoral Science Foundation; National Natural Science Foundation of China","keywords":"Multi-label classification; Computer science; Ambiguity; Artificial intelligence; Machine learning; Trustworthiness; Semantics (computer science)","score_opus":0.08242627889891666,"score_gpt":0.344599262681396,"score_spread":0.26217298378247933,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4292837269","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.047251854,0.00055985904,0.9467511,0.00049105904,0.00020591918,0.00020497714,0.00029310898,0.0016217247,0.0026203108],"genre_scores_gemma":[0.45935085,0.00024660394,0.53391093,0.0003249946,0.00013374,0.0002094364,0.0008858996,0.00016930181,0.0047682696],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99642795,0.0006058843,0.00033585014,0.0008916019,0.0013038405,0.00043489566],"domain_scores_gemma":[0.99522996,0.0021265873,0.00031214603,0.0008710061,0.0012088156,0.0002515427],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032529752,0.0010628722,0.001914428,0.0018907802,0.0018583916,0.0028316772,0.0033182965,0.0022631784,0.0045163757],"category_scores_gemma":[0.0064423587,0.00051613327,0.00193258,0.0016408329,0.0012512095,0.003928242,0.003094357,0.0027293959,0.0015360175],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015321675,0.0007702933,0.004976609,0.00032904546,0.00019880832,0.0003784723,0.0006149982,0.034760956,0.031419028,0.020453187,0.008803668,0.89576286],"study_design_scores_gemma":[0.000070314665,0.00022529272,0.0014826464,0.00006021621,0.00019155313,0.00022952403,0.00024096709,0.9280901,0.028085684,0.03685142,0.004410521,0.00006176553],"about_ca_topic_score_codex":0.004364582,"about_ca_topic_score_gemma":0.007504654,"teacher_disagreement_score":0.0045163757,"about_ca_system_score_codex":0.0011493667,"about_ca_system_score_gemma":0.0024554047,"threshold_uncertainty_score":0.01720357},"labels":[],"label_agreement":null},{"id":"W4293863379","doi":"10.1109/siu55565.2022.9864993","title":"Banking Order Classification and Information Extraction","year":2022,"lang":"en","type":"article","venue":"2022 30th Signal Processing and Communications Applications Conference (SIU)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Stantec (Canada)","funders":"","keywords":"Computer science; Workload; Communication source; Information extraction; Preprocessor; Database transaction; Process (computing); Support vector machine; Transaction processing; Transfer (computing); Order (exchange); Statistical classification; Artificial intelligence; Data mining; Information retrieval; Database; Operating system; Telecommunications","score_opus":0.0369949697109424,"score_gpt":0.28695350757049615,"score_spread":0.24995853785955374,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4293863379","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.14342117,0.0021080992,0.7466125,0.0013521498,0.0008054137,0.0016382951,0.014169118,0.060091134,0.029802158],"genre_scores_gemma":[0.35920653,0.0012544439,0.5909415,0.00036795845,0.00044557,0.0005430761,0.019886235,0.00079694204,0.026557738],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9986577,0.0000906704,0.00020666572,0.00032273727,0.0005901192,0.00013202887],"domain_scores_gemma":[0.99806947,0.00042266012,0.00024291496,0.00028525558,0.0009055268,0.00007413061],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005271339,0.0010023534,0.0010730891,0.0065544304,0.0008031693,0.0020191898,0.000866525,0.0007668607,0.0073288297],"category_scores_gemma":[0.0028076689,0.0003703903,0.0006831302,0.0039964914,0.00024969107,0.0018590001,0.00064824964,0.0006136315,0.009204938],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00039335268,0.0001908305,0.0064965803,0.0002652777,0.000034561315,0.0003205516,0.00015965225,0.0019080421,0.028781757,0.001263393,0.017922997,0.94226295],"study_design_scores_gemma":[0.0001268204,0.0006326318,0.063324586,0.00029499902,0.00031152193,0.002833517,0.00092464424,0.4042858,0.3433855,0.009192679,0.1743978,0.00028965928],"about_ca_topic_score_codex":0.0036345478,"about_ca_topic_score_gemma":0.002981169,"teacher_disagreement_score":0.0073288297,"about_ca_system_score_codex":0.0006310125,"about_ca_system_score_gemma":0.0010605509,"threshold_uncertainty_score":0.024517417},"labels":[],"label_agreement":null},{"id":"W4311843543","doi":"","title":"Vers une étude comparative de différentes approches de classification automatique de textes provenant des secteurs métiers","year":2021,"lang":"fr","type":"preprint","venue":"HAL (Le Centre pour la Communication Scientifique Directe)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Berger (Canada)","funders":"","keywords":"Computer science","score_opus":0.03285696509734804,"score_gpt":0.2624052596048865,"score_spread":0.22954829450753844,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4311843543","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.41963756,0.023891166,0.5178711,0.0022728918,0.0010636024,0.00081721594,0.0057966067,0.011845461,0.016804388],"genre_scores_gemma":[0.51681185,0.0051101972,0.45198575,0.0005269052,0.0005328316,0.00045949468,0.0077698254,0.0012009393,0.0156021975],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9736268,0.00918506,0.0024615892,0.00477827,0.009205276,0.0007429564],"domain_scores_gemma":[0.93935716,0.042061027,0.0020563526,0.0050073913,0.011040267,0.00047779383],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0140719535,0.0017406888,0.0015565213,0.011486883,0.0017568836,0.009192187,0.0020610814,0.0024078956,0.0049343714],"category_scores_gemma":[0.040317968,0.0006948373,0.0027878457,0.0075204223,0.0012519677,0.0061474456,0.0010833214,0.0021393278,0.00350981],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014888799,0.00046147188,0.027595717,0.0014258046,0.001665861,0.00014570061,0.0016910185,0.015258777,0.031183604,0.0042757727,0.0052419417,0.9095654],"study_design_scores_gemma":[0.00049768103,0.0028205863,0.19834273,0.0014944205,0.0039733117,0.0031278443,0.0058505163,0.50849205,0.15052466,0.012400175,0.111887105,0.00058888126],"about_ca_topic_score_codex":0.023173489,"about_ca_topic_score_gemma":0.026769271,"teacher_disagreement_score":0.023173489,"about_ca_system_score_codex":0.002239941,"about_ca_system_score_gemma":0.0019063007,"threshold_uncertainty_score":0.07442051},"labels":[],"label_agreement":null},{"id":"W4312543622","doi":"10.1007/978-3-031-16719-5_3","title":"An Introduction of ML Through PCG","year":2022,"lang":"en","type":"book-chapter","venue":"Synthesis lectures on games and computational intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"History; Computer science","score_opus":0.02523895594200046,"score_gpt":0.2703429659458372,"score_spread":0.24510401000383672,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4312543622","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0011705812,0.00891554,0.5774194,0.0027627246,0.0036261773,0.00008638398,0.00045630516,0.0040644584,0.4014984],"genre_scores_gemma":[0.07709525,0.0128179835,0.24455053,0.002928655,0.0067575593,0.00028884475,0.0011118485,0.0032944176,0.65115494],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9995053,0.000097022355,0.000025488944,0.00012337086,0.00020515712,0.000043604636],"domain_scores_gemma":[0.99959284,0.00020838465,0.000013316987,0.000076270146,0.00007940664,0.000029851417],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0003386448,0.00086024957,0.0005720101,0.0010678824,0.00071994384,0.0029921816,0.000997379,0.0010239239,0.07009333],"category_scores_gemma":[0.0017508634,0.00044178448,0.00048945245,0.001488646,0.0016476498,0.0034050597,0.001701977,0.0022139244,0.03284396],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00003391435,0.000039458908,0.000063822525,0.00019792408,0.0000073782066,0.000073791954,0.00014111979,0.0025961807,0.0017831498,0.44417328,0.094805606,0.45608434],"study_design_scores_gemma":[0.0000074368413,0.000031410073,0.00012095886,0.00013243621,0.000005761568,0.0001958141,0.000036899026,0.0077252607,0.0019559762,0.273255,0.7165115,0.000021586571],"about_ca_topic_score_codex":0.0013128314,"about_ca_topic_score_gemma":0.0013928004,"teacher_disagreement_score":0.07009333,"about_ca_system_score_codex":0.001068746,"about_ca_system_score_gemma":0.0006387944,"threshold_uncertainty_score":0.23448557},"labels":[],"label_agreement":null},{"id":"W4313021298","doi":"10.23952/jano.4.2022.3.06","title":"Hierarchical reinforcement learning with advantage function for entity relation extraction","year":2022,"lang":"en","type":"article","venue":"Journal of Applied and Numerical Optimization","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"National Natural Science Foundation of China","keywords":"Reinforcement learning; Relation (database); Relationship extraction; Reinforcement; Computer science; Function (biology); Extraction (chemistry); Artificial intelligence; Psychology; Data mining; Biology; Chemistry; Social psychology; Chromatography","score_opus":0.008532871366860002,"score_gpt":0.23142409086263183,"score_spread":0.22289121949577181,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4313021298","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013467232,0.00027792368,0.98387873,0.00019600808,0.000035492423,0.000058580998,0.000041858526,0.0009486859,0.0010954334],"genre_scores_gemma":[0.7728329,0.00024091318,0.22165097,0.00034659897,0.000056113997,0.00023642638,0.00022496431,0.00014523596,0.0042658877],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99883443,0.00035480742,0.0000786724,0.00031401444,0.00030237378,0.00011572004],"domain_scores_gemma":[0.99750227,0.0016697753,0.00020415052,0.00019290186,0.00033017405,0.000100722566],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0020611167,0.0009214442,0.0012909042,0.00070965214,0.0004063431,0.0007348778,0.0013613481,0.0010694131,0.0024807835],"category_scores_gemma":[0.0064782905,0.0004888367,0.00069009216,0.00055852946,0.00092899316,0.0020467844,0.0013323076,0.0018567003,0.00046868646],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025295955,0.00021556986,0.002164593,0.00017656964,0.00010545244,0.00019898394,0.00019557342,0.74095094,0.0056530666,0.021628587,0.0024952453,0.22596245],"study_design_scores_gemma":[0.000010558399,0.000020859487,0.00008931,0.000002853489,0.0000062255413,0.000010007651,0.0000025638149,0.99585414,0.0005333651,0.0032111155,0.0002536223,0.0000054350444],"about_ca_topic_score_codex":0.0050977115,"about_ca_topic_score_gemma":0.0050010122,"teacher_disagreement_score":0.0050977115,"about_ca_system_score_codex":0.0011621481,"about_ca_system_score_gemma":0.0018351094,"threshold_uncertainty_score":0.010900319},"labels":[],"label_agreement":null},{"id":"W4313343225","doi":"10.1007/978-3-031-23028-8","title":"Structural, Syntactic, and Statistical Pattern Recognition","year":2022,"lang":"en","type":"book","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Computer science; Artificial intelligence; Natural language processing; Pattern recognition (psychology); Sketch recognition; Speech recognition; Gesture recognition","score_opus":0.024316487183609348,"score_gpt":0.26366775665991143,"score_spread":0.2393512694763021,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4313343225","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015052444,0.015050034,0.91980946,0.0014947581,0.000890066,0.00009077209,0.001344094,0.006435042,0.039833292],"genre_scores_gemma":[0.1698773,0.015042729,0.7417922,0.00054159993,0.0013531446,0.0002585034,0.0065132133,0.0013041062,0.06331724],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99948645,0.0000705964,0.00005650281,0.000109345485,0.00023524144,0.000041906595],"domain_scores_gemma":[0.9988827,0.00044057384,0.000091491085,0.0002451564,0.00030231924,0.000037738566],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006583347,0.00090142014,0.0007459291,0.0019216146,0.0003391367,0.0017808684,0.0010444685,0.00055179844,0.009144901],"category_scores_gemma":[0.0027548857,0.00039715137,0.00083816465,0.0025988806,0.00093943125,0.002327014,0.00080372737,0.00086877943,0.00882948],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006316669,0.000047168836,0.0008175426,0.00029828685,0.000026741918,0.000094142146,0.00004629208,0.0028895258,0.01781612,0.029255971,0.020136004,0.928509],"study_design_scores_gemma":[0.000036032226,0.00039150548,0.00925071,0.00027338002,0.00016271313,0.0028845374,0.00025883174,0.2992339,0.069146,0.45354387,0.16469221,0.00012618543],"about_ca_topic_score_codex":0.0010628651,"about_ca_topic_score_gemma":0.0015870793,"teacher_disagreement_score":0.009144901,"about_ca_system_score_codex":0.00037251305,"about_ca_system_score_gemma":0.00076458266,"threshold_uncertainty_score":0.03059274},"labels":[],"label_agreement":null},{"id":"W4313343334","doi":"10.1007/978-3-031-23028-8_4","title":"Interactive Generalized Dirichlet Mixture Allocation Model","year":2022,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Latent Dirichlet allocation; Computer science; Inference; Topic model; Dirichlet distribution; Task (project management); Artificial intelligence; Hierarchical Dirichlet process; Machine learning; Prior probability; Data mining; Mathematics","score_opus":0.021942706797824202,"score_gpt":0.2639456888059402,"score_spread":0.242002982008116,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4313343334","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00424453,0.00090053934,0.9823397,0.00038147965,0.0001751876,0.00006584431,0.00059326494,0.0014155493,0.009883895],"genre_scores_gemma":[0.32018486,0.0023247956,0.5814515,0.0010243386,0.00079993764,0.0009244276,0.0052277627,0.0019272275,0.086135216],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.997591,0.001263527,0.000077539305,0.0005196182,0.00033247765,0.0002157782],"domain_scores_gemma":[0.9973385,0.0017701694,0.00007611803,0.00048717234,0.00022599855,0.00010208551],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0026337786,0.001232685,0.0020863584,0.0013209841,0.00097637874,0.0030476046,0.0037141384,0.002393066,0.01687128],"category_scores_gemma":[0.0069450024,0.0011896845,0.0020098188,0.0020908983,0.0013016267,0.0026842311,0.0032641976,0.0031407764,0.009326185],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00060198846,0.00021997803,0.0011344403,0.0003570591,0.00035376535,0.00039392564,0.0005080762,0.31515872,0.0040121046,0.3943905,0.037058778,0.24581058],"study_design_scores_gemma":[0.000037263544,0.000022499908,0.00024273753,0.000029311459,0.00006456013,0.00015585046,0.000035165765,0.8415373,0.0012268407,0.14223664,0.014375786,0.000036143043],"about_ca_topic_score_codex":0.0046617915,"about_ca_topic_score_gemma":0.0056910557,"teacher_disagreement_score":0.01687128,"about_ca_system_score_codex":0.001382929,"about_ca_system_score_gemma":0.0012513829,"threshold_uncertainty_score":0.056440055},"labels":[],"label_agreement":null},{"id":"W4313495625","doi":"10.31449/inf.v46i4.3476","title":"OMCOKE: A Machine Learning Outlier-based Overlapping Clustering Technique for Multi-Label Data Analysis","year":2022,"lang":"en","type":"article","venue":"Informatica","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Fanshawe College","funders":"","keywords":"Cluster analysis; Outlier; Computer science; Anomaly detection; Data mining; Artificial intelligence; Unsupervised learning; Cluster (spacecraft); CURE data clustering algorithm; Machine learning; Pattern recognition (psychology); Correlation clustering","score_opus":0.09572787538383581,"score_gpt":0.3254020660487998,"score_spread":0.22967419066496397,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4313495625","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006718704,0.00024619277,0.98974764,0.00012922264,0.00007155966,0.00014188135,0.00021043148,0.002277392,0.00045701693],"genre_scores_gemma":[0.10523909,0.00021152209,0.8908994,0.00014302776,0.00008341104,0.00039535735,0.0012335957,0.00048450867,0.0013101985],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99503595,0.001055245,0.0004063966,0.001290105,0.0018750397,0.00033734078],"domain_scores_gemma":[0.9935296,0.0020716737,0.001015821,0.0012134849,0.001962703,0.0002066495],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0036665937,0.0017000175,0.0022124043,0.005173019,0.002474859,0.0020314897,0.0031234154,0.0023106884,0.0014632042],"category_scores_gemma":[0.013879316,0.00061110465,0.0022883834,0.0061346344,0.0013567319,0.0027923936,0.003123215,0.0031948877,0.0012629902],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008094424,0.0005270476,0.010578652,0.00073583913,0.0008681375,0.000560323,0.0016074374,0.13683894,0.017028041,0.017925186,0.016944665,0.7955762],"study_design_scores_gemma":[0.000060209735,0.00012947374,0.0032238911,0.00008700452,0.00008904246,0.00047292505,0.00045035832,0.9419409,0.012995368,0.026861457,0.013566295,0.00012312728],"about_ca_topic_score_codex":0.006416671,"about_ca_topic_score_gemma":0.00968244,"teacher_disagreement_score":0.006416671,"about_ca_system_score_codex":0.0013087415,"about_ca_system_score_gemma":0.0024338784,"threshold_uncertainty_score":0.01939106},"labels":[],"label_agreement":null},{"id":"W4313644201","doi":"10.31219/osf.io/2t53f","title":"An Empirical Study of Supervised and Active Learning Methodologies for Classifying Research Papers","year":2023,"lang":"en","type":"preprint","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Machine learning; Artificial intelligence; Computer science; Random forest; Naive Bayes classifier; Supervised learning; Semi-supervised learning; Class (philosophy); Active learning (machine learning); Oversampling; Set (abstract data type); Empirical research; Instance-based learning; Ensemble learning; Support vector machine; Artificial neural network; Mathematics","score_opus":0.536340079485524,"score_gpt":0.5289477743316955,"score_spread":0.007392305153828493,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4313644201","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8667512,0.0040240204,0.110322714,0.0022766516,0.0002999821,0.00095587573,0.0013632807,0.0003732736,0.013633055],"genre_scores_gemma":[0.9575597,0.00056061195,0.037465785,0.00024658168,0.0002394457,0.00044490877,0.001545655,0.00007235017,0.001864863],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9066756,0.06469371,0.005420723,0.0038574021,0.01861547,0.00073713704],"domain_scores_gemma":[0.28547698,0.6189834,0.033764996,0.027008351,0.032513484,0.002252738],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07805445,0.00062750047,0.00061867095,0.0058576697,0.0011920427,0.003442904,0.0021055369,0.0019150067,0.0014720135],"category_scores_gemma":[0.38194624,0.00036954417,0.00072263286,0.0053154216,0.0026393835,0.006759707,0.0014322856,0.0020341335,0.00077906426],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0022654824,0.0046586334,0.49298215,0.0016386639,0.001009749,0.00040321783,0.006345485,0.025392056,0.0032249503,0.03511522,0.011775419,0.415189],"study_design_scores_gemma":[0.0007882729,0.0049164128,0.34131184,0.0013693452,0.00046523337,0.0029743502,0.011045789,0.5070047,0.013426382,0.077740304,0.03860967,0.00034772535],"about_ca_topic_score_codex":0.00086092943,"about_ca_topic_score_gemma":0.001321921,"teacher_disagreement_score":0.07805445,"about_ca_system_score_codex":0.0011610852,"about_ca_system_score_gemma":0.00094222545,"threshold_uncertainty_score":0.41279632},"labels":[],"label_agreement":null},{"id":"W4318604488","doi":"10.1109/ssci51031.2022.10022072","title":"Bayesian Folding-In Using Generalized Dirichlet and Beta-Liouville Kernels for Information Retrieval","year":2022,"lang":"en","type":"article","venue":"2022 IEEE Symposium Series on Computational Intelligence (SSCI)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Latent Dirichlet allocation; Probabilistic latent semantic analysis; Dirichlet distribution; Computer science; Kernel (algebra); Bayesian probability; Topic model; Mixture model; Folding (DSP implementation); Artificial intelligence; Pattern recognition (psychology); Mathematics","score_opus":0.028716928617994703,"score_gpt":0.28293088036610475,"score_spread":0.25421395174811007,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4318604488","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0048083044,0.0005047363,0.9933136,0.00018029654,0.000026148855,0.00004614748,0.00005525638,0.0002837418,0.00078167894],"genre_scores_gemma":[0.42479345,0.002394324,0.5638268,0.00044716397,0.00034313742,0.000494034,0.0008456622,0.00024540332,0.006609989],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.995417,0.002055105,0.0003161781,0.00073784235,0.0011488158,0.0003249878],"domain_scores_gemma":[0.99607795,0.0023019235,0.00029669545,0.00053434324,0.00065913773,0.00012986037],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0050535495,0.00086433435,0.0020213875,0.002865177,0.00093250535,0.0026298661,0.002109993,0.001916407,0.0018807657],"category_scores_gemma":[0.015968058,0.0007340218,0.0019421709,0.0038946283,0.0015042702,0.0056748325,0.0023844675,0.0018899487,0.0010705547],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00038497034,0.00034066106,0.0031285228,0.00042706638,0.00023056635,0.00018060154,0.0007191582,0.25412586,0.008714218,0.3024294,0.0060706297,0.4232484],"study_design_scores_gemma":[0.000018599872,0.000031069296,0.00037019554,0.000016145723,0.00002444287,0.00007740979,0.000033321172,0.91919416,0.0012823335,0.07642027,0.0024941552,0.00003785728],"about_ca_topic_score_codex":0.00801696,"about_ca_topic_score_gemma":0.005623979,"teacher_disagreement_score":0.00801696,"about_ca_system_score_codex":0.0026737573,"about_ca_system_score_gemma":0.0022912463,"threshold_uncertainty_score":0.026726067},"labels":[],"label_agreement":null},{"id":"W4318771398","doi":"10.1007/s10489-022-04350-1","title":"Multi-label learning with Relief-based label-specific feature selection","year":2023,"lang":"en","type":"article","venue":"Applied Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"National Natural Science Foundation of China","keywords":"Computer science; Lift (data mining); Redundancy (engineering); Artificial intelligence; Machine learning; Feature selection; Feature (linguistics); Multi-label classification; Pattern recognition (psychology)","score_opus":0.04294951323901801,"score_gpt":0.2772003155390294,"score_spread":0.23425080230001138,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4318771398","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025901895,0.00059853465,0.9674327,0.0005198473,0.00017728526,0.00018953044,0.00041330216,0.003435826,0.001331072],"genre_scores_gemma":[0.44102442,0.00032474424,0.54933065,0.00059934653,0.00038180512,0.00041424282,0.0028474582,0.0002997043,0.004777566],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9982393,0.00046279715,0.00011744868,0.0004120461,0.00056010747,0.00020825099],"domain_scores_gemma":[0.9977464,0.0010236026,0.00020626733,0.0003946304,0.00054546655,0.000083639396],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002289311,0.0012457673,0.0027128032,0.002109967,0.0008388283,0.0013420358,0.0027379522,0.0022721025,0.0031282073],"category_scores_gemma":[0.004639599,0.0004887976,0.0016852426,0.0023705652,0.00070210855,0.0016135674,0.0019741743,0.0020236117,0.0017515495],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004958585,0.000605234,0.0020736433,0.00029927987,0.00017588874,0.00023643511,0.00009465295,0.06500694,0.019159822,0.0033593792,0.01940545,0.8890874],"study_design_scores_gemma":[0.000077668534,0.00021621969,0.0007574493,0.000021982403,0.00006749568,0.00019215741,0.000043290278,0.98427504,0.0072936127,0.0050263,0.0019989524,0.00002976929],"about_ca_topic_score_codex":0.0013558683,"about_ca_topic_score_gemma":0.0021137372,"teacher_disagreement_score":0.0031282073,"about_ca_system_score_codex":0.0004871415,"about_ca_system_score_gemma":0.00084919826,"threshold_uncertainty_score":0.0121071935},"labels":[],"label_agreement":null},{"id":"W4321851655","doi":"10.1007/978-3-031-24340-0_22","title":"Basic and Depression Specific Emotions Identification in Tweets: Multi-label Classification Experiments","year":2023,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Emotion classification; Artificial intelligence; Identification (biology); Macro; Deep learning; Machine learning; Sentiment analysis; Empirical research; Natural language processing","score_opus":0.07319826536210684,"score_gpt":0.3081987816288172,"score_spread":0.23500051626671037,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4321851655","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9925418,0.00020277548,0.003910874,0.00014000977,0.00025567794,0.00019197738,0.0011859648,0.00014792423,0.0014228917],"genre_scores_gemma":[0.97863275,0.00017559231,0.011137711,0.00012160627,0.00013285661,0.00031191058,0.0054068244,0.000050566727,0.004030112],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.999275,0.00022788733,0.00007000481,0.00015541175,0.0001434344,0.00012822574],"domain_scores_gemma":[0.99773574,0.0013196254,0.00013611467,0.00020967143,0.00036408045,0.00023482961],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001635332,0.00079439196,0.00073014986,0.00037813146,0.00068574486,0.00073380535,0.0005288548,0.0010734837,0.0023056518],"category_scores_gemma":[0.0026713908,0.0001627465,0.0006004159,0.00035437674,0.00036444186,0.000750932,0.00074059877,0.0011726996,0.001392697],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.047744785,0.039571267,0.11413938,0.0020135024,0.0010257914,0.001287294,0.0039003869,0.02348347,0.24230702,0.0013606154,0.030664044,0.4925025],"study_design_scores_gemma":[0.0016907998,0.01915889,0.3523374,0.00020396739,0.0013518248,0.0015395151,0.0072728614,0.44072366,0.1623233,0.0028087539,0.0102296425,0.00035936642],"about_ca_topic_score_codex":0.0021007254,"about_ca_topic_score_gemma":0.0025499894,"teacher_disagreement_score":0.0023056518,"about_ca_system_score_codex":0.00029027154,"about_ca_system_score_gemma":0.00037751318,"threshold_uncertainty_score":0.008648515},"labels":[],"label_agreement":null},{"id":"W4327499178","doi":"10.1007/978-3-031-28241-6","title":"Advances in Information Retrieval","year":2023,"lang":"en","type":"book","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":25,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Leibniz-Gemeinschaft; University of Massachusetts Amherst; City, University of London; National Institute of Standards and Technology; La Rochelle Université; National Institute of Informatics; Indian Institute of Science Education and Research Mohali; University of Chinese Academy of Sciences; National Institute of Technology Hamirpur; Université de Lyon; Masarykova Univerzita; Ural Federal University; Université de Nantes; Stockholms Universitet; Institut National des Sciences Appliquées de Lyon; Universität Duisburg-Essen; Università di Pisa; Technische Universität Berlin; Bauhaus-Universität Weimar; Universidad de Granada; Università di Bologna; Universität Regensburg; Universitetet i Bergen; University of Windsor; Technische Universität Wien; Radboud Universiteit; University of Waterloo; Commonwealth Scientific and Industrial Research Organisation; Orta Doğu Teknik Üniversitesi; Instituto Superior Técnico; Université de Bretagne Occidentale; Tsinghua University; Chinese Academy of Sciences; Birkbeck, University of London; Universidade de Lisboa; Renmin University of China; Universität Innsbruck; Technische Universiteit Delft; Région Normandie; University of Minnesota; TU Graz, Internationale Beziehungen und Mobilitätsprogramme; Universiteit Utrecht; RMIT University; Haute école Spécialisée de Suisse Occidentale; University of Southampton; Universidade da Coruña; Istituto di Scienza e Tecnologie dell'Informazione; Universidad Nacional de Educación a Distancia; Universiteit Leiden; York University; University of Glasgow; Universität Passau; Universidade do Porto; Dublin City University; Politecnico di Torino; Friedrich-Schiller-Universität Jena; Universitetet i Stavanger; University of Regina; Université Grenoble Alpes; University of Southern Maine; Centre National de la Recherche Scientifique; University of Roehampton; Norges Teknisk-Naturvitenskapelige Universitet; Sun Yat-sen University; Universiteit van Amsterdam; Universidade de Santiago de Compostela; Università degli Studi di Cagliari; Aix-Marseille Université; University of Wolverhampton; Universidade Federal de Minas Gerais; Chinese University of Hong Kong; Aalborg Universitet; Kaiser Permanente; Indian Institute of Technology Kharagpur; Indian Institute of Science; Qatar University; Universidad Autónoma de Madrid; University of Tsukuba; Georgetown University; Universitatea din București; Università degli Studi di Padova; Zürcher Hochschule für Angewandte Wissenschaften; Johns Hopkins University; Indian National Science Academy","keywords":"Computer science; Information retrieval; State (computer science); Artificial intelligence; Programming language","score_opus":0.012864160102574714,"score_gpt":0.2606042818289115,"score_spread":0.24774012172633678,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4327499178","genre_codex":"review","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0020548995,0.6013346,0.077063866,0.00759361,0.01659062,0.0001556802,0.0009657664,0.003014821,0.29122618],"genre_scores_gemma":[0.015498421,0.28447187,0.06282778,0.003391319,0.011766665,0.00014583564,0.002168096,0.0009496012,0.61878043],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9986004,0.00018051299,0.00009716572,0.00019552911,0.00084009895,0.00008629448],"domain_scores_gemma":[0.9984585,0.00052281434,0.00007426822,0.00032452238,0.0005075905,0.000112209906],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0016865669,0.0015837514,0.002260586,0.005485951,0.0008260285,0.0046120123,0.0015501849,0.0014542498,0.055534817],"category_scores_gemma":[0.0032750645,0.00067340134,0.00070831197,0.008301434,0.0012261278,0.007467553,0.0018694123,0.0025352293,0.07511046],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000026729982,0.000049129983,0.00009760056,0.0009403209,0.00003138429,0.000033220287,0.00007417409,0.0003066723,0.001841202,0.04002342,0.31894687,0.6376292],"study_design_scores_gemma":[0.0000075401254,0.000041000636,0.00031493366,0.00027545632,0.000028259901,0.00025625373,0.000040540206,0.001160666,0.0010295442,0.028041288,0.96878886,0.00001566541],"about_ca_topic_score_codex":0.00094272423,"about_ca_topic_score_gemma":0.0015701798,"teacher_disagreement_score":0.055534817,"about_ca_system_score_codex":0.0011737635,"about_ca_system_score_gemma":0.0012884352,"threshold_uncertainty_score":0.18578243},"labels":[],"label_agreement":null},{"id":"W4327644040","doi":"10.1007/978-3-031-28238-6","title":"Advances in Information Retrieval","year":2023,"lang":"en","type":"book","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Zürcher Hochschule für Angewandte Wissenschaften; Leibniz-Gemeinschaft; National Institute of Standards and Technology; La Rochelle Université; Université de Caen Normandie; National Institute of Informatics; Indian Institute of Science Education and Research Mohali; University of Chinese Academy of Sciences; National Institute of Technology Hamirpur; Université de Lyon; Masarykova Univerzita; Universität Konstanz; Ural Federal University; Université de Nantes; Stockholms Universitet; Universität Leipzig; Universität Duisburg-Essen; Università degli Studi di Udine; Università di Pisa; Universidade Federal de Minas Gerais; University of Cape Town; Tsinghua University; Chinese Academy of Sciences; Université de Bretagne Occidentale; Georgetown University; University of Tsukuba; Technion-Israel Institute of Technology; Università di Bologna; Universitetet i Bergen; University of Windsor; Technische Universität Wien; Radboud Universiteit; University of Waterloo; Commonwealth Scientific and Industrial Research Organisation; Orta Doğu Teknik Üniversitesi; Universitatea din București; Università degli Studi di Padova; Universidad de Granada; Universität Innsbruck; Technische Universiteit Delft; Université de Neuchâtel; Région Normandie; TU Graz, Internationale Beziehungen und Mobilitätsprogramme; Universiteit Utrecht; National Institute of Advanced Industrial Science and Technology; RMIT University; Universidade da Coruña; Universidad Nacional de Educación a Distancia; University of Glasgow; York University; Universiteit Leiden; University of Regina; Université Grenoble Alpes; Universitetet i Stavanger; Universität Passau; Centre National de la Recherche Scientifique; Aix-Marseille Université; University of Wolverhampton; Universidade de Santiago de Compostela; Università degli Studi di Cagliari; Universidade do Porto; Dublin City University; Politecnico di Torino; Friedrich-Schiller-Universität Jena; Norges Teknisk-Naturvitenskapelige Universitet; Universiteit van Amsterdam; Qatar University; Universidad Autónoma de Madrid; Renmin University of China; University of Otago; Aalborg Universitet; Kaiser Permanente; Indian Institute of Technology Kharagpur; Indian Institute of Science; Sorbonne Université; Accenture","keywords":"Computer science; Information retrieval; State (computer science); Human–computer information retrieval; Artificial intelligence; Search engine; Programming language","score_opus":0.012864160102574714,"score_gpt":0.2606042818289115,"score_spread":0.24774012172633678,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4327644040","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0020548995,0.6013346,0.077063866,0.00759361,0.01659062,0.0001556802,0.0009657664,0.003014821,0.29122618],"genre_scores_gemma":[0.015498421,0.28447187,0.06282778,0.003391319,0.011766665,0.00014583564,0.002168096,0.0009496012,0.61878043],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9986004,0.00018051299,0.00009716572,0.00019552911,0.00084009895,0.00008629448],"domain_scores_gemma":[0.9984585,0.00052281434,0.00007426822,0.00032452238,0.0005075905,0.000112209906],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0016865669,0.0015837514,0.002260586,0.005485951,0.0008260285,0.0046120123,0.0015501849,0.0014542498,0.055534817],"category_scores_gemma":[0.0032750645,0.00067340134,0.00070831197,0.008301434,0.0012261278,0.007467553,0.0018694123,0.0025352293,0.07511046],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000026729982,0.000049129983,0.00009760056,0.0009403209,0.00003138429,0.000033220287,0.00007417409,0.0003066723,0.001841202,0.04002342,0.31894687,0.6376292],"study_design_scores_gemma":[0.0000075401254,0.000041000636,0.00031493366,0.00027545632,0.000028259901,0.00025625373,0.000040540206,0.001160666,0.0010295442,0.028041288,0.96878886,0.00001566541],"about_ca_topic_score_codex":0.00094272423,"about_ca_topic_score_gemma":0.0015701798,"teacher_disagreement_score":0.055534817,"about_ca_system_score_codex":0.0011737635,"about_ca_system_score_gemma":0.0012884352,"threshold_uncertainty_score":0.18578243},"labels":[],"label_agreement":null},{"id":"W4327657211","doi":"10.1007/978-3-031-28244-7","title":"Advances in Information Retrieval","year":2023,"lang":"en","type":"book","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":10,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"University of Massachusetts Amherst; Universität Innsbruck; Universität Konstanz; Universität Leipzig; Universität Duisburg-Essen; Università di Pisa; Wuhan University; Universidade do Porto; National Institute of Standards and Technology; Technion-Israel Institute of Technology; Rheinische Friedrich-Wilhelms-Universität Bonn; University of Cape Town; Sichuan University; University of Waterloo; Institute of Computing Technology, Chinese Academy of Sciences; Université de Caen Normandie; University of Crete; RMIT University; Tsinghua University; Edinburgh Napier University; Accenture; Renmin University of China; Università degli Studi di Milano-Bicocca; Chinese Academy of Sciences; Technische Universiteit Delft; Universiteit van Amsterdam; Dublin City University; University College London; University of Essex; Sorbonne Université; Università degli Studi di Milano; York University; Montclair State University; National Institute of Advanced Industrial Science and Technology; Universiteit Leiden; University of Otago; Université de Neuchâtel; Région Normandie; Università degli Studi di Udine; Johns Hopkins University","keywords":"Computer science; Information retrieval; State (computer science); Artificial intelligence; Programming language","score_opus":0.012864160102574714,"score_gpt":0.2606042818289115,"score_spread":0.24774012172633678,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4327657211","genre_codex":"review","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0020548995,0.6013346,0.077063866,0.00759361,0.01659062,0.0001556802,0.0009657664,0.003014821,0.29122618],"genre_scores_gemma":[0.015498421,0.28447187,0.06282778,0.003391319,0.011766665,0.00014583564,0.002168096,0.0009496012,0.61878043],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9986004,0.00018051299,0.00009716572,0.00019552911,0.00084009895,0.00008629448],"domain_scores_gemma":[0.9984585,0.00052281434,0.00007426822,0.00032452238,0.0005075905,0.000112209906],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0016865669,0.0015837514,0.002260586,0.005485951,0.0008260285,0.0046120123,0.0015501849,0.0014542498,0.055534817],"category_scores_gemma":[0.0032750645,0.00067340134,0.00070831197,0.008301434,0.0012261278,0.007467553,0.0018694123,0.0025352293,0.07511046],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000026729982,0.000049129983,0.00009760056,0.0009403209,0.00003138429,0.000033220287,0.00007417409,0.0003066723,0.001841202,0.04002342,0.31894687,0.6376292],"study_design_scores_gemma":[0.0000075401254,0.000041000636,0.00031493366,0.00027545632,0.000028259901,0.00025625373,0.000040540206,0.001160666,0.0010295442,0.028041288,0.96878886,0.00001566541],"about_ca_topic_score_codex":0.00094272423,"about_ca_topic_score_gemma":0.0015701798,"teacher_disagreement_score":0.055534817,"about_ca_system_score_codex":0.0011737635,"about_ca_system_score_gemma":0.0012884352,"threshold_uncertainty_score":0.18578243},"labels":[],"label_agreement":null},{"id":"W4365518837","doi":"10.54254/2755-2721/2/20220540","title":"A Novel Method for Text Classification Dealing with Local Data Structures and High Data Dimensionality","year":2023,"lang":"en","type":"article","venue":"Applied and Computational Engineering","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Computer science; Curse of dimensionality; Pattern recognition (psychology); Artificial intelligence; k-nearest neighbors algorithm; Feature vector; Correlation; Text categorization; Data mining; Data set; Set (abstract data type); Support vector machine; Mathematics","score_opus":0.060627553714363805,"score_gpt":0.29863529543887635,"score_spread":0.23800774172451256,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4365518837","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0052594757,0.0004788558,0.98974484,0.00017463177,0.00032775386,0.00021763016,0.0003651379,0.0020733932,0.0013582946],"genre_scores_gemma":[0.06754955,0.0006322385,0.92076415,0.00020078811,0.00035996255,0.00039686347,0.0013256712,0.00015833149,0.008612383],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99814403,0.00019410237,0.00015611056,0.00048556956,0.00091359846,0.000106609536],"domain_scores_gemma":[0.9986077,0.00031860315,0.00015172719,0.00022213743,0.00065096153,0.000048826863],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00091396115,0.001014339,0.0011652107,0.0038251595,0.0010816236,0.0013536692,0.0012681965,0.0010860743,0.002588132],"category_scores_gemma":[0.0027222459,0.00031412966,0.0009903111,0.0044133533,0.0006856423,0.0020556794,0.0007406478,0.0012156016,0.0026570624],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000109772125,0.000106758154,0.0013716121,0.00021181523,0.000067849964,0.00010301061,0.00011741551,0.0049568717,0.020757262,0.004952312,0.01144511,0.9558003],"study_design_scores_gemma":[0.000079576836,0.00026753903,0.0056752698,0.00008426273,0.000112673435,0.0016740003,0.00024335303,0.85783523,0.05215184,0.016109562,0.06564753,0.00011927547],"about_ca_topic_score_codex":0.0028360444,"about_ca_topic_score_gemma":0.004402585,"teacher_disagreement_score":0.0038251595,"about_ca_system_score_codex":0.00057153683,"about_ca_system_score_gemma":0.0014180966,"threshold_uncertainty_score":0.008658111},"labels":[],"label_agreement":null},{"id":"W4366150675","doi":"10.2139/ssrn.4420262","title":"Criteria Rating Prediction with Aspect Representation Learning for Multi-Criteria Recommendation","year":2023,"lang":"en","type":"preprint","venue":"SSRN Electronic Journal","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Representation (politics); Computer science; Artificial intelligence; Machine learning; Natural language processing; Political science","score_opus":0.07678940015155605,"score_gpt":0.3574067475961836,"score_spread":0.2806173474446276,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4366150675","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05308236,0.0010411724,0.93883985,0.00045107258,0.00014544278,0.00019618595,0.0009900876,0.0028430715,0.0024107108],"genre_scores_gemma":[0.69672036,0.00052951265,0.2944412,0.00023580196,0.00021325189,0.00028978035,0.0039591645,0.00016570641,0.0034451347],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9984353,0.00049971126,0.00013779652,0.00037810765,0.00038533707,0.0001636037],"domain_scores_gemma":[0.9956929,0.0023721596,0.00028403976,0.00062662706,0.0008295699,0.00019469578],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002270285,0.0011040858,0.0014654065,0.003592334,0.00055519224,0.0017629217,0.0016851914,0.0016673942,0.0029753365],"category_scores_gemma":[0.009787,0.00039150528,0.0016204232,0.004056112,0.0004047598,0.0020261807,0.0010088274,0.002426778,0.001652826],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005964259,0.0008455618,0.014997055,0.00028462082,0.0003500651,0.00017444679,0.00018862248,0.12564787,0.0041862237,0.0062544043,0.021573607,0.82490116],"study_design_scores_gemma":[0.000015957696,0.00005670615,0.00088177976,0.000018768042,0.00003637409,0.000033360317,0.000017989521,0.9920223,0.00061426056,0.005709602,0.00058096484,0.000011941873],"about_ca_topic_score_codex":0.0075694784,"about_ca_topic_score_gemma":0.008540522,"teacher_disagreement_score":0.0075694784,"about_ca_system_score_codex":0.0009140827,"about_ca_system_score_gemma":0.0010736571,"threshold_uncertainty_score":0.015050888},"labels":[],"label_agreement":null},{"id":"W4368755400","doi":"10.48550/arxiv.2305.02156","title":"Zero-Shot Listwise Document Reranking with a Large Language Model","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":20,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Pointwise; Ranking (information retrieval); Relevance (law); Information retrieval; Encoder; Pointwise mutual information; Task (project management); Natural language processing; Zero (linguistics); Language model; Identifier; Artificial intelligence; Mathematics; Mutual information; Linguistics","score_opus":0.09702878345608794,"score_gpt":0.2197408233135964,"score_spread":0.12271203985750846,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4368755400","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.023015888,0.000830726,0.966564,0.00018081468,0.00013547094,0.00015200557,0.00031690323,0.007481367,0.0013229517],"genre_scores_gemma":[0.25173354,0.00041579237,0.73151463,0.00034479014,0.00027703782,0.00031589944,0.0028186666,0.00061693235,0.01196274],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99819946,0.0006587368,0.00011237022,0.00044575866,0.00046113675,0.0001225595],"domain_scores_gemma":[0.996558,0.0013406097,0.00029394784,0.00078152237,0.0009064482,0.000119519216],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0021184576,0.0013551345,0.0015893566,0.0021675145,0.0006394098,0.0011790207,0.0018826014,0.0009930615,0.0026644163],"category_scores_gemma":[0.0056206253,0.00043083032,0.0007481659,0.0017606274,0.00070041034,0.0026715484,0.0010876744,0.0014417651,0.003282069],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00035569063,0.00039150476,0.0014456724,0.0003126936,0.00015007438,0.000156525,0.0001694262,0.044953607,0.030595245,0.0068755406,0.017492533,0.8971015],"study_design_scores_gemma":[0.00012244853,0.0004643843,0.0007978909,0.000024874747,0.00007400239,0.0003204041,0.00008355299,0.94157875,0.03530902,0.013653071,0.0074905674,0.000081046775],"about_ca_topic_score_codex":0.0035944222,"about_ca_topic_score_gemma":0.012329049,"teacher_disagreement_score":0.0035944222,"about_ca_system_score_codex":0.00064745534,"about_ca_system_score_gemma":0.0016255536,"threshold_uncertainty_score":0.011203587},"labels":[],"label_agreement":null},{"id":"W4376269558","doi":"10.1016/j.knosys.2023.110602","title":"SPRF: A semantic Pseudo-relevance Feedback enhancement for information retrieval via ConceptNet","year":2023,"lang":"en","type":"article","venue":"Knowledge-Based Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":20,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University; York University","funders":"Natural Science Foundation of Zhejiang Province; Natural Sciences and Engineering Research Council of Canada; China Scholarship Council; Hebei Normal University","keywords":"Computer science; Relevance feedback; Information retrieval; Relevance (law); Query expansion; Baseline (sea); Process (computing); Learning to rank; Ranking (information retrieval); Term Discrimination; Term (time); Concept search; Artificial intelligence; Data mining; Search engine; Web search query; Image retrieval","score_opus":0.0248971567349397,"score_gpt":0.27642516854207805,"score_spread":0.25152801180713835,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4376269558","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012783051,0.0015825311,0.9697971,0.00035292862,0.00039835376,0.00037908516,0.0008282516,0.010883201,0.0029954505],"genre_scores_gemma":[0.16605589,0.0007045073,0.820989,0.00042798187,0.00032240516,0.00038849527,0.002016007,0.0005082209,0.008587426],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99753654,0.0006741823,0.00013782908,0.00041989778,0.0010974822,0.00013404973],"domain_scores_gemma":[0.99792707,0.0007798513,0.00007902583,0.00032537544,0.00080636475,0.000082338745],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0029322235,0.0012230356,0.0015028557,0.0036094338,0.00084274466,0.0011417952,0.0021321643,0.0018080694,0.008535028],"category_scores_gemma":[0.0062267487,0.0004936217,0.0010436812,0.0020577465,0.0007326779,0.004262068,0.0019871453,0.0014968172,0.0029623148],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00078409124,0.0004548543,0.00046746604,0.0007120926,0.00014204888,0.00019485994,0.00019308868,0.011076847,0.027865382,0.01060501,0.023407055,0.9240973],"study_design_scores_gemma":[0.00028466908,0.0007167546,0.001371267,0.00013074605,0.00022700775,0.0006469588,0.00012337173,0.8698004,0.05048978,0.0358525,0.040237762,0.000118788426],"about_ca_topic_score_codex":0.0042840443,"about_ca_topic_score_gemma":0.0049072797,"teacher_disagreement_score":0.008535028,"about_ca_system_score_codex":0.00080671906,"about_ca_system_score_gemma":0.0017062877,"threshold_uncertainty_score":0.028552532},"labels":[],"label_agreement":null},{"id":"W4378418331","doi":"10.18280/ria.370219","title":"BalBERT: A New Approach to Improving Dataset Balancing for Text Classification","year":2023,"lang":"en","type":"article","venue":"Revue d intelligence artificielle","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Natural language processing; Information retrieval; Artificial intelligence","score_opus":0.09182440662175224,"score_gpt":0.31381214502686405,"score_spread":0.22198773840511182,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4378418331","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.062071115,0.0022703896,0.89079535,0.0014487681,0.0019071796,0.0018816661,0.0035283903,0.028630616,0.0074665104],"genre_scores_gemma":[0.24580246,0.0007087886,0.7080324,0.0015620566,0.0020117557,0.0024065957,0.01975752,0.0018211063,0.017897295],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99243414,0.0017982959,0.0008504137,0.0017581736,0.0027099713,0.00044904114],"domain_scores_gemma":[0.98764753,0.003718177,0.001268725,0.003677732,0.003154712,0.00053307356],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007974909,0.0025728594,0.002183537,0.0066455593,0.0022568076,0.003721021,0.005219638,0.0026400439,0.006208488],"category_scores_gemma":[0.02981559,0.0008250633,0.0016450061,0.0055011627,0.00096706796,0.010008108,0.0051506604,0.003159887,0.0060947104],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013061436,0.0008793591,0.006070252,0.00037176715,0.00019201098,0.00018572011,0.00046718266,0.015278459,0.031881277,0.0060433233,0.039603647,0.8977209],"study_design_scores_gemma":[0.0006239035,0.001627521,0.007482313,0.00018978398,0.00025610466,0.0007362002,0.0009773035,0.82356733,0.046597805,0.034014214,0.08370413,0.00022337696],"about_ca_topic_score_codex":0.0034934178,"about_ca_topic_score_gemma":0.005699572,"teacher_disagreement_score":0.007974909,"about_ca_system_score_codex":0.0014998849,"about_ca_system_score_gemma":0.0021559463,"threshold_uncertainty_score":0.04217583},"labels":[],"label_agreement":null},{"id":"W4382202851","doi":"10.1609/aaai.v37i11.26579","title":"Multi-Mask Label Mapping for Prompt-Based Learning","year":2023,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"Fundamental Research Funds for the Central Universities; State Key Laboratory of Software Development Environment","keywords":"Computer science; Natural language processing; Artificial intelligence; Task (project management); Context (archaeology); Exploit; Word (group theory); Machine learning; Linguistics","score_opus":0.19232711549277473,"score_gpt":0.3382618546859622,"score_spread":0.14593473919318747,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4382202851","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.031297546,0.0002705848,0.95893204,0.00037582693,0.000106908854,0.00014984739,0.00019507213,0.007569248,0.0011030061],"genre_scores_gemma":[0.55770063,0.00015939798,0.432741,0.0007697555,0.00014963976,0.00045212146,0.0011993035,0.000496053,0.00633209],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99839383,0.0005980635,0.00006870876,0.0005519769,0.00026771272,0.000119784614],"domain_scores_gemma":[0.9952878,0.0023049372,0.00026646862,0.0012064391,0.0005964495,0.00033789387],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0024039918,0.0016039158,0.0014695654,0.00078009494,0.0009005016,0.0012357786,0.0039875936,0.0030019644,0.0044873576],"category_scores_gemma":[0.011153188,0.0006324361,0.0008863761,0.0007873507,0.0013512123,0.004965818,0.0031327412,0.0037061665,0.0021238138],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013351041,0.0010356711,0.0034666199,0.00036971332,0.00007048858,0.00039585243,0.0007750186,0.11160705,0.033547394,0.01601753,0.011888554,0.8194909],"study_design_scores_gemma":[0.00004926635,0.00031485196,0.0003804709,0.000016937794,0.00002074536,0.00011988535,0.0001073921,0.9541438,0.012918,0.029058231,0.0028371385,0.000033344942],"about_ca_topic_score_codex":0.0014790483,"about_ca_topic_score_gemma":0.0028597508,"teacher_disagreement_score":0.0044873576,"about_ca_system_score_codex":0.0010233388,"about_ca_system_score_gemma":0.0015407351,"threshold_uncertainty_score":0.015011728},"labels":[],"label_agreement":null},{"id":"W4382931899","doi":"10.31436/iiumej.v24i2.2893","title":"Editorial","year":2023,"lang":"en","type":"editorial","venue":"IIUM Engineering Journal","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Islam; Engineering; Library science; Management; Theology; Philosophy","score_opus":0.006782703567458102,"score_gpt":0.23237174770403143,"score_spread":0.22558904413657332,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4382931899","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0002911261,0.0141834365,0.0007814531,0.060216427,0.7492006,0.00021099919,0.0015591917,0.000959056,0.17259765],"genre_scores_gemma":[0.0042526997,0.018105896,0.0009777991,0.032830436,0.38346246,0.0001848515,0.0022174239,0.00080300844,0.5571654],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9962567,0.00050364016,0.00036549268,0.0006810311,0.0018239812,0.00036920194],"domain_scores_gemma":[0.9804278,0.0019828265,0.0009979092,0.0012982036,0.0119057745,0.0033875098],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0032006023,0.0018402352,0.0014637308,0.0034020015,0.0022434464,0.009493507,0.002442291,0.0036518588,0.39019984],"category_scores_gemma":[0.024097959,0.00060285174,0.0011819494,0.0015952187,0.0010830367,0.0042951116,0.0021897722,0.0050548613,0.3079476],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000015477406,0.000004171034,0.000031896987,0.00009974917,0.0000026598914,0.000044079974,0.000011297086,0.000009279454,0.000034340388,0.00046768217,0.9861444,0.013135049],"study_design_scores_gemma":[0.000009663544,0.0000070704777,0.0000841294,0.00016957954,0.000004059107,0.000098912606,0.000036305762,0.000019734018,0.00005231226,0.0004407513,0.999073,0.00000444876],"about_ca_topic_score_codex":0.0013454842,"about_ca_topic_score_gemma":0.0020438256,"teacher_disagreement_score":0.60980016,"about_ca_system_score_codex":0.0022182474,"about_ca_system_score_gemma":0.005124548,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W4384570015","doi":"10.23977/acss.2023.070516","title":"Prediction and Classification Model Based on Wordle's Date","year":2023,"lang":"en","type":"article","venue":"Advances in Computer Signals and Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Interpretability; Popularity; Computer science; Cluster analysis; Interval (graph theory); Word (group theory); A priori and a posteriori; Reliability (semiconductor); Artificial intelligence; Promotion (chess); Machine learning; Mathematics; Psychology","score_opus":0.04978831599525085,"score_gpt":0.2853793996480487,"score_spread":0.23559108365279785,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4384570015","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.79237366,0.00177238,0.18698429,0.0024330795,0.0008704633,0.00035490355,0.00605062,0.0015607255,0.0075999335],"genre_scores_gemma":[0.96434957,0.00049574993,0.022944994,0.000120880635,0.00023525687,0.00019859892,0.004270196,0.000064629596,0.0073201167],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9991073,0.00013226505,0.00011860075,0.00030767915,0.00019319697,0.00014092033],"domain_scores_gemma":[0.99563545,0.0022976305,0.00048708566,0.00020519122,0.001196968,0.00017764172],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0017095,0.0012860224,0.00091525225,0.0044151302,0.00063839083,0.002148331,0.0012130938,0.0015361366,0.0046841605],"category_scores_gemma":[0.008005387,0.00027548627,0.0010728973,0.0020056942,0.0004307901,0.0024742468,0.0006741468,0.001431764,0.003016617],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0020946965,0.0012099794,0.34977973,0.00041756377,0.00032947975,0.0015995348,0.0011586213,0.24406481,0.006642485,0.009058506,0.02224237,0.3614022],"study_design_scores_gemma":[0.000023154496,0.000109984685,0.013762215,0.000028176668,0.00006169888,0.00014936834,0.00015014097,0.9792921,0.00099953,0.0035627089,0.0018301184,0.000030806645],"about_ca_topic_score_codex":0.006486979,"about_ca_topic_score_gemma":0.0043684645,"teacher_disagreement_score":0.006486979,"about_ca_system_score_codex":0.00085221464,"about_ca_system_score_gemma":0.00059053313,"threshold_uncertainty_score":0.015670061},"labels":[],"label_agreement":null},{"id":"W4384788087","doi":"10.1007/978-3-031-36819-6_4","title":"A Selective Supervised Latent Beta-Liouville Allocation for Document Classification","year":2023,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Computer science; Latent Dirichlet allocation; Inference; Artificial intelligence; Bernoulli's principle; Dirichlet distribution; Machine learning; Simple (philosophy); Prior probability; Gibbs sampling; Topic model; Word (group theory); Pattern recognition (psychology); Bayesian probability; Mathematics","score_opus":0.041366077434778034,"score_gpt":0.2744832432710408,"score_spread":0.23311716583626274,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4384788087","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0036388081,0.00022497043,0.9942643,0.00008506833,0.000052800286,0.000043457312,0.00006741265,0.0008358881,0.0007872308],"genre_scores_gemma":[0.12869324,0.00035943257,0.8542087,0.00039474102,0.00031421115,0.00059243635,0.001324623,0.0005445735,0.013568104],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9974464,0.0012835605,0.0001248264,0.00041750647,0.000522174,0.00020546724],"domain_scores_gemma":[0.99731404,0.0012649084,0.00009423972,0.0006116931,0.0005716792,0.00014330345],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0034397217,0.00078845036,0.002072194,0.0014475252,0.0013315299,0.0017650216,0.003730559,0.0018571403,0.006599693],"category_scores_gemma":[0.00581146,0.00062428607,0.001426027,0.0022897501,0.0011816347,0.0024465898,0.0029454457,0.0026463494,0.003961762],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00056003814,0.00040033588,0.0007224342,0.0001694193,0.0001359239,0.00006042704,0.00016126683,0.07629637,0.012009195,0.056067113,0.016525354,0.836892],"study_design_scores_gemma":[0.00004347053,0.00007595666,0.00015873404,0.000014857042,0.000022729979,0.000049818387,0.000021836104,0.9624633,0.0029919627,0.031136652,0.0030024084,0.000018281653],"about_ca_topic_score_codex":0.0033836612,"about_ca_topic_score_gemma":0.005761694,"teacher_disagreement_score":0.006599693,"about_ca_system_score_codex":0.0011955805,"about_ca_system_score_gemma":0.0023370998,"threshold_uncertainty_score":0.022078156},"labels":[],"label_agreement":null},{"id":"W4384934940","doi":"10.1007/s00521-023-08793-6","title":"Multi-graph embedding for partial label learning","year":2023,"lang":"en","type":"article","venue":"Neural Computing and Applications","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"Dongguan Science and Technology Bureau","keywords":"Computer science; Graph; Artificial intelligence; Embedding; Graph embedding; Pattern recognition (psychology); Classifier (UML); Theoretical computer science; Machine learning; Data mining; Algorithm","score_opus":0.055677746595602796,"score_gpt":0.34710596727854287,"score_spread":0.29142822068294005,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4384934940","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.016744193,0.0005762558,0.9769504,0.000502463,0.000113081944,0.000090116904,0.0013222846,0.0022309497,0.0014702835],"genre_scores_gemma":[0.33683863,0.0007724033,0.63761216,0.0006315521,0.00022866736,0.0004438871,0.010799354,0.0011087493,0.01156465],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99878126,0.00036529225,0.00006633916,0.00044891497,0.0002553609,0.0000828047],"domain_scores_gemma":[0.9960775,0.0016751538,0.00022422941,0.0013529226,0.00046425272,0.00020596947],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009340072,0.0012302182,0.0016015222,0.002257352,0.0009814823,0.0011786524,0.002353488,0.0020328774,0.005972002],"category_scores_gemma":[0.004941079,0.00064155855,0.0014588792,0.0029340351,0.00095784175,0.0041770083,0.002529352,0.0029772497,0.0022246004],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00042079602,0.0005433825,0.0021649788,0.0005820033,0.00023552227,0.00021522217,0.00027559642,0.13124269,0.009077984,0.0642357,0.03567438,0.7553317],"study_design_scores_gemma":[0.000022122402,0.000060731836,0.0003350181,0.000038484188,0.000036262976,0.0000698484,0.000049334245,0.8904276,0.001838152,0.10281546,0.004288732,0.00001822923],"about_ca_topic_score_codex":0.0052078855,"about_ca_topic_score_gemma":0.010391319,"teacher_disagreement_score":0.005972002,"about_ca_system_score_codex":0.0009660734,"about_ca_system_score_gemma":0.0011076803,"threshold_uncertainty_score":0.019978344},"labels":[],"label_agreement":null},{"id":"W4385078273","doi":"10.18280/isi.280317","title":"A Distributed Densely Connected Convolutional Network Approach for Enhanced Recognition of Health-Related Topics: A Societal Analysis Case Study","year":2023,"lang":"en","type":"article","venue":"Ingénierie des systèmes d information","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Social network analysis; Convolutional neural network; Computer network; Artificial intelligence; World Wide Web; Social media","score_opus":0.041564059756349324,"score_gpt":0.2769928398837452,"score_spread":0.23542878012739585,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4385078273","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8521317,0.0023240873,0.106305726,0.009482596,0.00016709004,0.00031802242,0.0044659614,0.0009389718,0.023865795],"genre_scores_gemma":[0.9594689,0.00062740734,0.03293918,0.00030163868,0.00008130917,0.0000581184,0.0016457328,0.000027924927,0.004849736],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9997124,0.00009953219,0.000013512716,0.000054430286,0.00006439538,0.00005579859],"domain_scores_gemma":[0.99970156,0.00011606674,0.00002758389,0.00003138113,0.00008464749,0.00003880992],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005485838,0.00042799197,0.00021795736,0.0010607595,0.0004901948,0.0005488377,0.00046736145,0.000860799,0.0014292028],"category_scores_gemma":[0.0010976922,0.00007444227,0.0003576804,0.0009150678,0.00030989645,0.00063795445,0.00063191185,0.00047694801,0.00032370733],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008663587,0.0009706219,0.16584428,0.00057162205,0.0003112485,0.013838565,0.00171289,0.15902452,0.019036092,0.027697884,0.048760913,0.56136495],"study_design_scores_gemma":[0.000049060753,0.000221102,0.058987357,0.00006292236,0.000102151396,0.0022719682,0.0020568182,0.87125856,0.010100348,0.012989508,0.041839443,0.000060626968],"about_ca_topic_score_codex":0.027164312,"about_ca_topic_score_gemma":0.03964476,"teacher_disagreement_score":0.027164312,"about_ca_system_score_codex":0.0016084219,"about_ca_system_score_gemma":0.00069472945,"threshold_uncertainty_score":0.054012418},"labels":[],"label_agreement":null},{"id":"W4385386810","doi":"10.18280/ria.370311","title":"Machine Learning-Based Recommendations and Classification System for Unstructured Resume Documents","year":2023,"lang":"en","type":"article","venue":"Revue d intelligence artificielle","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Artificial intelligence; Natural language processing","score_opus":0.057340242705371136,"score_gpt":0.3059013143271985,"score_spread":0.2485610716218274,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4385386810","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.21314849,0.0032420815,0.6303789,0.002422674,0.001076478,0.0026369214,0.016153371,0.11464586,0.016295185],"genre_scores_gemma":[0.42344284,0.0012744523,0.5292226,0.00062026904,0.00050693535,0.00082310685,0.01732385,0.00048088407,0.026305057],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99905854,0.00011217214,0.00015186417,0.0002842125,0.00032322848,0.00007001809],"domain_scores_gemma":[0.99518836,0.0017661442,0.0004578256,0.00056057627,0.0017732959,0.00025380927],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011653306,0.0010188605,0.0013677699,0.0046196384,0.0009777853,0.001362664,0.0017246109,0.0011822777,0.0047151544],"category_scores_gemma":[0.0065078903,0.00031526163,0.0006722683,0.002379331,0.00017871108,0.0016025398,0.00046619814,0.0010345293,0.006325909],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008782445,0.000872387,0.013225021,0.00044513168,0.00010601155,0.0009241391,0.0003050372,0.010576284,0.017743185,0.0009896853,0.044392392,0.90954256],"study_design_scores_gemma":[0.00016882131,0.0005260646,0.015754249,0.00016303765,0.00025874295,0.00078896753,0.00050568307,0.9078482,0.038503382,0.002019078,0.03330122,0.00016254271],"about_ca_topic_score_codex":0.0139977615,"about_ca_topic_score_gemma":0.021365881,"teacher_disagreement_score":0.0139977615,"about_ca_system_score_codex":0.00080333423,"about_ca_system_score_gemma":0.0012523637,"threshold_uncertainty_score":0.027832568},"labels":[],"label_agreement":null},{"id":"W4385486397","doi":"10.1007/978-3-031-33390-3_7","title":"Nearest Neighbors","year":2023,"lang":"en","type":"book-chapter","venue":"Statisctics and computing/Statistics and computing","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"k-nearest neighbors algorithm; Computer science; Pattern recognition (psychology); Naive Bayes classifier; Artificial intelligence; Classifier (UML); Similarity (geometry); Data mining; Machine learning; Support vector machine","score_opus":0.025564252508237035,"score_gpt":0.25865924454697137,"score_spread":0.23309499203873432,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4385486397","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011876061,0.005913408,0.69220185,0.0009844238,0.0020378486,0.00070484617,0.0056541143,0.0058862707,0.2747411],"genre_scores_gemma":[0.12340546,0.0036421723,0.564432,0.0008485681,0.00063558447,0.0004613431,0.015910324,0.0014875516,0.289177],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99788564,0.00021370746,0.00009778121,0.0006222745,0.001029037,0.00015157006],"domain_scores_gemma":[0.99866354,0.00023670743,0.00006228151,0.00048238557,0.0004966872,0.000058372858],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00096938614,0.0010727313,0.0014394938,0.0030329204,0.0015773614,0.0035066246,0.0022191934,0.0018915604,0.05380809],"category_scores_gemma":[0.005044371,0.00058481237,0.0011597052,0.002969342,0.0006596121,0.0034529425,0.0017426147,0.0012480904,0.041537687],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018341653,0.00013486073,0.0009779328,0.0002837245,0.00006939263,0.000100617224,0.000105918945,0.014557294,0.0028672833,0.066157155,0.11536281,0.79919964],"study_design_scores_gemma":[0.00007298932,0.00018207307,0.0015618632,0.00032072177,0.00011556571,0.0014547042,0.00054844155,0.22792342,0.014154529,0.18760413,0.56596357,0.000098007244],"about_ca_topic_score_codex":0.0040190793,"about_ca_topic_score_gemma":0.008667668,"teacher_disagreement_score":0.05380809,"about_ca_system_score_codex":0.0007702143,"about_ca_system_score_gemma":0.0012497582,"threshold_uncertainty_score":0.18000603},"labels":[],"label_agreement":null},{"id":"W4385572319","doi":"10.18653/v1/2023.acl-industry.55","title":"Weighted Contrastive Learning With False Negative Control to Help Long-tailed Product Classification","year":2023,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"","keywords":"Categorical variable; Categorization; Computer science; Regularization (linguistics); Artificial intelligence; Task (project management); Taxonomy (biology); Machine learning; Pattern recognition (psychology); Natural language processing; Engineering","score_opus":0.01927232653048668,"score_gpt":0.2567327726888022,"score_spread":0.2374604461583155,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4385572319","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07178314,0.0017080855,0.9188817,0.0010997273,0.00031326312,0.00023277574,0.0002818207,0.0027009002,0.0029985656],"genre_scores_gemma":[0.79470295,0.00039723548,0.19477373,0.0013915242,0.0003969647,0.00033044603,0.0012570907,0.00033080924,0.0064191986],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9957074,0.0013989226,0.00027448713,0.0011559044,0.0010863694,0.0003769874],"domain_scores_gemma":[0.98649967,0.007907549,0.0011411537,0.0016771586,0.0023356387,0.00043877025],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007910512,0.0021865135,0.0021392137,0.0016064935,0.00097386655,0.0019206107,0.0041017444,0.0029634514,0.0031933861],"category_scores_gemma":[0.023989964,0.00044059768,0.0009738596,0.0013531381,0.0024329755,0.0042170533,0.0029758078,0.0041954513,0.0013034584],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019797701,0.0012606424,0.012159565,0.0005204159,0.0002951886,0.00064369204,0.00034176154,0.1770833,0.02417455,0.021086158,0.01982522,0.74062973],"study_design_scores_gemma":[0.000058377707,0.00020591522,0.00084212946,0.000029275874,0.000045378616,0.0001607482,0.00003148761,0.9817613,0.006702794,0.008611333,0.001530562,0.000020644484],"about_ca_topic_score_codex":0.0023634005,"about_ca_topic_score_gemma":0.0030119221,"teacher_disagreement_score":0.007910512,"about_ca_system_score_codex":0.0017761261,"about_ca_system_score_gemma":0.0016475031,"threshold_uncertainty_score":0.04183525},"labels":[],"label_agreement":null},{"id":"W4385573359","doi":"10.18653/v1/2022.findings-emnlp.291","title":"Parameter-free Automatically Prompting: A Latent Pseudo Label Mapping Model for Prompt-based Learning","year":2022,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"Fundamental Research Funds for the Central Universities; State Key Laboratory of Software Development Environment","keywords":"Computer science; Artificial intelligence; Probabilistic logic; Machine learning; Multi-label classification; Task (project management); Pattern recognition (psychology)","score_opus":0.0630347075920334,"score_gpt":0.2732431962514197,"score_spread":0.2102084886593863,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4385573359","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010991352,0.000168997,0.9851289,0.00019840851,0.000047780395,0.000058657388,0.000109285116,0.0026693947,0.00062715076],"genre_scores_gemma":[0.48436198,0.00027497986,0.50420433,0.00069192844,0.00014530036,0.00065431395,0.0012196868,0.0007261001,0.0077214753],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.998809,0.0005117733,0.000040728937,0.0003651324,0.00017992227,0.00009350193],"domain_scores_gemma":[0.9977957,0.0011563741,0.00015019593,0.00043618964,0.00032405838,0.00013748491],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0020926502,0.0011044892,0.0012284518,0.00069321156,0.00061074103,0.0010862594,0.0033255115,0.001971218,0.0037000142],"category_scores_gemma":[0.006957721,0.0006554714,0.0010188795,0.0008737692,0.0012978041,0.0040211566,0.002225443,0.0034508428,0.0020480675],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006038271,0.0005952743,0.0022532758,0.0003256286,0.00009503534,0.0002195697,0.0007021096,0.3088123,0.016837219,0.03313847,0.014042897,0.6223745],"study_design_scores_gemma":[0.000021606285,0.000066596294,0.00014595063,0.000008489481,0.000008257531,0.00003403454,0.000024403078,0.9789603,0.0021333357,0.017535124,0.0010456361,0.000016268921],"about_ca_topic_score_codex":0.0019172637,"about_ca_topic_score_gemma":0.0032548497,"teacher_disagreement_score":0.0037000142,"about_ca_system_score_codex":0.0009291331,"about_ca_system_score_gemma":0.0015105149,"threshold_uncertainty_score":0.012377799},"labels":[],"label_agreement":null},{"id":"W4385573558","doi":"10.18653/v1/2022.wanlp-1.7","title":"A Benchmark Study of Contrastive Learning for Arabic Social Meaning","year":2022,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Meaning (existential); Benchmark (surveying); Arabic; Computer science; Natural language processing; Linguistics; Artificial intelligence; Contrastive analysis; Psychology; Philosophy; Geology","score_opus":0.02750089901426163,"score_gpt":0.2749420696812646,"score_spread":0.247441170667003,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4385573558","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8704358,0.0044885953,0.061756168,0.001346949,0.00029177818,0.00072012295,0.002331957,0.0011415007,0.057487134],"genre_scores_gemma":[0.93634194,0.0005469869,0.055360146,0.00013329425,0.00008056896,0.00024346735,0.0024508617,0.000111177535,0.004731437],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9983828,0.00096780725,0.00010150414,0.00020355779,0.00028511122,0.00005916451],"domain_scores_gemma":[0.9853107,0.011455801,0.00025121463,0.0012067115,0.001423637,0.00035199904],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0029262018,0.00064702996,0.00034661012,0.0013513538,0.00093545177,0.0014053421,0.0010519294,0.00065680087,0.005637991],"category_scores_gemma":[0.017574511,0.00013896503,0.00033387952,0.0011132499,0.00064875156,0.0030799578,0.0017848035,0.00096274354,0.001259927],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0026099796,0.003416914,0.01493009,0.0012520335,0.00020179161,0.00041977662,0.003989266,0.027607825,0.012225574,0.027996782,0.020386023,0.88496387],"study_design_scores_gemma":[0.00072958804,0.005167107,0.04297113,0.00040380302,0.00023698907,0.00085767894,0.009468509,0.7040729,0.052067537,0.0839458,0.09991868,0.0001603033],"about_ca_topic_score_codex":0.004305091,"about_ca_topic_score_gemma":0.004315692,"teacher_disagreement_score":0.005637991,"about_ca_system_score_codex":0.0010897979,"about_ca_system_score_gemma":0.00046969613,"threshold_uncertainty_score":0.018860996},"labels":[],"label_agreement":null},{"id":"W4385573784","doi":"10.18653/v1/2022.emnlp-industry.39","title":"Developing Prefix-Tuning Models for Hierarchical Text Classification","year":2022,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"","keywords":"Prefix; Computer science; Hierarchy; Task (project management); Set (abstract data type); Key (lock); Process (computing); Artificial intelligence; Machine learning; Engineering","score_opus":0.10234311420757611,"score_gpt":0.3022484223928824,"score_spread":0.1999053081853063,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4385573784","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.053557813,0.001170405,0.9359219,0.00040329708,0.00011563572,0.00017181727,0.0004813512,0.0057556108,0.002422246],"genre_scores_gemma":[0.56007767,0.0005969923,0.42938802,0.00057897525,0.00018225581,0.00043650178,0.0032055832,0.000501079,0.0050329],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9991372,0.0002225458,0.000059680886,0.0003628381,0.00012945339,0.000088234934],"domain_scores_gemma":[0.9971083,0.0016421145,0.00019374974,0.00050394307,0.0004337887,0.00011818816],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002188239,0.0011030334,0.0011771937,0.0010500656,0.0005974154,0.0012851194,0.0021851936,0.0014964133,0.0031488768],"category_scores_gemma":[0.0076769018,0.0005149689,0.0009505271,0.0013117059,0.00085000705,0.0043961247,0.0015605673,0.0027331326,0.002104452],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0004019325,0.0002571665,0.004240794,0.00016682979,0.00011044667,0.00011755339,0.0002800246,0.4017604,0.009263144,0.01371799,0.007929681,0.56175405],"study_design_scores_gemma":[0.00000924057,0.000031997766,0.00014363465,0.0000058551905,0.00000803052,0.000013035517,0.000015356283,0.99120647,0.0011633238,0.006641229,0.0007560052,0.000005823176],"about_ca_topic_score_codex":0.005693865,"about_ca_topic_score_gemma":0.008718078,"teacher_disagreement_score":0.005693865,"about_ca_system_score_codex":0.0015583112,"about_ca_system_score_gemma":0.0013341906,"threshold_uncertainty_score":0.011572659},"labels":[],"label_agreement":null},{"id":"W4386106544","doi":"10.1007/978-3-031-42795-4_6","title":"GNN-DES: A New End-to-End Dynamic Ensemble Selection Method Based on Multi-label Graph Neural Network","year":2023,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"École de Technologie Supérieure; Université du Québec à Montréal","funders":"","keywords":"Computer science; ENCODE; Artificial intelligence; Artificial neural network; Graph; Pattern recognition (psychology); Machine learning; Context (archaeology); Selection (genetic algorithm); Data mining; Theoretical computer science","score_opus":0.04133797308664411,"score_gpt":0.30452895542362235,"score_spread":0.26319098233697824,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4386106544","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011558868,0.0005451391,0.9749537,0.00015131803,0.00028823267,0.00013572704,0.0006175986,0.009665356,0.0020840436],"genre_scores_gemma":[0.104401335,0.00038444335,0.8698242,0.00047825632,0.00020398908,0.00029933796,0.0052791364,0.0012334869,0.017895808],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99898106,0.00019703741,0.000035156463,0.00034235968,0.0003495229,0.00009488254],"domain_scores_gemma":[0.99934417,0.00016972928,0.000027002403,0.00013056333,0.00028733016,0.000041154355],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0010424034,0.0020550692,0.0020932346,0.0016754773,0.0012848648,0.0010141496,0.0024675427,0.0015410644,0.004989108],"category_scores_gemma":[0.0016324111,0.00063075783,0.0011584244,0.0015799926,0.00038920052,0.00172456,0.0017034165,0.0022141973,0.0034759042],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00030974502,0.00033147342,0.0011659806,0.00007858582,0.0003211317,0.00012205808,0.000060972758,0.088790365,0.013002603,0.0025807791,0.029162882,0.86407334],"study_design_scores_gemma":[0.000021167347,0.00004851714,0.00035157902,0.000007211924,0.000039386377,0.000051164374,0.00001672196,0.9871104,0.0049075657,0.0027552089,0.0046725473,0.000018557654],"about_ca_topic_score_codex":0.010261752,"about_ca_topic_score_gemma":0.029044973,"teacher_disagreement_score":0.010261752,"about_ca_system_score_codex":0.0007045718,"about_ca_system_score_gemma":0.0010782614,"threshold_uncertainty_score":0.02040404},"labels":[],"label_agreement":null},{"id":"W4386163333","doi":"10.1016/j.neucom.2023.126729","title":"Within- cross- consensus-view representation-based multi-view multi-label learning with incomplete data","year":2023,"lang":"en","type":"article","venue":"Neurocomputing","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":13,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Representation (politics); Feature (linguistics); Feature learning; Artificial intelligence; Machine learning; Exploit; Data mining","score_opus":0.2010044733352705,"score_gpt":0.3881169748434069,"score_spread":0.1871125015081364,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4386163333","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.007288383,0.00025781384,0.99124336,0.00013670065,0.000049280756,0.00004637152,0.00007877296,0.0005059191,0.00039327046],"genre_scores_gemma":[0.48313823,0.0005109388,0.50839436,0.00055873976,0.00024295803,0.0003799021,0.002226006,0.0004105751,0.004138245],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9967097,0.0009654053,0.00022184361,0.0010755787,0.00067333155,0.0003541371],"domain_scores_gemma":[0.9946792,0.0023094835,0.00044043688,0.0009792779,0.0013186213,0.00027304844],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0049732453,0.0018348772,0.0039379313,0.0015706336,0.0013774316,0.0025259964,0.004968332,0.0036096745,0.0025035345],"category_scores_gemma":[0.008728761,0.0011198022,0.0025774979,0.0023454877,0.0014873537,0.0040427097,0.0045173024,0.0036324782,0.0012673222],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00073745626,0.00047195738,0.0020239803,0.00046210666,0.0006116124,0.00023824026,0.00043764146,0.4264575,0.010287802,0.013636936,0.009775445,0.5348593],"study_design_scores_gemma":[0.000012138974,0.000053526168,0.00011001621,0.000008762031,0.000024285184,0.000023703351,0.000020318741,0.9945245,0.00097260176,0.00395868,0.00027743375,0.000014122932],"about_ca_topic_score_codex":0.006874145,"about_ca_topic_score_gemma":0.0064789597,"teacher_disagreement_score":0.006874145,"about_ca_system_score_codex":0.0013234749,"about_ca_system_score_gemma":0.0023560468,"threshold_uncertainty_score":0.026301384},"labels":[],"label_agreement":null},{"id":"W4386196569","doi":"10.1007/978-3-031-42519-6_29","title":"A Machine-Learning Based Approach to Validating Learning Materials","year":2023,"lang":"en","type":"book-chapter","venue":"Lecture notes in networks and systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Athabasca University","funders":"","keywords":"Machine learning; Artificial intelligence; Computer science; Instance-based learning; Process (computing); Active learning (machine learning); Scalability; Unsupervised learning; Similarity (geometry); Online machine learning; Database","score_opus":0.030786557036258502,"score_gpt":0.2373420897512575,"score_spread":0.206555532714999,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4386196569","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.020549847,0.00023902315,0.950794,0.0007129801,0.00017381858,0.0013281433,0.0012841766,0.0057517625,0.019166326],"genre_scores_gemma":[0.12221015,0.00013800517,0.8607178,0.00025684276,0.000054653072,0.0007861367,0.0021086126,0.00053103536,0.013196846],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.96955955,0.010258334,0.0022525406,0.0035010085,0.013837187,0.0005913543],"domain_scores_gemma":[0.90473104,0.04797812,0.004038035,0.017481055,0.025007857,0.00076394714],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.020457366,0.0012925626,0.0010944798,0.00761971,0.0022647348,0.009675711,0.0057969335,0.00394282,0.01460131],"category_scores_gemma":[0.087045655,0.0007624635,0.0010390646,0.0038364544,0.003180548,0.010517855,0.0035091033,0.0023908904,0.008084456],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00066062296,0.0013311038,0.00873551,0.0008004821,0.00014425679,0.00033679596,0.0008702735,0.027672436,0.037738904,0.11100756,0.01482247,0.79587966],"study_design_scores_gemma":[0.0001389504,0.00096136035,0.005126996,0.0007406149,0.00016128107,0.00069733616,0.00085227337,0.6212701,0.20687243,0.09342298,0.0695292,0.0002264973],"about_ca_topic_score_codex":0.0026580733,"about_ca_topic_score_gemma":0.0037884258,"teacher_disagreement_score":0.020457366,"about_ca_system_score_codex":0.0029342864,"about_ca_system_score_gemma":0.0046889805,"threshold_uncertainty_score":0.10819024},"labels":[],"label_agreement":null},{"id":"W4386214112","doi":"10.1016/j.knosys.2023.110938","title":"Label correlation guided borderline oversampling for imbalanced multi-label data learning","year":2023,"lang":"en","type":"article","venue":"Knowledge-Based Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":16,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Oversampling; Weighting; Computer science; Machine learning; Class (philosophy); Multi-label classification; Artificial intelligence; Decision boundary; Range (aeronautics); Code (set theory); Correlation; Data mining; Source code; Tree (set theory); Macro; Pattern recognition (psychology); Support vector machine; Mathematics","score_opus":0.17484913156105525,"score_gpt":0.37731699735897584,"score_spread":0.2024678657979206,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4386214112","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08972379,0.0010749059,0.90240395,0.0008544028,0.0003725568,0.00031306376,0.0004264225,0.0033165999,0.0015143272],"genre_scores_gemma":[0.67651975,0.00020890005,0.31515592,0.0008989552,0.00030860532,0.0003302596,0.002832486,0.00042212938,0.0033230006],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99645114,0.0010642533,0.0002074852,0.0009191212,0.00090419996,0.00045372683],"domain_scores_gemma":[0.99218434,0.004005544,0.00045205723,0.0013761398,0.0014714733,0.0005104899],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0068941973,0.0012744956,0.002748831,0.0016101043,0.0022528716,0.0023661072,0.0036936319,0.002851966,0.0024659378],"category_scores_gemma":[0.014695601,0.0006362825,0.0011404532,0.0013248514,0.0018554466,0.002332123,0.00417709,0.004005997,0.00096603704],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0031155308,0.0015467893,0.016094828,0.0003758334,0.00026372605,0.0004456761,0.0008685146,0.17102268,0.018976672,0.020999499,0.02239667,0.7438935],"study_design_scores_gemma":[0.0000493495,0.00010390465,0.0006019576,0.000021384614,0.000029577655,0.00005232642,0.00009364399,0.9846676,0.0032318006,0.009803217,0.0013340259,0.000011072343],"about_ca_topic_score_codex":0.0068735527,"about_ca_topic_score_gemma":0.012174051,"teacher_disagreement_score":0.0068941973,"about_ca_system_score_codex":0.001648618,"about_ca_system_score_gemma":0.0029241992,"threshold_uncertainty_score":0.03646046},"labels":[],"label_agreement":null},{"id":"W4386266758","doi":"10.1109/access.2023.3309697","title":"MCNN-LSTM: Combining CNN and LSTM to Classify Multi-Class Text in Imbalanced News Data","year":2023,"lang":"en","type":"article","venue":"IEEE Access","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":64,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Computer science; Artificial intelligence; Convolutional neural network; Machine learning; Margin (machine learning); Deep learning; Class (philosophy); Feature (linguistics); Sentence; Document classification; Categorization; Natural language processing","score_opus":0.15525568721357122,"score_gpt":0.38574696803104114,"score_spread":0.23049128081746992,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4386266758","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.2601503,0.0052183154,0.70498246,0.0015321685,0.0015143803,0.00025028212,0.0021261326,0.014952061,0.009273904],"genre_scores_gemma":[0.8432761,0.0011775288,0.1420313,0.00075014634,0.000440033,0.00017419542,0.0033416424,0.00029120097,0.008517942],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9997186,0.000025552561,0.00001685047,0.00010817928,0.000067920926,0.000062950276],"domain_scores_gemma":[0.9996903,0.00007944544,0.000053517313,0.00004054013,0.00010712168,0.000029096967],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005728624,0.0012744647,0.0005917131,0.001069756,0.00036203535,0.00069001154,0.001028789,0.0008176141,0.0014817296],"category_scores_gemma":[0.0012559635,0.0003298592,0.00050104863,0.0012128339,0.00030313866,0.0018827674,0.0006585082,0.0010171429,0.0007589893],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00044102414,0.00031689586,0.00510209,0.00019722614,0.00021439792,0.0003702825,0.00014877872,0.09680742,0.032998025,0.0016479088,0.019224143,0.8425318],"study_design_scores_gemma":[0.000014320081,0.00008695576,0.001269538,0.000019152647,0.00003999696,0.0000801103,0.0000367758,0.98513514,0.009297798,0.002080008,0.0019249197,0.000015252008],"about_ca_topic_score_codex":0.008392334,"about_ca_topic_score_gemma":0.011756821,"teacher_disagreement_score":0.008392334,"about_ca_system_score_codex":0.00075059716,"about_ca_system_score_gemma":0.00063610607,"threshold_uncertainty_score":0.016686976},"labels":[],"label_agreement":null},{"id":"W4386708820","doi":"10.32920/24132588","title":"MLCM: Multi-Label Confusion Matrix","year":2023,"lang":"en","type":"preprint","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Ministère de la Défense Nationale","keywords":"Confusion matrix; Classifier (UML); Computer science; Ambiguity; Confusion; Artificial intelligence; Machine learning; Class (philosophy); Multi-label classification; Pattern recognition (psychology); Data mining","score_opus":0.13508193415366992,"score_gpt":0.3652572450979859,"score_spread":0.23017531094431598,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4386708820","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0023176586,0.00030320196,0.9887522,0.00044140575,0.00021992937,0.00026366746,0.0009594447,0.0050559426,0.0016865883],"genre_scores_gemma":[0.08082478,0.00035241502,0.90910023,0.00048540437,0.00033561306,0.00085263705,0.0029884698,0.00076286466,0.004297548],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9912999,0.0026938613,0.0006982948,0.0012099725,0.0037259848,0.00037202024],"domain_scores_gemma":[0.9844579,0.0059369155,0.001676902,0.0024796976,0.005060747,0.00038779582],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0048220432,0.0020332509,0.0012575046,0.0061769546,0.0014464561,0.004039844,0.0031944609,0.0023439785,0.009051795],"category_scores_gemma":[0.02397608,0.0005845772,0.0012362135,0.0036830467,0.001618367,0.004802299,0.0031837577,0.003328739,0.005862539],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00043646662,0.00028211946,0.0024659708,0.0008341404,0.00015026596,0.0003578026,0.0005676757,0.03438186,0.024678335,0.06012899,0.06744968,0.8082667],"study_design_scores_gemma":[0.0000712305,0.0002951355,0.0034671482,0.00024285198,0.000052655778,0.0010056032,0.0003002702,0.78096044,0.05666316,0.09453231,0.062084798,0.00032442654],"about_ca_topic_score_codex":0.003096788,"about_ca_topic_score_gemma":0.0037165126,"teacher_disagreement_score":0.009051795,"about_ca_system_score_codex":0.0016527615,"about_ca_system_score_gemma":0.0027637887,"threshold_uncertainty_score":0.030281305},"labels":[],"label_agreement":null},{"id":"W4386709454","doi":"10.32920/24132588.v1","title":"MLCM: Multi-Label Confusion Matrix","year":2023,"lang":"en","type":"preprint","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":18,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Ministère de la Défense Nationale","keywords":"Confusion matrix; Classifier (UML); Computer science; Ambiguity; Confusion; Artificial intelligence; Machine learning; Class (philosophy); Multi-label classification; Pattern recognition (psychology); Data mining","score_opus":0.13508193415366992,"score_gpt":0.3652572450979859,"score_spread":0.23017531094431598,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4386709454","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0023176586,0.00030320196,0.9887522,0.00044140575,0.00021992937,0.00026366746,0.0009594447,0.0050559426,0.0016865883],"genre_scores_gemma":[0.08082478,0.00035241502,0.90910023,0.00048540437,0.00033561306,0.00085263705,0.0029884698,0.00076286466,0.004297548],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9912999,0.0026938613,0.0006982948,0.0012099725,0.0037259848,0.00037202024],"domain_scores_gemma":[0.9844579,0.0059369155,0.001676902,0.0024796976,0.005060747,0.00038779582],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0048220432,0.0020332509,0.0012575046,0.0061769546,0.0014464561,0.004039844,0.0031944609,0.0023439785,0.009051795],"category_scores_gemma":[0.02397608,0.0005845772,0.0012362135,0.0036830467,0.001618367,0.004802299,0.0031837577,0.003328739,0.005862539],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00043646662,0.00028211946,0.0024659708,0.0008341404,0.00015026596,0.0003578026,0.0005676757,0.03438186,0.024678335,0.06012899,0.06744968,0.8082667],"study_design_scores_gemma":[0.0000712305,0.0002951355,0.0034671482,0.00024285198,0.000052655778,0.0010056032,0.0003002702,0.78096044,0.05666316,0.09453231,0.062084798,0.00032442654],"about_ca_topic_score_codex":0.003096788,"about_ca_topic_score_gemma":0.0037165126,"teacher_disagreement_score":0.009051795,"about_ca_system_score_codex":0.0016527615,"about_ca_system_score_gemma":0.0027637887,"threshold_uncertainty_score":0.030281305},"labels":[],"label_agreement":null},{"id":"W4386773820","doi":"10.5267/j.ijiec.2023.8.002","title":"A kernel-free L1 norm regularized ν-support vector machine model with application","year":2023,"lang":"en","type":"article","venue":"International Journal of Industrial Engineering Computations","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Fundamental Research Funds for the Central Universities; National Natural Science Foundation of China","keywords":"Support vector machine; Overfitting; Computer science; Kernel method; Artificial intelligence; Kernel (algebra); Binary classification; Machine learning; Polynomial kernel; Benchmark (surveying); Computational complexity theory; Mathematical optimization; Algorithm; Mathematics; Artificial neural network","score_opus":0.025864387485464106,"score_gpt":0.2603472942397424,"score_spread":0.2344829067542783,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4386773820","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009835532,0.00054433255,0.98759216,0.00029557696,0.0000607254,0.000033239026,0.00011189346,0.00032857095,0.0011980115],"genre_scores_gemma":[0.7033977,0.0015890024,0.278343,0.00044807757,0.0002693467,0.00038383846,0.0013701553,0.0002264702,0.013972555],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99941933,0.00016484661,0.000033912132,0.00013262901,0.00017999549,0.00006929458],"domain_scores_gemma":[0.99928266,0.00023759373,0.00006589628,0.00005787707,0.00031927336,0.000036747104],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001158637,0.0007015617,0.0011419011,0.0005914794,0.000314791,0.0011916079,0.0021571736,0.001287896,0.0019428494],"category_scores_gemma":[0.0024915992,0.00033373473,0.0010664393,0.0008061961,0.0005021172,0.0011299907,0.00089666375,0.0015073618,0.001032654],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017016225,0.000090517744,0.0015161292,0.00022108525,0.0000884403,0.0001384868,0.00009997925,0.8167404,0.0039509633,0.02488878,0.0064489925,0.14564611],"study_design_scores_gemma":[0.0000025563786,0.000014073834,0.000060982442,0.0000040528234,0.000004048161,0.000012945297,0.0000027111898,0.9975635,0.0001680718,0.0017362293,0.0004275692,0.0000033218037],"about_ca_topic_score_codex":0.004805003,"about_ca_topic_score_gemma":0.0026108827,"teacher_disagreement_score":0.004805003,"about_ca_system_score_codex":0.0005738299,"about_ca_system_score_gemma":0.0013141631,"threshold_uncertainty_score":0.009554088},"labels":[],"label_agreement":null},{"id":"W4387506342","doi":"10.23977/acss.2023.070806","title":"WXGCB: A Clustering Prior Weighting Semi-Supervised Learning Method Based on Space Level Constraint and Mixed Variable Metrics","year":2023,"lang":"en","type":"article","venue":"Advances in Computer Signals and Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Semi-supervised learning; Cluster analysis; Computer science; Supervised learning; Artificial intelligence; Machine learning; Unsupervised learning; Constrained clustering; Benchmark (surveying); Correlation clustering; Pattern recognition (psychology); Canopy clustering algorithm; Artificial neural network","score_opus":0.04618434634799053,"score_gpt":0.29861706043144637,"score_spread":0.25243271408345586,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4387506342","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0051192474,0.00022081786,0.99265105,0.000108766515,0.00003621903,0.000085354724,0.00009840049,0.0010514342,0.0006286947],"genre_scores_gemma":[0.1731729,0.0003947687,0.81754357,0.00048597733,0.00012250306,0.00079201214,0.0017184765,0.0007434729,0.0050263456],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99618053,0.001250956,0.00020948303,0.0010061958,0.0011683461,0.0001844905],"domain_scores_gemma":[0.99702674,0.00077868864,0.00026656454,0.00040217701,0.0013735249,0.00015236222],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032595526,0.0017058946,0.0021735707,0.00252619,0.0010230283,0.0017889778,0.003533253,0.001786113,0.0022032557],"category_scores_gemma":[0.005504811,0.00079542707,0.0013711518,0.0022777696,0.0013642483,0.0028588711,0.0022073183,0.00256543,0.001077306],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002924622,0.00029368163,0.0040120604,0.00044247738,0.00042449194,0.00009325687,0.00029516983,0.23508412,0.014237093,0.017775454,0.016197564,0.7108521],"study_design_scores_gemma":[0.000028800509,0.000051580733,0.000554165,0.000021554484,0.00002444193,0.000043097145,0.000027163798,0.98821753,0.0029242756,0.0054298337,0.0026505429,0.000026931775],"about_ca_topic_score_codex":0.01010099,"about_ca_topic_score_gemma":0.011671456,"teacher_disagreement_score":0.01010099,"about_ca_system_score_codex":0.0013896384,"about_ca_system_score_gemma":0.0032496033,"threshold_uncertainty_score":0.020084381},"labels":[],"label_agreement":null},{"id":"W4388144777","doi":"10.14569/ijacsa.2023.0141080","title":"A Novel Multidimensional Reference Model for Heterogeneous Textual Datasets using Context, Semantic and Syntactic Clues","year":2023,"lang":"en","type":"article","venue":"International Journal of Advanced Computer Science and Applications","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"Universiti Teknologi Petronas","keywords":"Computer science; Context (archaeology); Natural language processing; Information retrieval; Synonym (taxonomy); Dimension (graph theory); Search engine indexing; Semantics (computer science); Artificial intelligence","score_opus":0.05753518558212063,"score_gpt":0.34597527862950467,"score_spread":0.28844009304738405,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4388144777","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.029251326,0.0025417164,0.95500463,0.0012166202,0.00015653865,0.00043301168,0.004272226,0.003750019,0.0033738122],"genre_scores_gemma":[0.2880435,0.0016247912,0.6877015,0.0006006269,0.00021500641,0.001193312,0.014620862,0.0003640213,0.0056363447],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9951794,0.0011222705,0.0005878743,0.001662646,0.0012179756,0.00022981896],"domain_scores_gemma":[0.9953349,0.0013744673,0.00063006993,0.00081889034,0.001708459,0.00013322556],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003941191,0.0011019097,0.0012032859,0.008625826,0.0012177333,0.0034429596,0.0035226836,0.0015727954,0.002056161],"category_scores_gemma":[0.013813782,0.00039760864,0.0024299081,0.011046909,0.0005958825,0.0075536654,0.0025739328,0.001132958,0.0016862658],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00062042166,0.00039304158,0.025807772,0.001098105,0.00051387056,0.0010144872,0.0019550857,0.080044374,0.011566339,0.0730915,0.029792858,0.7741022],"study_design_scores_gemma":[0.000042514203,0.00034832995,0.0070162457,0.0002444366,0.00019792512,0.00074655644,0.00086549297,0.9022697,0.004083224,0.04475393,0.039311443,0.00012024199],"about_ca_topic_score_codex":0.014827949,"about_ca_topic_score_gemma":0.01734243,"teacher_disagreement_score":0.014827949,"about_ca_system_score_codex":0.0020175118,"about_ca_system_score_gemma":0.0020764107,"threshold_uncertainty_score":0.029483259},"labels":[],"label_agreement":null},{"id":"W4388348936","doi":"10.1007/978-3-031-46674-8_27","title":"Label Correlation Guided Feature Selection for Multi-label Learning","year":2023,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Feature selection; Minimum redundancy feature selection; Redundancy (engineering); Artificial intelligence; Discriminative model; Pattern recognition (psychology); Feature (linguistics); Curse of dimensionality; Correlation; Dimensionality reduction; Exploit; Machine learning; Feature learning; Multi-label classification; Mathematics","score_opus":0.06536076908770279,"score_gpt":0.3104444183153377,"score_spread":0.24508364922763493,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4388348936","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.016490027,0.000788793,0.97700614,0.00020638645,0.00014957495,0.000109249304,0.00038597762,0.0037021798,0.0011615994],"genre_scores_gemma":[0.3447541,0.00047638698,0.6376867,0.00043599127,0.00031373728,0.0004826271,0.0037757154,0.0007164936,0.011358273],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99870634,0.000354455,0.00007678933,0.00034439197,0.00032979707,0.00018821564],"domain_scores_gemma":[0.9979011,0.0010604961,0.00013043136,0.00038068573,0.0004436657,0.00008364263],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0017526255,0.0013826914,0.00220895,0.0017071726,0.0011329547,0.0014812421,0.0030092616,0.0021250937,0.004720963],"category_scores_gemma":[0.0031076772,0.0005301751,0.0015065911,0.0023490977,0.000700457,0.0016419081,0.0019090336,0.0024050705,0.0027403752],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00046650518,0.00045055326,0.001172975,0.00016229246,0.00012636879,0.00014542462,0.000071029324,0.03357489,0.023696665,0.0025388894,0.018742092,0.9188522],"study_design_scores_gemma":[0.000037735692,0.0001434911,0.00082347373,0.000022448523,0.00005375177,0.00010530662,0.000042727694,0.97495687,0.012923828,0.007987238,0.0028742768,0.000028789227],"about_ca_topic_score_codex":0.003341449,"about_ca_topic_score_gemma":0.0064505315,"teacher_disagreement_score":0.004720963,"about_ca_system_score_codex":0.0007045943,"about_ca_system_score_gemma":0.0010948501,"threshold_uncertainty_score":0.015793145},"labels":[],"label_agreement":null},{"id":"W4388780004","doi":"10.1515/9781552384039-021","title":"Tapor: Building a Portal for Text Analysis","year":2006,"lang":"en","type":"book-chapter","venue":"University of Calgary Press eBooks","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Computer science","score_opus":0.021800647478887526,"score_gpt":0.21131237931871086,"score_spread":0.18951173183982334,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4388780004","genre_codex":"software","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":"software","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0042476985,0.0008872543,0.2829491,0.00064747833,0.00030896283,0.0009049195,0.07009294,0.606063,0.033898603],"genre_scores_gemma":[0.025372664,0.0016365998,0.5074722,0.0008140907,0.00031871253,0.0019036278,0.20075305,0.10529,0.15643902],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9984212,0.00025058637,0.00016951092,0.00032699024,0.0006986883,0.0001330934],"domain_scores_gemma":[0.9941421,0.002523319,0.00024732194,0.0010206103,0.0015149446,0.0005516641],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00225399,0.0022995293,0.0017956663,0.008475685,0.0012374028,0.0054273424,0.0016751295,0.0012442843,0.11987118],"category_scores_gemma":[0.008867716,0.0014519832,0.0011822883,0.009578597,0.00061219564,0.0070944703,0.0037486604,0.0020799253,0.113439456],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00051593035,0.00013173468,0.0012809234,0.000636336,0.000087494656,0.0002908886,0.0007259815,0.0005941403,0.011447095,0.004590283,0.5973405,0.3823587],"study_design_scores_gemma":[0.00028902153,0.00012342609,0.004378252,0.00030700737,0.00011685135,0.00046343816,0.0007061088,0.02141148,0.028236676,0.01700954,0.92680496,0.0001532659],"about_ca_topic_score_codex":0.009965154,"about_ca_topic_score_gemma":0.012132176,"teacher_disagreement_score":0.11987118,"about_ca_system_score_codex":0.0010897787,"about_ca_system_score_gemma":0.0025286002,"threshold_uncertainty_score":0.40100902},"labels":[],"label_agreement":null},{"id":"W4389352596","doi":"10.1109/tsmc.2023.3327925","title":"Multiclass and Multilabel Classifications by Consensus and Complementarity-Based Multiview Latent Space Projection","year":2023,"lang":"en","type":"article","venue":"IEEE Transactions on Systems Man and Cybernetics Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Wilfrid Laurier University","funders":"National Natural Science Foundation of China","keywords":"Complementarity (molecular biology); Pairwise comparison; Artificial intelligence; Computer science; Matching (statistics); Representation (politics); Machine learning; Projection (relational algebra); Similarity (geometry); Pattern recognition (psychology); Mathematics; Data mining; Algorithm; Image (mathematics); Statistics","score_opus":0.040587114601292704,"score_gpt":0.2655434968731882,"score_spread":0.22495638227189546,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4389352596","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.004731225,0.0001277111,0.9942008,0.00011014541,0.000015536245,0.000023340133,0.000044765577,0.00015826186,0.0005881572],"genre_scores_gemma":[0.4319099,0.00055200246,0.5599699,0.00040029295,0.00024023156,0.0004193966,0.0011260011,0.00031109655,0.005071158],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.995834,0.0012759345,0.0001657718,0.0011763498,0.0011948638,0.0003531918],"domain_scores_gemma":[0.99568766,0.0018785578,0.00064115686,0.00062111055,0.0008938884,0.00027754347],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004280756,0.0013875577,0.0022427358,0.0024995082,0.0010902907,0.002578064,0.0026590733,0.0017917918,0.002777028],"category_scores_gemma":[0.009178643,0.00091571716,0.002114523,0.0022583394,0.0025711285,0.0032463477,0.0049356543,0.0029406003,0.0010035092],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027069857,0.00015370482,0.0025175277,0.0002896326,0.0003030496,0.00018406483,0.0006556262,0.5451075,0.0075441143,0.14635871,0.0063796984,0.29023576],"study_design_scores_gemma":[0.0000110138935,0.000034061468,0.0002139566,0.000016458896,0.000020222018,0.00003363313,0.00004708994,0.93870586,0.0012270897,0.058656927,0.0010102803,0.000023372093],"about_ca_topic_score_codex":0.0048206015,"about_ca_topic_score_gemma":0.0041792323,"teacher_disagreement_score":0.0048206015,"about_ca_system_score_codex":0.0017396361,"about_ca_system_score_gemma":0.0023400087,"threshold_uncertainty_score":0.022639096},"labels":[],"label_agreement":null},{"id":"W4389505417","doi":"10.1016/j.comcom.2023.12.003","title":"Robust multimodal federated learning for incomplete modalities","year":2023,"lang":"en","type":"article","venue":"Computer Communications","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":19,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Ontario Tech University","funders":"Basic and Applied Basic Research Foundation of Guangdong Province; National Natural Science Foundation of China","keywords":"Modalities; Computer science; Multimodal learning; Modality (human–computer interaction); Artificial intelligence; Machine learning; Representation (politics); Feature (linguistics); Dependency (UML); Feature learning","score_opus":0.13377088027244857,"score_gpt":0.3101905550907414,"score_spread":0.17641967481829282,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4389505417","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014065794,0.000331537,0.98272747,0.00018856068,0.00005184756,0.00005520818,0.00027799033,0.0013830586,0.00091851794],"genre_scores_gemma":[0.5392834,0.0004787425,0.44752836,0.00041488488,0.0001916206,0.00041314246,0.0024023755,0.00036054727,0.008926912],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9980744,0.00049770816,0.00013272768,0.00056326826,0.00045682117,0.00027506932],"domain_scores_gemma":[0.9967541,0.0014678143,0.00021621965,0.00084243,0.0006028366,0.000116554125],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003141541,0.0013473994,0.0019024904,0.0014779078,0.00091005437,0.0019322359,0.0023677263,0.0024738666,0.0050306213],"category_scores_gemma":[0.008582385,0.00057681376,0.0018317447,0.0013682181,0.00123611,0.0035999494,0.0045510237,0.0024425641,0.0018846546],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00083286647,0.00049166544,0.0018985252,0.00023353705,0.00026163668,0.0002479284,0.00023321435,0.18566103,0.01171437,0.011519016,0.008034451,0.7788718],"study_design_scores_gemma":[0.000018955228,0.00010037428,0.00037857456,0.000035662775,0.00005034834,0.0001121065,0.00008920955,0.9666131,0.0075575253,0.023697129,0.0013254429,0.000021435051],"about_ca_topic_score_codex":0.004122124,"about_ca_topic_score_gemma":0.004924826,"teacher_disagreement_score":0.0050306213,"about_ca_system_score_codex":0.0010298903,"about_ca_system_score_gemma":0.0016171049,"threshold_uncertainty_score":0.016829133},"labels":[],"label_agreement":null},{"id":"W4390873538","doi":"10.1109/iccv51070.2023.00166","title":"Parametric Information Maximization for Generalized Category Discovery","year":2023,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institut National de la Recherche Scientifique; Thales (Canada)","funders":"","keywords":"Parameterized complexity; Maximization; Computer science; Parametric statistics; Mutual information; Class (philosophy); Code (set theory); Data mining; Nonparametric statistics; Artificial intelligence; Theoretical computer science; Machine learning; Algorithm; Mathematics; Mathematical optimization; Statistics; Set (abstract data type); Programming language","score_opus":0.028113675131419043,"score_gpt":0.2630281952364658,"score_spread":0.23491452010504676,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4390873538","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0034617675,0.0003873372,0.9937484,0.00054410833,0.000020162282,0.00006915834,0.00032519957,0.00040219293,0.0010416026],"genre_scores_gemma":[0.23460996,0.00095539365,0.7523061,0.0012048064,0.00028488747,0.0011292335,0.0033888172,0.00066076114,0.0054600467],"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99195147,0.0042517073,0.00034210915,0.0015760554,0.0014158254,0.00046291956],"domain_scores_gemma":[0.9855042,0.010127189,0.0008954348,0.0018984678,0.0012111212,0.00036360085],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011898388,0.0018562751,0.0030756637,0.0028842157,0.001089771,0.0036455784,0.0056888056,0.0033369814,0.004230587],"category_scores_gemma":[0.03312018,0.001262746,0.0025331574,0.004707407,0.0031351934,0.0060280855,0.0052377237,0.005038107,0.0020999159],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002566085,0.00023095236,0.002829272,0.0005498456,0.0003816794,0.00019754535,0.0003999193,0.538397,0.001962686,0.21777682,0.019407013,0.21761069],"study_design_scores_gemma":[0.000018433424,0.000034092314,0.00022368574,0.000032685697,0.00001812543,0.00006959794,0.00002278561,0.77386206,0.0005827347,0.22245847,0.0026544866,0.000022972776],"about_ca_topic_score_codex":0.0030869495,"about_ca_topic_score_gemma":0.00342867,"teacher_disagreement_score":0.011898388,"about_ca_system_score_codex":0.00296908,"about_ca_system_score_gemma":0.0029418448,"threshold_uncertainty_score":0.0629254},"labels":[],"label_agreement":null},{"id":"W4391018555","doi":"10.1016/j.cmpb.2024.108032","title":"Label correlation guided discriminative label feature learning for multi-label chest image classification","year":2024,"lang":"en","type":"article","venue":"Computer Methods and Programs in Biomedicine","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":16,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Multi-label classification; Discriminative model; Artificial intelligence; Computer science; Pattern recognition (psychology); Feature (linguistics); Correlation; Machine learning; Consistency (knowledge bases); Off-label use; Mathematics; Medicine","score_opus":0.18679557094948226,"score_gpt":0.4398610810705291,"score_spread":0.25306551012104683,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4391018555","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09187536,0.0005776973,0.90045685,0.0004033108,0.00014848032,0.00019025944,0.0006954133,0.003976407,0.0016763641],"genre_scores_gemma":[0.68265337,0.00019674697,0.30767527,0.00037060055,0.00020291435,0.00032023474,0.003232855,0.0003187488,0.005029316],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9987349,0.00024228079,0.00006637543,0.00038950527,0.00031485694,0.00025199004],"domain_scores_gemma":[0.9979367,0.00079138926,0.00024455218,0.0003571036,0.00056396134,0.00010616831],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014815552,0.0007958016,0.0015083661,0.0015868193,0.0009806532,0.0012393532,0.0019946888,0.0016168077,0.0025234397],"category_scores_gemma":[0.0030975286,0.00031821974,0.0011269265,0.0016066686,0.0006640646,0.0012300196,0.0015264738,0.001969087,0.0013212205],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011460723,0.0011024598,0.009067654,0.00022554692,0.00013941323,0.00024115891,0.00019482803,0.04081585,0.047253836,0.0047837775,0.018146625,0.8768827],"study_design_scores_gemma":[0.00004528023,0.00015869009,0.0019506533,0.000015499889,0.000055600376,0.000116803596,0.0000595135,0.9782678,0.013692872,0.003938638,0.0016781888,0.000020531666],"about_ca_topic_score_codex":0.004964195,"about_ca_topic_score_gemma":0.012074568,"teacher_disagreement_score":0.004964195,"about_ca_system_score_codex":0.0009164839,"about_ca_system_score_gemma":0.0016661247,"threshold_uncertainty_score":0.009870589},"labels":[],"label_agreement":null},{"id":"W4392200326","doi":"10.18280/isi.290123","title":"Augmenting Document Classification Accuracy Through the Integration of Deep Contextual Embeddings","year":2024,"lang":"en","type":"article","venue":"Ingénierie des systèmes d information","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Information retrieval; Computer science; Artificial intelligence; Natural language processing; Data science","score_opus":0.030381369283085935,"score_gpt":0.28908779751152497,"score_spread":0.25870642822843903,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4392200326","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.24206322,0.0039755353,0.73703825,0.00095850753,0.00043113835,0.0001331282,0.001497815,0.007973844,0.005928622],"genre_scores_gemma":[0.72845495,0.001338654,0.26127514,0.00023423893,0.00026825521,0.000118982825,0.0036169933,0.00019795581,0.0044948147],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9993635,0.00013565918,0.000059804148,0.00017521181,0.00019675281,0.00006906324],"domain_scores_gemma":[0.9979582,0.0006983613,0.0002140755,0.00045781836,0.0006115339,0.000060073235],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009139198,0.001071914,0.00081845326,0.0014939621,0.00033720603,0.0011462992,0.00083773636,0.0007903249,0.0012210413],"category_scores_gemma":[0.004022975,0.0001969171,0.0005539345,0.001604058,0.00034268445,0.0028998125,0.0010088966,0.0012839688,0.0015887045],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020894283,0.0003102507,0.008783422,0.0002232362,0.000106764586,0.000070349306,0.00012996043,0.049815647,0.020787256,0.0025183065,0.009036516,0.90800947],"study_design_scores_gemma":[0.000019119485,0.00018994857,0.003742996,0.00003986994,0.00009053192,0.00011164614,0.00008625997,0.96455437,0.020139504,0.0051407386,0.0058524595,0.000032575797],"about_ca_topic_score_codex":0.0024486925,"about_ca_topic_score_gemma":0.0054165013,"teacher_disagreement_score":0.0024486925,"about_ca_system_score_codex":0.0005530147,"about_ca_system_score_gemma":0.0005889564,"threshold_uncertainty_score":0.004868865},"labels":[],"label_agreement":null},{"id":"W4392425987","doi":"10.48550/arxiv.2403.00143","title":"Tree-Averaging Algorithms for Ensemble-Based Unsupervised Discontinuous Constituency Parsing","year":2024,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Alliance de recherche numérique du Canada; Alberta Innovates; DeepMind; Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research","keywords":"Parsing; Tree (set theory); Computer science; Artificial intelligence; Ensemble learning; Natural language processing; Machine learning; Mathematics; Combinatorics","score_opus":0.10414774333138964,"score_gpt":0.2212843106027825,"score_spread":0.11713656727139286,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4392425987","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010131216,0.000620277,0.9819649,0.0001826873,0.00009643779,0.000058387363,0.00033899985,0.0056765974,0.00093047455],"genre_scores_gemma":[0.1645935,0.0005092958,0.82618016,0.0002664928,0.0002638972,0.00029913112,0.0039877817,0.0013778876,0.0025217645],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9979972,0.0006019915,0.000129358,0.0006968558,0.0004082067,0.00016637416],"domain_scores_gemma":[0.99383765,0.003471501,0.00027507072,0.0013444268,0.0008885682,0.00018274448],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032136876,0.0016578962,0.0020639002,0.0025530972,0.0013489813,0.0016378735,0.0030931453,0.0016818871,0.0034478107],"category_scores_gemma":[0.009486797,0.0006827228,0.0016073771,0.0035250746,0.0007786512,0.003999539,0.0017875419,0.003956696,0.0026839133],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001689551,0.00019654652,0.0026439638,0.0001962927,0.00029136473,0.000115902854,0.00025933603,0.16563612,0.0075611966,0.016639413,0.017716508,0.78857446],"study_design_scores_gemma":[0.000011614364,0.000033021868,0.00045421018,0.00001477696,0.000036640984,0.00005804325,0.000034588247,0.9672701,0.002780995,0.026720459,0.0025671136,0.000018425457],"about_ca_topic_score_codex":0.0046504596,"about_ca_topic_score_gemma":0.010312913,"teacher_disagreement_score":0.0046504596,"about_ca_system_score_codex":0.00096315815,"about_ca_system_score_gemma":0.0018754497,"threshold_uncertainty_score":0.016995788},"labels":[],"label_agreement":null},{"id":"W4392669860","doi":"10.18653/v1/2023.ijcnlp-main.10","title":"MasakhaNEWS: News Topic Classification for African languages","year":2023,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University; Mila - Quebec Artificial Intelligence Institute; University of Waterloo","funders":"DeepMind","keywords":"Computer science; Languages of Africa; Natural language processing; Artificial intelligence; Linguistics","score_opus":0.0562600828557314,"score_gpt":0.32059695456432447,"score_spread":0.26433687170859305,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4392669860","genre_codex":"dataset","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06695849,0.017177742,0.08317236,0.006095121,0.004375651,0.0022693272,0.6017626,0.1780352,0.040153526],"genre_scores_gemma":[0.072705045,0.0048935893,0.12551795,0.0007107373,0.001065168,0.0014282485,0.76539105,0.003503249,0.024784848],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9981919,0.00032746617,0.00022940495,0.0004460968,0.0005564446,0.00024871528],"domain_scores_gemma":[0.9968464,0.0012303862,0.00032451883,0.00050983526,0.00049201015,0.00059692987],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0020349866,0.0025091257,0.0012218766,0.014912457,0.0019576093,0.0051340675,0.0012864433,0.0016977482,0.019739268],"category_scores_gemma":[0.008265186,0.0006269535,0.0023467345,0.008189401,0.0003621978,0.0058933226,0.0034852207,0.0018984211,0.026553305],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009881731,0.00026107693,0.013073008,0.002225965,0.00035648944,0.00076390174,0.0007663619,0.0017665854,0.007667304,0.0028384207,0.6624807,0.30681196],"study_design_scores_gemma":[0.0003944312,0.00049253664,0.03735074,0.00095218566,0.00041749407,0.0018305044,0.0041706893,0.10168505,0.014052068,0.008163033,0.83025503,0.00023616823],"about_ca_topic_score_codex":0.011531117,"about_ca_topic_score_gemma":0.011941007,"teacher_disagreement_score":0.019739268,"about_ca_system_score_codex":0.0010918562,"about_ca_system_score_gemma":0.0018119462,"threshold_uncertainty_score":0.066034436},"labels":[],"label_agreement":null},{"id":"W4392904215","doi":"10.1109/icassp48485.2024.10447400","title":"ProbMCL: Simple Probabilistic Contrastive Learning for Multi-Label Visual Classification","year":2024,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Interpretability; Artificial intelligence; Machine learning; Probabilistic logic; Feature learning; Visualization; Contextual image classification; Pattern recognition (psychology); Image (mathematics)","score_opus":0.08465635311122566,"score_gpt":0.3599581659110958,"score_spread":0.27530181279987015,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4392904215","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009117709,0.00018402886,0.9878599,0.00025184153,0.000030931562,0.00009740053,0.00011865898,0.0014436082,0.00089593185],"genre_scores_gemma":[0.39800596,0.00022836169,0.59535176,0.00081798,0.00017951764,0.00046149144,0.0010517273,0.00045203915,0.003451189],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99799985,0.00062097836,0.00006932192,0.00058464473,0.00058480806,0.00014027646],"domain_scores_gemma":[0.995849,0.0020171383,0.00043531333,0.0008481862,0.00064646895,0.00020382518],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003240835,0.00133539,0.0013735495,0.0018485596,0.00086839794,0.0017917465,0.004484817,0.0023945405,0.0030232521],"category_scores_gemma":[0.01057007,0.0006871688,0.001297096,0.0013588436,0.0018975539,0.004273456,0.003897138,0.003856351,0.0014280534],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00045849252,0.000526142,0.005005387,0.00027228755,0.00017564202,0.00022956086,0.00024918834,0.23247358,0.014480488,0.04296982,0.010138843,0.6930206],"study_design_scores_gemma":[0.000015828291,0.000052433425,0.0001761603,0.00000971012,0.000009609632,0.000044178727,0.0000128044085,0.9765252,0.0027646117,0.01940438,0.00097456103,0.000010494708],"about_ca_topic_score_codex":0.0025475393,"about_ca_topic_score_gemma":0.004148339,"teacher_disagreement_score":0.004484817,"about_ca_system_score_codex":0.0018681536,"about_ca_system_score_gemma":0.001196023,"threshold_uncertainty_score":0.017139375},"labels":[],"label_agreement":null},{"id":"W4393160207","doi":"10.1609/aaai.v38i15.29562","title":"Federated Partial Label Learning with Local-Adaptive Augmentation and Regularization","year":2024,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Canadian Institute for Advanced Research; Carleton University","funders":"","keywords":"Regularization (linguistics); Computer science; Artificial intelligence","score_opus":0.06017459565364345,"score_gpt":0.2866706267842369,"score_spread":0.22649603113059344,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393160207","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012879307,0.000118830125,0.9837489,0.00021228332,0.000029797051,0.00004951716,0.00008590259,0.0021160722,0.0007593456],"genre_scores_gemma":[0.5213465,0.00012786509,0.4713597,0.000560092,0.000100498466,0.00032374208,0.00082806265,0.00044110705,0.0049124532],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9968929,0.0010766041,0.00011952426,0.001015931,0.00067485985,0.00022006239],"domain_scores_gemma":[0.99518,0.0014339988,0.00035277815,0.002119518,0.00071483816,0.00019873239],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0030327835,0.0012077838,0.0018665238,0.00073947327,0.0011400861,0.0018428699,0.0037209906,0.0019278381,0.0023566016],"category_scores_gemma":[0.007944854,0.0006011672,0.0010759998,0.0013871177,0.0020031035,0.004953873,0.0046717566,0.0030980587,0.0013259737],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006575271,0.00047345678,0.0031736467,0.00020434265,0.00011851928,0.00027283872,0.00058545684,0.44541103,0.015765287,0.030436298,0.011368562,0.4915331],"study_design_scores_gemma":[0.000021547827,0.00004237893,0.00011280481,0.000007326351,0.0000086142945,0.00004813551,0.00003552673,0.9804028,0.0032294225,0.014857455,0.00122027,0.0000137173765],"about_ca_topic_score_codex":0.0027295505,"about_ca_topic_score_gemma":0.0055110687,"teacher_disagreement_score":0.0037209906,"about_ca_system_score_codex":0.0012725155,"about_ca_system_score_gemma":0.002175818,"threshold_uncertainty_score":0.016039133},"labels":[],"label_agreement":null},{"id":"W4393161100","doi":"10.1609/aaai.v38i19.30157","title":"Toward Robustness in Multi-Label Classification: A Data Augmentation Strategy against Imbalance and Noise","year":2024,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":20,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Kootenay Association for Science & Technology","funders":"Institute for Information and Communications Technology Promotion; Ministry of Science and ICT, South Korea; National Research Foundation of Korea; National Research Foundation","keywords":"Robustness (evolution); Computer science; Artificial intelligence; Machine learning; Noise (video); Pattern recognition (psychology); Biology","score_opus":0.30698202867343055,"score_gpt":0.37346752807819505,"score_spread":0.0664854994047645,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393161100","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.03182076,0.00062651525,0.9622165,0.00084399193,0.00019149683,0.00015641864,0.00027636203,0.0026386634,0.0012293825],"genre_scores_gemma":[0.40227765,0.0003418573,0.58914155,0.0014911968,0.0005394109,0.00061417616,0.0018069529,0.00076812995,0.0030190647],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99394107,0.0022076939,0.00025747594,0.0018945313,0.0013840307,0.00031522434],"domain_scores_gemma":[0.98867667,0.0047197198,0.0011318699,0.0034821085,0.0015710621,0.00041849044],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009330565,0.002289138,0.002053762,0.002035434,0.0014097724,0.0027741073,0.004278686,0.0026336086,0.0016683819],"category_scores_gemma":[0.02311863,0.00092387537,0.001636899,0.0019090354,0.002887212,0.0052746874,0.006001203,0.00501309,0.0016803328],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012822328,0.00080535805,0.013352558,0.0005401669,0.00033387262,0.00028210075,0.001389704,0.18427505,0.044161193,0.01912088,0.015714614,0.7187423],"study_design_scores_gemma":[0.000090759946,0.00022663441,0.0013395752,0.00006386874,0.000063431995,0.00017370052,0.00019262666,0.9409692,0.01733915,0.033603176,0.005889133,0.00004869315],"about_ca_topic_score_codex":0.0011004746,"about_ca_topic_score_gemma":0.0015536945,"teacher_disagreement_score":0.009330565,"about_ca_system_score_codex":0.0009896763,"about_ca_system_score_gemma":0.0014402797,"threshold_uncertainty_score":0.049345374},"labels":[],"label_agreement":null},{"id":"W4393168550","doi":"10.23919/icact60172.2024.10471992","title":"Multi-Class Document Classification using LayoutLMv1 and V2","year":2024,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Class (philosophy); Computer science; Artificial intelligence; Information retrieval; Natural language processing","score_opus":0.062262732467935386,"score_gpt":0.3185489801885477,"score_spread":0.2562862477206123,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393168550","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.15198053,0.015355822,0.39442867,0.0024542264,0.0039093685,0.0031091846,0.094678886,0.31676036,0.01732293],"genre_scores_gemma":[0.26696628,0.0015970585,0.5742811,0.0009080277,0.0006201096,0.0018752014,0.13852076,0.0029880349,0.012243456],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9964393,0.00053509354,0.0004433239,0.0011292852,0.0009800594,0.00047291914],"domain_scores_gemma":[0.9961655,0.001369113,0.000279427,0.000804959,0.0011357361,0.00024527186],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0034903584,0.003382521,0.0023282242,0.013115235,0.0016471117,0.003919171,0.003543005,0.0038914368,0.009118656],"category_scores_gemma":[0.0072498517,0.0006278884,0.0027898494,0.0072435807,0.0006627331,0.0032057865,0.002335697,0.0027990392,0.011162046],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009215528,0.0006978292,0.0057147685,0.0009821682,0.00039376342,0.00031329956,0.00018710004,0.011688586,0.010914589,0.0010548781,0.11871109,0.8484204],"study_design_scores_gemma":[0.0005522106,0.0011925992,0.010556265,0.00035364553,0.00027643042,0.0013456163,0.0010693999,0.83959514,0.061551318,0.0074216067,0.07582462,0.00026115286],"about_ca_topic_score_codex":0.010615663,"about_ca_topic_score_gemma":0.0154241985,"teacher_disagreement_score":0.013115235,"about_ca_system_score_codex":0.002326642,"about_ca_system_score_gemma":0.0027286976,"threshold_uncertainty_score":0.030504882},"labels":[],"label_agreement":null},{"id":"W4393343556","doi":"10.36227/techrxiv.171177556.62647395/v1","title":"MediCaption: Integrating YOLO-Driven Computer Vision and NLP for Advanced Pharmaceutical Package Recognition and Annotation","year":2024,"lang":"en","type":"preprint","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Lakehead University","funders":"","keywords":"Annotation; Computer science; Artificial intelligence; Natural language processing; Information retrieval","score_opus":0.05480120033226021,"score_gpt":0.3483446999975729,"score_spread":0.2935434996653127,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393343556","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05963124,0.0021942072,0.77920604,0.0006673236,0.00041281004,0.0009927236,0.02269544,0.12533686,0.008863294],"genre_scores_gemma":[0.117922395,0.00079097226,0.8125359,0.0006384223,0.00013913799,0.00085299806,0.053650767,0.0021141532,0.011355229],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9992512,0.00011705602,0.0000444026,0.00034914375,0.00017614335,0.00006196318],"domain_scores_gemma":[0.9993099,0.00022706375,0.00007431028,0.00018532934,0.0001706362,0.00003283616],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00096754485,0.0014110417,0.000693388,0.0019859532,0.00041907083,0.0012113866,0.0019458465,0.0012299728,0.0065307077],"category_scores_gemma":[0.0016649425,0.00042005753,0.00092734606,0.0008315928,0.00041656318,0.0014540477,0.0013240252,0.0008867064,0.00778097],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007317622,0.00046162604,0.003224666,0.00078142557,0.00014936128,0.00027075023,0.00027390753,0.015138459,0.08141819,0.0016270365,0.068569146,0.8273537],"study_design_scores_gemma":[0.00014119221,0.0010412893,0.009968902,0.00019307988,0.0001539769,0.00065047917,0.0002276469,0.7320593,0.1360215,0.004516325,0.114873916,0.00015240973],"about_ca_topic_score_codex":0.009899194,"about_ca_topic_score_gemma":0.016502418,"teacher_disagreement_score":0.009899194,"about_ca_system_score_codex":0.0012938424,"about_ca_system_score_gemma":0.0009211172,"threshold_uncertainty_score":0.021847367},"labels":[],"label_agreement":null},{"id":"W4393371926","doi":"10.1109/tfuzz.2024.3382981","title":"Takagi–Sugeno–Kang Fuzzy Systems for High-Dimensional Multilabel Classification","year":2024,"lang":"en","type":"article","venue":"IEEE Transactions on Fuzzy Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":16,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Fundamental Research Funds for the Central Universities; National Natural Science Foundation of China","keywords":"Fuzzy logic; Computer science; Fuzzy control system; Artificial intelligence; Pattern recognition (psychology); Mathematics","score_opus":0.03851565968555158,"score_gpt":0.2744791117419057,"score_spread":0.2359634520563541,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393371926","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012044023,0.00064420485,0.9849476,0.00019115895,0.00006454042,0.00003398321,0.00005939933,0.00023187017,0.001783114],"genre_scores_gemma":[0.7666542,0.0008449283,0.22849287,0.00014171973,0.000121918994,0.0001992323,0.00026227068,0.00003579793,0.0032471481],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9993249,0.00015359913,0.000065111446,0.00020590209,0.00019529606,0.000055220276],"domain_scores_gemma":[0.9994248,0.00023167903,0.000100321566,0.000064424275,0.000148604,0.000030228763],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011870023,0.0007060993,0.0008812622,0.0006163882,0.0007687745,0.0010870731,0.00124237,0.0010417338,0.0013443058],"category_scores_gemma":[0.0020472158,0.00031245462,0.001021134,0.0008219171,0.00072117156,0.0013251764,0.00074504747,0.0014303657,0.00037385637],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014102692,0.000081727674,0.0018781007,0.00026356443,0.000114046634,0.00029517055,0.0004904933,0.7859653,0.009703107,0.06833291,0.002163901,0.13057062],"study_design_scores_gemma":[0.0000041710414,0.00001706222,0.0001588992,0.000008873629,0.0000107595915,0.000015638981,0.000015706555,0.9847252,0.00051299523,0.013803414,0.0007163002,0.000011017836],"about_ca_topic_score_codex":0.005850943,"about_ca_topic_score_gemma":0.006286124,"teacher_disagreement_score":0.005850943,"about_ca_system_score_codex":0.0011546637,"about_ca_system_score_gemma":0.0010182778,"threshold_uncertainty_score":0.011633754},"labels":[],"label_agreement":null},{"id":"W4394987794","doi":"10.1016/j.datak.2024.102306","title":"Effective text classification using BERT, MTM LSTM, and DT","year":2024,"lang":"en","type":"article","venue":"Data & Knowledge Engineering","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":56,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Artificial Intelligence in Medicine (Canada); University of Calgary","funders":"","keywords":"Security token; Computer science; Artificial intelligence; Encoder; Binary classification; Transformer; Recall; Deep learning; Long short term memory; Natural language processing; Artificial neural network; Machine learning; Recurrent neural network; Support vector machine","score_opus":0.04931219236959951,"score_gpt":0.3094819476933262,"score_spread":0.2601697553237267,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4394987794","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.049094092,0.0022570896,0.9276817,0.0012633511,0.0011431879,0.00016206835,0.0017180869,0.009320917,0.007359538],"genre_scores_gemma":[0.46537128,0.0012101938,0.5054748,0.0007186317,0.00077770895,0.00022373091,0.0041403924,0.00042960208,0.021653691],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9995552,0.00007035082,0.000045274086,0.00013954632,0.00012682218,0.000062814295],"domain_scores_gemma":[0.99908495,0.00032543222,0.00007557225,0.00012442042,0.00032669966,0.000062820916],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00062062964,0.0008233437,0.00072448223,0.0018119869,0.0006673686,0.0010940748,0.0010243567,0.0012921399,0.005158818],"category_scores_gemma":[0.0024480983,0.00022915447,0.00060308794,0.0018133991,0.00030550736,0.0026564065,0.0007310713,0.0012833177,0.0033267254],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002427495,0.0001341855,0.0007072202,0.00014614622,0.00004037334,0.000099432364,0.00004500004,0.020095931,0.02194989,0.0048454525,0.0138783045,0.9378154],"study_design_scores_gemma":[0.000018067498,0.00007866747,0.000664972,0.000024120145,0.000038737275,0.00011809509,0.000039396935,0.9720643,0.013423923,0.008044233,0.0054685655,0.00001688484],"about_ca_topic_score_codex":0.007583996,"about_ca_topic_score_gemma":0.00974217,"teacher_disagreement_score":0.007583996,"about_ca_system_score_codex":0.0009054172,"about_ca_system_score_gemma":0.0015728936,"threshold_uncertainty_score":0.017257929},"labels":[],"label_agreement":null},{"id":"W4396797825","doi":"10.3390/electronics13101859","title":"Hidden Variable Models in Text Classification and Sentiment Analysis","year":2024,"lang":"en","type":"article","venue":"Electronics","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Variable (mathematics); Sentiment analysis; Artificial intelligence; Computer science; Natural language processing; Pattern recognition (psychology); Mathematics","score_opus":0.017311466224837296,"score_gpt":0.2570866683851846,"score_spread":0.23977520216034734,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4396797825","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013663628,0.0009473892,0.9819405,0.00095333206,0.00015044655,0.000047499107,0.00029256113,0.00042628532,0.0015784191],"genre_scores_gemma":[0.57087016,0.0018429265,0.41591904,0.0005250965,0.0006656486,0.0003032384,0.0015555307,0.0003528375,0.0079656],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99823534,0.0009375955,0.00007528739,0.00037636695,0.00024735084,0.00012799648],"domain_scores_gemma":[0.9966008,0.0025431984,0.00028709832,0.00023805394,0.0002613048,0.00006961728],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0030209278,0.0009003287,0.00090227637,0.00173992,0.00069359055,0.001784941,0.001575047,0.0014095603,0.0028235982],"category_scores_gemma":[0.008216184,0.0004967111,0.001273141,0.0019662674,0.0013055116,0.0023916378,0.0009852265,0.002223886,0.0010255816],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001929954,0.00014592176,0.0052255816,0.0003291373,0.00033430758,0.00021805103,0.0005861201,0.52318406,0.0031236243,0.23969357,0.0070400056,0.2199266],"study_design_scores_gemma":[0.0000052160826,0.000009291404,0.0004635567,0.000014990968,0.000012971338,0.000014688614,0.00002216944,0.93435705,0.00029487823,0.063354686,0.0014391338,0.000011361874],"about_ca_topic_score_codex":0.0071095913,"about_ca_topic_score_gemma":0.0072368635,"teacher_disagreement_score":0.0071095913,"about_ca_system_score_codex":0.0011943147,"about_ca_system_score_gemma":0.00087957946,"threshold_uncertainty_score":0.01597637},"labels":[],"label_agreement":null},{"id":"W4396964204","doi":"10.23977/jeis.2024.090205","title":"A Comprehensive Review of Text Classification Algorithms","year":2024,"lang":"en","type":"review","venue":"Journal of Electronics and Information Science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Algorithm; Artificial intelligence","score_opus":0.048905006203252895,"score_gpt":0.35917823473218735,"score_spread":0.31027322852893446,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4396964204","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00076044403,0.97442406,0.011034527,0.0020938774,0.00186496,0.00010993494,0.0005296313,0.00035521458,0.008827382],"genre_scores_gemma":[0.004414609,0.9652685,0.016792495,0.0015336113,0.0028931662,0.0001644655,0.0015651888,0.00009441865,0.0072736647],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9990101,0.00016499282,0.00014956779,0.00017201362,0.00044725614,0.000055997494],"domain_scores_gemma":[0.99692494,0.0017130895,0.00017960173,0.000101504695,0.0010032357,0.00007758491],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014769187,0.0010196592,0.0013380477,0.006063715,0.0005618278,0.0016711965,0.0013778427,0.0011473704,0.009049908],"category_scores_gemma":[0.0051812953,0.0003328171,0.00094989786,0.006285162,0.00045944407,0.0036905818,0.0006306094,0.0012519546,0.008539364],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000030610434,0.000044404624,0.00022650193,0.0059671323,0.000041035186,0.000033225348,0.00003718214,0.00031636815,0.000576055,0.0026848253,0.054294482,0.9357483],"study_design_scores_gemma":[0.000012654881,0.00008265377,0.001372064,0.0046618558,0.00012309916,0.00040045328,0.00007830354,0.001149619,0.0009516381,0.005010901,0.98611856,0.000038166832],"about_ca_topic_score_codex":0.0015799437,"about_ca_topic_score_gemma":0.0019090881,"teacher_disagreement_score":0.009049908,"about_ca_system_score_codex":0.00072518986,"about_ca_system_score_gemma":0.0018141659,"threshold_uncertainty_score":0.030274987},"labels":[],"label_agreement":null},{"id":"W4398162687","doi":"10.1109/access.2024.3403569","title":"Multi-Label Lifelong Machine Learning: A Scoping Review of Algorithms, Techniques, and Applications","year":2024,"lang":"en","type":"review","venue":"IEEE Access","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Lifelong learning; Computer science; Machine learning; Artificial intelligence; Forgetting; Process (computing); Adaptability; Adaptation (eye); Stability (learning theory); Multi-label classification; Intersection (aeronautics); Engineering","score_opus":0.13773303840081133,"score_gpt":0.44577431195005823,"score_spread":0.30804127354924693,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4398162687","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00008617263,0.9966,0.0013958084,0.0006839367,0.00018921972,0.000021397986,0.000030327576,0.000016242642,0.0009769622],"genre_scores_gemma":[0.00091063464,0.99627644,0.0018363179,0.0003519181,0.00022881434,0.000041288415,0.00006243069,0.00000979865,0.00028226976],"study_design_codex":"design_other","study_design_gemma":"systematic_review","domain_scores_codex":[0.9984977,0.00039427218,0.00027623985,0.00022756179,0.00053109234,0.00007303687],"domain_scores_gemma":[0.9849399,0.011477748,0.0007425592,0.00036453753,0.002290817,0.00018440903],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0043988763,0.0012095592,0.0019657528,0.00789235,0.00068640104,0.0026740117,0.0021873717,0.0021868432,0.003679923],"category_scores_gemma":[0.014341566,0.00074934866,0.00159086,0.009446225,0.0012902318,0.004352392,0.0012473066,0.0025261154,0.0022357353],"study_design_candidate":"systematic_review","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000046322264,0.00007455085,0.0003523876,0.053444702,0.00020261465,0.00008421647,0.00019347828,0.0010451989,0.000371818,0.012460224,0.031990793,0.8997337],"study_design_scores_gemma":[0.000019398742,0.000141922,0.0012139083,0.07496964,0.00063104794,0.0005808074,0.0002793796,0.0010713213,0.0006157032,0.016747078,0.90365785,0.00007195393],"about_ca_topic_score_codex":0.004366207,"about_ca_topic_score_gemma":0.0060154814,"teacher_disagreement_score":0.00789235,"about_ca_system_score_codex":0.0018486724,"about_ca_system_score_gemma":0.0058738417,"threshold_uncertainty_score":0.023263812},"labels":[],"label_agreement":null},{"id":"W4399554982","doi":"10.48550/arxiv.2406.05631","title":"CCSI: Continual Class-Specific Impression for Data-free Class Incremental Learning","year":2024,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Canadian Institutes of Health Research; Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research","keywords":"Impression; Class (philosophy); Computer science; Psychology; Artificial intelligence; World Wide Web","score_opus":0.1322242034962122,"score_gpt":0.23236020368046958,"score_spread":0.10013600018425739,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4399554982","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05403855,0.00035874537,0.93721527,0.0004118922,0.00021083036,0.0002090373,0.0005096068,0.0037694885,0.003276563],"genre_scores_gemma":[0.66177183,0.00024780573,0.3272747,0.0006865474,0.0002081002,0.0004557119,0.002500744,0.0005966648,0.006257894],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99919933,0.000110022025,0.00004050357,0.00025736075,0.00030435759,0.000088444394],"domain_scores_gemma":[0.99756074,0.0007543368,0.00022859334,0.0008402862,0.00045933406,0.00015673638],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0017021957,0.00096604024,0.0008014212,0.00062061247,0.0004102726,0.0010705481,0.0031810633,0.0010074491,0.0035362474],"category_scores_gemma":[0.0076847957,0.00049233885,0.00080341846,0.00062250573,0.0012055947,0.0020224296,0.0024546003,0.0022379179,0.0008050009],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00078476995,0.00055476784,0.0072248355,0.0002686307,0.00014021472,0.00032831723,0.0004581444,0.25930455,0.032220654,0.024859395,0.017272487,0.6565832],"study_design_scores_gemma":[0.000027949596,0.00016142505,0.00082020444,0.000018641667,0.000022545642,0.00011174392,0.000031077136,0.97415733,0.011717639,0.00945851,0.0034408031,0.000032117892],"about_ca_topic_score_codex":0.0029013585,"about_ca_topic_score_gemma":0.004169421,"teacher_disagreement_score":0.0035362474,"about_ca_system_score_codex":0.0009792878,"about_ca_system_score_gemma":0.0014446905,"threshold_uncertainty_score":0.011829972},"labels":[],"label_agreement":null},{"id":"W4399906408","doi":"10.18280/ria.380307","title":"A New Algorithm for Arabic Document Clustering Utilizing Maximal Wordsets","year":2024,"lang":"fr","type":"article","venue":"Revue d intelligence artificielle","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Arabic; Cluster analysis; Document clustering; Computer science; Artificial intelligence; Information retrieval; Algorithm; Natural language processing; Pattern recognition (psychology); Linguistics","score_opus":0.07427204738448545,"score_gpt":0.3190446043352724,"score_spread":0.24477255695078692,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4399906408","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0042461497,0.00042233255,0.9906501,0.00011960099,0.00014086717,0.0002687373,0.00047881613,0.0022265785,0.0014467872],"genre_scores_gemma":[0.017946646,0.00021635731,0.977443,0.00006594235,0.000069468835,0.00029288503,0.0012591946,0.00019683728,0.002509612],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99784696,0.00025354253,0.0003231664,0.00061357627,0.0008385561,0.00012426647],"domain_scores_gemma":[0.9985701,0.00038713904,0.00013014345,0.00021923466,0.00063380454,0.00005967557],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014465675,0.0018954609,0.0015177369,0.0065828892,0.0020260706,0.002071908,0.0022097647,0.0011833942,0.0044731954],"category_scores_gemma":[0.0045706914,0.00064118905,0.0016535455,0.0059156073,0.0007499283,0.002500017,0.0015967512,0.001416348,0.0045733326],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020687819,0.00007934986,0.0007510377,0.00021004287,0.00010998004,0.00009803289,0.00024347933,0.018702755,0.0105699375,0.0072281817,0.0081758415,0.9536244],"study_design_scores_gemma":[0.00015693766,0.00030026498,0.0021615038,0.00012742792,0.00014220766,0.0011621902,0.00058409816,0.8084873,0.0437475,0.05081768,0.09215004,0.00016286613],"about_ca_topic_score_codex":0.005594385,"about_ca_topic_score_gemma":0.006626624,"teacher_disagreement_score":0.0065828892,"about_ca_system_score_codex":0.0011904065,"about_ca_system_score_gemma":0.0022259154,"threshold_uncertainty_score":0.014964402},"labels":[],"label_agreement":null},{"id":"W4400612757","doi":"10.31436/iiumej.v25i2.3364","title":"Editorial","year":2024,"lang":"en","type":"editorial","venue":"IIUM Engineering Journal","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Engineering; Islam; Library science; Management; Theology; Philosophy; Computer science","score_opus":0.004789427579921352,"score_gpt":0.22719978476527677,"score_spread":0.22241035718535543,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4400612757","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0002997621,0.013591635,0.00083975523,0.060639143,0.7099949,0.00023245424,0.0016538767,0.001075181,0.21167335],"genre_scores_gemma":[0.004007511,0.015998648,0.000975903,0.032155387,0.31813332,0.00019127098,0.0022072569,0.00079737755,0.6255333],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9962218,0.000511647,0.00036676443,0.00069929357,0.0018275598,0.00037296923],"domain_scores_gemma":[0.98208874,0.001840985,0.00088951155,0.001236717,0.01063112,0.0033128597],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0030571728,0.0017753646,0.0014467542,0.0031784065,0.00223693,0.009474734,0.0024022448,0.0036895403,0.44525984],"category_scores_gemma":[0.023411242,0.00059560285,0.0011657625,0.0015374756,0.0010369814,0.004221713,0.002294511,0.0049944255,0.35873887],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000015537926,0.0000047299636,0.000032196924,0.00009450415,0.0000025409443,0.00004463251,0.000010824311,0.000009053267,0.000034379744,0.0004834442,0.98498094,0.014287227],"study_design_scores_gemma":[0.000009868801,0.0000072447515,0.00008217091,0.00014814438,0.0000035957305,0.00009500836,0.00003518821,0.000018498817,0.00004711681,0.00043031797,0.99911875,0.0000041024846],"about_ca_topic_score_codex":0.0013020502,"about_ca_topic_score_gemma":0.0019477968,"teacher_disagreement_score":0.44525984,"about_ca_system_score_codex":0.0020814736,"about_ca_system_score_gemma":0.0049827923,"threshold_uncertainty_score":0},"labels":[],"label_agreement":null},{"id":"W4400653413","doi":"10.5267/j.ijdns.2024.6.012","title":"An improved multi-stage framework for large-scale hierarchical text classification problems using a modified feature hashing and bi-filtering strategy","year":2024,"lang":"en","type":"article","venue":"International Journal of Data and Network Science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Hierarchy; Reduction (mathematics); Hash function; Pattern recognition (psychology); Artificial intelligence; Dimensionality reduction; Data mining; Feature (linguistics); Multi-label classification; Feature hashing; Task (project management); Scale (ratio); Machine learning; Hash table; Mathematics","score_opus":0.12167052302534487,"score_gpt":0.39335622059897357,"score_spread":0.2716856975736287,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4400653413","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.005860639,0.00023395273,0.9924567,0.000060486822,0.00003334333,0.00009414777,0.00008820376,0.0009184629,0.00025397702],"genre_scores_gemma":[0.14049065,0.0002529793,0.8540485,0.00015540869,0.00014755195,0.0004010396,0.00094789016,0.00011476661,0.0034411815],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9984347,0.00025826634,0.00014220744,0.00034489692,0.00061718724,0.00020272698],"domain_scores_gemma":[0.99884254,0.00036214697,0.00010561857,0.00019368329,0.000424303,0.000071771225],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013956178,0.0008728323,0.0017485889,0.0019219749,0.00076261105,0.0009773993,0.0024739571,0.0012787392,0.002295651],"category_scores_gemma":[0.0024904876,0.00047483415,0.0017184322,0.002091563,0.0004470241,0.00202337,0.0011371543,0.0011045409,0.0015192623],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027300775,0.00023878722,0.0020994078,0.00020421634,0.00012869228,0.00015966175,0.00020343588,0.07527233,0.029705547,0.005967353,0.006052479,0.8796951],"study_design_scores_gemma":[0.000019186657,0.00011193992,0.000883085,0.000007235125,0.000027239974,0.00008532035,0.000039214567,0.9892231,0.0043697795,0.003574769,0.0016321836,0.000026978112],"about_ca_topic_score_codex":0.012595619,"about_ca_topic_score_gemma":0.010510423,"teacher_disagreement_score":0.012595619,"about_ca_system_score_codex":0.00067302503,"about_ca_system_score_gemma":0.0015345279,"threshold_uncertainty_score":0.02504462},"labels":[],"label_agreement":null},{"id":"W4400725186","doi":"10.1007/978-3-031-64359-0_24","title":"Limitations of the Utility of Categorization in eDiscovery Review Efforts","year":2024,"lang":"en","type":"book-chapter","venue":"Communications in computer and information science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"","keywords":"Categorization; Computer science; Information retrieval; Data science; Artificial intelligence","score_opus":0.09306055483829982,"score_gpt":0.2995506511540169,"score_spread":0.20649009631571708,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4400725186","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08588447,0.17479199,0.193905,0.114001386,0.0046565756,0.0024882792,0.018245272,0.0063741026,0.39965302],"genre_scores_gemma":[0.7343194,0.037891537,0.17335916,0.019884726,0.0030468954,0.0021049266,0.0062238663,0.0010538734,0.022115525],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9074623,0.05562637,0.0062239966,0.0050720405,0.024133487,0.0014816979],"domain_scores_gemma":[0.533525,0.37139392,0.011170505,0.020375531,0.0609406,0.002594529],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.101131365,0.000806152,0.0016520874,0.017806673,0.002317522,0.0146817155,0.004708216,0.0016774669,0.008167513],"category_scores_gemma":[0.33167556,0.00080228463,0.0011474027,0.017186783,0.0026319055,0.014536712,0.0044648624,0.0018855949,0.0060014986],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00028277803,0.00018426418,0.020659862,0.0037755228,0.00035448783,0.0000759894,0.0013113687,0.0019457943,0.0005815224,0.047568575,0.08589367,0.8373661],"study_design_scores_gemma":[0.00023435058,0.00047718186,0.051496197,0.013443836,0.0012585067,0.0012218863,0.00967142,0.049776874,0.008422127,0.2409592,0.622696,0.00034245691],"about_ca_topic_score_codex":0.013640634,"about_ca_topic_score_gemma":0.017820582,"teacher_disagreement_score":0.101131365,"about_ca_system_score_codex":0.0045636976,"about_ca_system_score_gemma":0.006840538,"threshold_uncertainty_score":0.53484017},"labels":[],"label_agreement":null},{"id":"W4400868692","doi":"10.1007/s10489-024-05639-z","title":"Multi-kernel partial label learning using graph contrast disambiguation","year":2024,"lang":"en","type":"article","venue":"Applied Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"Dongguan Science and Technology Bureau","keywords":"Computer science; Artificial intelligence; Contrast (vision); Graph; Kernel (algebra); Pattern recognition (psychology); Natural language processing; Theoretical computer science; Discrete mathematics; Mathematics","score_opus":0.06580646160920452,"score_gpt":0.3192109118102478,"score_spread":0.2534044502010433,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4400868692","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05375334,0.0005708975,0.938736,0.00027751902,0.00012604946,0.00006105255,0.00027660295,0.003929722,0.0022687865],"genre_scores_gemma":[0.588812,0.00028172391,0.4034215,0.00024518906,0.000107745145,0.000084054496,0.0014434871,0.00064806663,0.0049562296],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99894816,0.00025911923,0.000054303157,0.0004249468,0.00018954079,0.00012386027],"domain_scores_gemma":[0.99817955,0.0006242811,0.00013812906,0.0005522515,0.00040684198,0.000098967306],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00092006766,0.0010766443,0.0015823753,0.0022494895,0.0011158538,0.0019125311,0.0021355536,0.0017973661,0.0034827474],"category_scores_gemma":[0.0029126601,0.00049685483,0.0013673448,0.0020617307,0.00082106737,0.0031997445,0.0024260795,0.0017343335,0.0019501213],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010496732,0.0005371618,0.0033980897,0.0003502511,0.0003048668,0.0002287332,0.00017683698,0.08997057,0.040020205,0.017635498,0.009960313,0.8363679],"study_design_scores_gemma":[0.000030726722,0.00007686719,0.00064819324,0.00001563677,0.00007964009,0.00009928209,0.00004776294,0.9680862,0.012021617,0.016716046,0.0021500655,0.000028042337],"about_ca_topic_score_codex":0.0034197546,"about_ca_topic_score_gemma":0.005875343,"teacher_disagreement_score":0.0034827474,"about_ca_system_score_codex":0.00062340166,"about_ca_system_score_gemma":0.00094889384,"threshold_uncertainty_score":0.0116509795},"labels":[],"label_agreement":null},{"id":"W4401009136","doi":"10.1016/j.inffus.2024.102600","title":"Incomplete label distribution learning via label correlation decomposition","year":2024,"lang":"en","type":"article","venue":"Information Fusion","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"National Natural Science Foundation of China","keywords":"Computer science; Decomposition; Distribution (mathematics); Correlation; Multi-label classification; Artificial intelligence; Mathematics; Chemistry","score_opus":0.012884044777630204,"score_gpt":0.26547569615949135,"score_spread":0.2525916513818611,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4401009136","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0052921684,0.00017145225,0.99315697,0.00020766904,0.000028833407,0.00003270751,0.00011428047,0.00050349126,0.0004924727],"genre_scores_gemma":[0.27388293,0.0005635636,0.7173332,0.00047619888,0.0002831925,0.00033893448,0.0023430702,0.0003706314,0.00440828],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99653697,0.0011960973,0.00018549737,0.000709058,0.0010811802,0.00029123446],"domain_scores_gemma":[0.9929426,0.0035557924,0.0005446614,0.0012724501,0.0014716536,0.00021290961],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004502133,0.0011504573,0.0022966384,0.002493284,0.0010797951,0.0026182798,0.002249377,0.0018747153,0.0025918137],"category_scores_gemma":[0.009916792,0.0007863782,0.001861721,0.003535359,0.0014385935,0.0035902166,0.0029973642,0.003334253,0.0015320902],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005311589,0.0005567963,0.0026337302,0.00031177938,0.0003334814,0.00016782353,0.0002554552,0.19223182,0.014253808,0.048613597,0.014346271,0.7257643],"study_design_scores_gemma":[0.000014306332,0.000029368128,0.00030029687,0.00001646432,0.000044263892,0.000033490458,0.000020323918,0.96445316,0.003478124,0.030369604,0.0012233554,0.00001718052],"about_ca_topic_score_codex":0.0038071573,"about_ca_topic_score_gemma":0.004586051,"teacher_disagreement_score":0.004502133,"about_ca_system_score_codex":0.0013984725,"about_ca_system_score_gemma":0.0024796075,"threshold_uncertainty_score":0.02380985},"labels":[],"label_agreement":null},{"id":"W4401508264","doi":"10.1109/dcoss-iot61029.2024.00037","title":"Privacy-Preserving Multi-Party Keyword-Based Classification of Unstructured Text Data","year":2024,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"","keywords":"Computer science; Information retrieval; Unstructured data; Keyword search; Natural language processing; World Wide Web; Data mining; Big data","score_opus":0.10229281079065004,"score_gpt":0.3338654759186699,"score_spread":0.23157266512801983,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4401508264","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.038896795,0.00024948744,0.9563198,0.0008490176,0.000081237675,0.00019896467,0.00041054084,0.000639872,0.0023542314],"genre_scores_gemma":[0.81160843,0.0002518285,0.18293631,0.00032558743,0.00015409874,0.00019938972,0.00066332123,0.0000821205,0.0037787806],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9931272,0.0018629543,0.0006756504,0.0012018518,0.0023282,0.0008040444],"domain_scores_gemma":[0.98825455,0.0037147047,0.0013162306,0.005455385,0.0009944806,0.00026466436],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0033611087,0.00040749193,0.0013257994,0.0008897425,0.0014088576,0.0028296474,0.0018231639,0.0013262698,0.0015520399],"category_scores_gemma":[0.012444589,0.0002957405,0.0010550045,0.0021011431,0.0011817984,0.0047116694,0.0030144393,0.0016986334,0.0013209758],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002514904,0.0007354965,0.0062115435,0.00064474746,0.00030866862,0.0013826499,0.0015916084,0.19540827,0.08054585,0.27642393,0.013605234,0.42062712],"study_design_scores_gemma":[0.00008136057,0.00017464701,0.0007209712,0.00003293512,0.000052561405,0.00078052765,0.00022863752,0.80765176,0.0452931,0.13880843,0.0061202683,0.00005480334],"about_ca_topic_score_codex":0.0005269902,"about_ca_topic_score_gemma":0.00052724086,"teacher_disagreement_score":0.0033611087,"about_ca_system_score_codex":0.0010896875,"about_ca_system_score_gemma":0.0019226172,"threshold_uncertainty_score":0.017775416},"labels":[],"label_agreement":null},{"id":"W4402670684","doi":"10.18653/v1/2024.findings-acl.151","title":"Accurate and Nuanced Open-QA Evaluation Through Textual Entailment","year":2024,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Textual entailment; Computer science; Natural language processing; Logical consequence; Artificial intelligence; Information retrieval","score_opus":0.0861146672899413,"score_gpt":0.3814566730101803,"score_spread":0.29534200572023905,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402670684","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.121480696,0.0043665688,0.79778796,0.0030779294,0.0013861947,0.0010514697,0.0076682605,0.028621562,0.034559373],"genre_scores_gemma":[0.6137265,0.0006010766,0.35174662,0.00093784544,0.00046049326,0.00031860406,0.01579099,0.0025007592,0.013917169],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.98431385,0.0081479605,0.0011452608,0.0019962103,0.0037141466,0.0006826414],"domain_scores_gemma":[0.9670236,0.017295754,0.0011770246,0.0044388594,0.009223205,0.0008416212],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009448487,0.0016928731,0.0013565394,0.0033216102,0.0019963365,0.0047838395,0.0024736607,0.003489592,0.01958059],"category_scores_gemma":[0.05501971,0.0006184696,0.0011302937,0.0016689141,0.0012479756,0.006530402,0.005158877,0.0027845586,0.009476873],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0026536882,0.0010897131,0.005941579,0.0027871523,0.0003981147,0.0009917759,0.0021472962,0.03735646,0.069512844,0.02913031,0.09447676,0.75351435],"study_design_scores_gemma":[0.00047554364,0.0008343671,0.0066875243,0.0008138312,0.00041209735,0.0012868842,0.0020038423,0.71318805,0.100679286,0.09296554,0.08040881,0.00024411887],"about_ca_topic_score_codex":0.00481062,"about_ca_topic_score_gemma":0.0068681417,"teacher_disagreement_score":0.01958059,"about_ca_system_score_codex":0.001939615,"about_ca_system_score_gemma":0.0029737756,"threshold_uncertainty_score":0.06550366},"labels":[],"label_agreement":null},{"id":"W4402671274","doi":"10.18653/v1/2024.acl-long.808","title":"Tree-Averaging Algorithms for Ensemble-Based Unsupervised Discontinuous Constituency Parsing","year":2024,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Alliance de recherche numérique du Canada; Alberta Innovates; DeepMind; Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research","keywords":"Parsing; Computer science; Tree (set theory); Ensemble learning; Artificial intelligence; Algorithm; Machine learning; Mathematics","score_opus":0.03995286326179818,"score_gpt":0.2922784025302487,"score_spread":0.2523255392684505,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402671274","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010120508,0.0005628435,0.98181194,0.00016180624,0.00009594459,0.000057832945,0.00031521663,0.005957887,0.00091602624],"genre_scores_gemma":[0.15936568,0.00044074972,0.8321614,0.00024684472,0.00023453042,0.0002730116,0.0035119045,0.0013510048,0.0024148582],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99815,0.00055753934,0.000117896925,0.000630568,0.0003791504,0.00016491555],"domain_scores_gemma":[0.9945458,0.0029712084,0.00025512284,0.0011781683,0.00087881123,0.0001708756],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0029546292,0.0016550615,0.0020092546,0.0022407072,0.0013018951,0.0015511496,0.003058676,0.0016838129,0.0038215488],"category_scores_gemma":[0.008417856,0.0006834607,0.0015045374,0.0030949088,0.0007537381,0.0038054523,0.0017126015,0.0037879522,0.0027982765],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017908425,0.00019800394,0.002693037,0.00018829074,0.00030051492,0.00011929492,0.00025092874,0.17654519,0.008494018,0.014439299,0.017150376,0.779442],"study_design_scores_gemma":[0.000011405421,0.000035156267,0.000452782,0.000013747413,0.000035306897,0.000057474757,0.000031013617,0.9741096,0.002917039,0.019940874,0.0023768072,0.000018732226],"about_ca_topic_score_codex":0.005178457,"about_ca_topic_score_gemma":0.0116970055,"teacher_disagreement_score":0.005178457,"about_ca_system_score_codex":0.0009476267,"about_ca_system_score_gemma":0.0018694407,"threshold_uncertainty_score":0.015625775},"labels":[],"label_agreement":null},{"id":"W4402812082","doi":"10.1109/iccc62479.2024.10681804","title":"DCML: Boosting Applying Experience of NILM with Dilated Convolution and Multi-Task Learning","year":2024,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo; University of Calgary","funders":"Research and Development; Central South University; National Natural Science Foundation of China","keywords":"Boosting (machine learning); Computer science; Convolution (computer science); Task (project management); Artificial intelligence; Engineering","score_opus":0.020856789116897853,"score_gpt":0.261504320181814,"score_spread":0.24064753106491615,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402812082","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.03326511,0.000852416,0.9584401,0.0003846614,0.00017987381,0.00008403377,0.000099207755,0.0029334864,0.0037610964],"genre_scores_gemma":[0.68870264,0.0004223365,0.3005072,0.0009531961,0.00025730013,0.00019078427,0.0006205837,0.00037537515,0.007970666],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9992793,0.00017046898,0.000036417303,0.00021162911,0.00019171974,0.000110436195],"domain_scores_gemma":[0.9989919,0.00033890374,0.000081879116,0.00018713543,0.00031916008,0.00008098472],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0021544101,0.0011400519,0.001219587,0.00085476536,0.0004336154,0.0008345521,0.0020463879,0.0012357722,0.002619052],"category_scores_gemma":[0.003908182,0.00048748593,0.00092849944,0.0005240284,0.00066209707,0.0015664175,0.0018017226,0.0015449093,0.0015091031],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00031678512,0.00024219358,0.003092226,0.00016025415,0.0001443806,0.00016776098,0.00010432661,0.44090846,0.015672399,0.0075807255,0.009050367,0.52256006],"study_design_scores_gemma":[0.000006342872,0.00003963974,0.00015795104,0.0000048761403,0.0000072132207,0.000022784167,0.0000041784124,0.99594647,0.001499549,0.0013676604,0.0009389175,0.0000044844064],"about_ca_topic_score_codex":0.0041777147,"about_ca_topic_score_gemma":0.004312441,"teacher_disagreement_score":0.0041777147,"about_ca_system_score_codex":0.0010832987,"about_ca_system_score_gemma":0.0010593039,"threshold_uncertainty_score":0.011393726},"labels":[],"label_agreement":null},{"id":"W4403724357","doi":"10.1109/dsaa61799.2024.10722777","title":"Multi-View Relational Evidential C-Medoid Clustering with Adaptive Weighted","year":2024,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Medoid; Cluster analysis; Computer science; Data mining; Artificial intelligence; Pattern recognition (psychology)","score_opus":0.04369156456313723,"score_gpt":0.27403866543081806,"score_spread":0.23034710086768084,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4403724357","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0037066815,0.00014816535,0.99551445,0.0000661001,0.0000140726925,0.00004144083,0.000053740237,0.00013070647,0.0003246479],"genre_scores_gemma":[0.18519114,0.00029028894,0.81255174,0.000156976,0.00003941733,0.00020976365,0.0006004001,0.00009132052,0.000868982],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9962173,0.0014831125,0.00029615485,0.0008840206,0.000972182,0.00014722391],"domain_scores_gemma":[0.99458885,0.0027753627,0.0005865743,0.0008587806,0.001058361,0.00013220111],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005291321,0.0014271969,0.0022149917,0.0026218824,0.0010220088,0.002294889,0.003424562,0.0024793232,0.001618022],"category_scores_gemma":[0.013450852,0.0007400496,0.0022780155,0.0029189999,0.0013192991,0.0030039074,0.0029700778,0.0025130694,0.00081209955],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00030387536,0.00011037662,0.0017633874,0.00042401382,0.00033874894,0.00017428772,0.0004849442,0.7391796,0.0049683983,0.03325051,0.0032279738,0.21577387],"study_design_scores_gemma":[0.000009988895,0.000028050184,0.00014272146,0.00001607501,0.000015728081,0.000049382616,0.000037281396,0.98641706,0.0011436957,0.011457678,0.0006609794,0.000021375465],"about_ca_topic_score_codex":0.004530506,"about_ca_topic_score_gemma":0.004999141,"teacher_disagreement_score":0.005291321,"about_ca_system_score_codex":0.0012360999,"about_ca_system_score_gemma":0.0016266559,"threshold_uncertainty_score":0.027983546},"labels":[],"label_agreement":null},{"id":"W4403839440","doi":"10.1080/10618600.2024.2421248","title":"Multi-label Random Subspace Ensemble Classification","year":2024,"lang":"en","type":"article","venue":"Journal of Computational and Graphical Statistics","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"York University; National Institute on Aging; National Institutes of Health; National Science Foundation","keywords":"Random forest; Random subspace method; Computer science; Classifier (UML); Subspace topology; Artificial intelligence; Ensemble learning; Linear subspace; Machine learning; Pattern recognition (psychology); Multinomial distribution; Multi-label classification; Data mining; Algorithm; Mathematics; Statistics","score_opus":0.03378278262940175,"score_gpt":0.30295361300985085,"score_spread":0.2691708303804491,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4403839440","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011290608,0.000721577,0.98508793,0.0001758834,0.000114898765,0.000058689362,0.00017037956,0.00094695314,0.0014330515],"genre_scores_gemma":[0.448824,0.0006905093,0.5410928,0.00047789555,0.00044412163,0.00028758423,0.0022307222,0.00027441204,0.0056778733],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99730945,0.0010641029,0.000094696676,0.0005127472,0.0007966267,0.00022229805],"domain_scores_gemma":[0.99680567,0.0011754108,0.00020049127,0.0006986216,0.00097540556,0.00014436863],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032729418,0.0010820079,0.002353039,0.0017755056,0.0007871704,0.0013156183,0.0022762117,0.0014242899,0.0022939064],"category_scores_gemma":[0.0058515775,0.00031750937,0.0014150707,0.0015616049,0.00053641084,0.002838686,0.0015482265,0.0018309862,0.0015695542],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021283256,0.00026897294,0.0041040634,0.00011570093,0.00022222524,0.000099525125,0.00012225231,0.32544717,0.002816277,0.013495817,0.011876986,0.6412181],"study_design_scores_gemma":[0.000005633073,0.0000259091,0.00019912644,0.000008077221,0.000011682212,0.000030658473,0.0000140679385,0.9915706,0.000895559,0.005731257,0.001496426,0.00001095117],"about_ca_topic_score_codex":0.0027070348,"about_ca_topic_score_gemma":0.0038872024,"teacher_disagreement_score":0.0032729418,"about_ca_system_score_codex":0.000605804,"about_ca_system_score_gemma":0.0008577617,"threshold_uncertainty_score":0.01730913},"labels":[],"label_agreement":null},{"id":"W4404037418","doi":"10.1109/mlsp58920.2024.10734736","title":"Self Supervised Dictionary Learning Using Kernel Matching","year":2024,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Computer science; Artificial intelligence; Kernel (algebra); Dictionary learning; Pattern recognition (psychology); Matching (statistics); Machine learning; Semi-supervised learning; Mathematics; Sparse approximation; Statistics","score_opus":0.02366937728997995,"score_gpt":0.2678861414947453,"score_spread":0.24421676420476537,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4404037418","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0015317042,0.000039728868,0.9978452,0.00004178052,0.000013892251,0.000012594427,0.000013880624,0.00012096387,0.00038028488],"genre_scores_gemma":[0.19777754,0.00027227568,0.79532623,0.00022889896,0.0001470694,0.00022741243,0.00039538334,0.00027397083,0.0053513125],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99884784,0.00044356304,0.00006261929,0.00022645458,0.0003443286,0.00007507725],"domain_scores_gemma":[0.99812335,0.0006642041,0.00021719415,0.00048789664,0.0004136995,0.000093623275],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014642028,0.0006313081,0.0011994159,0.0009199502,0.00038570198,0.0012529864,0.001965271,0.0015090198,0.002831641],"category_scores_gemma":[0.0057053315,0.00045806696,0.0007119207,0.0011987453,0.0011462119,0.0026047186,0.0027845625,0.0016799187,0.0015104503],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013837936,0.00020883135,0.0011459116,0.00025609706,0.00015003857,0.0001383275,0.000205044,0.4585232,0.0143533265,0.19204934,0.008624314,0.32420722],"study_design_scores_gemma":[0.0000064962596,0.000028329885,0.000041698466,0.0000059073923,0.0000035972298,0.000035697452,0.0000068368845,0.9778702,0.001275574,0.01944881,0.0012702205,0.000006520772],"about_ca_topic_score_codex":0.00070299197,"about_ca_topic_score_gemma":0.0009563508,"teacher_disagreement_score":0.002831641,"about_ca_system_score_codex":0.0004894737,"about_ca_system_score_gemma":0.0009108898,"threshold_uncertainty_score":0.009472787},"labels":[],"label_agreement":null},{"id":"W4404200925","doi":"10.1007/978-3-031-71452-8_12","title":"What Constitutes a Sufficiently Adequate Binary Classification System?","year":2024,"lang":"en","type":"book-chapter","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Jewish General Hospital","funders":"","keywords":"Binary number; Computer science; Mathematics; Arithmetic","score_opus":0.039512616332957815,"score_gpt":0.25775004462695994,"score_spread":0.2182374282940021,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4404200925","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.035252593,0.0084875235,0.85555166,0.031528372,0.0021133313,0.00037737255,0.0022698177,0.0030576114,0.06136175],"genre_scores_gemma":[0.21256278,0.003123577,0.75879663,0.004421625,0.001721056,0.0007857888,0.0033975001,0.00087259884,0.01431844],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99477744,0.0018319451,0.00046290303,0.0008913287,0.0017236379,0.00031277392],"domain_scores_gemma":[0.9884206,0.006085624,0.000500043,0.0017287872,0.0028880753,0.00037683288],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006701184,0.0005580822,0.0012080462,0.0022790702,0.0010822255,0.0049274904,0.0013961617,0.0021576108,0.0049977014],"category_scores_gemma":[0.03051397,0.0003832757,0.000592904,0.0016471721,0.0025078715,0.0074768616,0.002203891,0.0018521369,0.005634068],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00026497568,0.00015561206,0.002760803,0.0013384626,0.000071329305,0.000119826764,0.00050110364,0.0035547386,0.0072267433,0.45255953,0.0582565,0.47319043],"study_design_scores_gemma":[0.0000419732,0.00012367177,0.0016516923,0.0008228105,0.00006486321,0.0004403448,0.00055744004,0.054102477,0.007365729,0.81098676,0.12378827,0.000053953743],"about_ca_topic_score_codex":0.0013426495,"about_ca_topic_score_gemma":0.0014432397,"teacher_disagreement_score":0.006701184,"about_ca_system_score_codex":0.00085705216,"about_ca_system_score_gemma":0.0021137905,"threshold_uncertainty_score":0.03543967},"labels":[],"label_agreement":null},{"id":"W4404387399","doi":"10.18280/ts.410509","title":"Enhanced Improved Proportionate Set-Membership Fast NLMS Using the ℓ0 Norm","year":2024,"lang":"en","type":"article","venue":"Traitement du signal","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Norm (philosophy); Mathematics; Set (abstract data type); Computer science; Political science; Programming language","score_opus":0.03695893696391265,"score_gpt":0.27848977989132734,"score_spread":0.2415308429274147,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4404387399","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0024494538,0.000065135355,0.9966266,0.00004394536,0.000021414542,0.000013080238,0.00001436612,0.00013064464,0.0006353903],"genre_scores_gemma":[0.12241517,0.00024712554,0.8707847,0.00015668158,0.000063688145,0.00014160862,0.00020689308,0.00014948893,0.0058346665],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99941456,0.00019005494,0.000033724915,0.00008763692,0.0002389454,0.00003509981],"domain_scores_gemma":[0.9989624,0.00055514736,0.00007022534,0.000067580404,0.0003176894,0.000026893884],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011553697,0.0008304933,0.00060333515,0.00048771067,0.0003403114,0.0006695773,0.0010744102,0.001005085,0.002174957],"category_scores_gemma":[0.0039651426,0.00036561894,0.00069385074,0.0005086377,0.00063903246,0.0014338988,0.0010254976,0.001400365,0.0010270689],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020873174,0.00007696819,0.00065141986,0.00025119647,0.000092638285,0.00015591164,0.0004067654,0.52122617,0.036201667,0.044613592,0.00364525,0.39246973],"study_design_scores_gemma":[0.000008166469,0.000048127684,0.00006586378,0.000011244905,0.0000049109103,0.000042644537,0.000011060724,0.9881982,0.005062404,0.003926657,0.0026042876,0.000016487349],"about_ca_topic_score_codex":0.0021974277,"about_ca_topic_score_gemma":0.0024167625,"teacher_disagreement_score":0.0021974277,"about_ca_system_score_codex":0.0004515019,"about_ca_system_score_gemma":0.000872622,"threshold_uncertainty_score":0.007275939},"labels":[],"label_agreement":null},{"id":"W4404682082","doi":"10.54254/2755-2721/97/20241397","title":"Review on Application of Chi-square Statistic in Text Classification in Recent Five Years","year":2024,"lang":"en","type":"article","venue":"Applied and Computational Engineering","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University","funders":"","keywords":"Feature selection; Statistic; Chi-square test; Computer science; Feature (linguistics); Selection (genetic algorithm); Test (biology); Natural language processing; Artificial intelligence; Information retrieval; Statistics; Mathematics; Linguistics","score_opus":0.012529627397966573,"score_gpt":0.2512400210169778,"score_spread":0.23871039361901122,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4404682082","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0017099503,0.9738722,0.017301042,0.002777231,0.0009681492,0.00006604181,0.00021204642,0.000119008764,0.0029742946],"genre_scores_gemma":[0.025930457,0.94547564,0.023029128,0.0013037791,0.0025439411,0.00021041988,0.00055669673,0.00006608331,0.0008838522],"study_design_codex":"design_other","study_design_gemma":"systematic_review","domain_scores_codex":[0.9905318,0.003863971,0.0014768713,0.0010811473,0.0028900972,0.00015608044],"domain_scores_gemma":[0.92575496,0.060708504,0.0026300228,0.0008561371,0.009691757,0.00035850695],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.010837954,0.0010201012,0.0021228036,0.009132147,0.00060525804,0.0022279464,0.0022057563,0.0013755929,0.0024878487],"category_scores_gemma":[0.037998486,0.00054828345,0.0017315033,0.012087612,0.0018717946,0.0028037333,0.00079265353,0.001878253,0.0013978113],"study_design_candidate":"systematic_review","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013909835,0.000054461365,0.006171899,0.018744165,0.00037501153,0.00014937058,0.00039760306,0.0010011777,0.0007623368,0.0060349014,0.01707758,0.9490925],"study_design_scores_gemma":[0.00007570523,0.0007514357,0.039931998,0.027733985,0.0016015209,0.0033413216,0.0018299259,0.009314071,0.0058336626,0.023949929,0.8852174,0.00041890878],"about_ca_topic_score_codex":0.005369814,"about_ca_topic_score_gemma":0.004951788,"teacher_disagreement_score":0.989162,"about_ca_system_score_codex":0.001743246,"about_ca_system_score_gemma":0.004060589,"threshold_uncertainty_score":0.057317257},"labels":[],"label_agreement":null},{"id":"W4404781466","doi":"10.18653/v1/2024.findings-emnlp.257","title":"Graph-tree Fusion Model with Bidirectional Information Propagation for Long Document Classification","year":2024,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research","keywords":"Computer science; Artificial intelligence; Graph; Document classification; Tree (set theory); Fusion; Information retrieval; Data mining; Theoretical computer science; Mathematics","score_opus":0.02160782277492738,"score_gpt":0.2581732532938748,"score_spread":0.23656543051894743,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4404781466","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025673993,0.0010721928,0.96536493,0.000592233,0.00012258092,0.000117883465,0.00069395354,0.0041775587,0.0021846527],"genre_scores_gemma":[0.5987465,0.0011647113,0.3845287,0.00060342974,0.00023064157,0.0003694316,0.0041691884,0.0004982656,0.009689198],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99940896,0.0001269061,0.000038746864,0.00018254516,0.00016470834,0.000078268735],"domain_scores_gemma":[0.99885595,0.0004992391,0.00011476329,0.00014685828,0.0003243798,0.000058760033],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012263609,0.000987489,0.0009652954,0.0022850959,0.0007057428,0.0009888856,0.0019937644,0.0014083257,0.0028169614],"category_scores_gemma":[0.0027996153,0.0003018179,0.0010886255,0.0029521019,0.0005013826,0.003416935,0.00094425376,0.0019800446,0.0018218298],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003628778,0.00034792075,0.0025202634,0.00021534589,0.00014791264,0.00024412232,0.00032118114,0.27979237,0.009882284,0.026025105,0.021118974,0.6590217],"study_design_scores_gemma":[0.000007063827,0.000026951197,0.00021466978,0.000007547625,0.000026074507,0.000025015514,0.000014595566,0.9850728,0.001531316,0.0116283195,0.0014361716,0.000009529089],"about_ca_topic_score_codex":0.013158062,"about_ca_topic_score_gemma":0.016139269,"teacher_disagreement_score":0.013158062,"about_ca_system_score_codex":0.0015238777,"about_ca_system_score_gemma":0.0016791639,"threshold_uncertainty_score":0.026162922},"labels":[],"label_agreement":null},{"id":"W4404799249","doi":"10.1007/s11517-024-03247-0","title":"CorLabelNet: a comprehensive framework for multi-label chest X-ray image classification with correlation guided discriminant feature learning and oversampling","year":2024,"lang":"en","type":"article","venue":"Medical & Biological Engineering & Computing","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"National Natural Science Foundation of China","keywords":"Oversampling; Discriminative model; Artificial intelligence; Feature (linguistics); Computer science; Pattern recognition (psychology); Machine learning; Correlation; Multi-label classification; Discriminant; Class (philosophy); Mathematics","score_opus":0.060818128199565454,"score_gpt":0.3265953085034993,"score_spread":0.2657771803039339,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4404799249","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008491914,0.0008874607,0.95084304,0.00019865007,0.0001422667,0.0002816768,0.0023687996,0.034913458,0.0018727976],"genre_scores_gemma":[0.078915305,0.00066065864,0.89745504,0.0005197933,0.00014207634,0.00059118203,0.011946447,0.0020061675,0.007763293],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9989371,0.00017559664,0.000060341088,0.00033807088,0.00036959592,0.00011925259],"domain_scores_gemma":[0.9992654,0.00018651398,0.000052947726,0.00018512925,0.0002511673,0.000058930844],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019632557,0.0020525916,0.0023539595,0.0024399536,0.0011960992,0.0020747534,0.0042827995,0.0025660344,0.0062090904],"category_scores_gemma":[0.0029510034,0.0008387599,0.0018631154,0.0020434249,0.0005794888,0.0019831953,0.0029007765,0.002399295,0.0041886694],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005456575,0.0005779206,0.0024241987,0.00042839115,0.00032939727,0.0002766699,0.00013957218,0.04600563,0.012617495,0.00928706,0.0676009,0.85976714],"study_design_scores_gemma":[0.000060073,0.000112521455,0.00075627887,0.00006290122,0.00006999755,0.00017502448,0.000051949894,0.9526225,0.010205882,0.015376415,0.020462725,0.000043770735],"about_ca_topic_score_codex":0.017702652,"about_ca_topic_score_gemma":0.039256953,"teacher_disagreement_score":0.017702652,"about_ca_system_score_codex":0.0014660422,"about_ca_system_score_gemma":0.002674396,"threshold_uncertainty_score":0.035199225},"labels":[],"label_agreement":null},{"id":"W4404984454","doi":"10.2139/ssrn.5031329","title":"Research on Multi-Dimensional Feature Multi-Label Decision Models for Traditional Medicine Based on Deep Learning","year":2024,"lang":"en","type":"preprint","venue":"SSRN Electronic Journal","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria","funders":"","keywords":"Artificial intelligence; Feature (linguistics); Computer science; Machine learning; Deep learning","score_opus":0.15229368374303165,"score_gpt":0.38134160667929157,"score_spread":0.22904792293625992,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4404984454","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.061140586,0.004251352,0.9273525,0.003496645,0.00027284096,0.00008896632,0.00035668022,0.0003628256,0.0026777142],"genre_scores_gemma":[0.7521561,0.0025203933,0.23638822,0.001033474,0.00050319807,0.00015365506,0.0008124609,0.00008754742,0.006345079],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99875987,0.00040963828,0.00007364827,0.00039283556,0.00023521416,0.00012864641],"domain_scores_gemma":[0.99305254,0.00491146,0.0004224155,0.00037522087,0.0010159861,0.00022243455],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0033936726,0.0009858599,0.0014937837,0.0010491858,0.00036633664,0.0021713895,0.0018881066,0.0015565843,0.0025855924],"category_scores_gemma":[0.008163319,0.000454674,0.0013832524,0.0013875313,0.00070894073,0.004473597,0.0009903829,0.0035683957,0.0004886432],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005022243,0.000957117,0.009743694,0.00049316394,0.0005138034,0.00010202211,0.00022921136,0.2961273,0.004294509,0.042940415,0.006453706,0.6376429],"study_design_scores_gemma":[0.0000073206943,0.000053853877,0.0005680874,0.000030300927,0.000030490677,0.000019853913,0.000020957876,0.9796571,0.0007370797,0.018319143,0.0005456768,0.000010086375],"about_ca_topic_score_codex":0.003627389,"about_ca_topic_score_gemma":0.003798674,"teacher_disagreement_score":0.003627389,"about_ca_system_score_codex":0.0017459798,"about_ca_system_score_gemma":0.0013011805,"threshold_uncertainty_score":0.017947733},"labels":[],"label_agreement":null},{"id":"W4405496143","doi":"10.1007/978-3-031-61503-0_23","title":"Automated Classification of Construction Claim Documents Using Text Mining","year":2024,"lang":"en","type":"book-chapter","venue":"Lecture notes in civil engineering","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Information retrieval; Natural language processing; Data science; Artificial intelligence","score_opus":0.01905286285939375,"score_gpt":0.2504813625161217,"score_spread":0.23142849965672793,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4405496143","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.58798265,0.009534966,0.2890408,0.0023353526,0.0011985558,0.0015116599,0.06456084,0.019782698,0.024052376],"genre_scores_gemma":[0.5318417,0.002287119,0.34963527,0.00023336045,0.0006122662,0.0005887312,0.09832623,0.00043095645,0.016044386],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9990464,0.00012073067,0.00014909783,0.00019333669,0.0003952318,0.00009517559],"domain_scores_gemma":[0.9964657,0.0017970357,0.00044824806,0.00028142796,0.0008933643,0.00011416582],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00079345045,0.00071878737,0.00067013426,0.008550335,0.000715363,0.0019382798,0.0008742178,0.0008937556,0.0027789753],"category_scores_gemma":[0.0030958138,0.00023114099,0.0007312044,0.0051251026,0.00024157,0.0014882344,0.00055587984,0.0007043274,0.0035335736],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00040450957,0.00063176814,0.014775864,0.0006853754,0.000078776946,0.0006999938,0.00026383967,0.0035637808,0.03813184,0.0019359917,0.038495056,0.9003332],"study_design_scores_gemma":[0.00020210522,0.00065368006,0.11489523,0.0007914502,0.0005848405,0.0034519378,0.0021538862,0.5563758,0.15201159,0.015864013,0.15283552,0.00017992704],"about_ca_topic_score_codex":0.0031257353,"about_ca_topic_score_gemma":0.0041475534,"teacher_disagreement_score":0.008550335,"about_ca_system_score_codex":0.0005564256,"about_ca_system_score_gemma":0.0010032749,"threshold_uncertainty_score":0.009296596},"labels":[],"label_agreement":null},{"id":"W4405786055","doi":"10.1109/iros58592.2024.10802538","title":"Contextual Emotion Recognition using Large Vision Language Models","year":2024,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Artificial intelligence; Natural language processing; Emotion recognition; Human–computer interaction; Speech recognition; Computer vision","score_opus":0.05055027205860438,"score_gpt":0.31501068606604454,"score_spread":0.26446041400744014,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4405786055","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.17175217,0.0031528105,0.7944605,0.0020850145,0.0007213648,0.00028999383,0.0029017932,0.01579202,0.008844354],"genre_scores_gemma":[0.7841735,0.0006907695,0.20044823,0.0012100454,0.00032029394,0.00028626478,0.005781123,0.00035280632,0.0067369696],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99941707,0.000128413,0.000025110929,0.0002524639,0.00009225069,0.00008468039],"domain_scores_gemma":[0.99952435,0.00014490078,0.00005116148,0.00010207798,0.00013809201,0.000039432634],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006917989,0.0012827525,0.0006984317,0.0006324719,0.00035299477,0.0011664769,0.0015047687,0.0009255811,0.002067974],"category_scores_gemma":[0.002074016,0.0002997872,0.0013969211,0.00037301605,0.00039821462,0.0016567847,0.0011144525,0.0017228092,0.001706071],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009849442,0.00082550076,0.004590086,0.0002982434,0.00031513884,0.0004929551,0.000375885,0.114193544,0.07875823,0.008123458,0.03740645,0.75363547],"study_design_scores_gemma":[0.000029973564,0.0001280105,0.001767894,0.000026067622,0.000058592002,0.000092423565,0.00010831213,0.974755,0.011158106,0.0074900123,0.0043545803,0.00003097281],"about_ca_topic_score_codex":0.0067743603,"about_ca_topic_score_gemma":0.009872036,"teacher_disagreement_score":0.0067743603,"about_ca_system_score_codex":0.0009559331,"about_ca_system_score_gemma":0.0005849991,"threshold_uncertainty_score":0.013469875},"labels":[],"label_agreement":null},{"id":"W4406553888","doi":"10.1016/j.asoc.2025.112757","title":"Three-way multi-label classification: A review, a framework, and new challenges","year":2025,"lang":"en","type":"article","venue":"Applied Soft Computing","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":22,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"National Key Research and Development Program of China; National Natural Science Foundation of China","keywords":"Computer science; Multi-label classification; Artificial intelligence; Machine learning","score_opus":0.09022495306802511,"score_gpt":0.32144610589805883,"score_spread":0.23122115283003372,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4406553888","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006360766,0.63871485,0.32801473,0.0148420315,0.0030333856,0.00024093075,0.00034419078,0.00097107777,0.0074780365],"genre_scores_gemma":[0.14998163,0.4779009,0.3449405,0.0074183173,0.010158462,0.00080830825,0.0016938378,0.0005814402,0.0065167267],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.990664,0.0030993666,0.0009709025,0.0018128185,0.0031395606,0.0003133968],"domain_scores_gemma":[0.97717947,0.014829947,0.0010720431,0.0011246413,0.005247121,0.0005467571],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.015118427,0.0018999352,0.0041927923,0.005022856,0.0019167344,0.009515189,0.0064973957,0.0030871301,0.0027375536],"category_scores_gemma":[0.018785387,0.00086277834,0.0025626193,0.0070687006,0.0034147324,0.013295715,0.003236063,0.005195038,0.0020385513],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015468648,0.00029991963,0.0028913398,0.0055513936,0.0003804658,0.000057012996,0.0003253587,0.0029110464,0.0006496968,0.023394708,0.01841581,0.9449686],"study_design_scores_gemma":[0.00015797287,0.0010748856,0.0079381745,0.010914814,0.0017431116,0.0020588364,0.0027806463,0.25710645,0.0067752446,0.36743376,0.34131664,0.0006995045],"about_ca_topic_score_codex":0.0049060574,"about_ca_topic_score_gemma":0.0047902334,"teacher_disagreement_score":0.015118427,"about_ca_system_score_codex":0.0023823096,"about_ca_system_score_gemma":0.0043671275,"threshold_uncertainty_score":0.0799548},"labels":[],"label_agreement":null},{"id":"W4407264831","doi":"10.29173/cais1978","title":"Exploring a Machine-Generated Concept Hierarchy Through the Lens of \"Naive\" Classification","year":2025,"lang":"en","type":"article","venue":"Proceedings of the Annual Conference of CAIS / Actes du congrès annuel de l ACSI","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"","keywords":"Hierarchy; Computer science; Lens (geology); Artificial intelligence; Machine learning; Physics; Political science; Optics","score_opus":0.08693258341529242,"score_gpt":0.27825960745357914,"score_spread":0.19132702403828672,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4407264831","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.028402844,0.0009340845,0.9495629,0.00585447,0.000118264164,0.0003259445,0.0005287071,0.0004875039,0.013785206],"genre_scores_gemma":[0.25724038,0.00036441753,0.7380913,0.0006222886,0.000112965485,0.00035843957,0.0009878371,0.00011461111,0.0021077567],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9882339,0.00737944,0.00048518542,0.0012928194,0.0023501536,0.0002585482],"domain_scores_gemma":[0.94729733,0.041152775,0.0028639664,0.0041099237,0.0037793054,0.0007966744],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.019089872,0.00082504563,0.00088957936,0.011290587,0.0027145788,0.010884252,0.0026662468,0.001622359,0.0053329463],"category_scores_gemma":[0.061486166,0.0005241542,0.0014599729,0.0054638665,0.008347268,0.014721639,0.003631429,0.0043617547,0.00083900214],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000087160864,0.00009844844,0.003702878,0.00035824502,0.00006788484,0.00012576445,0.007077869,0.0049816268,0.0008839956,0.86951333,0.0042269104,0.10887594],"study_design_scores_gemma":[0.000029950106,0.000045014232,0.0010538683,0.00019360204,0.00002395211,0.00009623682,0.0015647571,0.07448072,0.0006754837,0.9067304,0.01507934,0.000026864593],"about_ca_topic_score_codex":0.0077736476,"about_ca_topic_score_gemma":0.010123977,"teacher_disagreement_score":0.019089872,"about_ca_system_score_codex":0.0050695185,"about_ca_system_score_gemma":0.004628073,"threshold_uncertainty_score":0.10095811},"labels":[],"label_agreement":null},{"id":"W4407870825","doi":"10.1016/j.ress.2025.110971","title":"Creating an incident investigation framework for a complex socio-technical system: Application of multi-label text classification and Bayesian network structure learning","year":2025,"lang":"en","type":"article","venue":"Reliability Engineering & System Safety","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Natural Sciences and Engineering Research Council of Canada; AltaLink; Alberta Electric System Operator","keywords":"Bayesian network; Computer science; Artificial intelligence; Bayesian probability; Machine learning; Data mining","score_opus":0.016915216967306333,"score_gpt":0.26893714021609716,"score_spread":0.2520219232487908,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4407870825","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0052299732,0.0000302292,0.992338,0.00036322637,0.000012496819,0.00017185873,0.00023704293,0.00068364653,0.0009335737],"genre_scores_gemma":[0.09515687,0.000065930944,0.9026307,0.00006497672,0.000019809335,0.00026086517,0.0005937187,0.00013238865,0.0010748002],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9983473,0.00066055026,0.00011932548,0.00036155962,0.000403024,0.000108262335],"domain_scores_gemma":[0.9959758,0.002106333,0.00046011477,0.00032894866,0.00088248437,0.00024629085],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0037753684,0.0007771934,0.0006016074,0.00432996,0.0017090581,0.0035628865,0.002198308,0.0016370533,0.003385189],"category_scores_gemma":[0.008058286,0.00068480574,0.0016337368,0.0019019399,0.001327925,0.0038416642,0.0028052041,0.0020067922,0.0006776071],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001263781,0.00045729036,0.010431371,0.00034098356,0.00017634469,0.0008372631,0.002214924,0.5988143,0.0053049293,0.2232726,0.00824053,0.14978312],"study_design_scores_gemma":[0.000008981608,0.000011778267,0.00033989674,0.000025653337,0.000018427903,0.000038131824,0.00015559663,0.9626139,0.0005934041,0.033431493,0.0027466926,0.000015979853],"about_ca_topic_score_codex":0.030390551,"about_ca_topic_score_gemma":0.05710355,"teacher_disagreement_score":0.030390551,"about_ca_system_score_codex":0.0030701288,"about_ca_system_score_gemma":0.0051045916,"threshold_uncertainty_score":0.060427308},"labels":[],"label_agreement":null},{"id":"W4408010102","doi":"10.1016/j.knosys.2025.113210","title":"Fine-grained local label correlation for multi-label classification","year":2025,"lang":"en","type":"article","venue":"Knowledge-Based Systems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"National Key Research and Development Program of China; National Natural Science Foundation of China","keywords":"Multi-label classification; Correlation; Off-label use; Computer science; Pattern recognition (psychology); Statistics; Artificial intelligence; Mathematics; Medicine; Internal medicine; Geometry","score_opus":0.07526925042946161,"score_gpt":0.3345912497241709,"score_spread":0.25932199929470934,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4408010102","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.035996143,0.0007247457,0.95575947,0.00026874169,0.00011860317,0.00016070378,0.0005322936,0.004503833,0.0019354617],"genre_scores_gemma":[0.47503373,0.0003299476,0.5159416,0.0003022337,0.00020921623,0.00025610265,0.0023726758,0.00042473758,0.0051296763],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99735475,0.0005406727,0.00018918198,0.00079453166,0.00080049055,0.00032034118],"domain_scores_gemma":[0.99436307,0.0018363752,0.00058215327,0.0016020297,0.0013786679,0.0002376343],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0025839761,0.0009302204,0.0017839618,0.0036192155,0.0016733395,0.0025291822,0.002248227,0.002058149,0.003911972],"category_scores_gemma":[0.006469608,0.00047958925,0.0009353818,0.0042328034,0.00092987966,0.0030094634,0.0025821945,0.002392697,0.0026528942],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00052642776,0.00077206467,0.00493396,0.0002584876,0.00016962962,0.0001683301,0.00021279769,0.045202505,0.052501086,0.0075581567,0.01126096,0.87643564],"study_design_scores_gemma":[0.000032848904,0.00012893496,0.0028053583,0.000044759076,0.000086979744,0.00012188391,0.00011184439,0.9439313,0.028977128,0.019232802,0.004482999,0.000043072552],"about_ca_topic_score_codex":0.006442994,"about_ca_topic_score_gemma":0.014854889,"teacher_disagreement_score":0.006442994,"about_ca_system_score_codex":0.0013313149,"about_ca_system_score_gemma":0.0022250928,"threshold_uncertainty_score":0.013665557},"labels":[],"label_agreement":null},{"id":"W4408100472","doi":"10.1109/rws62086.2025.10904839","title":"UNet-Based Deep Learning Pathloss Estimator with Boundary Condition Input","year":2025,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"École de Technologie Supérieure","funders":"","keywords":"Estimator; Computer science; Artificial intelligence; Statistics; Mathematics","score_opus":0.006467127590436183,"score_gpt":0.247263460090543,"score_spread":0.24079633250010682,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4408100472","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010595599,0.00016829564,0.9871049,0.0000913554,0.000032679065,0.000017171114,0.00007461695,0.0008159547,0.0010993623],"genre_scores_gemma":[0.69545907,0.00047176474,0.29443803,0.00038037007,0.00007772424,0.00017430128,0.00097008696,0.00024626902,0.007782304],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99980396,0.000029861225,0.000009003624,0.00004709955,0.00007696807,0.000033059383],"domain_scores_gemma":[0.99951816,0.00018730885,0.000040721643,0.000042027514,0.00019205638,0.00001973065],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00044634155,0.00064217485,0.00058756204,0.0004897474,0.000209522,0.00056681974,0.0012519223,0.0008888617,0.0017302354],"category_scores_gemma":[0.0019409279,0.00030870188,0.0003816252,0.0003962298,0.00040924022,0.0013499073,0.00093845435,0.001275656,0.00065512257],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000100855235,0.00008224322,0.0012036025,0.00007243742,0.00003871595,0.000094266514,0.000036313115,0.78189063,0.008619295,0.0052089286,0.0032470147,0.19940576],"study_design_scores_gemma":[0.000002262299,0.000010114573,0.000080492704,0.000003243568,0.0000029176094,0.000018837098,0.0000020112402,0.9976047,0.001136386,0.0008635964,0.00027210705,0.0000032571386],"about_ca_topic_score_codex":0.0050366917,"about_ca_topic_score_gemma":0.0052356273,"teacher_disagreement_score":0.0050366917,"about_ca_system_score_codex":0.0007037065,"about_ca_system_score_gemma":0.00075533474,"threshold_uncertainty_score":0.010014713},"labels":[],"label_agreement":null},{"id":"W4408897052","doi":"10.1109/icmlc63072.2024.10935045","title":"Text Classification Method Based on Gating Mechanism and Graph Convolutional Networks","year":2024,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Gating; Mechanism (biology); Graph; Convolutional neural network; Artificial intelligence; Theoretical computer science; Physics; Neuroscience","score_opus":0.025615101472069732,"score_gpt":0.28803812802383805,"score_spread":0.2624230265517683,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4408897052","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12572339,0.0011890188,0.8535429,0.00057925493,0.0003180482,0.00036791502,0.0015821557,0.011387095,0.00531022],"genre_scores_gemma":[0.6807127,0.00084479694,0.29536277,0.00048605507,0.0001923842,0.00034129174,0.0070511657,0.00033826008,0.014670504],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9996933,0.000029910787,0.000023074985,0.000105325846,0.000095962016,0.0000524878],"domain_scores_gemma":[0.9996468,0.00008120174,0.000060226088,0.000047350193,0.00013670915,0.000027806134],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00035380133,0.0010741507,0.0005693326,0.0018600613,0.0003650457,0.00058731006,0.0011646942,0.00075459725,0.0018484481],"category_scores_gemma":[0.0010886629,0.00020071707,0.00077899446,0.0015480571,0.0002997129,0.0017704119,0.0004956869,0.0007015955,0.0009799709],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00035874618,0.00021133288,0.0040830676,0.00018717701,0.000080531165,0.00021865519,0.00010801674,0.060585104,0.048829835,0.0065571917,0.014866269,0.86391413],"study_design_scores_gemma":[0.000032536842,0.00008021581,0.0016508427,0.000014197846,0.000045636774,0.00010401428,0.00003179404,0.97006375,0.018546991,0.0055703754,0.0038426868,0.000016963097],"about_ca_topic_score_codex":0.008034677,"about_ca_topic_score_gemma":0.009188787,"teacher_disagreement_score":0.008034677,"about_ca_system_score_codex":0.0007450492,"about_ca_system_score_gemma":0.0009865796,"threshold_uncertainty_score":0.015975833},"labels":[],"label_agreement":null},{"id":"W4409576551","doi":"10.61091/jcmcc127a-134","title":"Research on Multi-Label Legal Text Categorization Methods Based on Large Predicate Models","year":2025,"lang":"en","type":"article","venue":"Journal of Combinatorial Mathematics and Combinatorial Computing","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Predicate (mathematical logic); Categorization; Natural language processing; Computer science; Text categorization; Artificial intelligence; Information retrieval; Programming language","score_opus":0.07133117302106569,"score_gpt":0.391292831074241,"score_spread":0.31996165805317534,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4409576551","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.035653736,0.0033097416,0.95315343,0.0012008331,0.00028207325,0.00015302657,0.0003938939,0.0022309842,0.0036221445],"genre_scores_gemma":[0.7186685,0.0029848167,0.26123112,0.0008224975,0.0008326286,0.00038247494,0.0036842625,0.00039534492,0.01099828],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9981767,0.00037395314,0.00012195497,0.00061226275,0.0005765694,0.00013864944],"domain_scores_gemma":[0.9974661,0.0011930683,0.00031161017,0.00035061012,0.00058344926,0.00009511879],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0015615039,0.0012688997,0.0013032567,0.0032554003,0.0008564415,0.0018096399,0.0026368329,0.0012064127,0.0026029735],"category_scores_gemma":[0.0041550854,0.00032786798,0.001563435,0.0025896009,0.00079567987,0.007695884,0.0010140206,0.001914184,0.0013653745],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020281113,0.00045120533,0.0045730863,0.0004281352,0.00015997876,0.00018739514,0.00033448733,0.071932286,0.00836922,0.032355133,0.009875064,0.8711312],"study_design_scores_gemma":[0.000011014895,0.000053841228,0.0008260809,0.000024399931,0.00003640999,0.0000742118,0.00010624735,0.9771179,0.0023533313,0.016547425,0.002830288,0.000018818231],"about_ca_topic_score_codex":0.005163463,"about_ca_topic_score_gemma":0.0035392093,"teacher_disagreement_score":0.005163463,"about_ca_system_score_codex":0.0016080117,"about_ca_system_score_gemma":0.0011014185,"threshold_uncertainty_score":0.011667013},"labels":[],"label_agreement":null},{"id":"W4410109448","doi":"10.1016/j.nlp.2025.100152","title":"Bayesian Q-learning in multi-objective reward model for homophobic and transphobic text classification in low-resource languages: A hypothesis testing framework in multi-objective setting","year":2025,"lang":"en","type":"article","venue":"Natural Language Processing Journal","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"Science Foundation Ireland","keywords":"Bayesian probability; Computer science; Resource (disambiguation); Machine learning; Artificial intelligence; Natural language processing; Psychology","score_opus":0.02416340836884429,"score_gpt":0.3046702726710389,"score_spread":0.2805068643021946,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4410109448","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.11552638,0.0007661704,0.87529844,0.0030339928,0.00014441732,0.000323977,0.00040814865,0.000678337,0.003820028],"genre_scores_gemma":[0.91314876,0.00023197912,0.07909059,0.000638162,0.00010865439,0.0005083506,0.0002751856,0.000074320626,0.005924038],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99783736,0.0009593814,0.0000994513,0.00055124913,0.00026236937,0.0002901473],"domain_scores_gemma":[0.9874994,0.00945813,0.0009988266,0.00032125346,0.0012574511,0.00046489594],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0062335776,0.0012205994,0.0028067478,0.00095865753,0.0007286967,0.0017070328,0.0030578908,0.0028941543,0.0043954235],"category_scores_gemma":[0.015884887,0.00085216225,0.00093659153,0.0007113456,0.0022626938,0.0021659713,0.0016937621,0.0033200774,0.0005948248],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000292184,0.0001546586,0.0029955558,0.0001283469,0.00006962757,0.0002114626,0.00018659835,0.9437391,0.00071813026,0.022521071,0.0013792975,0.027603915],"study_design_scores_gemma":[0.000014981001,0.00002425077,0.00019023697,0.0000071200166,0.0000059670883,0.000008057302,0.000006089876,0.99533385,0.00010447284,0.0042018867,0.00009636604,0.0000066854104],"about_ca_topic_score_codex":0.014031808,"about_ca_topic_score_gemma":0.008577307,"teacher_disagreement_score":0.014031808,"about_ca_system_score_codex":0.0025358796,"about_ca_system_score_gemma":0.0026192202,"threshold_uncertainty_score":0.032966673},"labels":[],"label_agreement":null},{"id":"W4410546712","doi":"10.18280/isi.300408","title":"An Accurate Model for Text Document Classification Using Machine Learning Techniques","year":2025,"lang":"en","type":"article","venue":"Ingénierie des systèmes d information","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Artificial intelligence; Machine learning; Document classification; Natural language processing; Information retrieval","score_opus":0.035065862375805834,"score_gpt":0.30417657013829197,"score_spread":0.26911070776248613,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4410546712","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.019637076,0.0015447516,0.97210544,0.00079681235,0.00029122093,0.00026163523,0.0010268531,0.0027932893,0.001542976],"genre_scores_gemma":[0.35093158,0.002478368,0.6311946,0.000451948,0.0005698086,0.0010457406,0.0038600487,0.00019642692,0.009271519],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99863464,0.00026717453,0.00015131407,0.00038092327,0.00046652937,0.00009939692],"domain_scores_gemma":[0.9981324,0.0008495244,0.00017312967,0.00020065226,0.0006052665,0.000038993967],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0017449022,0.00096012413,0.0012308025,0.0029716655,0.0005324307,0.0018912995,0.0020150745,0.0017378541,0.0014894039],"category_scores_gemma":[0.0047972724,0.0003414319,0.0011609464,0.0026595325,0.00044937307,0.00294288,0.0006442048,0.001849263,0.0029344105],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00030780068,0.00042672153,0.0049027624,0.00047557804,0.00014726626,0.00032778995,0.00023209144,0.3614134,0.010918798,0.01771246,0.013935612,0.58919966],"study_design_scores_gemma":[0.0000062147724,0.00004100874,0.0004281575,0.00002332433,0.000017852917,0.000080180645,0.000013982425,0.99123085,0.0012581603,0.0042526643,0.0026360543,0.000011605354],"about_ca_topic_score_codex":0.0049522864,"about_ca_topic_score_gemma":0.0042092917,"teacher_disagreement_score":0.0049522864,"about_ca_system_score_codex":0.0013836932,"about_ca_system_score_gemma":0.0011494232,"threshold_uncertainty_score":0.010039449},"labels":[],"label_agreement":null},{"id":"W4410863961","doi":"10.1007/978-3-031-84756-1_3","title":"An Introduction to ML Through PCG","year":2025,"lang":"en","type":"book-chapter","venue":"Synthesis lectures on games and computational intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Sudbury; University of Alberta","funders":"","keywords":"Computer science; History","score_opus":0.020586847759865076,"score_gpt":0.28160711620189516,"score_spread":0.2610202684420301,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4410863961","genre_codex":"methods","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0009886697,0.0057055987,0.70810306,0.0021663723,0.0019490351,0.00008130543,0.00072179467,0.008466909,0.27181724],"genre_scores_gemma":[0.057268832,0.009726951,0.37035525,0.0022144485,0.0037190933,0.00026905627,0.0018310053,0.0050161006,0.5495993],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99948066,0.00008990903,0.00002786426,0.0001215495,0.00023643908,0.000043576543],"domain_scores_gemma":[0.9994935,0.00026981378,0.0000145456825,0.000092588176,0.00009756968,0.000031971813],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0003732999,0.00097443454,0.000688138,0.0011927106,0.0005968679,0.0028558972,0.0010076368,0.00096246833,0.0929864],"category_scores_gemma":[0.0019515407,0.00049097906,0.0004914047,0.0016299582,0.0012664957,0.0030030007,0.0016126804,0.0020795164,0.045283798],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000038667113,0.000044772667,0.00007894201,0.00021662014,0.000010063473,0.000080687154,0.00012400669,0.0029612023,0.0024536802,0.19197293,0.12455191,0.67746645],"study_design_scores_gemma":[0.0000113578535,0.000030283303,0.0001534166,0.00014823841,0.000008010712,0.00023636821,0.00004238075,0.0109910425,0.0034398308,0.22865745,0.75625545,0.00002623172],"about_ca_topic_score_codex":0.0013043103,"about_ca_topic_score_gemma":0.0016699488,"teacher_disagreement_score":0.0929864,"about_ca_system_score_codex":0.00088366494,"about_ca_system_score_gemma":0.0006573284,"threshold_uncertainty_score":0.3110705},"labels":[],"label_agreement":null},{"id":"W4411799602","doi":"10.1109/lsp.2025.3584670","title":"A Novel Evaluation Criterion for Density Clustering via Circular Information Granules","year":2025,"lang":"en","type":"article","venue":"IEEE Signal Processing Letters","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Cluster analysis; Mathematics; Computer science; Pattern recognition (psychology); Probability density function; Data mining; Artificial intelligence; Statistics","score_opus":0.02650558789289352,"score_gpt":0.2806127953078521,"score_spread":0.25410720741495857,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4411799602","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.018365547,0.0007569348,0.97761995,0.00018493299,0.00006076457,0.00012380129,0.00013779876,0.00030090014,0.0024494035],"genre_scores_gemma":[0.56078607,0.0009217198,0.43443665,0.00019260433,0.00022746665,0.0004908634,0.00070208876,0.00022804223,0.0020143744],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9960729,0.00096212846,0.0003346363,0.00055061345,0.0018390908,0.00024073613],"domain_scores_gemma":[0.9943011,0.0020419569,0.00052085373,0.00037307892,0.002546153,0.00021688634],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0037062385,0.0011157937,0.0013635183,0.004522385,0.0010113828,0.0030052215,0.0012969323,0.0012258785,0.0012240893],"category_scores_gemma":[0.013317383,0.00035273205,0.0009036229,0.003063692,0.0015099266,0.0035452682,0.0017392981,0.0008390896,0.00038217258],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009020556,0.00019268064,0.010170492,0.0009572698,0.00034378664,0.00043845526,0.00089845574,0.32498237,0.032539062,0.1920671,0.010953657,0.42555454],"study_design_scores_gemma":[0.000036584344,0.00014914408,0.0026167503,0.00006786518,0.0000736983,0.00021641373,0.00017061923,0.95396715,0.009014372,0.029063761,0.004532389,0.000091259375],"about_ca_topic_score_codex":0.002956334,"about_ca_topic_score_gemma":0.0014685764,"teacher_disagreement_score":0.004522385,"about_ca_system_score_codex":0.0021057562,"about_ca_system_score_gemma":0.0012333491,"threshold_uncertainty_score":0.01960069},"labels":[],"label_agreement":null},{"id":"W4412353994","doi":"10.2139/ssrn.5348737","title":"Land Cover Classification and Change Detection Using Large Language Models: A Novel Benchmark Study for Remote Sensing Applications","year":2025,"lang":"en","type":"preprint","venue":"SSRN Electronic Journal","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Guelph","funders":"","keywords":"Benchmark (surveying); Land cover; Cover (algebra); Change detection; Remote sensing; Computer science; Data mining; Natural language processing; Artificial intelligence; Land use; Geography; Cartography; Engineering","score_opus":0.05303684395705223,"score_gpt":0.31590635339267226,"score_spread":0.26286950943562004,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4412353994","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8646558,0.0032345892,0.11438971,0.0015217505,0.000289372,0.00035526147,0.007949292,0.0018940873,0.005710176],"genre_scores_gemma":[0.9261455,0.00048656896,0.05945997,0.00019025772,0.00023144881,0.0001552579,0.01089893,0.0001759489,0.0022562668],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99779934,0.00094187615,0.00016593793,0.0005281021,0.00039298245,0.0001716841],"domain_scores_gemma":[0.99007016,0.0068167523,0.0004985057,0.0013706522,0.0009659151,0.00027801588],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0042529996,0.0014764484,0.0011198743,0.0019758418,0.0009645871,0.0025052202,0.0018246502,0.0021718235,0.0015555301],"category_scores_gemma":[0.012939594,0.00027719722,0.0010939784,0.0024206075,0.000910439,0.0029874826,0.0013798566,0.0013978359,0.0007466894],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002571415,0.0034157406,0.055765126,0.0009589516,0.00082705944,0.00084390235,0.00038988746,0.5214036,0.011814935,0.0075359615,0.019595195,0.37487817],"study_design_scores_gemma":[0.00007021798,0.00033233393,0.007256706,0.000014677895,0.00007242339,0.00015598163,0.00018807477,0.98156273,0.0034645402,0.0053838277,0.001471849,0.000026674346],"about_ca_topic_score_codex":0.015453298,"about_ca_topic_score_gemma":0.014191025,"teacher_disagreement_score":0.015453298,"about_ca_system_score_codex":0.0011319768,"about_ca_system_score_gemma":0.001071371,"threshold_uncertainty_score":0.03072673},"labels":[],"label_agreement":null},{"id":"W4412512470","doi":"10.1007/978-981-96-6688-1_28","title":"A Simultaneous Hierarchical Count Data Clustering and Feature Selection Based on Multinomial Nested Dirichlet Mixture Using the Minorization-Maximization Framework","year":2025,"lang":"en","type":"book-chapter","venue":"Communications in computer and information science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Computer science; Multinomial distribution; Feature selection; Latent Dirichlet allocation; Selection (genetic algorithm); Hierarchical Dirichlet process; Dirichlet distribution; Cluster analysis; Maximization; Hierarchical clustering; Count data; Data mining; Artificial intelligence; Statistics; Topic model; Mathematics; Mathematical optimization","score_opus":0.034810372676734196,"score_gpt":0.3026684632058938,"score_spread":0.2678580905291596,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4412512470","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0013090096,0.00006543446,0.9979831,0.000035656736,0.000015377773,0.000027767375,0.00004120686,0.0003536065,0.00016885759],"genre_scores_gemma":[0.03465008,0.00013347734,0.9608267,0.00009681075,0.00009128086,0.00028599866,0.0007155222,0.00037906773,0.0028210613],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9965647,0.0012423736,0.00020132787,0.00083461934,0.00089710136,0.00025991915],"domain_scores_gemma":[0.9965223,0.0018973071,0.00016623955,0.0005129294,0.0007379794,0.00016327546],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032546716,0.0015690866,0.004011118,0.002037213,0.0017369079,0.002235496,0.00620163,0.0016770134,0.0034685472],"category_scores_gemma":[0.007908129,0.0015110953,0.0036207442,0.003593362,0.0014424388,0.0030093174,0.0049799704,0.0025446292,0.0024886064],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006092833,0.00034317092,0.002046232,0.00041484932,0.0005228596,0.00029883327,0.0007351476,0.19011132,0.024005534,0.075339586,0.015917799,0.68965536],"study_design_scores_gemma":[0.00001633296,0.00003127278,0.00029825658,0.000008831851,0.000031917967,0.00008904972,0.00003448089,0.9747898,0.0021529654,0.020574264,0.0019394245,0.00003350494],"about_ca_topic_score_codex":0.008089202,"about_ca_topic_score_gemma":0.012794583,"teacher_disagreement_score":0.008089202,"about_ca_system_score_codex":0.0014347619,"about_ca_system_score_gemma":0.002266384,"threshold_uncertainty_score":0.01721251},"labels":[],"label_agreement":null},{"id":"W4412620322","doi":"10.1007/978-981-96-7423-7_9","title":"NLP Combined with Bi-LSTM Classifier Based Intent Detection Algorithm for Smart House Control Using WhatsApp Message","year":2025,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Royal Military College of Canada","funders":"","keywords":"Computer science; Classifier (UML); Artificial intelligence; Machine learning; Natural language processing","score_opus":0.01943103631634458,"score_gpt":0.24352514535941552,"score_spread":0.22409410904307095,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4412620322","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08876973,0.0009876981,0.8818501,0.00037035678,0.00058187114,0.00018027247,0.0015259082,0.015770372,0.0099637415],"genre_scores_gemma":[0.5985316,0.00058827485,0.37172648,0.0004168912,0.00018039094,0.0002671108,0.0038875737,0.00037642947,0.024025219],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99986625,0.000014527009,0.000010499747,0.00004100027,0.000045569606,0.00002222093],"domain_scores_gemma":[0.9998903,0.00002848575,0.0000077980285,0.000012888571,0.00005512489,0.000005429306],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00016228997,0.0005799792,0.00044663585,0.00041470057,0.00026999915,0.00034415905,0.0004863365,0.00046305294,0.0043118596],"category_scores_gemma":[0.00034763882,0.00016245099,0.00039857827,0.00039777963,0.00009504341,0.00069507083,0.00036025196,0.0006126019,0.0018858408],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00034576745,0.00020843487,0.0008139212,0.0001956545,0.00003314194,0.00027465742,0.00011000382,0.013430145,0.08422264,0.0011300846,0.012114948,0.8871207],"study_design_scores_gemma":[0.000028173556,0.0001832459,0.002466958,0.000026914897,0.000057204466,0.00014519686,0.00009394419,0.932222,0.05641963,0.0018830661,0.006447393,0.000026333646],"about_ca_topic_score_codex":0.005189186,"about_ca_topic_score_gemma":0.0064875283,"teacher_disagreement_score":0.005189186,"about_ca_system_score_codex":0.00020504698,"about_ca_system_score_gemma":0.00041597194,"threshold_uncertainty_score":0.014424622},"labels":[],"label_agreement":null},{"id":"W4413679785","doi":"10.1109/compsac65507.2025.00049","title":"A Late Fusion Approach Using CSNNs for Multi-Modal Toxicity Detection in Online Media","year":2025,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of the Fraser Valley","funders":"","keywords":"Modal; Computer science; Fusion; Materials science; Linguistics; Composite material; Philosophy","score_opus":0.07134076682124128,"score_gpt":0.3228740942330066,"score_spread":0.2515333274117653,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4413679785","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08863252,0.00081135595,0.90222836,0.00044755483,0.00021274928,0.0000886815,0.00044240648,0.0033251506,0.0038111736],"genre_scores_gemma":[0.8303565,0.0005640755,0.16050692,0.00050509424,0.00011987982,0.00010922741,0.00079335494,0.00016590687,0.006879006],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99975747,0.00002868502,0.000012899301,0.00008229011,0.00008002567,0.00003867811],"domain_scores_gemma":[0.99951553,0.00012251141,0.000069533824,0.000049724727,0.0002066648,0.00003609652],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000612156,0.001001325,0.0006254998,0.0009852359,0.00034792162,0.0006656757,0.0009594872,0.0008117928,0.0011515695],"category_scores_gemma":[0.0015335184,0.00023426981,0.0007162713,0.00057446084,0.0003851536,0.0013079852,0.0011359953,0.0010976174,0.00062521885],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007331513,0.0004399027,0.0086601,0.00029167376,0.00019725291,0.0004945049,0.00023398199,0.13869415,0.21299991,0.0042451173,0.0051488066,0.6278615],"study_design_scores_gemma":[0.000007025381,0.00015855292,0.0024747495,0.000017895376,0.00005579847,0.00012724422,0.000059467213,0.95430684,0.036240354,0.004549711,0.001969791,0.00003264731],"about_ca_topic_score_codex":0.0030512984,"about_ca_topic_score_gemma":0.0059973015,"teacher_disagreement_score":0.0030512984,"about_ca_system_score_codex":0.0007110047,"about_ca_system_score_gemma":0.0005596808,"threshold_uncertainty_score":0.006067097},"labels":[],"label_agreement":null},{"id":"W4413912352","doi":"10.5267/j.ijdns.2024.11.003","title":"Multi-label classification analysis with modified C-Tran on SCIN dataset ,","year":2025,"lang":"en","type":"article","venue":"International Journal of Data and Network Science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Computer science; Business","score_opus":0.07758290269645432,"score_gpt":0.3729983239875304,"score_spread":0.2954154212910761,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4413912352","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.38428536,0.018599352,0.12959835,0.0064591235,0.007370568,0.0033566148,0.3676471,0.05513183,0.027551763],"genre_scores_gemma":[0.33689648,0.0015382267,0.105489366,0.0015614568,0.00064839167,0.0017843733,0.540997,0.0013647156,0.009719991],"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9946544,0.0011560143,0.0005564721,0.0015906683,0.0014489472,0.00059351703],"domain_scores_gemma":[0.9929892,0.00247526,0.0004359533,0.0010887494,0.0025822162,0.00042857233],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007172796,0.0048341677,0.0021839559,0.007915155,0.0019970625,0.003407036,0.003546608,0.0030733733,0.006662468],"category_scores_gemma":[0.014721639,0.00043486612,0.0035241751,0.0046185534,0.0010844965,0.0030647262,0.0024537703,0.0038318262,0.0056260303],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0032422922,0.0028295666,0.066043116,0.0030492404,0.0016592019,0.0014415878,0.00058828725,0.06804741,0.006471262,0.0036365145,0.48345602,0.35953543],"study_design_scores_gemma":[0.0004993724,0.001284652,0.028807439,0.0004883593,0.0005228993,0.0010594343,0.0016466464,0.85640746,0.0131800445,0.008732973,0.08706929,0.0003014528],"about_ca_topic_score_codex":0.03699351,"about_ca_topic_score_gemma":0.05493728,"teacher_disagreement_score":0.03699351,"about_ca_system_score_codex":0.0036932302,"about_ca_system_score_gemma":0.0029622486,"threshold_uncertainty_score":0.07355636},"labels":[],"label_agreement":null},{"id":"W4414059432","doi":"10.1007/s10032-025-00555-5","title":"Optimizing identity documents classification in online systems: A comparative analysis","year":2025,"lang":"en","type":"article","venue":"International Journal on Document Analysis and Recognition (IJDAR)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"International Medias Data Services (Canada)","funders":"","keywords":"Convolutional neural network; Context (archaeology); Identity (music); Process (computing); A priori and a posteriori; Identity management; Strengths and weaknesses","score_opus":0.04133032381567437,"score_gpt":0.3529996195214886,"score_spread":0.31166929570581425,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4414059432","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7729157,0.009723417,0.20104359,0.0008119297,0.00011029223,0.00022365607,0.0003382258,0.0012894267,0.013543718],"genre_scores_gemma":[0.95673835,0.0010535634,0.039462555,0.000044751014,0.00005290896,0.00003120682,0.0003175625,0.00010486689,0.002194254],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.9962226,0.001597066,0.00026620255,0.0004376067,0.0010889465,0.00038748313],"domain_scores_gemma":[0.98342544,0.012204483,0.00058602635,0.0012385686,0.0023460423,0.00019944971],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0038859788,0.00051735085,0.0012554851,0.0018144198,0.0006531327,0.0025822977,0.0009905263,0.00086469715,0.0029116606],"category_scores_gemma":[0.013199641,0.00020562121,0.000579562,0.0025703362,0.000477263,0.0029908847,0.00065281807,0.0005551391,0.00060090487],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018007542,0.0009792936,0.013906866,0.00033728115,0.00016612529,0.00006942569,0.0001829324,0.17996256,0.00524734,0.006726855,0.003333638,0.787287],"study_design_scores_gemma":[0.000031990665,0.00059271953,0.00863424,0.000016799317,0.00014046513,0.00009505334,0.00030504362,0.9785832,0.0062229633,0.0036775498,0.0016794674,0.000020476271],"about_ca_topic_score_codex":0.008352025,"about_ca_topic_score_gemma":0.006963532,"teacher_disagreement_score":0.008352025,"about_ca_system_score_codex":0.002479901,"about_ca_system_score_gemma":0.0019117048,"threshold_uncertainty_score":0.020551324},"labels":[],"label_agreement":null},{"id":"W4414117165","doi":"10.1109/fuzz62266.2025.11152226","title":"Dynamic Recursive Fuzzy ART Multi-label Classifier","year":2025,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Classifier (UML); Fuzzy logic; Adaptive resonance theory; Pattern recognition (psychology); Incremental learning; Noisy data; Fuzzy classification; Fuzzy control system","score_opus":0.02345672928870909,"score_gpt":0.3015598249915767,"score_spread":0.2781030957028676,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4414117165","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015210801,0.00038083707,0.980368,0.00022610443,0.00008577922,0.000079873935,0.00007589116,0.0010240873,0.0025487025],"genre_scores_gemma":[0.42312002,0.0002569228,0.56901836,0.00059121696,0.0001890445,0.0002641575,0.00042218657,0.00021664119,0.0059214435],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99787045,0.00042905938,0.00009305077,0.00056479924,0.0008171513,0.00022551825],"domain_scores_gemma":[0.99665964,0.0013487934,0.00025752315,0.00045713608,0.0011673719,0.0001095947],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0030323826,0.0010097225,0.0017470563,0.0022281203,0.0012085392,0.0021975143,0.004077094,0.003013756,0.002922581],"category_scores_gemma":[0.007752059,0.00049660885,0.0014004936,0.0011912913,0.0011646793,0.0028636735,0.0018735477,0.0026683868,0.0014664507],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00026388344,0.00024855186,0.002548304,0.00014675542,0.00013221579,0.00016958559,0.00024937445,0.26896673,0.013783019,0.024184544,0.007966212,0.6813408],"study_design_scores_gemma":[0.000004180551,0.000021047283,0.00011571745,0.000006811698,0.0000086959835,0.000031290063,0.000008200953,0.9944969,0.0015893414,0.0031271465,0.00058063405,0.000010048764],"about_ca_topic_score_codex":0.0056421063,"about_ca_topic_score_gemma":0.007118452,"teacher_disagreement_score":0.0056421063,"about_ca_system_score_codex":0.0014862997,"about_ca_system_score_gemma":0.0012138261,"threshold_uncertainty_score":0.016036987},"labels":[],"label_agreement":null},{"id":"W4414230855","doi":"10.1109/gem66882.2025.11155795","title":"LADDER: Level Analysis Dataset for Difficulty Evaluation and Ranking","year":2025,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Chicoutimi","funders":"","keywords":"Ranking (information retrieval); Bridge (graph theory); Limiting; Resource (disambiguation); Object (grammar); Focus (optics)","score_opus":0.07098476990132718,"score_gpt":0.3651269513298248,"score_spread":0.29414218142849763,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4414230855","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014106402,0.00037413108,0.008477895,0.00039864157,0.0002006058,0.0006499722,0.9640479,0.004557578,0.0071868626],"genre_scores_gemma":[0.01131821,0.00011398654,0.010084289,0.0001239477,0.00003722366,0.0012740899,0.974685,0.00023519683,0.0021281552],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9969675,0.0004555245,0.00058755727,0.0007099717,0.001000596,0.00027891874],"domain_scores_gemma":[0.9934324,0.001505107,0.0007086157,0.0016215063,0.0022130287,0.00051922374],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0021631112,0.0017922027,0.00094882783,0.005265758,0.00095598324,0.00234111,0.0025907857,0.0019336673,0.012445076],"category_scores_gemma":[0.011795005,0.00039072696,0.0014518353,0.0041615246,0.00051162526,0.002148062,0.00258441,0.002110941,0.018925631],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005229251,0.0006528895,0.022194253,0.0012329416,0.00014718459,0.00016038962,0.00029223456,0.0026253285,0.0021094775,0.0042751217,0.8963968,0.06939038],"study_design_scores_gemma":[0.00049090345,0.00033918204,0.085154966,0.0006332318,0.00010919447,0.0005234156,0.0009861017,0.01699131,0.005175508,0.009528376,0.87985075,0.00021710961],"about_ca_topic_score_codex":0.010214124,"about_ca_topic_score_gemma":0.02219634,"teacher_disagreement_score":0.012445076,"about_ca_system_score_codex":0.0015150836,"about_ca_system_score_gemma":0.0018622156,"threshold_uncertainty_score":0.04163289},"labels":[],"label_agreement":null},{"id":"W4414360013","doi":"10.18280/mmep.120835","title":"Enhanced Text Extraction: Combining Bacteria Foraging Optimization Algorithm-Optimized Scale-Invariant Feature Transform with Machine Learning for Robust Performance","year":2025,"lang":"en","type":"article","venue":"Mathematical Modelling and Engineering Problems","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Pattern recognition (psychology); Feature (linguistics); Support vector machine; Feature selection; Foraging; Training set","score_opus":0.013538007089078518,"score_gpt":0.21107193211330813,"score_spread":0.19753392502422962,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4414360013","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.019170016,0.000489237,0.97549736,0.00013179859,0.00007529839,0.00005894156,0.0001173843,0.003128878,0.001331075],"genre_scores_gemma":[0.29412666,0.00039002896,0.6974141,0.00025099865,0.00012150258,0.00015730681,0.0008982326,0.00055145,0.0060897092],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99964964,0.000036264337,0.000023316861,0.00008590111,0.00016395506,0.000040886636],"domain_scores_gemma":[0.9996785,0.00008757425,0.00004488974,0.000052103213,0.0001211243,0.000015840546],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005596736,0.0009208631,0.0009767998,0.0011598704,0.0002935267,0.00076121517,0.0011333519,0.0008986108,0.0020984835],"category_scores_gemma":[0.0015962002,0.00024954544,0.00080631906,0.0010614288,0.00030975026,0.0014286212,0.00057173165,0.0006574704,0.0022953334],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00025624316,0.0001519242,0.0010987902,0.00014633374,0.00010633495,0.00015445212,0.00005684794,0.09214259,0.10049278,0.0031310339,0.007008587,0.795254],"study_design_scores_gemma":[0.000018216888,0.00005861302,0.0004679437,0.0000068998397,0.00001912596,0.00008904621,0.000012701172,0.97350186,0.022073993,0.0014809322,0.0022547713,0.000016003549],"about_ca_topic_score_codex":0.0025251627,"about_ca_topic_score_gemma":0.0030844545,"teacher_disagreement_score":0.0025251627,"about_ca_system_score_codex":0.00046744363,"about_ca_system_score_gemma":0.0005933215,"threshold_uncertainty_score":0.0070200562},"labels":[],"label_agreement":null},{"id":"W4415185722","doi":"10.1016/j.prevetmed.2025.106723","title":"Automating classification of veterinary biosecurity recommendations using machine learning","year":2025,"lang":"en","type":"article","venue":"Preventive Veterinary Medicine","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Association des Médecins Vétérinaires du Québec; University of Guelph; University of Calgary; Université de Montréal; Cegep de Saint Hyacinthe","funders":"Ville de Québec; Novalait; Université de Montréal; Dairy Farmers of Canada; Natural Sciences and Engineering Research Council of Canada; Ministère de l'Agriculture, des Pêcheries et de l'Alimentation","keywords":"Biosecurity; Random forest; Support vector machine; Naive Bayes classifier; Consistency (knowledge bases); Linear discriminant analysis; Bayes' theorem; Quality assurance","score_opus":0.09194989337965144,"score_gpt":0.3794110015846574,"score_spread":0.287461108205006,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4415185722","genre_codex":"empirical","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.66501456,0.0055155456,0.27747446,0.0025737882,0.00052772975,0.0016343603,0.021581603,0.015536324,0.010141614],"genre_scores_gemma":[0.739572,0.0010283726,0.22543259,0.00031532577,0.000124353,0.00038723863,0.025561707,0.0001186157,0.007459801],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99905103,0.00023572383,0.00011767273,0.0002742187,0.00022531312,0.00009603307],"domain_scores_gemma":[0.99576026,0.0022331083,0.00033231816,0.00021121331,0.0013914631,0.00007160449],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001463788,0.00084412907,0.00052238314,0.0027565777,0.00046000304,0.001313889,0.0007153125,0.00084392435,0.0013042955],"category_scores_gemma":[0.005208849,0.00014905435,0.0005362672,0.0015261918,0.0001933914,0.00090434076,0.00027168175,0.00070986385,0.0015034906],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002963469,0.00041891533,0.05246766,0.0005918438,0.000121432546,0.00039310727,0.00047899605,0.029408816,0.01587973,0.00067439274,0.02526246,0.87400645],"study_design_scores_gemma":[0.000054462133,0.0002649211,0.052310146,0.00026516072,0.00012729698,0.00031669094,0.0008691048,0.89896744,0.021431543,0.0018925312,0.023438532,0.00006212479],"about_ca_topic_score_codex":0.07383468,"about_ca_topic_score_gemma":0.09377553,"teacher_disagreement_score":0.07383468,"about_ca_system_score_codex":0.001578247,"about_ca_system_score_gemma":0.0022599043,"threshold_uncertainty_score":0.14680982},"labels":[],"label_agreement":null},{"id":"W4415524230","doi":"10.1109/ubmk67458.2025.11206854","title":"Demographic-Aware Product Recommendation through Heterogeneous Graph Neural Networks","year":2025,"lang":"","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Nexen (Canada)","funders":"","keywords":"Recommender system; Graph; Scalability; Collaborative filtering; Matrix decomposition; Artificial neural network; Product (mathematics); Convolution (computer science)","score_opus":0.024751924016009466,"score_gpt":0.2795145131428526,"score_spread":0.25476258912684313,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4415524230","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.38009864,0.0016148987,0.6051019,0.00091408036,0.00018852648,0.0001209791,0.0011385683,0.0043667178,0.00645574],"genre_scores_gemma":[0.9334862,0.00032567448,0.06074814,0.00022610095,0.00006075624,0.00004466511,0.0010615502,0.00004494473,0.0040019033],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9998037,0.000040192277,0.000008659624,0.00007451992,0.000039233117,0.000033722154],"domain_scores_gemma":[0.9995819,0.00017557164,0.000047413134,0.000053104395,0.00011676523,0.000025242141],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00042338722,0.0006336754,0.00046489167,0.000877322,0.00030767353,0.00051186327,0.0009875181,0.0005929184,0.00080313295],"category_scores_gemma":[0.0015485628,0.00029006848,0.00051543984,0.00095279654,0.00020002662,0.0010700016,0.00040224302,0.000724717,0.0004087926],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024727176,0.0003556531,0.010621582,0.000068610534,0.0001666175,0.0001334157,0.00008866272,0.6028781,0.0047829356,0.0033963998,0.005890084,0.3713707],"study_design_scores_gemma":[0.0000032457751,0.000023590119,0.0007453989,0.0000030517913,0.000013779299,0.000012287956,0.000007274113,0.9971846,0.00055057724,0.0011829735,0.0002697116,0.0000036536935],"about_ca_topic_score_codex":0.03100377,"about_ca_topic_score_gemma":0.05769288,"teacher_disagreement_score":0.03100377,"about_ca_system_score_codex":0.00084062293,"about_ca_system_score_gemma":0.0004889251,"threshold_uncertainty_score":0.06164664},"labels":[],"label_agreement":null},{"id":"W4416109760","doi":"10.1093/comjnl/bxaf124","title":"CV content recognition using YOLOv8 and Tesseract-OCR deep learning","year":2025,"lang":"en","type":"article","venue":"The Computer Journal","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Preprocessor; Consistency (knowledge bases); Sorting; Variety (cybernetics); Deep learning; Hyperparameter; Analytics; Precision and recall; Component (thermodynamics)","score_opus":0.06729306244984125,"score_gpt":0.276650143117134,"score_spread":0.20935708066729275,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4416109760","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.30787128,0.0040771463,0.5633147,0.0006838195,0.0013296196,0.0011077701,0.011315598,0.089231506,0.021068657],"genre_scores_gemma":[0.51635957,0.0011652892,0.43528363,0.0003695506,0.00022165329,0.0005203247,0.020668479,0.0009845734,0.024426896],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9992926,0.0000549402,0.000052038216,0.00026805315,0.00022261926,0.00010961001],"domain_scores_gemma":[0.99917716,0.00014940661,0.00008575952,0.00015674814,0.00037572425,0.00005524013],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00066458853,0.0012692007,0.0008675903,0.004115173,0.00039982304,0.001390938,0.0016395078,0.0010753112,0.006908273],"category_scores_gemma":[0.002143545,0.0002829897,0.00095349946,0.0018270228,0.00031404043,0.0012310898,0.0010427227,0.0010367507,0.0072122803],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00029861685,0.0001886371,0.0022137198,0.00021321431,0.000055926226,0.00010690266,0.000051696472,0.00934876,0.028996125,0.00047562728,0.014428193,0.9436225],"study_design_scores_gemma":[0.00005459574,0.00025190177,0.008821333,0.00010675116,0.000094410476,0.00020575138,0.00017389253,0.89869165,0.07440101,0.0010810308,0.016045801,0.0000719707],"about_ca_topic_score_codex":0.011840108,"about_ca_topic_score_gemma":0.0122291725,"teacher_disagreement_score":0.011840108,"about_ca_system_score_codex":0.00088678324,"about_ca_system_score_gemma":0.00087476266,"threshold_uncertainty_score":0.023542404},"labels":[],"label_agreement":null},{"id":"W4416136027","doi":"10.48550/arxiv.2506.05027","title":"Tuning the Right Foundation Models is What you Need for Partial Label Learning","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Canadian Institute for Advanced Research","keywords":"Ambiguity; Initialization; Foundation (evidence); Benchmark (surveying); Classifier (UML); Convolutional neural network; Model selection","score_opus":0.08464897028036827,"score_gpt":0.3101483991326191,"score_spread":0.22549942885225083,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4416136027","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.030938534,0.0024514864,0.93781126,0.008496846,0.00044284042,0.0001954579,0.0012996269,0.012802732,0.0055612694],"genre_scores_gemma":[0.24638906,0.0015465732,0.733588,0.0045182174,0.00044080804,0.0004541489,0.005842989,0.0025576213,0.0046625524],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99645835,0.001477587,0.00016632148,0.0010309016,0.00061761163,0.0002493243],"domain_scores_gemma":[0.98776186,0.0037987225,0.0005646868,0.0060525457,0.00129514,0.00052705995],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0070794984,0.0020127543,0.0015241136,0.0011852635,0.0014571415,0.003312396,0.0031918744,0.0030063905,0.004413584],"category_scores_gemma":[0.02209309,0.0007879058,0.0015494935,0.0012985435,0.0028358044,0.015110986,0.004203607,0.0071728807,0.006071779],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006275628,0.0005297248,0.012345978,0.0007931733,0.00032943382,0.00019504294,0.0008363671,0.080222584,0.014712748,0.04910922,0.09299237,0.74730587],"study_design_scores_gemma":[0.00012815808,0.00036568305,0.0020500522,0.0004894572,0.00012318204,0.00039921864,0.00085529085,0.6809211,0.0121171465,0.24561204,0.056784354,0.00015431903],"about_ca_topic_score_codex":0.0044623343,"about_ca_topic_score_gemma":0.01084767,"teacher_disagreement_score":0.0070794984,"about_ca_system_score_codex":0.0015371733,"about_ca_system_score_gemma":0.002206031,"threshold_uncertainty_score":0.03744042},"labels":[],"label_agreement":null},{"id":"W4417112536","doi":"10.21203/rs.3.rs-7724663/v1","title":"Evolutionary Feature-wise Thresholding for Binary Representation of NLP Embeddings","year":2025,"lang":"","type":"preprint","venue":"Research Square","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Wilfrid Laurier University; Brock University","funders":"","keywords":"Binary number; Thresholding; Representation (politics); Embedding; Pattern recognition (psychology); Range (aeronautics); Key (lock)","score_opus":0.11120563944789606,"score_gpt":0.4393729790355389,"score_spread":0.3281673395876428,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4417112536","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.044712104,0.00022420115,0.9516436,0.00029402468,0.000103570586,0.000063053056,0.00020287983,0.0011137235,0.0016429083],"genre_scores_gemma":[0.45599818,0.00019093814,0.5368401,0.00018341892,0.0000807782,0.00019125635,0.0011853991,0.00048632285,0.0048436173],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9992017,0.00019088609,0.000065456785,0.00024455882,0.00019452664,0.00010282743],"domain_scores_gemma":[0.997758,0.0010469379,0.0001614709,0.00036556306,0.000589942,0.0000780686],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012876402,0.00044607228,0.0008102387,0.0012337016,0.0004644983,0.0013944382,0.0011538051,0.0011058984,0.0038054069],"category_scores_gemma":[0.007625193,0.00027445127,0.0006174754,0.001276972,0.00066405896,0.0015070395,0.0012114189,0.0013990519,0.0011871816],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022316613,0.00015356438,0.0020161734,0.00015595279,0.00004699489,0.00008842082,0.00018204216,0.062876135,0.033589438,0.024034437,0.0054277177,0.871206],"study_design_scores_gemma":[0.000017224416,0.0000744955,0.0012176869,0.000035625108,0.000021067439,0.00012249175,0.000057368474,0.96097594,0.012203055,0.023567075,0.0016939001,0.000014001322],"about_ca_topic_score_codex":0.0016904998,"about_ca_topic_score_gemma":0.0021406983,"teacher_disagreement_score":0.0038054069,"about_ca_system_score_codex":0.00071741693,"about_ca_system_score_gemma":0.00077757786,"threshold_uncertainty_score":0.0127303},"labels":[],"label_agreement":null},{"id":"W4417210052","doi":"10.1093/jssam/smaf023","title":"Analyzing List-Style Open-Ended Questions: Combining Texts from Individual Answer Boxes Improves Classification with Language Models","year":2025,"lang":"en","type":"article","venue":"Journal of Survey Statistics and Methodology","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Classifier (UML); Factorial; Transformer; Language model; Encoder; Question answering","score_opus":0.1819431608627828,"score_gpt":0.3925421491784883,"score_spread":0.21059898831570548,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4417210052","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.68798774,0.00043952648,0.30162558,0.0008992046,0.00015562554,0.00047997863,0.0012917059,0.0031625573,0.003958044],"genre_scores_gemma":[0.889342,0.00008131956,0.10671594,0.0001974179,0.0000836684,0.00030210023,0.0016400535,0.00016380993,0.0014737553],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9864066,0.009822274,0.00063785136,0.0015180345,0.0012468407,0.00036843237],"domain_scores_gemma":[0.85148835,0.12985285,0.0050208685,0.0047253342,0.0075901835,0.0013223919],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0120942015,0.00091549597,0.000964469,0.0021773477,0.00061363535,0.0026940643,0.0009943836,0.0015958027,0.0037622256],"category_scores_gemma":[0.07694288,0.00029345087,0.0008439714,0.0014864341,0.0006095132,0.0036184073,0.0018151754,0.0018397857,0.0021927457],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0046343505,0.0023906846,0.14412019,0.0012020796,0.00043594936,0.00022937125,0.0035191425,0.031262748,0.046536703,0.0036236418,0.011937998,0.75010717],"study_design_scores_gemma":[0.0001918038,0.001718379,0.0763791,0.00029994483,0.00028755155,0.00018623107,0.0022585567,0.84214526,0.056125503,0.013262848,0.006967902,0.00017694752],"about_ca_topic_score_codex":0.0011683746,"about_ca_topic_score_gemma":0.0017378266,"teacher_disagreement_score":0.9879058,"about_ca_system_score_codex":0.00081497844,"about_ca_system_score_gemma":0.00066869694,"threshold_uncertainty_score":0.06396103},"labels":[],"label_agreement":null},{"id":"W4417471484","doi":"10.1109/iccvdm66874.2025.11290528","title":"Fusion of Local and Global Context in Large Language Models for Text Classification","year":2025,"lang":"","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Ambiguity; Language model; Context (archaeology); Pooling; Word embedding; Representation (politics); Encoder; Context model","score_opus":0.023662733678754096,"score_gpt":0.30029385108595696,"score_spread":0.27663111740720286,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4417471484","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.05640631,0.0026643656,0.93542355,0.0003049338,0.00017887593,0.00008835505,0.00033360752,0.0032537864,0.0013461486],"genre_scores_gemma":[0.75357854,0.0011346147,0.23915693,0.00030294823,0.00032968985,0.0002474015,0.0012959494,0.0002819793,0.0036720682],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99951935,0.00014037821,0.000030442967,0.0001705179,0.00007739627,0.00006191495],"domain_scores_gemma":[0.9994936,0.00020964042,0.00006349617,0.00009067121,0.00010569194,0.000036871563],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00076181826,0.0014882095,0.00092059333,0.0010646137,0.0004765109,0.00083466707,0.001150939,0.00060776307,0.001174302],"category_scores_gemma":[0.0021124643,0.0003479331,0.0011227379,0.0011182176,0.00034587437,0.0025085267,0.0010939857,0.001443547,0.0008446062],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005178573,0.00028939647,0.0040735663,0.00027656113,0.000253629,0.00031751025,0.0003054873,0.18500969,0.029902719,0.009552635,0.0063056834,0.7631953],"study_design_scores_gemma":[0.000014408509,0.000084293126,0.0006336553,0.000018076818,0.00006813583,0.000047020018,0.000038777074,0.985435,0.0047594514,0.0070972526,0.0017861685,0.000017781904],"about_ca_topic_score_codex":0.0043231524,"about_ca_topic_score_gemma":0.009459482,"teacher_disagreement_score":0.0043231524,"about_ca_system_score_codex":0.0005927227,"about_ca_system_score_gemma":0.00087286514,"threshold_uncertainty_score":0.008596003},"labels":[],"label_agreement":null},{"id":"W4417477703","doi":"10.1002/eng2.70555","title":"Advertisement Image Classification—Visual ( <scp>RESNET</scp> ) Versus Textual ( <scp>BERT</scp> ) Features: An Experimental Study","year":2025,"lang":"en","type":"article","venue":"Engineering Reports","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Conestoga College","funders":"","keywords":"Newspaper; Set (abstract data type); Encoder; Transformer; The Internet; Contextual image classification","score_opus":0.014320708605344403,"score_gpt":0.2894027489401498,"score_spread":0.2750820403348054,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4417477703","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9800811,0.0014491696,0.0090780305,0.00035179948,0.0004212143,0.00028508122,0.0013520408,0.0011801952,0.0058014346],"genre_scores_gemma":[0.97387505,0.00058307016,0.016146027,0.00019255893,0.00013039717,0.00017513688,0.0045744483,0.00011974115,0.0042035785],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9991818,0.0002168395,0.000075093616,0.00020196906,0.00017583591,0.00014852166],"domain_scores_gemma":[0.99790025,0.0010150677,0.00016286179,0.0002779412,0.00048999663,0.00015383148],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0016070036,0.0016074842,0.00080113835,0.0010408771,0.00042825745,0.0010811064,0.0009895806,0.0011350975,0.0028591757],"category_scores_gemma":[0.0034311933,0.00030154208,0.0008400833,0.0006759266,0.00054719753,0.0013046564,0.0006593768,0.0013948838,0.0014949413],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.010351561,0.00989598,0.05281007,0.002030169,0.0010746642,0.0013476243,0.0008042211,0.08621428,0.06893325,0.0015631062,0.03971356,0.7252615],"study_design_scores_gemma":[0.00034480976,0.0037939367,0.047657136,0.0001903211,0.00064881786,0.0005910337,0.0011669025,0.87810147,0.06074758,0.0010357234,0.0056038518,0.00011834482],"about_ca_topic_score_codex":0.012594018,"about_ca_topic_score_gemma":0.00961395,"teacher_disagreement_score":0.012594018,"about_ca_system_score_codex":0.00070750143,"about_ca_system_score_gemma":0.00053062104,"threshold_uncertainty_score":0.025041401},"labels":[],"label_agreement":null},{"id":"W49807964","doi":"","title":"A simple feature selection method for text classification","year":2001,"lang":"en","type":"article","venue":"International Joint Conference on Artificial Intelligence","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":26,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval","funders":"","keywords":"Feature selection; Computer science; Information gain; Feature (linguistics); Simple (philosophy); Set (abstract data type); Artificial intelligence; Selection (genetic algorithm); Pattern recognition (psychology); Data mining; Feature extraction; Machine learning","score_opus":0.15109002272713962,"score_gpt":0.3835078255874474,"score_spread":0.23241780286030778,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W49807964","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008176571,0.00060472277,0.98605484,0.00016260719,0.00020293069,0.000689494,0.00061469054,0.002649612,0.00084469677],"genre_scores_gemma":[0.07247215,0.00043118387,0.9202034,0.0001619129,0.00024637708,0.0014105403,0.0016183472,0.00018871839,0.0032673497],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99710065,0.000722519,0.00023653159,0.0005252296,0.0012921275,0.00012290938],"domain_scores_gemma":[0.99792826,0.0010511316,0.000115721276,0.00022873624,0.00062509783,0.000051019608],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0022784034,0.0016513726,0.0020193376,0.0030226258,0.0009101505,0.0010760096,0.001194247,0.0013325766,0.0048206407],"category_scores_gemma":[0.0061564106,0.00031937924,0.0015829742,0.0039250413,0.0005095998,0.0014698151,0.00079559116,0.0009734111,0.0031602941],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00024898522,0.00016609926,0.0011294059,0.00028500814,0.00015984704,0.00014472411,0.00007858877,0.009971893,0.020315398,0.0020036877,0.0086727,0.9568236],"study_design_scores_gemma":[0.0005533823,0.001512734,0.014455852,0.00018226558,0.00048310476,0.0026629488,0.00018050514,0.7893302,0.082134776,0.026977953,0.08112256,0.00040375962],"about_ca_topic_score_codex":0.0014705411,"about_ca_topic_score_gemma":0.0013946374,"teacher_disagreement_score":0.0048206407,"about_ca_system_score_codex":0.0004149337,"about_ca_system_score_gemma":0.00075730233,"threshold_uncertainty_score":0.016126692},"labels":[],"label_agreement":null},{"id":"W66763315","doi":"10.1007/978-3-642-30217-6_2","title":"Active Learning for Hierarchical Text Classification","year":2012,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":22,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Computer science; Oracle; Text categorization; Categorization; Machine learning; Active learning (machine learning); Artificial intelligence; Multi-label classification; Hierarchical database model; Relation (database); Data mining; Information retrieval","score_opus":0.034292010814983995,"score_gpt":0.2791535654519344,"score_spread":0.24486155463695042,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W66763315","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0017202733,0.001110641,0.9937023,0.00013450174,0.00010023261,0.00004956038,0.0002358165,0.002145008,0.0008016892],"genre_scores_gemma":[0.084268674,0.0010790505,0.89681745,0.00022258678,0.00040423163,0.0004624135,0.002471022,0.0006188957,0.013655752],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9981572,0.0006342778,0.00015849213,0.00044730195,0.00050668046,0.0000960246],"domain_scores_gemma":[0.9944259,0.0039182403,0.00016982637,0.000851966,0.0005406308,0.0000933553],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0027344483,0.0012277471,0.001554114,0.0019192063,0.00080102234,0.0017890986,0.0038603365,0.0017761252,0.008097391],"category_scores_gemma":[0.0070738057,0.00085336354,0.0012615613,0.0021709318,0.0008883182,0.004047474,0.0021510157,0.0030752323,0.0044427556],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015714053,0.00015686202,0.00029413594,0.0002522182,0.00008025937,0.000049469476,0.00011664067,0.030730026,0.0049506812,0.021372233,0.017466487,0.92437387],"study_design_scores_gemma":[0.000024018374,0.000048511785,0.0002584118,0.00003434402,0.0000319609,0.00006613345,0.000027441147,0.8990626,0.0061600404,0.0846018,0.00966309,0.000021638782],"about_ca_topic_score_codex":0.0022565704,"about_ca_topic_score_gemma":0.0033484385,"teacher_disagreement_score":0.008097391,"about_ca_system_score_codex":0.00075526634,"about_ca_system_score_gemma":0.0006562681,"threshold_uncertainty_score":0.027088463},"labels":[],"label_agreement":null},{"id":"W68431266","doi":"","title":"Model Based Document Classification and Clustering","year":2008,"lang":"en","type":"article","venue":"International journal of tomography and simulation","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Cluster analysis; Computer science; Weighting; Pattern recognition (psychology); Dimensionality reduction; Artificial intelligence; Naive Bayes classifier; Classifier (UML); Data mining; Document clustering; Document classification; Support vector machine","score_opus":0.03912766990925967,"score_gpt":0.292956668367835,"score_spread":0.2538289984585753,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W68431266","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0021281447,0.00043449475,0.9939262,0.00022590466,0.000089833986,0.00023368259,0.00031379194,0.0013553672,0.001292565],"genre_scores_gemma":[0.035803635,0.00055689644,0.9584773,0.00012797127,0.00014635563,0.00051752187,0.0013391358,0.00022966087,0.0028015254],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99319106,0.0016414858,0.00052631216,0.0013696579,0.0029877434,0.00028377795],"domain_scores_gemma":[0.99461126,0.002018103,0.00033512342,0.0014339696,0.0014938165,0.0001077366],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0046804273,0.0012828349,0.00273651,0.006260696,0.0017968315,0.0049779266,0.0031816699,0.002113678,0.003873407],"category_scores_gemma":[0.012875069,0.00069093576,0.002220614,0.006034981,0.0011439109,0.0038215688,0.0019623637,0.0023384755,0.004310734],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012751517,0.00025984604,0.0020209916,0.0005035432,0.00026777812,0.00010354312,0.00040267588,0.10466201,0.0050271405,0.059013095,0.019790739,0.8078211],"study_design_scores_gemma":[0.0000256959,0.00007237069,0.00097256264,0.000079674224,0.00005577678,0.00031472198,0.00014428969,0.8929834,0.0059968955,0.06651921,0.032751903,0.00008356319],"about_ca_topic_score_codex":0.0048718536,"about_ca_topic_score_gemma":0.004738296,"teacher_disagreement_score":0.006260696,"about_ca_system_score_codex":0.0022320973,"about_ca_system_score_gemma":0.0022707053,"threshold_uncertainty_score":0.024752736},"labels":[],"label_agreement":null},{"id":"W6887713244","doi":"10.17600/18001062","title":"APPEAL ATL 19-2 cruise,Côtes De La Manche R/V","year":2019,"lang":"fr","type":"other","venue":"Institut Français de Recherche pour l'Exploitation de la Mer","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Nova scotia; Appeal; Western europe; Settlement (finance)","score_opus":0.12242737919141,"score_gpt":0.36933885016424317,"score_spread":0.24691147097283317,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6887713244","genre_codex":"empirical","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.46073148,0.0013566925,0.028376801,0.0023735946,0.00075730484,0.0013197741,0.04690682,0.0058923047,0.45228517],"genre_scores_gemma":[0.56579995,0.00076158077,0.040462043,0.00082613877,0.00014669097,0.0007294864,0.041854292,0.0022993363,0.3471205],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9995982,0.000024171546,0.0000074869035,0.00010002235,0.0001928029,0.00007729032],"domain_scores_gemma":[0.99932075,0.00008961047,0.000044152366,0.0000637254,0.00036034375,0.00012133492],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00051601796,0.000381283,0.0003155867,0.00078577484,0.0010150892,0.0014554912,0.000707285,0.00064772664,0.03371116],"category_scores_gemma":[0.0010305233,0.00037003172,0.00059815176,0.0010805714,0.0005267541,0.00073796883,0.0010541776,0.0012922955,0.0074297367],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0039480184,0.00046693475,0.1494852,0.0016902548,0.00031744826,0.0031645438,0.007134593,0.017369317,0.13856201,0.022129664,0.26176965,0.39396238],"study_design_scores_gemma":[0.00013231524,0.0005543109,0.24541111,0.00019409946,0.000039412418,0.00029032005,0.0024021424,0.0056990194,0.0058015543,0.0015409138,0.7378457,0.00008904361],"about_ca_topic_score_codex":0.28178412,"about_ca_topic_score_gemma":0.48744157,"teacher_disagreement_score":0.28178412,"about_ca_system_score_codex":0.0019438972,"about_ca_system_score_gemma":0.003650089,"threshold_uncertainty_score":0.5602879},"labels":[],"label_agreement":null},{"id":"W6920345536","doi":"10.6068/dp14ba8daf1dc3","title":"Trend 1961 - 2013. Statistics Canada. CANSIM: Construction - Machinery and Equipment | Country: Canada | Table: Flows and stocks of fixed non-residential capital, by sector of North American Industry Classification System (NAICS) and asset | Variable: Hyperbolic (delayed) end-year net stock, Computers (x 1,000,000), Mining and oil and gas extraction, Current prices | Units: $CAD, 1961-2013. Data-Planet™ Statistical Ready Reference by Conquest Systems, Inc. Dataset-ID: 075-001-034.","year":2015,"lang":"en","type":"other","venue":"Data Planet","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Economic statistics; Census; Official statistics; Summary statistics; Index (typography); Stock (firearms); Descriptive statistics; Investment (military); Publication; Capital (architecture)","score_opus":0.020323707901361513,"score_gpt":0.24353244910684727,"score_spread":0.22320874120548576,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6920345536","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000061498016,0.00003997316,0.000016732709,0.00007632152,0.000016558393,0.000007550378,0.999124,0.000040646737,0.00061680155],"genre_scores_gemma":[0.00081474346,0.00019201219,0.00020805371,0.00008405264,0.00001198938,0.000056677072,0.9957009,0.00005427519,0.0028772235],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9970451,0.00013746523,0.00030149956,0.00041944624,0.001384905,0.000711522],"domain_scores_gemma":[0.97329867,0.0009727969,0.0009787125,0.00077200227,0.022790397,0.0011874777],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012448801,0.0021421402,0.0022352843,0.008412409,0.0026211317,0.003964049,0.0043025855,0.0013395426,0.072210856],"category_scores_gemma":[0.015072232,0.001385189,0.001762388,0.03789568,0.0005746427,0.0021689208,0.0019990648,0.0025589217,0.043844637],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000022080832,0.0000066652105,0.0013509243,0.00022188881,0.000021083846,0.0000074886184,0.000018557272,0.00014282143,0.0000101944615,0.00040501336,0.9964451,0.0013482407],"study_design_scores_gemma":[0.0001419914,0.000011620613,0.028992841,0.00073778664,0.000066612956,0.000028271032,0.00043099193,0.0005774982,0.0002363243,0.0006710869,0.968026,0.000078925426],"about_ca_topic_score_codex":0.99312156,"about_ca_topic_score_gemma":0.99201715,"teacher_disagreement_score":0.072210856,"about_ca_system_score_codex":0.041323792,"about_ca_system_score_gemma":0.0981774,"threshold_uncertainty_score":0.2998265},"labels":[],"label_agreement":null},{"id":"W6925191551","doi":"10.17182/hepdata.26861.v1/t14","title":"\"Table 14\" of \"Backward pi- d Elastic Scattering from 496-MeV?c to 1050-MeV/c\"","year":2013,"lang":"en","type":"dataset","venue":"HEPData","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Scattering; Deformation (meteorology); Population; Elastic scattering; Elasticity (physics)","score_opus":0.03266979796748133,"score_gpt":0.26291160112065126,"score_spread":0.23024180315316994,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6925191551","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00040392627,0.00012878643,0.00012790457,0.00006849731,0.00005457198,0.000019038003,0.9975279,0.0005692524,0.0011001258],"genre_scores_gemma":[0.0009934044,0.00007992305,0.0004224628,0.000065079184,0.0000116651945,0.000073845855,0.99750656,0.00008343352,0.0007636678],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99937904,0.00007935121,0.000050737373,0.00017750646,0.00017573163,0.00013760068],"domain_scores_gemma":[0.99905735,0.00022591853,0.000098033735,0.0002033733,0.00030734763,0.000108004264],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.00068928924,0.003477664,0.0016600926,0.0022974703,0.0012818426,0.0015894354,0.0038076798,0.0026884482,0.046908658],"category_scores_gemma":[0.0020446554,0.00067357975,0.0021326037,0.0038274804,0.0004802883,0.00084204355,0.001264914,0.0023399442,0.048605803],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015629982,0.00004680497,0.0010130329,0.00079257705,0.00006477332,0.000047504192,0.000010138379,0.00078242004,0.0004332665,0.0004545863,0.9938595,0.0023390849],"study_design_scores_gemma":[0.0009985178,0.00006501111,0.009531341,0.00029984646,0.00013989363,0.00019976118,0.00008252496,0.0028629743,0.004007756,0.0029412052,0.97879785,0.00007335667],"about_ca_topic_score_codex":0.03503023,"about_ca_topic_score_gemma":0.07341995,"teacher_disagreement_score":0.9530913,"about_ca_system_score_codex":0.0017786658,"about_ca_system_score_gemma":0.0025671206,"threshold_uncertainty_score":0.15692508},"labels":[],"label_agreement":null},{"id":"W6931862811","doi":"10.5683/sp3/1jyjiy","title":"Labour Force Survey, August 2019 [Canada] [Rebased 2025]","year":2023,"lang":"en","type":"dataset","venue":"Borealis","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Statistics Canada","funders":"","keywords":"Unemployment; Current Population Survey; Government (linguistics); Population; Wage; Descriptive statistics; Minimum wage; Discouraged worker","score_opus":0.02842488221238821,"score_gpt":0.26997064311107544,"score_spread":0.24154576089868723,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6931862811","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00068784505,0.0015765749,0.00034957266,0.0041731438,0.0018933564,0.0007613591,0.9475942,0.0002690813,0.04269483],"genre_scores_gemma":[0.008373268,0.005228917,0.0027228869,0.0073940875,0.00044946212,0.002266116,0.8523565,0.00029640025,0.12091229],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99541146,0.00027476245,0.00042515597,0.000366789,0.0027366385,0.00078525173],"domain_scores_gemma":[0.9798952,0.00039453743,0.00034883598,0.00034267385,0.017999379,0.0010194578],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003581451,0.001142719,0.0011420496,0.003905411,0.002826427,0.0028589542,0.0032837666,0.0014797449,0.05259795],"category_scores_gemma":[0.016441528,0.0010252388,0.0011692173,0.009815219,0.0005917453,0.0015934478,0.0014015717,0.003605343,0.03471682],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000020119414,0.000008816192,0.0012803547,0.00017014859,0.000007740534,0.000008930951,0.00003470387,0.00004051841,0.000017865588,0.00045411807,0.9903616,0.0075951023],"study_design_scores_gemma":[0.00004916495,0.000014528697,0.06548895,0.0005915634,0.000025503812,0.000020722651,0.0002788845,0.00011080465,0.000048170492,0.0002649529,0.93307245,0.00003435227],"about_ca_topic_score_codex":0.98512113,"about_ca_topic_score_gemma":0.98880506,"teacher_disagreement_score":0.05259795,"about_ca_system_score_codex":0.043137155,"about_ca_system_score_gemma":0.10992289,"threshold_uncertainty_score":0.31298345},"labels":[],"label_agreement":null},{"id":"W6957941294","doi":"10.6068/dp15df304bf0d75","title":"Trend 1980 - 2014. Energy Information Administration. International Energy Statistics: Liquid Petroleum Gases and Ethane | Country: Canada | Category: Production | Series: LPG Production (nonrefinery) | Units: Barrels Per Day, 1980-2014. Data-Planet™ Statistical Ready Reference by Conquest Systems, Inc. Dataset-ID: 004-015-004.","year":2017,"lang":"en","type":"other","venue":"Data Planet","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Production (economics); Petroleum; Energy (signal processing); Administration (probate law); Energy policy; Agency (philosophy); Liquefied petroleum gas; Environmental impact of the energy industry","score_opus":0.021915702606264645,"score_gpt":0.24903766311853273,"score_spread":0.22712196051226807,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6957941294","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000039862764,0.000023353348,0.000012776031,0.00003564443,0.00001654346,0.0000050642757,0.9993498,0.000041155174,0.00047591532],"genre_scores_gemma":[0.00022381304,0.00006403691,0.00007850472,0.000022734443,0.0000069519797,0.000029093104,0.9985581,0.000029154626,0.0009876724],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9981693,0.00010454898,0.0001814004,0.00031762948,0.00088345975,0.00034361889],"domain_scores_gemma":[0.9875316,0.0005670415,0.0006301624,0.0006654474,0.01010912,0.00049666787],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0010773897,0.002098809,0.0020373082,0.006446682,0.0014522148,0.0038009158,0.003515156,0.001243095,0.057163693],"category_scores_gemma":[0.008792206,0.0012527902,0.0013611296,0.02743217,0.0005452106,0.0026508574,0.0016269657,0.0026975048,0.06680691],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000217316,0.000008680417,0.0007657709,0.00020329669,0.000018237364,0.0000051572497,0.000008549376,0.00015220832,0.000016934857,0.0003409997,0.9972409,0.0012174592],"study_design_scores_gemma":[0.00008870154,0.000008890195,0.01063937,0.0003722011,0.00002686712,0.00001202207,0.00015343245,0.00029328334,0.00023602955,0.00052071235,0.9876123,0.000036301673],"about_ca_topic_score_codex":0.8422721,"about_ca_topic_score_gemma":0.81640863,"teacher_disagreement_score":0.1577279,"about_ca_system_score_codex":0.012576412,"about_ca_system_score_gemma":0.025156496,"threshold_uncertainty_score":0.31731355},"labels":[],"label_agreement":null},{"id":"W6976673881","doi":"10.60692/hwq4j-m3d14","title":"Classifying Arabic Text Using KNN Classifier","year":2016,"lang":"en","type":"article","venue":"Greater South Information System","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of New Brunswick","funders":"","keywords":"Classifier (UML); Search engine indexing; Pattern recognition (psychology); Feature selection; Word error rate; Term (time)","score_opus":0.07232163768643263,"score_gpt":0.23594012380209306,"score_spread":0.16361848611566043,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6976673881","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.45045307,0.006358316,0.46487552,0.0017111112,0.0021140908,0.0025499335,0.008613166,0.016545618,0.04677919],"genre_scores_gemma":[0.53627175,0.0021035937,0.42381734,0.00034595272,0.0003918659,0.0006304237,0.009521756,0.00021555542,0.0267018],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9986941,0.00013082167,0.0002085916,0.00029834977,0.00053023215,0.00013782672],"domain_scores_gemma":[0.9984363,0.0003934783,0.000104845865,0.00009043478,0.0009171252,0.00005791315],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008990754,0.0011031522,0.0009116099,0.005728563,0.0012104483,0.0016399098,0.0009818143,0.0013137063,0.0047583804],"category_scores_gemma":[0.0028367618,0.00018941429,0.00069096446,0.0029176166,0.0003813893,0.0013485799,0.00047398827,0.00073847675,0.00487769],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005136314,0.00032237108,0.008220012,0.00049015257,0.00010678003,0.00052646163,0.00031829035,0.015578341,0.023653029,0.0014344803,0.02021764,0.9286188],"study_design_scores_gemma":[0.000066974564,0.000466729,0.01990031,0.00028648356,0.00015648037,0.0013630815,0.0014517582,0.8630739,0.059726104,0.0057317372,0.04763094,0.00014550229],"about_ca_topic_score_codex":0.00896313,"about_ca_topic_score_gemma":0.008519637,"teacher_disagreement_score":0.00896313,"about_ca_system_score_codex":0.00092176726,"about_ca_system_score_gemma":0.001053354,"threshold_uncertainty_score":0.017821908},"labels":[],"label_agreement":null},{"id":"W6977231403","doi":"10.6084/m9.figshare.26569141","title":"Additional file 1 of Knowledge and appropriateness of care of family physicians and physiotherapists in the management of shoulder pain: a survey study in the province of Quebec, Canada","year":2024,"lang":"en","type":"article","venue":"Figshare","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Université Laval; Centre for Interdisciplinary Research in Rehabilitation; Université de Montréal; Hôpital Maisonneuve-Rosemont","funders":"","keywords":"Survey research; MEDLINE; Health services research; Survey data collection; Data collection; Primary care","score_opus":0.0298694448598964,"score_gpt":0.26385001193260077,"score_spread":0.23398056707270437,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6977231403","genre_codex":"dataset","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006819945,0.000078114914,0.00016861995,0.00055177213,0.000033132383,0.00063225674,0.9856118,0.000055126533,0.006049329],"genre_scores_gemma":[0.20877899,0.0010662003,0.004987568,0.0017338139,0.00016238842,0.011948618,0.72612834,0.0001980836,0.044996005],"study_design_codex":"not_applicable","study_design_gemma":"observational","domain_scores_codex":[0.99928206,0.0001193179,0.00010241427,0.0000963067,0.0002166717,0.00018319687],"domain_scores_gemma":[0.9883329,0.004450041,0.0011412586,0.00043573178,0.0050155194,0.0006245359],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0011706555,0.0004576768,0.0007687481,0.0022539373,0.00232932,0.0010502912,0.0014526172,0.0006720242,0.45432857],"category_scores_gemma":[0.016052313,0.00030634616,0.0005581548,0.00519935,0.00034364004,0.0010370165,0.0005382541,0.0008046056,0.016061956],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014962797,0.00018880796,0.03525696,0.0010250816,0.000029215982,0.00007956509,0.00072704913,0.0002754519,0.000036817077,0.00062651886,0.95118326,0.010421602],"study_design_scores_gemma":[0.0016664637,0.0002650782,0.7088198,0.0039963005,0.00013022874,0.00041130336,0.0069892006,0.0027089182,0.00030217427,0.0016454944,0.27289554,0.00016955509],"about_ca_topic_score_codex":0.83699214,"about_ca_topic_score_gemma":0.88746023,"teacher_disagreement_score":0.45432857,"about_ca_system_score_codex":0.010950149,"about_ca_system_score_gemma":0.01239999,"threshold_uncertainty_score":0.7783341},"labels":[],"label_agreement":null},{"id":"W6992394548","doi":"","title":"Le Québec mis en caricatures. Humeurs et humours d'une société à travers le temps Quebec in caricature. Moods and humour of a society through time","year":2013,"lang":"fr","type":"other","venue":"OpenEdition (OpenEdition)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Period (music); Theme (computing)","score_opus":0.013766931604180781,"score_gpt":0.24745574286617844,"score_spread":0.23368881126199767,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6992394548","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08392921,0.059116513,0.0041877977,0.049728416,0.0044372566,0.0001220721,0.060399488,0.0015772647,0.736502],"genre_scores_gemma":[0.22166678,0.0074139717,0.0018181606,0.0011738278,0.00018120215,0.000038694463,0.0065948423,0.0002757296,0.7608368],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9995407,0.000041224517,0.000013685825,0.00006594989,0.0002316955,0.00010687607],"domain_scores_gemma":[0.99882275,0.00008355939,0.00006087998,0.00003860747,0.00071461,0.00027953053],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00049724284,0.0004798723,0.0002906653,0.0026523506,0.006281711,0.004876598,0.0006312883,0.00092668406,0.060618855],"category_scores_gemma":[0.0018401238,0.00024678637,0.0002418032,0.005851461,0.0013355376,0.0015971594,0.0010104877,0.0012059783,0.0054277387],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006569593,0.00003145051,0.015180652,0.00015836743,0.000018486526,0.00022161723,0.0077421097,0.00021419983,0.00039240994,0.013399907,0.77429414,0.18828109],"study_design_scores_gemma":[0.000005764595,0.000011660804,0.09511313,0.00016256655,0.000012152337,0.00012111525,0.0086505385,0.00029034758,0.00037448097,0.00088965654,0.894335,0.00003351172],"about_ca_topic_score_codex":0.98517644,"about_ca_topic_score_gemma":0.9958162,"teacher_disagreement_score":0.060618855,"about_ca_system_score_codex":0.028735224,"about_ca_system_score_gemma":0.01740999,"threshold_uncertainty_score":0.2084896},"labels":[],"label_agreement":null},{"id":"W7009548693","doi":"","title":"Enhancing Text Annotation with Few-shot and Active Learning: A Comprehensive Study and Tool Development","year":2023,"lang":"en","type":"dissertation","venue":"Spectrum Research Repository (Concordia University)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Concordia University","keywords":"Process (computing); Task (project management); Field (mathematics); Feature (linguistics); Matching (statistics)","score_opus":0.04011149522743568,"score_gpt":0.29513010778234766,"score_spread":0.255018612554912,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7009548693","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0068461373,0.005159077,0.9784445,0.00059732434,0.00025720915,0.00017515133,0.00016222797,0.0050319647,0.0033263157],"genre_scores_gemma":[0.11765405,0.006747602,0.8581312,0.00069897185,0.00037335494,0.00043123274,0.001532559,0.0010073462,0.013423805],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99638957,0.0011171527,0.00021013491,0.0008377619,0.0013244521,0.0001208984],"domain_scores_gemma":[0.9883782,0.007339674,0.0004400882,0.0011383545,0.0024303063,0.00027337452],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0043012807,0.0011134492,0.001305386,0.003122274,0.0013244029,0.0027771562,0.0035978395,0.0022121293,0.00273038],"category_scores_gemma":[0.013017016,0.00072026567,0.0013377832,0.0024649454,0.0014079228,0.006253894,0.0021104417,0.002561107,0.0026569914],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00012238679,0.00020747383,0.00047970755,0.0006329861,0.000054273445,0.000118505,0.000546247,0.008754752,0.013610015,0.0064061577,0.005845149,0.9632222],"study_design_scores_gemma":[0.000048944996,0.00041346144,0.0018200434,0.00058861845,0.00013721349,0.0008020925,0.0011103561,0.78111696,0.088401936,0.034356132,0.09101566,0.00018866081],"about_ca_topic_score_codex":0.0032275533,"about_ca_topic_score_gemma":0.003158501,"teacher_disagreement_score":0.0043012807,"about_ca_system_score_codex":0.0010436936,"about_ca_system_score_gemma":0.0014744491,"threshold_uncertainty_score":0.022747636},"labels":[],"label_agreement":null},{"id":"W7015701947","doi":"","title":"A text categorization approach for match-making in online business tendering","year":2005,"lang":"en","type":"article","venue":"NPARC","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"University of New Brunswick","funders":"","keywords":"Categorization; Ranking (information retrieval); Order (exchange); Training set; Procurement; Electronic business","score_opus":0.03290863753924243,"score_gpt":0.2748034285535879,"score_spread":0.24189479101434547,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7015701947","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.044220727,0.00082964794,0.94372064,0.00053716655,0.00015376582,0.0010010032,0.00061952026,0.0018964082,0.0070211254],"genre_scores_gemma":[0.22325954,0.00028284054,0.77042985,0.00016129298,0.00013218318,0.0005855857,0.0010054793,0.00008822269,0.004055052],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9967282,0.0013575689,0.00028672125,0.00058544875,0.00090372114,0.00013834305],"domain_scores_gemma":[0.99516654,0.0028214736,0.00032914,0.00037262336,0.0011908736,0.000119488315],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0029764078,0.00060697953,0.00066541246,0.0065530613,0.0018043135,0.0016684914,0.0013991778,0.0012205109,0.004225327],"category_scores_gemma":[0.009818473,0.00018955053,0.0008718249,0.0043140203,0.0007007048,0.0028762578,0.00067747664,0.0007841834,0.0019153676],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002052258,0.000407537,0.0029936524,0.00045672763,0.000060612812,0.0001564131,0.00091364735,0.0073911627,0.013533245,0.011321202,0.0048220754,0.9577387],"study_design_scores_gemma":[0.00017046755,0.00072767335,0.01982361,0.0003229573,0.00020106418,0.0017860272,0.0036805528,0.76972616,0.043270364,0.088456936,0.071579956,0.0002542259],"about_ca_topic_score_codex":0.0033472085,"about_ca_topic_score_gemma":0.003665392,"teacher_disagreement_score":0.0065530613,"about_ca_system_score_codex":0.0011006293,"about_ca_system_score_gemma":0.0012100714,"threshold_uncertainty_score":0.015740931},"labels":[],"label_agreement":null},{"id":"W7020719597","doi":"","title":"$87.40 Million in Sales Expected for Vivint Solar Inc (NYSE:VSLR) This Quarter","year":2020,"lang":"en","type":"other","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Quarter (Canadian coin); Revenue; Work (physics)","score_opus":0.02115992947317765,"score_gpt":0.25607000225421295,"score_spread":0.2349100727810353,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7020719597","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0013952719,0.0005805071,0.0006729076,0.0022617776,0.0017712589,0.00007592884,0.01119807,0.002807371,0.97923696],"genre_scores_gemma":[0.0012080825,0.00024382511,0.00015477346,0.00031036913,0.00012319472,0.000015643793,0.004282516,0.00025349183,0.9934082],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99976605,0.000014509839,0.000007960592,0.00004635565,0.00012480815,0.000040356226],"domain_scores_gemma":[0.9995055,0.000024370345,0.000020008376,0.000028390867,0.00018714758,0.0002344884],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.00031344756,0.00083203905,0.00039171212,0.0012722688,0.00089474354,0.002796691,0.0005323919,0.00100769,0.7380474],"category_scores_gemma":[0.0008866121,0.00023931442,0.0004298632,0.0009939522,0.00035821067,0.0018279386,0.0014815313,0.0010608061,0.7653584],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000023676832,0.000016982794,0.00009750226,0.000025048583,9.681816e-7,0.000009268126,0.000005301002,0.000031238997,0.00021473372,0.00053558685,0.97261566,0.026423886],"study_design_scores_gemma":[0.000016238911,0.00003180796,0.00091906585,0.00004531013,0.0000022847453,0.000024728113,0.000049810827,0.00016837436,0.00018098782,0.0004503655,0.9981059,0.000005090909],"about_ca_topic_score_codex":0.008056525,"about_ca_topic_score_gemma":0.01764024,"teacher_disagreement_score":0.26195258,"about_ca_system_score_codex":0.00068130647,"about_ca_system_score_gemma":0.0012930416,"threshold_uncertainty_score":0.37364352},"labels":[],"label_agreement":null},{"id":"W7022485765","doi":"","title":"9780472902422.pdf","year":2021,"lang":"en","type":"other","venue":"OAPEN (The OAPEN Foundation)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"Social Sciences and Humanities Research Council of Canada; Jackman Humanities Institute, University of Toronto","keywords":"Eugenics; Context (archaeology); Population; Identity (music); Categorization; Indigenous; Perception; Embodied cognition","score_opus":0.019927424160352456,"score_gpt":0.2639188037139476,"score_spread":0.24399137955359515,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7022485765","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0006225212,0.0012874606,0.00057343376,0.0020589372,0.0012655376,0.00004880834,0.0038871418,0.0009887931,0.98926735],"genre_scores_gemma":[0.0034721743,0.0012871758,0.00042764738,0.00059313537,0.0003209511,0.00006190451,0.002037581,0.00050263765,0.9912969],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99959236,0.000060719638,0.000021883618,0.000064509535,0.00019181072,0.00006862965],"domain_scores_gemma":[0.99925834,0.00019851179,0.000061479426,0.00010903077,0.00020874408,0.00016392543],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0005715226,0.00045171092,0.0003475013,0.0015534622,0.0016401167,0.007410944,0.00094277447,0.0013102825,0.83771676],"category_scores_gemma":[0.0024927277,0.00024446344,0.0003503716,0.0022625572,0.0005808798,0.0036720068,0.003737939,0.0013161553,0.6168519],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000028420569,0.000015341431,0.00017769464,0.00018565514,0.000002310002,0.00006303575,0.00033589776,0.000026193795,0.00021621509,0.0066391416,0.82778233,0.16452764],"study_design_scores_gemma":[0.0000016626251,0.000003706927,0.0003110473,0.00008077411,7.4623875e-7,0.000030989806,0.00011777237,0.000009229265,0.00004282907,0.00017231611,0.9992268,0.0000020606474],"about_ca_topic_score_codex":0.0028429895,"about_ca_topic_score_gemma":0.003904378,"teacher_disagreement_score":0.16228324,"about_ca_system_score_codex":0.0010368886,"about_ca_system_score_gemma":0.0008113914,"threshold_uncertainty_score":0.23147738},"labels":[],"label_agreement":null},{"id":"W7030395727","doi":"","title":"Ne niin sanotut \"pestuumarkkinat\" : palkollisten pestuutapahtumat sanomalehdissä ja muistitiedossa vuosina 1880 - 1920","year":2018,"lang":"fi","type":"other","venue":"Jyväskylä University Digital Archive (University of Jyväskylä)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Life style; Quarter (Canadian coin)","score_opus":0.0114479324778916,"score_gpt":0.18376768885274974,"score_spread":0.17231975637485814,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7030395727","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.3945115,0.030849647,0.0019534838,0.006061559,0.0007157574,0.00008035807,0.0030623747,0.00015732522,0.56260794],"genre_scores_gemma":[0.5836519,0.013583197,0.0017856858,0.0008633999,0.0001553593,0.000046545378,0.0030595302,0.00006988622,0.39678457],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.99983823,0.000015821395,0.000006262841,0.000045944125,0.00005945107,0.000034161145],"domain_scores_gemma":[0.99990046,0.000014500916,0.00002256076,0.0000061928126,0.000037681304,0.000018592042],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00023390354,0.0002386789,0.0001347754,0.00051420764,0.0011095464,0.0014537949,0.0002954646,0.00041101305,0.019425578],"category_scores_gemma":[0.0002804451,0.00014722203,0.00015334788,0.0007326852,0.000802589,0.0008930235,0.0010570332,0.00068489485,0.0024867968],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006621783,0.00017138789,0.15631986,0.0020686847,0.00009571286,0.0019893683,0.039459582,0.0006470006,0.027366273,0.07554226,0.079670064,0.6160076],"study_design_scores_gemma":[0.000005970457,0.00012444919,0.12741497,0.00023486037,0.000016653848,0.00040959285,0.0061677215,0.000085104366,0.0026368971,0.0013503325,0.86153567,0.000017810033],"about_ca_topic_score_codex":0.021557832,"about_ca_topic_score_gemma":0.06978423,"teacher_disagreement_score":0.021557832,"about_ca_system_score_codex":0.0023006967,"about_ca_system_score_gemma":0.0016755755,"threshold_uncertainty_score":0.06498504},"labels":[],"label_agreement":null},{"id":"W7066926928","doi":"","title":"102.7 KIIS FM Los Angeles Airchecks January 2025","year":2025,"lang":"en","type":"other","venue":"Internet Archive (Internet Archive)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Context (archaeology); Thursday; Set (abstract data type); Collectable","score_opus":0.015821200614007283,"score_gpt":0.25682547217852564,"score_spread":0.24100427156451837,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7066926928","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0004044802,0.00016071628,0.00012143632,0.0010822278,0.0009139871,0.000052302286,0.0036653448,0.0014548725,0.99214464],"genre_scores_gemma":[0.0011031885,0.00007859153,0.00007580783,0.00024987725,0.00009590963,0.000017624932,0.0015552741,0.00028659118,0.9965372],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99963856,0.000021267824,0.000010044657,0.00005444433,0.00017585776,0.000099772114],"domain_scores_gemma":[0.9992442,0.000027842105,0.000030806237,0.000055390286,0.00032263834,0.00031903922],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.00035268062,0.00083143235,0.000315782,0.00087015267,0.003748117,0.0051704207,0.0006147739,0.0014838751,0.80958635],"category_scores_gemma":[0.001304457,0.00040564762,0.00033762486,0.000839344,0.00038316686,0.00220975,0.0019972003,0.0017194778,0.6751284],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000010188626,0.000008241509,0.000083323095,0.000016100936,5.2939185e-7,0.00001825972,0.00002427293,0.0000055821292,0.0000607654,0.00039166474,0.992986,0.0063949646],"study_design_scores_gemma":[0.0000032210999,0.0000048525826,0.00038313813,0.000017095676,6.269586e-7,0.000009911539,0.000107710344,0.000016195449,0.00003808845,0.00004720092,0.99936944,0.0000026119342],"about_ca_topic_score_codex":0.0543204,"about_ca_topic_score_gemma":0.18596119,"teacher_disagreement_score":0.80958635,"about_ca_system_score_codex":0.002287332,"about_ca_system_score_gemma":0.0020202422,"threshold_uncertainty_score":0.27160197},"labels":[],"label_agreement":null},{"id":"W7069047744","doi":"","title":"Akron, Ohio","year":2009,"lang":"en","type":"other","venue":"OhioLink ETD Center (Ohio Library and Information Network)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Watson; Booster (rocketry); Morning; Swift","score_opus":0.008611227068965154,"score_gpt":0.20176666614710442,"score_spread":0.19315543907813926,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7069047744","genre_codex":"other","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":"other","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0017313675,0.0022212856,0.0009029113,0.0014877181,0.0014495829,0.00008646783,0.0074058706,0.0010773957,0.9836374],"genre_scores_gemma":[0.0031485003,0.0013879975,0.0006256463,0.00033855767,0.00011358033,0.00005041981,0.0027890005,0.0003536062,0.99119276],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99899644,0.000071412745,0.000055827695,0.00044121416,0.00032879197,0.000106317246],"domain_scores_gemma":[0.9987739,0.00021799853,0.000083986946,0.0001714808,0.00041881768,0.00033388735],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0005768973,0.0021368708,0.0011546413,0.0018048211,0.0039535835,0.0073041716,0.001663895,0.0026344901,0.886105],"category_scores_gemma":[0.0017494513,0.00080843945,0.0007404623,0.0025312402,0.0006514523,0.003782217,0.003069488,0.0026556347,0.77309006],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00030459173,0.00041264037,0.0022755668,0.0004156131,0.000037437974,0.0008812334,0.00030593787,0.0002888106,0.0016814034,0.00774706,0.7070941,0.27855572],"study_design_scores_gemma":[0.000034653807,0.000043062137,0.0018077791,0.00018727365,0.000011724624,0.0001745436,0.0002475905,0.00020156302,0.00031954815,0.0010288031,0.9959281,0.000015429227],"about_ca_topic_score_codex":0.0063315793,"about_ca_topic_score_gemma":0.016162356,"teacher_disagreement_score":0.886105,"about_ca_system_score_codex":0.0014459436,"about_ca_system_score_gemma":0.0018271358,"threshold_uncertainty_score":0.1624574},"labels":[],"label_agreement":null},{"id":"W7115013425","doi":"10.1007/s44443-025-00413-8","title":"A novel multi-label deep forest algorithm based on elite preservation strategy and multi-layer feature fusion","year":2025,"lang":"en","type":"article","venue":"Journal of King Saud University - Computer and Information Sciences","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"National Natural Science Foundation of China","keywords":"Feature (linguistics); Field (mathematics); Fusion; Stability (learning theory); Pattern recognition (psychology); Random forest; Layer (electronics); Statistical classification","score_opus":0.0334171096165064,"score_gpt":0.2660460454538522,"score_spread":0.23262893583734578,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7115013425","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.03042742,0.00033902717,0.9660175,0.00018755777,0.00008295218,0.00011170998,0.00010226146,0.0013925927,0.0013389369],"genre_scores_gemma":[0.38452643,0.00018476843,0.60943663,0.0003923077,0.00009655252,0.00025263018,0.0008175026,0.00019505317,0.0040982235],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9993506,0.00008403248,0.000038362377,0.00017158606,0.0002169715,0.00013851114],"domain_scores_gemma":[0.99918526,0.00021429008,0.000076706456,0.000105168256,0.00033767906,0.00008089471],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013207946,0.0010574295,0.0013653336,0.0013782377,0.0010291772,0.00096026866,0.0023040595,0.0016097196,0.0020636918],"category_scores_gemma":[0.0023699496,0.0003532338,0.0010127496,0.0010530384,0.0005044809,0.0023160295,0.0014564873,0.0015850933,0.0007055202],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00028719436,0.00026187516,0.004190426,0.000073432966,0.000096373675,0.000107415035,0.00013007797,0.14608365,0.01252806,0.004458142,0.005636767,0.82614666],"study_design_scores_gemma":[0.000028037648,0.000056457382,0.00038776197,0.000008002284,0.000018359766,0.00005263536,0.000023109023,0.9929629,0.002701224,0.0030224868,0.00072794076,0.000011101808],"about_ca_topic_score_codex":0.008350008,"about_ca_topic_score_gemma":0.01171022,"teacher_disagreement_score":0.008350008,"about_ca_system_score_codex":0.00089485734,"about_ca_system_score_gemma":0.0016219992,"threshold_uncertainty_score":0.016602814},"labels":[],"label_agreement":null},{"id":"W7115168809","doi":"10.18280/isi.301001","title":"Text Augmentation Approaches to Enhance Traditional Machine Learning Performance for SDGs Classification of Indonesian News Articles","year":2025,"lang":"","type":"article","venue":"Ingénierie des systèmes d information","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"Universitas Gadjah Mada","keywords":"Indonesian; Training set; Key (lock); Support vector machine","score_opus":0.07416843936564876,"score_gpt":0.2659454558059801,"score_spread":0.19177701644033135,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7115168809","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7242171,0.0050254497,0.2323464,0.0021193654,0.0027980362,0.0004969116,0.0039596134,0.014933285,0.014103849],"genre_scores_gemma":[0.84213513,0.0008209396,0.13511847,0.00033406448,0.00088225404,0.00029127882,0.008125443,0.00027864805,0.012013861],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9992748,0.00020690508,0.00010508403,0.00014794456,0.00017852466,0.000086697095],"domain_scores_gemma":[0.9970892,0.0012244583,0.00018092386,0.00029346574,0.001083333,0.00012868978],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0015118013,0.0010775657,0.0006936061,0.0018563211,0.0005753159,0.0011146171,0.0008445551,0.00077706086,0.003636415],"category_scores_gemma":[0.0034189166,0.00019446517,0.00073068304,0.0015513108,0.00032968252,0.0012562171,0.0008363202,0.0011337277,0.002040003],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013042189,0.0009962281,0.008147872,0.00037930906,0.00013341809,0.00031496445,0.00028201274,0.017963238,0.05423262,0.0010787903,0.016990727,0.89817667],"study_design_scores_gemma":[0.000097138014,0.000570487,0.010075632,0.00006304877,0.00030056894,0.00027135861,0.0003552805,0.8916302,0.08010573,0.0019380081,0.014549577,0.00004299388],"about_ca_topic_score_codex":0.0027125168,"about_ca_topic_score_gemma":0.0044079013,"teacher_disagreement_score":0.003636415,"about_ca_system_score_codex":0.00034305398,"about_ca_system_score_gemma":0.0009430071,"threshold_uncertainty_score":0.01216501},"labels":[],"label_agreement":null},{"id":"W7116838783","doi":"10.1109/icsec67360.2025.11298043","title":"An Integration of Fine-Tuned RoBERTa, Support Vector Machine, and Differential Evolution in Enhancing Multi-Label Text Classification for Academic Publications","year":2025,"lang":"","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Assumption University","funders":"","keywords":"Support vector machine; Feature selection; Benchmark (surveying); Classifier (UML); Differential evolution; Feature (linguistics); Class (philosophy)","score_opus":0.04325472606089602,"score_gpt":0.33758448402179303,"score_spread":0.294329757960897,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7116838783","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.11090566,0.0017182474,0.88040876,0.0007517116,0.00020382763,0.00013912423,0.00010509272,0.0026834907,0.0030840682],"genre_scores_gemma":[0.7094493,0.0004116775,0.2847665,0.00041522854,0.00018762166,0.0001423366,0.00048903975,0.00019819515,0.0039400724],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9981951,0.00046644988,0.00013992537,0.00048252317,0.0005764295,0.00013960639],"domain_scores_gemma":[0.99776196,0.00079620455,0.000261608,0.00033194938,0.0007476095,0.0001008178],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002830898,0.00080196204,0.0011527286,0.0024584292,0.00053905224,0.0016242524,0.0016456086,0.001251517,0.0006865328],"category_scores_gemma":[0.006106634,0.00031759962,0.0008907337,0.0018281091,0.00051056565,0.0022815373,0.0009904112,0.0012552544,0.0006028607],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021978567,0.0004276321,0.009117678,0.0001390714,0.00017574472,0.00017614473,0.00023543181,0.14079846,0.033541564,0.006864092,0.0033900617,0.80491436],"study_design_scores_gemma":[0.00001199235,0.00010161264,0.0012546547,0.000008765719,0.00002820995,0.00008615368,0.000034834975,0.98736995,0.00623729,0.0032318218,0.0016177141,0.000017050745],"about_ca_topic_score_codex":0.001970376,"about_ca_topic_score_gemma":0.0027646902,"teacher_disagreement_score":0.002830898,"about_ca_system_score_codex":0.0008497539,"about_ca_system_score_gemma":0.0010878294,"threshold_uncertainty_score":0.014971375},"labels":[],"label_agreement":null},{"id":"W7117547339","doi":"10.18280/isi.301114","title":"SHADO: A Semantics-Preserving Hybrid Framework for Automatic Text Classification Using Domain Ontology","year":2025,"lang":"","type":"article","venue":"Ingénierie des systèmes d information","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Domain (mathematical analysis); Ontology; Feature (linguistics); Identification (biology); Pattern recognition (psychology)","score_opus":0.03452624255051188,"score_gpt":0.2994413137071079,"score_spread":0.264915071156596,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7117547339","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006732175,0.00037422113,0.9611025,0.00015786062,0.00007309505,0.00018772103,0.003165496,0.027019937,0.0011870989],"genre_scores_gemma":[0.08298949,0.00043888664,0.89374685,0.00028584487,0.000070523325,0.00031773112,0.013849632,0.0027891109,0.005511888],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9988391,0.00013480074,0.00011521656,0.0002818888,0.0005429813,0.00008606014],"domain_scores_gemma":[0.9989011,0.00027080276,0.00009615539,0.00032208377,0.00031832285,0.00009159491],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012565792,0.0010327828,0.0012883425,0.005444186,0.0009252024,0.002480721,0.0017680909,0.0007808168,0.0038105769],"category_scores_gemma":[0.0027091096,0.0005625048,0.0017627514,0.0033137533,0.0005328874,0.004195989,0.00273812,0.0012081112,0.0025033667],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00069165387,0.00038736727,0.0039660237,0.00084463914,0.0004194823,0.0003812246,0.00061009405,0.009174731,0.040014237,0.03476561,0.041796926,0.8669479],"study_design_scores_gemma":[0.00015018224,0.00020588748,0.004951609,0.00022005952,0.00037362485,0.0005854816,0.0006457487,0.62220657,0.057751242,0.13065207,0.1820591,0.00019850484],"about_ca_topic_score_codex":0.007932015,"about_ca_topic_score_gemma":0.017538406,"teacher_disagreement_score":0.007932015,"about_ca_system_score_codex":0.00085656106,"about_ca_system_score_gemma":0.0021622982,"threshold_uncertainty_score":0.015771687},"labels":[],"label_agreement":null},{"id":"W7117575766","doi":"10.18280/isi.301102","title":"Indonesian Sports Text Classification Modeling Based on Few-Shot NER","year":2025,"lang":"","type":"article","venue":"Ingénierie des systèmes d information","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Indonesian; Topic model; Feature (linguistics); Named-entity recognition; Acronym","score_opus":0.02922572258510529,"score_gpt":0.2616909532835031,"score_spread":0.23246523069839783,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7117575766","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.48229173,0.0034841814,0.48164934,0.0011163695,0.00095212524,0.00042451665,0.007209807,0.0056179683,0.017253987],"genre_scores_gemma":[0.8465684,0.0010064475,0.09944268,0.00024254067,0.0003531343,0.00026302168,0.014455921,0.00029104712,0.037376866],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9995296,0.00005978506,0.000037446945,0.00023263281,0.000078890014,0.00006167667],"domain_scores_gemma":[0.9995652,0.00015342319,0.000036340763,0.000049128834,0.00016368204,0.000032203807],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00045054549,0.00080326875,0.0007699142,0.0021923291,0.0006186447,0.000928273,0.0008345736,0.0008286479,0.0031021305],"category_scores_gemma":[0.0009871324,0.00026641565,0.0011649416,0.001088261,0.00025826902,0.0014587576,0.00045948985,0.00080752093,0.002598297],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013667361,0.0011358196,0.026936995,0.000623765,0.0004637754,0.0016685982,0.0002937035,0.10577112,0.043695297,0.0039902898,0.025349146,0.78870475],"study_design_scores_gemma":[0.000013197436,0.000098174634,0.014179274,0.00003502815,0.00013307828,0.00036434963,0.000099039324,0.9727883,0.0065441644,0.001609515,0.004105361,0.000030455141],"about_ca_topic_score_codex":0.008879098,"about_ca_topic_score_gemma":0.014194095,"teacher_disagreement_score":0.008879098,"about_ca_system_score_codex":0.00042711385,"about_ca_system_score_gemma":0.00049416965,"threshold_uncertainty_score":0.017654836},"labels":[],"label_agreement":null},{"id":"W7124915570","doi":"10.1109/cloudcom67567.2025.11331420","title":"Enhancing Tail NFT Recommendation via Dependency-Aware Extreme Multi-Label Learning","year":2025,"lang":"","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Partition (number theory); Class (philosophy); Probabilistic logic; Multi-label classification; Set (abstract data type); Tree (set theory); Recommender system; Semantics (computer science)","score_opus":0.05599960013446609,"score_gpt":0.30490817461370134,"score_spread":0.24890857447923526,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7124915570","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.09586409,0.0011036171,0.89188594,0.0005667825,0.00012783716,0.00017809337,0.0012889924,0.0055595646,0.0034251076],"genre_scores_gemma":[0.6061951,0.00045342775,0.3773163,0.0009291781,0.00024930408,0.00025011663,0.0063806474,0.00043009297,0.0077957623],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99867576,0.00028125977,0.000073538766,0.00041445342,0.00040771285,0.0001471121],"domain_scores_gemma":[0.9956819,0.002119489,0.00030112782,0.0008552455,0.00082965445,0.00021255494],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012809773,0.0011422085,0.0016347964,0.001468889,0.0010647334,0.0010717874,0.0022958128,0.0017639969,0.0023903558],"category_scores_gemma":[0.006083666,0.0005351117,0.0013396575,0.002037723,0.0006755273,0.0026702706,0.0013256693,0.0024935578,0.0018343254],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008426223,0.0012529928,0.025634065,0.00031561835,0.00026864436,0.00034954827,0.0004015571,0.21991402,0.015948625,0.006077133,0.024750026,0.7042452],"study_design_scores_gemma":[0.000033962137,0.00007424319,0.0010887048,0.000011175336,0.000032643038,0.00006440279,0.00003054577,0.9894303,0.0023697414,0.005294354,0.0015490905,0.000020839427],"about_ca_topic_score_codex":0.01357176,"about_ca_topic_score_gemma":0.034065362,"teacher_disagreement_score":0.01357176,"about_ca_system_score_codex":0.0010346003,"about_ca_system_score_gemma":0.0015302779,"threshold_uncertainty_score":0.026985526},"labels":[],"label_agreement":null},{"id":"W7132542374","doi":"","title":"Fast & confident probabilistic categorisation","year":2007,"lang":"en","type":"article","venue":"NPARC","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":true,"route_about_ca":false,"ca_institutions":"","funders":"","keywords":"Probabilistic logic; Labelling; Set (abstract data type); Anomaly detection; Test (biology); Measure (data warehouse); Test set; Layer (electronics)","score_opus":0.017939049263417092,"score_gpt":0.2566820421824322,"score_spread":0.23874299291901507,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7132542374","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006809687,0.0008320534,0.95339704,0.0011999693,0.0009193064,0.00025241612,0.0040690154,0.02356276,0.008957735],"genre_scores_gemma":[0.13957877,0.00061353587,0.7973995,0.0008396141,0.0009388326,0.0004360411,0.020576706,0.0037082164,0.03590876],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9879881,0.0018939325,0.0004891667,0.0023311747,0.0063955314,0.00090205687],"domain_scores_gemma":[0.97889245,0.006406894,0.0008124552,0.0069990945,0.006389069,0.0005000832],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0076091383,0.0018236387,0.002200224,0.0044510644,0.0016219782,0.005630599,0.0053917407,0.0043793353,0.042569432],"category_scores_gemma":[0.03592595,0.0011274683,0.0021220278,0.0031951459,0.0011663156,0.0072071636,0.0078045777,0.004876292,0.032494493],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006013323,0.00011085013,0.0015456819,0.00030846975,0.00010915373,0.00019948307,0.00011465108,0.034975924,0.008356331,0.031351645,0.1367998,0.78552675],"study_design_scores_gemma":[0.000089434565,0.00014235982,0.001999506,0.000107195665,0.00006502117,0.0009089656,0.00012819258,0.7243891,0.024646461,0.14507581,0.102283485,0.00016448938],"about_ca_topic_score_codex":0.003193541,"about_ca_topic_score_gemma":0.0041588126,"teacher_disagreement_score":0.042569432,"about_ca_system_score_codex":0.0018565588,"about_ca_system_score_gemma":0.0024541717,"threshold_uncertainty_score":0.1424089},"labels":[],"label_agreement":null},{"id":"W8258861","doi":"10.7589/0090-3558-29.4.596","title":"Multi-class categorization based on cluster analysis and TFIDF","year":2008,"lang":"en","type":"article","venue":"Journal of Wildlife Diseases","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Categorization; tf–idf; Computer science; Class (philosophy); Artificial intelligence; Humanities; Information retrieval; Natural language processing; Philosophy; Physics","score_opus":0.018639204838426317,"score_gpt":0.25320885059448606,"score_spread":0.23456964575605974,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W8258861","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.13275112,0.0026509187,0.8236553,0.0013813342,0.0019458423,0.0040626745,0.011653524,0.014415152,0.0074841618],"genre_scores_gemma":[0.3841248,0.00056498946,0.59038424,0.00014916412,0.0005884575,0.0029098536,0.015584124,0.0004930065,0.005201265],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9949116,0.00061735854,0.0008255302,0.0014473612,0.0014467464,0.00075154915],"domain_scores_gemma":[0.9925069,0.0027856107,0.00038038526,0.00048464118,0.0034839483,0.0003584859],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0058067124,0.0018140449,0.0019261728,0.015184279,0.0026282994,0.0028981173,0.002064298,0.0019171084,0.005569869],"category_scores_gemma":[0.012888002,0.00027927855,0.0023852738,0.008587381,0.0008364425,0.0017764643,0.0015563782,0.0013696359,0.0039072484],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015783423,0.0005901412,0.011552025,0.0006828977,0.00034609815,0.00039498162,0.0009947714,0.0077044307,0.013202613,0.0019813732,0.02625025,0.93472195],"study_design_scores_gemma":[0.0002763375,0.00089783274,0.039504576,0.00029707962,0.0005530148,0.0011244213,0.0030408853,0.88871056,0.022353237,0.01645946,0.026400315,0.00038235844],"about_ca_topic_score_codex":0.012891685,"about_ca_topic_score_gemma":0.008243349,"teacher_disagreement_score":0.015184279,"about_ca_system_score_codex":0.0016210721,"about_ca_system_score_gemma":0.0020043908,"threshold_uncertainty_score":0.030709207},"labels":[],"label_agreement":null}]}