{"id":"W4393773180","doi":"10.5281/zenodo.6149598","title":"TopiOCQA processed Wikipedia data","year":2022,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Computer science; Information retrieval; Data science; World Wide Web; Data mining","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001596892,0.003400619,0.001382273,0.007145502,0.00132565,0.002466022,0.002555928,0.002169165,0.02630789],"category_scores_gemma":[0.007030532,0.0008264021,0.002286521,0.006829483,0.0007433766,0.001355315,0.001930874,0.002384775,0.04676177],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001787672,"about_ca_system_score_gemma":0.004830393,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0506222,"about_ca_topic_score_gemma":0.06532497,"domain_scores_codex":[0.9976579,0.0003501252,0.0002467108,0.0006678156,0.0007349647,0.0003424555],"domain_scores_gemma":[0.9962382,0.0006235946,0.0002108646,0.0009392629,0.001596776,0.000391222],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001922846,0.0001699018,0.001352489,0.0008803564,0.0001044591,0.00007312993,0.00008017348,0.001273487,0.001574551,0.0006855915,0.9872124,0.006401266],"study_design_scores_gemma":[0.0005986004,0.0001038503,0.008313859,0.0003354595,0.0001574599,0.000166116,0.0003026869,0.006448708,0.005737588,0.001975574,0.9757357,0.0001244054],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.001483401,0.0001078536,0.0003949667,0.00007265762,0.00007547851,0.00009945562,0.9938815,0.002536793,0.001347864],"genre_scores_gemma":[0.0009802403,0.0000273532,0.0008961455,0.0000231183,0.000007435522,0.0001162408,0.9971418,0.0001743312,0.0006333324],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.0506222,"threshold_uncertainty_score":0.1006551,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08125994892770544,"score_gpt":0.2764849832977754,"score_spread":0.1952250343700699,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}