{"id":"W2947784394","doi":"10.25300/misq/2019/14439","title":"Expecting the Unexpected: Effects of Data Collection Design Choices on the Quality of Crowdsourced User-Generated Content1","year":2019,"lang":"en","type":"article","venue":"MIS Quarterly","topic":"Open Source Software Innovations","field":"Computer Science","cited_by":109,"is_retracted":false,"has_abstract":true,"ca_institutions":"Memorial University of Newfoundland; HEC Montréal","funders":"","keywords":"Quality (philosophy); Crowdsourcing; Computer science; User-generated content; Data collection; Data quality; Content (measure theory); User needs; Data science; World Wide Web; Knowledge management; Business; Internet privacy; Marketing; Social media; Mathematics; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2316472,0.001292942,0.0009277053,0.001989089,0.002554914,0.007259825,0.002605311,0.002543741,0.001946563],"category_scores_gemma":[0.6461616,0.001298101,0.001636736,0.003314843,0.005954311,0.007713755,0.005021533,0.00311126,0.000427476],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004216119,"about_ca_system_score_gemma":0.003117909,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003711588,"about_ca_topic_score_gemma":0.002694487,"domain_scores_codex":[0.7292483,0.2001993,0.02120188,0.01431615,0.03263357,0.002400804],"domain_scores_gemma":[0.08938777,0.8271304,0.02990438,0.0388569,0.01304833,0.001672286],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.01610838,0.00402326,0.4420003,0.006211287,0.003750399,0.0006271282,0.04143145,0.04427941,0.02642836,0.02422844,0.005022974,0.3858886],"study_design_scores_gemma":[0.00460214,0.01474219,0.6237585,0.004574706,0.003619755,0.001312307,0.02353773,0.1165896,0.06708069,0.1035935,0.03521343,0.001375471],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8439292,0.001986867,0.1327536,0.004438872,0.0002002785,0.00365999,0.0008125508,0.0009028298,0.01131579],"genre_scores_gemma":[0.9229926,0.0003771894,0.07219187,0.0009672947,0.00007776438,0.002057452,0.00039864,0.0002796773,0.0006575838],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7683529,"threshold_uncertainty_score":0.9475158,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08067820091748466,"score_gpt":0.3121066432477392,"score_spread":0.2314284423302546,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}