{"id":"W2951405260","doi":"10.1007/978-3-030-23381-5_5","title":"Big Data Quality: A Data Quality Profiling Model","year":2019,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":13,"is_retracted":false,"has_abstract":false,"ca_institutions":"Concordia University","funders":"","keywords":"Data quality; Profiling (computer programming); Computer science; Data governance; Big data; Data mining; Data science; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008647586,0.001091083,0.0007725279,0.003777913,0.001066503,0.005621995,0.002309333,0.001529593,0.003859043],"category_scores_gemma":[0.02343069,0.0007121955,0.001468737,0.004508887,0.001981141,0.01116984,0.00304114,0.002572191,0.0008610815],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003120563,"about_ca_system_score_gemma":0.00243834,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005101338,"about_ca_topic_score_gemma":0.003976997,"domain_scores_codex":[0.994888,0.001620542,0.0003014061,0.0008106788,0.001957801,0.00042164],"domain_scores_gemma":[0.9839633,0.008126445,0.002101953,0.001879094,0.003159967,0.0007691575],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0002183971,0.0002359278,0.01686552,0.0003784371,0.0001398653,0.0001423855,0.0008449011,0.1174847,0.001270644,0.6377418,0.0199822,0.2046953],"study_design_scores_gemma":[0.0000158893,0.00006379586,0.003099595,0.0001250791,0.00006532667,0.0001478554,0.000264219,0.6623379,0.001167365,0.3212425,0.0114275,0.00004302932],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01072778,0.0005484493,0.9724559,0.003805049,0.00009040009,0.0001657366,0.0005362483,0.0007863296,0.01088403],"genre_scores_gemma":[0.5881675,0.001220184,0.3971795,0.001063112,0.0003534346,0.0003896827,0.00115296,0.000339411,0.01013414],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008647586,"threshold_uncertainty_score":0.04573339,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5635995789952036,"score_gpt":0.4702822448180456,"score_spread":0.09331733417715798,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}