{"id":"W7162329119","doi":"10.63282/3050-922x.ijeret-v4i2p117","title":"A Scalable Architecture for Automated Data Classification and Sensitive Information Discovery Using Artificial Intelligence","year":2023,"lang":"","type":"article","venue":"International Journal of Emerging Research in Engineering and Technology","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Institute on Governance","funders":"","keywords":"Scalability; Data governance; Flexibility (engineering); Knowledge extraction; Data architecture; Cloud computing; Architecture; Data classification; Data warehouse","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009634071,0.0001329997,0.0002619532,0.00584746,0.0001342878,0.0007066203,0.001193337,0.0001568589,0.000002500085],"category_scores_gemma":[0.00825221,0.0001235606,0.00002990621,0.002237709,0.0002814144,0.002033632,0.001321537,0.0006335366,0.000005013039],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001240158,"about_ca_system_score_gemma":0.0001582091,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00004741322,"about_ca_topic_score_gemma":0.00002021463,"domain_scores_codex":[0.9970125,0.000118225,0.001082716,0.0003196487,0.001089403,0.0003775323],"domain_scores_gemma":[0.9967375,0.001446702,0.0003293132,0.0003476659,0.001066838,0.00007197993],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003609076,0.0001022111,0.0003232775,0.0002191549,0.0002663239,0.0001164609,0.001376889,0.1217449,0.004300228,0.1084985,0.0009305319,0.7617606],"study_design_scores_gemma":[0.0002025472,0.0001089819,0.0003551812,0.000488951,0.00001087408,0.00008448832,0.006158448,0.9545534,0.0004178817,0.03065448,0.006855297,0.0001095118],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3460316,0.0003791612,0.6161194,0.03482378,0.001678786,0.0004620771,0.0003746149,0.0001092419,0.0000212451],"genre_scores_gemma":[0.9904314,0.0008742777,0.008446557,0.0000207149,0.0001362316,0.000006380668,0.00006304517,0.000009653013,0.00001176093],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8328084,"threshold_uncertainty_score":0.9879262,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2884627211744191,"score_gpt":0.4907000701104051,"score_spread":0.202237348935986,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}