{"id":"W4390145251","doi":"10.18280/isi.280626","title":"Enhancing Identity Document Classification in KYC Processes: An Evaluation of the Bag-of-Visual-Words Model and Segmentation Impact","year":2023,"lang":"en","type":"article","venue":"Ingénierie des systèmes d information","topic":"Authorship Attribution and Profiling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Binus University","keywords":"Identity (music); Segmentation; Artificial intelligence; Pattern recognition (psychology); Natural language processing; Computer science; Information retrieval; Art; Aesthetics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003529368,0.00009435838,0.000124763,0.0002917734,0.0001323185,0.0001495385,0.000244326,0.00006740028,0.000003773419],"category_scores_gemma":[0.0004973319,0.00007706996,0.00003098963,0.001473027,0.00005112222,0.007243765,0.00009369243,0.0000754953,0.000004097418],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000309754,"about_ca_system_score_gemma":0.0003714761,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00008673883,"about_ca_topic_score_gemma":0.00009590228,"domain_scores_codex":[0.9982805,0.0002149603,0.0006218087,0.0001209569,0.0006154365,0.000146335],"domain_scores_gemma":[0.9986454,0.00005750042,0.0005156907,0.0002119289,0.0005341844,0.00003532849],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007746935,0.0001285291,0.05437794,0.002530396,0.0000574814,2.292747e-7,0.1820011,0.3926443,0.04222718,0.04934136,0.00002060884,0.2765933],"study_design_scores_gemma":[0.000274576,0.00004491277,0.08966109,0.0001419388,0.00001119841,0.000001408305,0.001700742,0.8695993,0.02123149,0.01725404,8.491321e-7,0.00007844412],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6859,0.00002264846,0.3134865,0.00002743294,0.0000755982,0.0003582984,0.000004132242,0.00003971412,0.00008575204],"genre_scores_gemma":[0.9974884,0.00002259784,0.002343478,0.00001612727,0.00000683771,0.00005801692,0.00005724173,0.000003326908,0.000003929551],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.476955,"threshold_uncertainty_score":0.5251555,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05658156724440002,"score_gpt":0.361020012995824,"score_spread":0.304438445751424,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}