{"id":"W4415779721","doi":"10.33423/jabe.v27i5.7857","title":"Approaching Human-Level Data Coding? A Systematic Comparison of OpenAI, DeepSeek, and Human Coders in Qualitative Analysis of Customer Reviews","year":2025,"lang":"","type":"article","venue":"Journal of Applied Business and Economics","topic":"Computational and Text Analysis Methods","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Coding (social sciences); Qualitative analysis; Qualitative research; Scalability; Qualitative property","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.5500536,0.001530321,0.002662034,0.01124834,0.004518851,0.007425406,0.003474213,0.001949808,0.002288057],"category_scores_gemma":[0.7711039,0.001746198,0.00199754,0.01025084,0.01313111,0.009420106,0.01109722,0.003243495,0.0007153244],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.009274106,"about_ca_system_score_gemma":0.02464052,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006699915,"about_ca_topic_score_gemma":0.01485527,"domain_scores_codex":[0.218852,0.6656753,0.05098808,0.01758029,0.04466936,0.002234902],"domain_scores_gemma":[0.10276,0.7069666,0.05001308,0.04572116,0.09292778,0.001611491],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"qualitative","study_design_gemma":"observational","study_design_scores_codex":[0.001515944,0.0002957195,0.06451184,0.04220553,0.002479845,0.0003591186,0.4824165,0.001772451,0.007087642,0.02947562,0.01026866,0.3576112],"study_design_scores_gemma":[0.00202757,0.002705184,0.09289512,0.1253062,0.003171261,0.001197787,0.4033376,0.02411059,0.02504273,0.1594505,0.159229,0.001526496],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2760432,0.02064671,0.64043,0.01401533,0.00229757,0.02795425,0.002587724,0.0009178552,0.01510735],"genre_scores_gemma":[0.6172096,0.002795268,0.3222463,0.003987224,0.0002296331,0.05056843,0.001041388,0.0006089383,0.001313207],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.4499464,"threshold_uncertainty_score":0.554864,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2436110177352338,"score_gpt":0.4710197405948601,"score_spread":0.2274087228596263,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}