{"id":"W4406896595","doi":"10.2196/59452","title":"The Social Construction of Categorical Data: Mixed Methods Approach to Assessing Data Features in Publicly Available Datasets","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Categorical variable; Machine learning; Leverage (statistics); Computer science; Artificial intelligence; Data collection; Population; Data pre-processing; Data science; Data mining; Medicine; Statistics; Mathematics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.307354,0.001878796,0.001972509,0.009606103,0.003597256,0.008913924,0.005640745,0.003666134,0.002302482],"category_scores_gemma":[0.5070894,0.001167807,0.00613893,0.008832786,0.008601903,0.006043894,0.008270581,0.004983005,0.0003186967],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005927955,"about_ca_system_score_gemma":0.004973158,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004956136,"about_ca_topic_score_gemma":0.005273924,"domain_scores_codex":[0.5279987,0.4132713,0.01558305,0.01751491,0.02416525,0.001466756],"domain_scores_gemma":[0.2038004,0.7159185,0.03025354,0.03432851,0.0144357,0.001263324],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"qualitative","study_design_scores_codex":[0.001869129,0.001545284,0.4172037,0.00776782,0.0135175,0.001201066,0.03933753,0.03594062,0.003056262,0.208599,0.005915319,0.2640468],"study_design_scores_gemma":[0.0005641502,0.003123426,0.134623,0.00471776,0.004890596,0.001284263,0.03103414,0.335057,0.0135716,0.4347705,0.0354717,0.0008919018],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.09955515,0.001733373,0.8831347,0.004561824,0.0002870772,0.004977489,0.002469028,0.0004073176,0.002874068],"genre_scores_gemma":[0.4347946,0.0003383406,0.5488944,0.001034014,0.0001777617,0.01268778,0.001477591,0.0001358039,0.0004596018],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.692646,"threshold_uncertainty_score":0.8541558,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2458722112389667,"score_gpt":0.5393125788566828,"score_spread":0.2934403676177161,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}