{"id":"W4389362477","doi":"10.48550/arxiv.2312.00805","title":"Gender inference: can chatGPT outperform common commercial tools?","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Sports Analytics and Performance","field":"Economics, Econometrics and Finance","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"University of Toronto","keywords":"Computer science; Inference; Artificial intelligence; Data science; Set (abstract data type); Generative grammar; Machine learning","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0004436144,0.0003968308,0.000777005,0.0005060588,0.0002500682,0.0001924979,0.0008775358,0.0004651331,0.0007877632],"category_scores_gemma":[0.00003925469,0.0005191216,0.0003373763,0.0004576028,0.0001284598,0.0002334621,0.0009003471,0.0008664161,0.001134137],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003277112,"about_ca_system_score_gemma":0.0001181454,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002725597,"about_ca_topic_score_gemma":0.00138006,"domain_scores_codex":[0.9978859,0.00001350033,0.0005597388,0.0009801937,0.00003948107,0.0005211761],"domain_scores_gemma":[0.9980299,0.00006248758,0.0005896288,0.001044269,0.00007577869,0.0001979458],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00002973024,0.00009010112,0.5714755,0.000135819,0.0002179664,0.0001129938,0.0005078138,0.08809452,2.670326e-7,0.3373452,0.001652072,0.0003379335],"study_design_scores_gemma":[0.001037739,0.0000911516,0.4131795,0.0001108369,0.0001141863,0.000002522993,0.0002186051,0.406253,0.00001154978,0.1462968,0.03095893,0.001725137],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9677905,0.000154685,0.004197944,0.0003342226,0.001966042,0.000318936,0.0009537971,0.0001811627,0.02410273],"genre_scores_gemma":[0.9886631,0.001677833,0.00002111573,0.0003205931,0.0002687774,0.000002469598,0.0003351762,0.00005862101,0.008652307],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3181585,"threshold_uncertainty_score":0.9997261,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2764190071359,"score_gpt":0.2171654692307627,"score_spread":0.05925353790513727,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}