{"id":"W4390215202","doi":"10.48550/arxiv.2312.14769","title":"Large Language Model (LLM) Bias Index -- LLMBI","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Topic Modeling","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"University Canada West","funders":"","keywords":"Metric (unit); Computer science; Index (typography); Measure (data warehouse); Empirical measure; Reliability (semiconductor); Econometrics; Data science; Gender bias; Performance metric; Artificial intelligence; Cognitive psychology; Machine learning; Natural language processing; Psychology; Data mining; Statistics; Social psychology; Mathematics; Economics; Operations management","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0004401481,0.0003460823,0.0003589278,0.0003999172,0.0001497788,0.0001596716,0.00278541,0.0003914077,0.00002101669],"category_scores_gemma":[0.00005641499,0.0004161189,0.0002511386,0.0005925149,0.00004255081,0.0003535101,0.004986621,0.0008053232,0.0003527037],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002032387,"about_ca_system_score_gemma":0.0002796496,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003190381,"about_ca_topic_score_gemma":0.0002084303,"domain_scores_codex":[0.9974552,0.0001077915,0.0002379221,0.001455872,0.0001681585,0.0005750441],"domain_scores_gemma":[0.9972253,0.00008640757,0.0002074261,0.002178916,0.0001050977,0.0001968291],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000005422638,0.00006378184,0.001397329,0.00005643192,0.00004857549,0.000482604,0.001126125,0.8355995,0.00001425325,0.1604907,0.0004397896,0.00027544],"study_design_scores_gemma":[0.0003367174,0.00001103088,0.0002226299,0.00006260144,0.00002318104,0.000001882836,0.0001631029,0.9351789,0.00003289195,0.06343412,0.0001295741,0.0004033286],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2368531,0.0000396215,0.7596558,0.0001324301,0.0005759466,0.0001851658,0.00002662508,0.000754338,0.00177696],"genre_scores_gemma":[0.9837686,0.00006745853,0.003394833,0.0001618486,0.0001055758,0.000001337662,0.00001879307,0.00003597969,0.01244558],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.756261,"threshold_uncertainty_score":0.9998291,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1565319545738375,"score_gpt":0.2146151699651807,"score_spread":0.05808321539134317,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}