{"id":"W7117645573","doi":"10.1109/wincom65874.2025.11313356","title":"Ranking Large Language Models with Human Preferences: A Game-Theoretic and Bayesian Comparative Study","year":2025,"lang":"","type":"article","venue":"","topic":"Mobile Crowdsensing and Crowdsourcing","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université du Québec à Trois-Rivières","funders":"","keywords":"Ranking (information retrieval); Pairwise comparison; Transitive relation; Convergence (economics); Bayesian probability; Ranking SVM; Scalability; Preference; Sensitivity (control systems)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.0009722557,0.0005513378,0.0007981943,0.0003336722,0.0009052742,0.001365866,0.0007432704,0.0001198723,0.00007339803],"category_scores_gemma":[0.00001296285,0.0004331504,0.00007361233,0.0009439187,0.0003728877,0.000559327,0.000626946,0.0004966318,0.000005822581],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00006213373,"about_ca_system_score_gemma":0.0001902282,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003429709,"about_ca_topic_score_gemma":0.001254229,"domain_scores_codex":[0.9962125,0.000597259,0.0005846248,0.001323902,0.0004916639,0.0007899929],"domain_scores_gemma":[0.9980926,0.0002250238,0.0001981797,0.001106959,0.0001876459,0.0001895846],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001745224,0.002312867,0.007346376,0.0003513111,0.0006502709,0.000200177,0.4461298,0.004154082,0.0003931707,0.5233388,0.0001361577,0.01481242],"study_design_scores_gemma":[0.004155437,0.001538799,0.001579044,0.001249368,0.0002666448,0.0000263963,0.0780787,0.8943152,0.0007801711,0.01716328,0.00002917852,0.0008177582],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5039294,0.0004833235,0.4709419,0.00006232822,0.00008186637,0.0007612832,0.000002330682,0.0001327433,0.02360477],"genre_scores_gemma":[0.9945354,0.000009839491,0.002918771,0.0001919914,0.0000376342,0.00003986759,0.00000211196,0.00001878874,0.002245624],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8901612,"threshold_uncertainty_score":0.999812,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02112583726665783,"score_gpt":0.2886566296831123,"score_spread":0.2675307924164545,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}