{"id":"W4407953544","doi":"10.1145/3701551.3705706","title":"LLM4Eval@WSDM 2025: Large Language Model for Evaluation in Information Retrieval","year":2025,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"Microsoft (Canada); University of Waterloo","funders":"Universitas Brawijaya","keywords":"Computer science; Information retrieval; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001253827,0.00006605059,0.00008401553,0.0002054034,0.00004618411,0.00008842608,0.0003157712,0.00005929892,0.00001461961],"category_scores_gemma":[0.0002412604,0.00006345282,0.0000327095,0.00032037,0.000003632803,0.001023631,0.0001183083,0.00006606419,0.00001579511],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001133041,"about_ca_system_score_gemma":0.0001955144,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002123804,"about_ca_topic_score_gemma":0.00005759191,"domain_scores_codex":[0.9991271,0.00003013724,0.0002581365,0.0001569178,0.0002474851,0.0001802596],"domain_scores_gemma":[0.9994159,0.00005080573,0.00004163598,0.0003333163,0.0001383387,0.00002003928],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0000430092,0.00007002452,0.0003688178,0.0001011824,0.00001316608,4.535784e-7,0.008025382,0.1544534,0.0004187836,0.6786105,0.003437415,0.1544578],"study_design_scores_gemma":[0.001001709,0.000007248027,0.0002023363,0.0000144076,0.00000378881,1.574111e-7,0.0001081166,0.9858114,0.0005257245,0.0118721,0.0003879003,0.00006509067],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02455564,0.00005101558,0.965009,0.0009346348,0.0001969916,0.0004788772,0.000002833343,0.00008082916,0.008690172],"genre_scores_gemma":[0.9142671,0.000002712627,0.08290412,0.001159171,0.00001735304,0.00004014588,0.00001710335,0.000002139863,0.0015902],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8897114,"threshold_uncertainty_score":0.2587531,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02675071938737008,"score_gpt":0.3243063935755636,"score_spread":0.2975556741881935,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}