{"id":"W4415955467","doi":"10.1109/iccv51701.2025.00074","title":"MultiVerse: A Multi-Turn Conversation Benchmark for Evaluating Large Vision and Language Models","year":2025,"lang":"","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Kootenay Association for Science & Technology","funders":"Ministry of Science and ICT, South Korea","keywords":"Conversation; Benchmark (surveying); Set (abstract data type); Perception; Context (archaeology); Key (lock)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008396982,0.004803728,0.001453746,0.002990464,0.001500712,0.002892681,0.003465478,0.002968597,0.005523018],"category_scores_gemma":[0.02816993,0.0006302134,0.002031943,0.001260869,0.001066408,0.004135068,0.005783799,0.00340538,0.003663797],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00161926,"about_ca_system_score_gemma":0.001883339,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01069686,"about_ca_topic_score_gemma":0.01495218,"domain_scores_codex":[0.9908229,0.004913836,0.0006803318,0.001941202,0.001189148,0.0004525365],"domain_scores_gemma":[0.9883963,0.007648197,0.0005237299,0.001288882,0.001325209,0.0008175698],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0051905,0.003276755,0.0307963,0.00496649,0.002162427,0.0009120132,0.002754722,0.1595426,0.02673757,0.006909142,0.1224856,0.634266],"study_design_scores_gemma":[0.0005071021,0.003104432,0.01456487,0.0003863334,0.0003396033,0.0008580226,0.002201718,0.8968257,0.02841153,0.01309032,0.03938298,0.0003273927],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.4977448,0.01277866,0.351933,0.002151705,0.002417834,0.003268063,0.03577909,0.0585308,0.03539621],"genre_scores_gemma":[0.6690353,0.0009842737,0.2458513,0.001050612,0.0003164463,0.002515171,0.06993712,0.002781791,0.007527985],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.01069686,"threshold_uncertainty_score":0.04440802,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02903482643643528,"score_gpt":0.3890024476712032,"score_spread":0.3599676212347679,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}