{"id":"W4404780760","doi":"10.18653/v1/2024.wikinlp-1.9","title":"Retrieval Evaluation for Long-Form and Knowledge-Intensive Image–Text Article Composition","year":2024,"lang":"en","type":"article","venue":"","topic":"Image Retrieval and Classification Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Information retrieval; Composition (language); Image retrieval; Image (mathematics); Natural language processing; Artificial intelligence; Linguistics","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006873751,0.0001000795,0.00009831943,0.0001061219,0.0001152513,0.0004480323,0.0001715106,0.00005481282,0.00003565981],"category_scores_gemma":[0.0001039752,0.00008247275,0.00005609404,0.0003784185,0.00006071545,0.0008255118,0.00008236145,0.00007582922,0.00009653661],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00008905741,"about_ca_system_score_gemma":0.0001003876,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000002621761,"about_ca_topic_score_gemma":0.000001376579,"domain_scores_codex":[0.9990541,0.00004219491,0.0001917967,0.0003426571,0.0002054065,0.000163869],"domain_scores_gemma":[0.9986099,0.0001513536,0.00003130363,0.0002190093,0.0009260519,0.00006236973],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00005796584,0.00009157138,0.0000388858,0.0001919271,0.00004349316,0.000005434706,0.001636112,5.677528e-7,0.1918995,0.1828863,0.01091977,0.6122285],"study_design_scores_gemma":[0.0002079545,0.000113817,0.001080284,0.0000426956,0.00002345924,0.00002768195,0.00005524481,0.6272838,0.3493169,0.02036974,0.0013512,0.0001271856],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.009318897,0.0008363493,0.9823593,0.003679867,0.0002416678,0.0005681814,0.000002951828,0.0005414292,0.002451394],"genre_scores_gemma":[0.9705299,0.00005005548,0.02806375,0.0002383173,0.00008420587,0.00004664264,0.00001256425,0.00001030808,0.0009642756],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.961211,"threshold_uncertainty_score":0.4320386,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02998989438937405,"score_gpt":0.3324935095904673,"score_spread":0.3025036152010933,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}