{"id":"W6910435349","doi":"10.48448/a3r5-n223","title":"Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation","year":2024,"lang":"en","type":"other","venue":"Underline Science Inc.","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Perception; Set (abstract data type); Measure (data warehouse); Affect (linguistics); Diffusion; Point (geometry); Variation (astronomy); Calibration","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.00563535,0.0006103067,0.000568268,0.002733641,0.0002699195,0.0009433716,0.0006518328,0.0003220823,0.0007053432],"category_scores_gemma":[0.0009389893,0.0005512509,0.00006050767,0.003088103,0.001545809,0.0004194128,0.0005140679,0.0007677693,0.0007488305],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002200369,"about_ca_system_score_gemma":0.0007905804,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004779223,"about_ca_topic_score_gemma":0.01390321,"domain_scores_codex":[0.9948676,0.0002776247,0.0005572002,0.001960043,0.001420501,0.0009170857],"domain_scores_gemma":[0.9984576,0.0001166421,0.0001780275,0.000779776,0.0000831088,0.0003848301],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003146783,0.001510222,0.0130481,0.002626092,0.0004614335,0.0005699001,0.07629053,0.004619122,0.3146561,0.07638611,0.4790641,0.03045364],"study_design_scores_gemma":[0.009186313,0.001542778,0.00735013,0.01493529,0.001403718,0.0005468572,0.0520981,0.5861533,0.002439921,0.07305751,0.233484,0.01780207],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"other","genre_gemma":"empirical","genre_scores_codex":[0.02438554,0.001522228,0.1509783,0.0007523351,0.002996385,0.004295597,0.0005383652,0.002347721,0.8121836],"genre_scores_gemma":[0.9388123,0.00004895278,0.02219062,0.0002008151,0.001096151,0.00006048503,0.00004503255,0.001059951,0.03648565],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9144268,"threshold_uncertainty_score":0.9996939,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06876972136773002,"score_gpt":0.3102602665424992,"score_spread":0.2414905451747692,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}