{"id":"W4362700320","doi":"10.31219/osf.io/d7pbh","title":"The Rational Agent Benchmark for Data Visualization","year":2023,"lang":"en","type":"preprint","venue":"","topic":"Data Visualization and Analytics","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Science North","funders":"","keywords":"Visualization; Computer science; Benchmark (surveying); Bounding overwatch; Information visualization; Task (project management); Data visualization; Rational agent; Creative visualization; Rational design; Human–computer interaction; Data mining; Machine learning; Artificial intelligence; Engineering; Systems engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02663824,0.00157609,0.001168189,0.002346944,0.001460737,0.003590344,0.002583819,0.002723045,0.003829847],"category_scores_gemma":[0.1178187,0.0004510047,0.001108182,0.0024657,0.002607655,0.003077631,0.003626476,0.002688986,0.0009153281],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002064663,"about_ca_system_score_gemma":0.002846149,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003691625,"about_ca_topic_score_gemma":0.003307651,"domain_scores_codex":[0.9686781,0.02441283,0.001461506,0.001605454,0.003314343,0.000527774],"domain_scores_gemma":[0.8873727,0.08682951,0.003910881,0.01593297,0.004147853,0.001805985],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003245437,0.002655121,0.01132736,0.002696197,0.0006411516,0.0005718813,0.002413796,0.3975101,0.008062356,0.3344432,0.05393805,0.1824954],"study_design_scores_gemma":[0.0007738185,0.0007322945,0.002746705,0.0002328529,0.00005338411,0.0001542236,0.000314046,0.7408103,0.0069261,0.2268066,0.02034817,0.0001015275],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1947116,0.004349217,0.7390208,0.00748685,0.000632425,0.00207835,0.006515906,0.009892985,0.03531186],"genre_scores_gemma":[0.4573211,0.0006022091,0.5343432,0.000432152,0.00008969496,0.001957728,0.002487073,0.0007708213,0.001995918],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.02663824,"threshold_uncertainty_score":0.1408781,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.17094996800839,"score_gpt":0.408702341540989,"score_spread":0.237752373532599,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}