{"id":"W3119519251","doi":"10.1609/aaai.v35i16.17681","title":"What's the Best Place for an AI Conference, Vancouver or _______: Why Completing Comparative Questions is Difficult","year":2021,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Topic Modeling","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Computer science; Competence (human resources); Artificial intelligence; sort; Natural language processing; Benchmark (surveying); Set (abstract data type); Task (project management); Language model; Machine learning; Cognitive science; Psychology; Information retrieval","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001300269,0.0005638764,0.0004139375,0.0007662399,0.003226705,0.004520489,0.0007929296,0.001520996,0.04888696],"category_scores_gemma":[0.007582098,0.0002551862,0.0003331777,0.001467751,0.0009661181,0.003530284,0.0009270457,0.002152928,0.01137626],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003728793,"about_ca_system_score_gemma":0.003879177,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.1778551,"about_ca_topic_score_gemma":0.412489,"domain_scores_codex":[0.9993579,0.0002195016,0.00003090532,0.000156972,0.0001302013,0.0001045652],"domain_scores_gemma":[0.99753,0.0006630539,0.0001282406,0.0002078333,0.000780488,0.000690475],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004745171,0.0001578961,0.01446973,0.0006598427,0.00008305041,0.0006339146,0.002689063,0.004381315,0.003370955,0.02303216,0.6434322,0.3066154],"study_design_scores_gemma":[0.00006335695,0.00008816709,0.02861219,0.0004947063,0.00005417647,0.0004165666,0.007635457,0.01207624,0.004215505,0.0293159,0.9169004,0.0001274441],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"other","genre_gemma":"empirical","genre_scores_codex":[0.1865802,0.01119606,0.02771194,0.09881852,0.006200174,0.0004247253,0.02210391,0.007116349,0.6398482],"genre_scores_gemma":[0.6952793,0.005767223,0.04340654,0.005112211,0.0008747542,0.0002214436,0.02562975,0.001252831,0.2224559],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.1778551,"threshold_uncertainty_score":0.3536397,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2076591633305094,"score_gpt":0.3647780794122421,"score_spread":0.1571189160817327,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}