{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":476,"total_is_capped":false,"direct_labels_cover":3,"predictions_cover":476,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"8f8a0ffd912f","filters":{"topic":"Multimodal Machine Learning Applications"}},"results":[{"id":"W1514535095","doi":"10.48550/arxiv.1502.03044","title":"Show, Attend and Tell: Neural Image Caption Generation with Visual Attention","year":2015,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":7525,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Canadian Institute for Advanced Research; University of Toronto; Université de Montréal","funders":"","keywords":"Computer science; Benchmark (surveying); Artificial intelligence; Visualization; Gaze; Object (grammar); Backpropagation; Salient; Sequence (biology); Object detection; Machine translation; Image (mathematics); Artificial neural network; Machine learning; Computer vision; Pattern recognition (psychology)","authors":[{"name":"Kelvin Xu","is_ca":true},{"name":"Jimmy Ba","is_ca":true},{"name":"Ryan Kiros","is_ca":true},{"name":"Kyunghyun Cho","is_ca":true},{"name":"Aaron Courville","is_ca":true},{"name":"Rich Zemel","is_ca":true},{"name":"Yoshua Bengio","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06664802413473758,"gpt":0.2082971016600826,"spread":0.141649077525345,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008708236,0.001429545,0.0006569051,0.0008400625,0.0004916052,0.001031298,0.002432609,0.002228557,0.00756685],"category_scores_gemma":[0.004161246,0.0005923039,0.0007824763,0.0007845811,0.0007864303,0.002500932,0.001588558,0.00190988,0.002448102],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001014995,"about_ca_system_score_gemma":0.0006239883,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007836649,"about_ca_topic_score_gemma":0.01137355,"domain_scores_codex":[0.9996555,0.00009229153,0.00001229826,0.0001238032,0.00007257556,0.00004359007],"domain_scores_gemma":[0.9990698,0.0004825535,0.00004823041,0.0002088273,0.0001304791,0.00006016395],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006173333,0.0002694919,0.0009739755,0.0003818756,0.0001857627,0.0003440555,0.0002956024,0.1508136,0.0299698,0.01622626,0.0841597,0.7157626],"study_design_scores_gemma":[0.00005160049,0.00007078199,0.0002298033,0.00001545525,0.00002286343,0.00008817526,0.00002418372,0.9688085,0.01167903,0.01406701,0.00492134,0.00002121397],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.05071336,0.003153895,0.8817399,0.001608391,0.001054017,0.0003673916,0.002217181,0.04610902,0.01303676],"genre_scores_gemma":[0.521648,0.001022969,0.447942,0.001464084,0.0004796683,0.000443454,0.005082408,0.002350086,0.01956726],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.007836649,"threshold_uncertainty_score":0.02531362,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1566289585","doi":"10.1109/iccv.2015.11","title":"Aligning Books and Movies: Towards Story-Like Visual Explanations by Watching Movies and Reading Books","year":2015,"lang":"en","type":"preprint","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":2068,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Canadian Institute for Advanced Research; University of Toronto","funders":"","keywords":"Computer science; Reading (process); Context (archaeology); Semantics (computer science); Sentence; Embedding; Object (grammar); Artificial intelligence; Feeling; Natural language processing; Character (mathematics); Linguistics; Psychology; History","authors":[{"name":"Yukun Zhu","is_ca":true},{"name":"Ryan Kiros","is_ca":true},{"name":"Rich Zemel","is_ca":true},{"name":"Ruslan Salakhutdinov","is_ca":true},{"name":"Raquel Urtasun","is_ca":true},{"name":"Antonio Torralba","is_ca":false},{"name":"Sanja Fidler","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0244207246769013,"gpt":0.3090277660838301,"spread":0.2846070414069288,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002834161,0.0007629422,0.0002569709,0.0005202683,0.0002783437,0.000907579,0.0007457805,0.0008417455,0.004448122],"category_scores_gemma":[0.002290468,0.0003593072,0.0006383325,0.0005375159,0.0004159119,0.002393796,0.0008487474,0.001176413,0.0009780509],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004774238,"about_ca_system_score_gemma":0.0003918638,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004727492,"about_ca_topic_score_gemma":0.008455875,"domain_scores_codex":[0.9998028,0.0000483525,0.000006689846,0.00009455799,0.00002992502,0.00001780736],"domain_scores_gemma":[0.9996352,0.000138054,0.00005739879,0.00007241093,0.0000654471,0.00003138803],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006945355,0.0003032994,0.01535984,0.0005684051,0.0002710068,0.0009039085,0.003014842,0.07789803,0.0741183,0.03498066,0.02653541,0.7653518],"study_design_scores_gemma":[0.00003874348,0.0001555213,0.0125357,0.00009767801,0.0001228415,0.0005327721,0.0009875154,0.8941216,0.02974631,0.03797665,0.02363104,0.00005356873],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1977962,0.001326665,0.7792934,0.001353167,0.0001840743,0.0002011915,0.002121264,0.005970215,0.01175382],"genre_scores_gemma":[0.6557407,0.0007571069,0.3306255,0.0003248565,0.00009229362,0.00009447573,0.003929224,0.0003964749,0.00803926],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004727492,"threshold_uncertainty_score":0.01488042,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2760103357","doi":"10.1609/aaai.v32i1.11671","title":"FiLM: Visual Reasoning with a General Conditioning Layer","year":2018,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":1633,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Canadian Institute for Advanced Research; Université de Montréal","funders":"Fonds de recherche du Québec – Nature et technologies; CHIST-ERA; Nvidia","keywords":"Affine transformation; Computer science; Benchmark (surveying); Artificial intelligence; Feature (linguistics); Computation; Transformation (genetics); Artificial neural network; Simple (philosophy); Layer (electronics); Visual reasoning; Image (mathematics); Task (project management); Process (computing); Pattern recognition (psychology); Machine learning; Algorithm; Mathematics","authors":[{"name":"Ethan Perez","is_ca":true},{"name":"Florian Strub","is_ca":false},{"name":"Harm de Vries","is_ca":true},{"name":"Vincent Dumoulin","is_ca":true},{"name":"Aaron Courville","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04609872896526987,"gpt":0.3260767922855972,"spread":0.2799780633203274,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006397308,0.001068357,0.0004502192,0.0003313238,0.0002746774,0.001305957,0.001926961,0.001076341,0.01379259],"category_scores_gemma":[0.00284155,0.000518426,0.000651501,0.0002475681,0.0009339169,0.003454172,0.001959354,0.0021374,0.002281313],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000678196,"about_ca_system_score_gemma":0.0006646126,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002211309,"about_ca_topic_score_gemma":0.003112122,"domain_scores_codex":[0.9996909,0.00004986714,0.00001791759,0.0001119563,0.00008353875,0.00004590556],"domain_scores_gemma":[0.9994383,0.0001743177,0.00005448889,0.0002234226,0.00006621449,0.00004314872],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001089078,0.0004489443,0.0014442,0.0007522595,0.0002412783,0.0002834982,0.0003204255,0.1298295,0.1252228,0.08001629,0.03318373,0.6271679],"study_design_scores_gemma":[0.0001144776,0.0002177195,0.0004922131,0.00005354484,0.00006839664,0.0001309734,0.0000334242,0.8590227,0.07309932,0.05123974,0.01549397,0.00003364491],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02013849,0.0004267631,0.9561568,0.0005475299,0.0001719791,0.0001998324,0.000560865,0.01305041,0.00874723],"genre_scores_gemma":[0.4952376,0.0003680628,0.4889565,0.0009619433,0.0001065531,0.000303953,0.001202365,0.001116639,0.01174642],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01379259,"threshold_uncertainty_score":0.04614073,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2767290858","doi":"10.1109/msp.2017.2738401","title":"Deep Multimodal Learning: A Survey on Recent Advances and Trends","year":2017,"lang":"en","type":"article","venue":"IEEE Signal Processing Magazine","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":1067,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Guelph","funders":"","keywords":"Deep learning; Computer science; Artificial intelligence; Modalities; Multimodal learning; Field (mathematics); Machine learning; Data science","authors":[{"name":"Dhanesh Ramachandram","is_ca":true},{"name":"Graham W. Taylor","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02787362915645639,"gpt":0.3174627048172625,"spread":0.2895890756608062,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001300369,0.0009737989,0.0008777864,0.001962439,0.0002462234,0.001300265,0.001325234,0.00100977,0.006409968],"category_scores_gemma":[0.003602025,0.0004462422,0.0005408275,0.002654588,0.0004811135,0.003100375,0.001246972,0.001777424,0.002055154],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008791328,"about_ca_system_score_gemma":0.001046923,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002065561,"about_ca_topic_score_gemma":0.002860891,"domain_scores_codex":[0.9996333,0.00007146651,0.00004054614,0.00007475433,0.0001482044,0.00003170887],"domain_scores_gemma":[0.998737,0.0007360709,0.00006855372,0.00004972942,0.0003387785,0.00006991217],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00008126433,0.00006801814,0.001253221,0.00250353,0.00006493377,0.00006856299,0.0000644957,0.004631367,0.0008894861,0.01202402,0.02600042,0.9523507],"study_design_scores_gemma":[0.00003796822,0.000295869,0.003315086,0.005118185,0.0002702497,0.001077669,0.0003418624,0.04961083,0.005154359,0.04942865,0.8852258,0.0001233173],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.00519095,0.908178,0.06436006,0.005162235,0.0006922676,0.00006301374,0.0003899018,0.0004294902,0.01553405],"genre_scores_gemma":[0.03756598,0.919416,0.03289833,0.002054714,0.001098869,0.00009333131,0.0008143654,0.000139719,0.005918615],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.006409968,"threshold_uncertainty_score":0.02144349,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1586939924","doi":"10.1109/iccv.2015.512","title":"Describing Videos by Exploiting Temporal Structure","year":2015,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":956,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Polytechnique Montréal; Université de Montréal; Université de Sherbrooke","funders":"Compute Canada; Canada Research Chairs; Canadian Institute for Advanced Research","keywords":"Computer science; Recurrent neural network; Artificial intelligence; Representation (politics); Convolutional neural network; Context (archaeology); Motion (physics); Natural language; Pattern recognition (psychology); Artificial neural network; Machine learning","authors":[{"name":"Li Yao","is_ca":true},{"name":"Atousa Torabi","is_ca":true},{"name":"Kyunghyun Cho","is_ca":true},{"name":"Nicolas Ballas","is_ca":true},{"name":"Christopher Pal","is_ca":true},{"name":"Hugo Larochelle","is_ca":true},{"name":"Aaron Courville","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.05364504113686984,"gpt":0.2721015833326518,"spread":0.2184565421957819,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007077378,0.00110141,0.0004700376,0.00220224,0.0003536103,0.001024809,0.001045981,0.0006807908,0.002248605],"category_scores_gemma":[0.004547385,0.0002894748,0.0007594549,0.001981998,0.000378405,0.003786745,0.0009460966,0.0008668533,0.0009434641],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001325743,"about_ca_system_score_gemma":0.0007407964,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01866006,"about_ca_topic_score_gemma":0.02596431,"domain_scores_codex":[0.999369,0.0001621112,0.00006047286,0.0001842603,0.0001765188,0.00004756883],"domain_scores_gemma":[0.9984493,0.000609378,0.0002932733,0.0003098083,0.0002836469,0.00005449543],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00080337,0.0002075456,0.008141397,0.001016046,0.0002210755,0.0007949208,0.0006058461,0.1244507,0.02702975,0.02653597,0.03079319,0.7794001],"study_design_scores_gemma":[0.00003871594,0.0001570982,0.003088984,0.0001178619,0.000123558,0.0005851814,0.0002636113,0.9158756,0.0214684,0.02439838,0.03381789,0.00006479347],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1381117,0.004737106,0.8219122,0.001080952,0.0002550811,0.00044763,0.01341947,0.006181569,0.01385424],"genre_scores_gemma":[0.6084393,0.003643945,0.3440395,0.0003901484,0.0002198823,0.0003179974,0.03174729,0.0004741719,0.01072763],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01866006,"threshold_uncertainty_score":0.03710294,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2171361956","doi":"","title":"Multimodal Neural Language Models","year":2014,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":568,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto; Canadian Institute for Advanced Research","funders":"","keywords":"Computer science; Artificial intelligence; Convolutional neural network; Natural language processing; Modalities; Focus (optics); Sentence; Phrase; Natural language; Image (mathematics); Artificial neural network; Language model; Word (group theory); Speech recognition; Linguistics","authors":[{"name":"Ryan Kiros","is_ca":true},{"name":"Ruslan Salakhutdinov","is_ca":true},{"name":"Rich Zemel","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01089575007474679,"gpt":0.2662476004378025,"spread":0.2553518503630557,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009277636,0.0008407904,0.0007423628,0.0007727878,0.0004572747,0.001475152,0.001654094,0.001380173,0.009357654],"category_scores_gemma":[0.004621759,0.0003936867,0.001244809,0.000710235,0.0006117765,0.003275502,0.001220807,0.00204356,0.002529785],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009686984,"about_ca_system_score_gemma":0.0006817829,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005433103,"about_ca_topic_score_gemma":0.006173786,"domain_scores_codex":[0.9994388,0.0001824596,0.00003071958,0.0001805228,0.00009932472,0.00006811745],"domain_scores_gemma":[0.9988134,0.0006697032,0.0001085451,0.0001455728,0.000209952,0.00005281578],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003868944,0.0002764124,0.002122654,0.0003855671,0.0003166813,0.0005997912,0.0004935652,0.5265467,0.01140704,0.2114589,0.01817525,0.2278306],"study_design_scores_gemma":[0.00001024191,0.00002810499,0.0001800838,0.00001626625,0.00002807466,0.00008548774,0.00002933122,0.9518902,0.001279441,0.04454684,0.001889024,0.00001690258],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0653773,0.002057777,0.8965693,0.003878658,0.0004424281,0.0001567631,0.003037262,0.003465689,0.02501479],"genre_scores_gemma":[0.8659543,0.001200511,0.09123997,0.0009465327,0.0003539934,0.0003527458,0.002626588,0.0003660118,0.03695936],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009357654,"threshold_uncertainty_score":0.03130448,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1575833922","doi":"10.48550/arxiv.1505.02074","title":"Exploring Models and Data for Image Question Answering","year":2015,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":390,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Image (mathematics); Question answering; Suite; Artificial intelligence; Segmentation; Image segmentation; Simple (philosophy); Object (grammar); Baseline (sea); Information retrieval; Pattern recognition (psychology); Machine learning; Data mining","authors":[{"name":"Mengye Ren","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.4143372677061843,"gpt":0.2670283867265147,"spread":0.1473088809796696,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008460967,0.002298572,0.001697247,0.003373009,0.0009894086,0.00362408,0.004168534,0.004126429,0.004163468],"category_scores_gemma":[0.0391469,0.0008524997,0.002833024,0.002846571,0.001940202,0.01113566,0.004623545,0.005614033,0.002891325],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003181083,"about_ca_system_score_gemma":0.001548955,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008511794,"about_ca_topic_score_gemma":0.00939417,"domain_scores_codex":[0.9925256,0.004008802,0.0003584115,0.002107964,0.0007609351,0.0002383876],"domain_scores_gemma":[0.9751848,0.01753728,0.0009660153,0.004257829,0.001576787,0.0004772547],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001633361,0.001847601,0.02381503,0.002594246,0.0006115886,0.0003894912,0.001420152,0.2878342,0.01179507,0.05764866,0.07647693,0.5339337],"study_design_scores_gemma":[0.00006453598,0.000151888,0.001298459,0.00009147044,0.0000460357,0.0001233129,0.0002552964,0.8974559,0.002781626,0.08701441,0.01067635,0.00004068692],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.09592718,0.008450113,0.8591858,0.009577334,0.0003897402,0.000541164,0.01478038,0.006618079,0.004530195],"genre_scores_gemma":[0.4621869,0.001745867,0.4788042,0.001963648,0.0004675657,0.0009868657,0.05053119,0.0004805771,0.002833211],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008511794,"threshold_uncertainty_score":0.0447464,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2963398599","doi":"10.1109/cvpr.2016.500","title":"Ask Me Anything: Free-Form Visual Question Answering Based on Knowledge from External Sources","year":2016,"lang":"en","type":"preprint","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":368,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Question answering; Computer science; Image (mathematics); Information retrieval; Knowledge base; Ask price; Representation (politics); Artificial intelligence; Knowledge representation and reasoning; Natural language; Questions and answers; Natural language processing","authors":[{"name":"Qi Wu","is_ca":false},{"name":"Peng Wang","is_ca":false},{"name":"Chunhua Shen","is_ca":false},{"name":"Anthony Dick","is_ca":false},{"name":"Anton van den Hengel","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01567864347003803,"gpt":0.3060882820700778,"spread":0.2904096386000397,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00205934,0.001779751,0.001035149,0.001940762,0.000702317,0.002041579,0.003509652,0.003174398,0.008840864],"category_scores_gemma":[0.009059206,0.0005754305,0.001683058,0.0009942789,0.001238486,0.006028608,0.00317029,0.002356916,0.002742514],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001313304,"about_ca_system_score_gemma":0.001080573,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008442337,"about_ca_topic_score_gemma":0.008949405,"domain_scores_codex":[0.9981681,0.0006392327,0.00009238483,0.0006369841,0.0003249534,0.00013836],"domain_scores_gemma":[0.9964898,0.002168948,0.0002085441,0.000559866,0.0004203219,0.0001524729],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008793915,0.0009025443,0.004316508,0.001992815,0.0003212105,0.0008115704,0.003168538,0.05223382,0.04023241,0.04263968,0.05793997,0.7945615],"study_design_scores_gemma":[0.0001480826,0.0002351719,0.002105511,0.0001626622,0.0001754222,0.0004268425,0.0006276321,0.8318028,0.02190738,0.1125866,0.02972427,0.00009748845],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02766516,0.001328002,0.9449382,0.001530613,0.0001381907,0.0005558711,0.002472258,0.0123185,0.009053255],"genre_scores_gemma":[0.4302499,0.0005259383,0.546946,0.00123314,0.000236717,0.0008350798,0.009857893,0.0005380867,0.009577236],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008840864,"threshold_uncertainty_score":0.02957565,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2799002257","doi":"10.1109/cvpr.2018.00886","title":"VirtualHome: Simulating Household Activities Via Programs","year":2018,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":350,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto; McGill University","funders":"Natural Sciences and Engineering Research Council of Canada; Defense Advanced Research Projects Agency; Intelligence Advanced Research Projects Activity; Samsung; Nvidia","keywords":"Computer science; Task (project management); Representation (politics); Variety (cybernetics); Human–computer interaction; Interface (matter); Code (set theory); Game engine; Natural language; Artificial intelligence; Programming language","authors":[{"name":"Xavier Puig","is_ca":false},{"name":"Kevin Ra","is_ca":true},{"name":"Marko Boben","is_ca":false},{"name":"Jiaman Li","is_ca":true},{"name":"Tingwu Wang","is_ca":true},{"name":"Sanja Fidler","is_ca":true},{"name":"Antonio Torralba","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02535626076205967,"gpt":0.2773558627617337,"spread":0.251999601999674,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002178115,0.0006743589,0.0002685476,0.000353139,0.0001946748,0.0005320495,0.001199631,0.0006568769,0.003353127],"category_scores_gemma":[0.001187828,0.000260816,0.0004972526,0.0002533305,0.0005952434,0.000814601,0.0008603788,0.0005601419,0.0004025334],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000439928,"about_ca_system_score_gemma":0.000390291,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008309905,"about_ca_topic_score_gemma":0.01149222,"domain_scores_codex":[0.9998353,0.00006526148,0.000008251676,0.00004481118,0.00002741009,0.00001900591],"domain_scores_gemma":[0.9997165,0.0001766786,0.00001923727,0.00003659453,0.00002156408,0.00002952953],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005409574,0.0004361819,0.007750667,0.0004215345,0.0000813632,0.0005599021,0.00111331,0.9030892,0.01533282,0.01137109,0.00725991,0.05204305],"study_design_scores_gemma":[0.00004823137,0.00009694928,0.001422183,0.00002360356,0.00001458657,0.00008794219,0.000182194,0.9812785,0.006289679,0.003459289,0.007078035,0.0000187123],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4472789,0.0002475715,0.5287184,0.0002991467,0.00008369324,0.0005214297,0.004294036,0.009758864,0.00879791],"genre_scores_gemma":[0.8147359,0.0002018432,0.1768283,0.00009995038,0.000009189251,0.0005146976,0.00386981,0.0005349798,0.003205248],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008309905,"threshold_uncertainty_score":0.01652306,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2894280539","doi":"10.1609/aaai.v33i01.33019062","title":"Multilevel Language and Vision Integration for Text-to-Clip Retrieval","year":2019,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":332,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"Intelligence Advanced Research Projects Activity","keywords":"Computer science; Task (project management); CLIPS; Matching (statistics); Metric (unit); Natural language processing; Artificial intelligence; Sentence; Similarity (geometry); Word (group theory); Recurrent neural network; Artificial neural network; Information retrieval; Image (mathematics)","authors":[{"name":"Huijuan Xu","is_ca":false},{"name":"Kun He","is_ca":false},{"name":"Bryan A. Plummer","is_ca":false},{"name":"Leonid Sigal","is_ca":true},{"name":"Stan Sclaroff","is_ca":false},{"name":"Kate Saenko","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04201553110016543,"gpt":0.3481929253520091,"spread":0.3061773942518437,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009210044,0.001311605,0.00135685,0.001668145,0.0004621608,0.001620743,0.002430938,0.001864659,0.007957785],"category_scores_gemma":[0.003483669,0.000350951,0.001228622,0.001611571,0.0005271452,0.003263856,0.001694466,0.002130667,0.004059237],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001306627,"about_ca_system_score_gemma":0.001255096,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009208652,"about_ca_topic_score_gemma":0.01418468,"domain_scores_codex":[0.9992666,0.0001095575,0.00004396455,0.0002450061,0.0002018419,0.0001331651],"domain_scores_gemma":[0.9990699,0.0003108155,0.00007922149,0.0002213635,0.0002290329,0.0000898025],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006814227,0.0008924959,0.001006175,0.0005546804,0.0001922486,0.0003552905,0.0001637555,0.1213117,0.07133438,0.008834662,0.03320715,0.7614659],"study_design_scores_gemma":[0.00003350159,0.0002388138,0.0003530096,0.0000139356,0.00004535774,0.0001026446,0.00002898068,0.9749228,0.01543631,0.005325906,0.003473097,0.00002567412],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05728419,0.002737205,0.9063554,0.0008489378,0.0003668681,0.0004311829,0.001641363,0.02171342,0.00862141],"genre_scores_gemma":[0.5687347,0.0009429358,0.4088047,0.0009682454,0.0005305567,0.0004781554,0.00626005,0.0007969667,0.01248369],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009208652,"threshold_uncertainty_score":0.02662146,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1995820507","doi":"10.1109/cvpr.2013.340","title":"A Thousand Frames in Just a Few Words: Lingual Description of Videos through Latent Topics and Sparse Object Stitching","year":2013,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":294,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"Interior Business Center; Defense Advanced Research Projects Agency; U.S. Department of the Interior; Simon Fraser University; National Science Foundation","keywords":"Computer science; Image stitching; Artificial intelligence; Natural language processing; Natural language; Object (grammar); Probabilistic logic; Image (mathematics); Language model; Annotation; Natural language generation; Information retrieval; Pattern recognition (psychology)","authors":[{"name":"Pradipto Das","is_ca":false},{"name":"Chenliang Xu","is_ca":false},{"name":"Richard F. Doell","is_ca":false},{"name":"Jason J. Corso","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03467305324326582,"gpt":0.2914807309224713,"spread":0.2568076776792055,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009175241,0.0006201326,0.0004956338,0.001629692,0.0004424361,0.001042037,0.0009010676,0.0006991843,0.001633606],"category_scores_gemma":[0.005076235,0.0003328977,0.0007279789,0.001237,0.0005681436,0.002517625,0.001175071,0.001099756,0.0008708909],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007395279,"about_ca_system_score_gemma":0.0006394507,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008098359,"about_ca_topic_score_gemma":0.009755483,"domain_scores_codex":[0.9994306,0.0001878018,0.00003667258,0.0001570898,0.0001339556,0.00005389682],"domain_scores_gemma":[0.9986756,0.0004806171,0.0001667568,0.0003233006,0.0002893141,0.00006428408],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008319698,0.000170485,0.006583968,0.0003532885,0.0001365438,0.000805636,0.001820062,0.04197271,0.04741967,0.01828252,0.01855282,0.8630702],"study_design_scores_gemma":[0.00003076738,0.0001326696,0.004331086,0.00007965259,0.00008725578,0.0006566847,0.0007114306,0.9229225,0.02994592,0.0246462,0.0163714,0.00008444411],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.08455831,0.0008990722,0.9041079,0.0006911561,0.0001003455,0.0001620927,0.001497761,0.004781284,0.003202019],"genre_scores_gemma":[0.4743637,0.0008605722,0.5145702,0.0003277732,0.0001522855,0.0002080691,0.00429937,0.0004751237,0.004742889],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.008098359,"threshold_uncertainty_score":0.01610243,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2174492417","doi":"10.48550/arxiv.1511.05960","title":"ABC-CNN: An Attention Based Convolutional Neural Network for Visual Question Answering","year":2015,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":278,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Convolutional neural network; Question answering; Computer science; Artificial intelligence; Visual attention; Natural language processing; Pattern recognition (psychology); Psychology; Neuroscience; Cognition","authors":[{"name":"Kan Chen","is_ca":false},{"name":"Jiang Wang","is_ca":false},{"name":"Liang-Chieh Chen","is_ca":false},{"name":"Haoyuan Gao","is_ca":false},{"name":"Wei Xu","is_ca":false},{"name":"Ram Nevatia","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.07866269093093313,"gpt":0.2518239291440776,"spread":0.1731612382131444,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004328714,0.001280838,0.0004830661,0.0007202059,0.0003079529,0.0006717303,0.001855477,0.001311234,0.005142367],"category_scores_gemma":[0.00138577,0.0003508061,0.0007338519,0.0007255144,0.0004727645,0.001645046,0.001068856,0.001469803,0.00149482],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001563393,"about_ca_system_score_gemma":0.001034121,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02656222,"about_ca_topic_score_gemma":0.0357933,"domain_scores_codex":[0.9997326,0.00003919641,0.00001129216,0.0001104702,0.00005443299,0.00005198343],"domain_scores_gemma":[0.9996561,0.0001013367,0.00002876443,0.00006896905,0.0001146135,0.00003022203],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004566159,0.0004362787,0.005084494,0.0006280658,0.000238824,0.0003093976,0.0002702696,0.1040762,0.05309794,0.01855166,0.07851823,0.738332],"study_design_scores_gemma":[0.00003471009,0.0001118201,0.00154959,0.00004492843,0.00006191425,0.00011683,0.00004240902,0.9514227,0.01505206,0.01710245,0.01443607,0.00002453229],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.09505685,0.005729004,0.8430711,0.001847485,0.000629882,0.000578391,0.006278602,0.02420368,0.02260497],"genre_scores_gemma":[0.6778176,0.001644334,0.2834142,0.001971014,0.0001795138,0.0004137194,0.0129365,0.000449566,0.0211735],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02656222,"threshold_uncertainty_score":0.0528152,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4402716477","doi":"10.1109/cvpr52733.2024.00913","title":"MMMU: A Massive Multi-Discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","year":2024,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":245,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Victoria; University of Waterloo","funders":"","keywords":"Benchmark (surveying); Computer science; Artificial intelligence; Cognitive science; Psychology; Geology","authors":[{"name":"Yue Xiang","is_ca":false},{"name":"Yuansheng Ni","is_ca":true},{"name":"Tianyu Zheng","is_ca":false},{"name":"Kai Zhang","is_ca":false},{"name":"Ruoqi Liu","is_ca":false},{"name":"Ge ZHANG","is_ca":true},{"name":"Samuel Stevens","is_ca":false},{"name":"Dongfu Jiang","is_ca":true},{"name":"Weiming Ren","is_ca":true},{"name":"Yuxuan Sun","is_ca":false},{"name":"Cong Wei","is_ca":true},{"name":"Botao Yu","is_ca":false},{"name":"Ruibin Yuan","is_ca":false},{"name":"Renliang Sun","is_ca":true},{"name":"Minghao Yin","is_ca":false},{"name":"Boyuan Zheng","is_ca":false},{"name":"Zhenzhu Yang","is_ca":false},{"name":"Yibo Liu","is_ca":true},{"name":"Wenhao Huang","is_ca":false},{"name":"Huan Sun","is_ca":false},{"name":"Yu Su","is_ca":false},{"name":"Wenhu Chen","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04329207881041666,"gpt":0.3393487419959848,"spread":0.2960566631855682,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002941309,0.002822069,0.000859192,0.002817094,0.0009989219,0.002621144,0.003718298,0.003443238,0.01226431],"category_scores_gemma":[0.01686873,0.0004631427,0.001663685,0.00201437,0.0008699822,0.003952968,0.004265556,0.002789638,0.006168539],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002775596,"about_ca_system_score_gemma":0.002557525,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02164984,"about_ca_topic_score_gemma":0.02662444,"domain_scores_codex":[0.996995,0.001061933,0.0002333604,0.0007736659,0.0006394805,0.000296606],"domain_scores_gemma":[0.9946449,0.002851316,0.0002679452,0.0008580398,0.0008578173,0.000519914],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.002235776,0.002763939,0.01561159,0.003358727,0.0008044827,0.0007285161,0.001338545,0.1728493,0.008460232,0.01322595,0.325524,0.4530988],"study_design_scores_gemma":[0.0006006227,0.001227517,0.01429746,0.0006033094,0.000234905,0.0005195384,0.001540394,0.7825888,0.01654877,0.03085206,0.1508304,0.0001562419],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.4126042,0.01200299,0.2367111,0.005452842,0.002084343,0.003651148,0.1035858,0.09968363,0.1242239],"genre_scores_gemma":[0.5216844,0.001554238,0.2589757,0.001931075,0.0002845746,0.002311501,0.1917499,0.002599522,0.01890909],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.02164984,"threshold_uncertainty_score":0.04304767,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2963499204","doi":"","title":"VSE++: Improving Visual-Semantic Embeddings with Hard Negatives.","year":2018,"lang":"en","type":"article","venue":"British Machine Vision Conference","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":230,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Modal; Ranking (information retrieval); Information retrieval; Learning to rank; Artificial intelligence; Simple (philosophy); Image retrieval; Image (mathematics); Machine learning; Data mining; Pattern recognition (psychology)","authors":[{"name":"Fartash Faghri","is_ca":true},{"name":"David J. Fleet","is_ca":true},{"name":"Jamie Kiros","is_ca":false},{"name":"Sanja Fidler","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01003198278439735,"gpt":0.2815968184575066,"spread":0.2715648356731092,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002019302,0.002154962,0.00135451,0.001751601,0.0005357601,0.001588575,0.002230057,0.001556172,0.005029542],"category_scores_gemma":[0.01103893,0.0004473596,0.0009276638,0.001412285,0.0009563417,0.004684827,0.003259375,0.001961862,0.004707535],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005045528,"about_ca_system_score_gemma":0.0007210181,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00186724,"about_ca_topic_score_gemma":0.003003387,"domain_scores_codex":[0.9983743,0.0004745629,0.0001009962,0.0003546106,0.0005726981,0.0001227213],"domain_scores_gemma":[0.9975063,0.0007613799,0.0001913725,0.0008554801,0.0005920529,0.00009339352],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007223589,0.0007782765,0.003052091,0.0005696344,0.0001913602,0.0001962813,0.0001823499,0.0399479,0.0272205,0.01428023,0.05327483,0.8595842],"study_design_scores_gemma":[0.0001101798,0.0006539277,0.001261823,0.0000782761,0.00007711967,0.0005975178,0.0002419209,0.9062929,0.02828174,0.03556922,0.02675942,0.00007586795],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06114625,0.002165731,0.9096893,0.0005135356,0.0005613486,0.0003406352,0.00259586,0.01501827,0.007969151],"genre_scores_gemma":[0.4582328,0.0007878417,0.499397,0.0009950993,0.0003744088,0.0005242042,0.01667294,0.001641488,0.02137415],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005029542,"threshold_uncertainty_score":0.01682544,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2560645892","doi":"10.1109/iccv.2017.140","title":"Areas of Attention for Image Captioning","year":2017,"lang":"en","type":"preprint","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":218,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"École de Technologie Supérieure","funders":"Agence Nationale de la Recherche","keywords":"Closed captioning; Computer science; Pairwise comparison; Transformer; Artificial intelligence; Convolutional neural network; Image (mathematics); Language model; Pattern recognition (psychology); Computer vision","authors":[{"name":"Marco Pedersoli","is_ca":true},{"name":"Thomas W. Lucas","is_ca":false},{"name":"Cordelia Schmid","is_ca":false},{"name":"Jakob Verbeek","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03048174510081268,"gpt":0.3389131894072359,"spread":0.3084314443064232,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001107255,0.00169072,0.0007889174,0.001714679,0.0005119204,0.001560753,0.00216928,0.001540958,0.006123016],"category_scores_gemma":[0.003952969,0.0005401542,0.001455524,0.001189853,0.0009690293,0.00333475,0.002123064,0.002283188,0.002708413],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001325295,"about_ca_system_score_gemma":0.0009001623,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005393265,"about_ca_topic_score_gemma":0.007413249,"domain_scores_codex":[0.9990984,0.000233317,0.0000394038,0.0003570968,0.0001506507,0.0001210611],"domain_scores_gemma":[0.9986603,0.0004740253,0.0001277891,0.0003908764,0.0002695398,0.00007752395],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007371056,0.0002492642,0.002842713,0.0006313706,0.0001988207,0.0002915944,0.0004523749,0.1143268,0.04423166,0.01877627,0.03934645,0.7779157],"study_design_scores_gemma":[0.00003200288,0.0001294607,0.001320615,0.00004236658,0.00007064534,0.0002097205,0.00006707769,0.9267137,0.03274359,0.02047676,0.01816045,0.0000335176],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0496842,0.003529439,0.9048429,0.0008990293,0.0004569732,0.0003860443,0.002185701,0.02612534,0.01189039],"genre_scores_gemma":[0.6140251,0.001416337,0.362097,0.0007602937,0.0003740201,0.0004415552,0.006080111,0.001586934,0.01321867],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006123016,"threshold_uncertainty_score":0.02048349,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2963062932","doi":"10.1609/aaai.v30i1.10475","title":"SentiCap: Generating Image Descriptions with Sentiments","year":2016,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":214,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"Australian Research Council; Instituto de Ciencias del Mar y Limnología, Universidad Nacional Autónoma de México; Australian Government; Institute for Catastrophic Loss Reduction; Nvidia","keywords":"Closed captioning; Computer science; Natural language processing; Stylized fact; Artificial intelligence; Image (mathematics); Vocabulary; Sentiment analysis; Regularization (linguistics); Quality (philosophy); Linguistics","authors":[{"name":"A. P. Mathews","is_ca":false},{"name":"Lexing Xie","is_ca":false},{"name":"Xuming He","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.05085603367949731,"gpt":0.2937594390146995,"spread":0.2429034053352022,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001048335,0.001844846,0.0004621265,0.001467355,0.0004114996,0.001029907,0.001313492,0.001208019,0.01077604],"category_scores_gemma":[0.004670191,0.000487978,0.00108341,0.0007523642,0.0004292772,0.001582649,0.001254775,0.001029673,0.004331301],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000664828,"about_ca_system_score_gemma":0.00036674,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001836809,"about_ca_topic_score_gemma":0.002555441,"domain_scores_codex":[0.9994465,0.0001773042,0.00003400127,0.0001215543,0.0001841263,0.00003670325],"domain_scores_gemma":[0.9985885,0.0005369618,0.0001056786,0.0002508641,0.0004551639,0.00006274948],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0009490997,0.0004815393,0.002687371,0.002158948,0.0003713054,0.001092237,0.001174615,0.0589124,0.1076123,0.01125397,0.2280201,0.5852861],"study_design_scores_gemma":[0.00008880949,0.0003130745,0.001941368,0.00009349947,0.0000771499,0.0004136547,0.0002699044,0.8659899,0.05890851,0.01188358,0.05992255,0.00009804838],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06870779,0.00130443,0.7728536,0.0009779379,0.0009836159,0.001459662,0.01287272,0.119798,0.02104236],"genre_scores_gemma":[0.2895195,0.000801025,0.6551006,0.0006184354,0.0003038248,0.001225648,0.03160553,0.005731046,0.01509449],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01077604,"threshold_uncertainty_score":0.03604943,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2960202457","doi":"10.1145/3306346.3322941","title":"PlanIT","year":2019,"lang":"en","type":"article","venue":"ACM Transactions on Graphics","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":207,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Simon Fraser University","funders":"FP7 Ideas: European Research Council; National Science Foundation","keywords":"Computer science; Scene graph; Graph; Relation (database); Generative model; Artificial intelligence; Spatial relation; Representation (politics); Theoretical computer science; Set (abstract data type); Generative grammar; Data mining; Rendering (computer graphics); Programming language","authors":[{"name":"Kai Wang","is_ca":false},{"name":"Ben Weissmann","is_ca":false},{"name":"Manolis Savva","is_ca":true},{"name":"Anne Lynn S. Chang","is_ca":true},{"name":"Daniel Ritchie","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01302205938873805,"gpt":0.2537439968164512,"spread":0.2407219374277132,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007882133,0.001499701,0.0007003132,0.001129788,0.0009505751,0.00339281,0.003197519,0.001382824,0.07979538],"category_scores_gemma":[0.002225199,0.0008188433,0.001973276,0.0008244314,0.001109588,0.003993443,0.003494972,0.002028212,0.02573233],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001586781,"about_ca_system_score_gemma":0.001819408,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005912184,"about_ca_topic_score_gemma":0.01214227,"domain_scores_codex":[0.9991925,0.0001374772,0.00004709805,0.000236694,0.0002819533,0.0001043255],"domain_scores_gemma":[0.9995198,0.0001119375,0.00003348751,0.0001894421,0.0001025777,0.0000426948],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002513933,0.0001170948,0.0007373788,0.0006535036,0.00007042472,0.000341397,0.000298772,0.04415829,0.00362993,0.4641005,0.1304894,0.3551519],"study_design_scores_gemma":[0.00007125749,0.00008179215,0.0002567315,0.0001446001,0.00004117466,0.0003632831,0.00008530528,0.2670994,0.007330085,0.227057,0.4974196,0.00004970686],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.001587367,0.0003765012,0.9102837,0.000688844,0.0002828269,0.0002418904,0.003124317,0.03296761,0.05044693],"genre_scores_gemma":[0.06825519,0.0007673282,0.8454546,0.0009434745,0.0001635342,0.0007424827,0.01314411,0.009237201,0.06129213],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.07979538,"threshold_uncertainty_score":0,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2048343491","doi":"10.1109/cvpr.2014.455","title":"What Are You Talking About? Text-to-Image Coreference","year":2014,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":205,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Coreference; Computer science; Artificial intelligence; Parsing; Natural language processing; Exploit; Object (grammar); Image (mathematics); Noun; Resolution (logic)","authors":[{"name":"Chen Kong","is_ca":false},{"name":"Dahua Lin","is_ca":false},{"name":"Mohit Bansal","is_ca":false},{"name":"Raquel Urtasun","is_ca":true},{"name":"Sanja Fidler","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01403630361228849,"gpt":0.278239799894357,"spread":0.2642034962820686,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001506537,0.0006858076,0.000611625,0.001675379,0.001222689,0.001527116,0.0008530335,0.001595405,0.005125426],"category_scores_gemma":[0.009573392,0.0003035821,0.0005959733,0.00193507,0.0008418298,0.003588327,0.002011176,0.001447993,0.002724288],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009824544,"about_ca_system_score_gemma":0.0005207406,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00340775,"about_ca_topic_score_gemma":0.00478333,"domain_scores_codex":[0.9981688,0.000663233,0.0001181686,0.0006418541,0.0002840967,0.0001237499],"domain_scores_gemma":[0.9963431,0.002283369,0.0004074668,0.0003880895,0.0005016981,0.00007618854],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001681654,0.0001740986,0.03598414,0.002130888,0.0002642295,0.003474479,0.01881173,0.005734941,0.04548193,0.05189672,0.1735454,0.6608197],"study_design_scores_gemma":[0.00007735655,0.0002504037,0.03641601,0.0007905664,0.0004139893,0.007783058,0.02242094,0.08773324,0.1034659,0.1425147,0.5978267,0.0003071169],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3377686,0.009787598,0.5474504,0.01134802,0.002007477,0.0004154296,0.02225303,0.005746095,0.06322332],"genre_scores_gemma":[0.8142791,0.001787066,0.1511826,0.004530261,0.0004020465,0.0003015937,0.01172846,0.0008530469,0.01493585],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005125426,"threshold_uncertainty_score":0.01714629,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4312372711","doi":"10.1109/cvpr52688.2022.00495","title":"X-Pool: Cross-Modal Language-Video Attention for Text-Video Retrieval","year":2022,"lang":"en","type":"article","venue":"2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":204,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Vector Institute; University of Toronto","funders":"","keywords":"Computer science; Focus (optics); Information retrieval; Representation (politics); ENCODE; Pooling; Recall; Natural language processing; Artificial intelligence; Similarity (geometry); Text retrieval; Code (set theory); Function (biology); Image (mathematics); Linguistics","authors":[{"name":"Satya Krishna Gorti","is_ca":false},{"name":"Noël Vouitsis","is_ca":true},{"name":"Keyvan Golestan","is_ca":false},{"name":"Maksims Volkovs","is_ca":false},{"name":"Animesh Garg","is_ca":true},{"name":"Guangwei Yu","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03439024797878233,"gpt":0.3264412100324542,"spread":0.2920509620536719,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001272262,0.002048034,0.0015465,0.001951143,0.0005282754,0.001148195,0.003410534,0.001796134,0.007246877],"category_scores_gemma":[0.002471823,0.000464227,0.001587637,0.00131923,0.0006294205,0.002682947,0.002054155,0.001507324,0.003044774],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001564969,"about_ca_system_score_gemma":0.001106776,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01519648,"about_ca_topic_score_gemma":0.01573423,"domain_scores_codex":[0.999424,0.0000904245,0.00002906484,0.0002252226,0.000132795,0.00009843796],"domain_scores_gemma":[0.9995549,0.000162802,0.00003804755,0.00009124653,0.0001082084,0.00004476445],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001072542,0.0006627087,0.001616056,0.0005054881,0.0003622572,0.0003517152,0.0002099437,0.05156916,0.05345302,0.004378988,0.04002761,0.8457906],"study_design_scores_gemma":[0.0001092372,0.000370326,0.001009057,0.00003937401,0.0001346427,0.0003361755,0.00006895575,0.9640018,0.02062264,0.006575952,0.006683908,0.00004786703],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04358679,0.005199775,0.9148979,0.0005577985,0.0003960676,0.0006978968,0.001645763,0.02789606,0.005121961],"genre_scores_gemma":[0.471549,0.001866285,0.4915252,0.002287125,0.0006040695,0.001009883,0.007063023,0.001165796,0.02292954],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01519648,"threshold_uncertainty_score":0.03021604,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2734498959","doi":"10.48550/arxiv.1709.07871","title":"FiLM: Visual Reasoning with a General Conditioning Layer","year":2017,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":189,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal","funders":"","keywords":"Affine transformation; Computer science; Benchmark (surveying); Feature (linguistics); Artificial intelligence; Transformation (genetics); Computation; Simple (philosophy); Artificial neural network; Layer (electronics); Image (mathematics); Task (project management); Process (computing); Pattern recognition (psychology); Machine learning; Algorithm; Mathematics; Engineering","authors":[{"name":"Ethan Perez","is_ca":true},{"name":"Florian Strub","is_ca":true},{"name":"Harm de Vries","is_ca":false},{"name":"Vincent Dumoulin","is_ca":true},{"name":"Aaron Courville","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.05285417320652501,"gpt":0.2337116258580682,"spread":0.1808574526515432,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006610155,0.00102828,0.0004500605,0.00032876,0.000274618,0.001287947,0.001865301,0.001101909,0.01354691],"category_scores_gemma":[0.002976926,0.0004916331,0.0006196535,0.0002622523,0.0009667533,0.003394955,0.002052416,0.002115168,0.002218924],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006640726,"about_ca_system_score_gemma":0.0006375542,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002051456,"about_ca_topic_score_gemma":0.002973128,"domain_scores_codex":[0.9996926,0.00005406551,0.00001683993,0.0001139302,0.00007843997,0.00004419943],"domain_scores_gemma":[0.9994597,0.0001677266,0.00005269947,0.0002166441,0.00006084976,0.00004241687],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001012953,0.0004403288,0.001566121,0.0007074808,0.0002346323,0.000279288,0.0003226025,0.1391833,0.1123724,0.08695943,0.03264521,0.6242763],"study_design_scores_gemma":[0.00009902248,0.0001880886,0.0004797252,0.00004939901,0.00005807153,0.0001188006,0.00003236476,0.8702818,0.05922699,0.05626043,0.0131757,0.00002960549],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0208631,0.0004443693,0.9575563,0.0006042538,0.0001620012,0.00018521,0.0005561789,0.01103744,0.008591094],"genre_scores_gemma":[0.5194729,0.0003745376,0.4653334,0.0009391079,0.0001094962,0.000294098,0.001165952,0.001000593,0.01131],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01354691,"threshold_uncertainty_score":0.04531896,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4312261477","doi":"10.1109/cvpr52688.2022.00517","title":"Winoground: Probing Vision and Language Models for Visio-Linguistic Compositionality","year":2022,"lang":"en","type":"article","venue":"2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":185,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Principle of compositionality; Computer science; Set (abstract data type); Task (project management); Artificial intelligence; Natural language processing; Language model; Field (mathematics); State (computer science); Programming language","authors":[{"name":"Tristan Thrush","is_ca":false},{"name":"Ryan Jiang","is_ca":true},{"name":"Max Bartolo","is_ca":false},{"name":"Amanpreet Singh","is_ca":false},{"name":"Adina Williams","is_ca":false},{"name":"Douwe Kiela","is_ca":false},{"name":"Candace Ross","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04285904995147653,"gpt":0.3168681275049487,"spread":0.2740090775534722,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003736268,0.004465636,0.001409772,0.004003144,0.002108563,0.004403759,0.00564254,0.004321734,0.01236508],"category_scores_gemma":[0.01498279,0.0008695145,0.002717929,0.002359469,0.002070962,0.006637028,0.00511719,0.004234019,0.01218563],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002813806,"about_ca_system_score_gemma":0.001833864,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02382137,"about_ca_topic_score_gemma":0.04241925,"domain_scores_codex":[0.9953696,0.001410412,0.0002843266,0.001551056,0.0009483427,0.0004363086],"domain_scores_gemma":[0.9932966,0.002680946,0.0003788262,0.002401344,0.0008720488,0.0003702777],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.002056893,0.001285216,0.01468683,0.003215835,0.0006189026,0.0008452618,0.0007536715,0.02686524,0.01496031,0.01212634,0.7073715,0.2152139],"study_design_scores_gemma":[0.001337673,0.001344907,0.02203143,0.001043006,0.000421088,0.004068686,0.002689083,0.4710379,0.05289121,0.04023012,0.4024624,0.0004424668],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"empirical","genre_scores_codex":[0.2756926,0.01024918,0.1272124,0.005235222,0.002466207,0.002859758,0.4208225,0.09746896,0.0579933],"genre_scores_gemma":[0.2213479,0.0007626862,0.132909,0.002026225,0.0002904452,0.001300529,0.6286279,0.003756492,0.008978853],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02382137,"threshold_uncertainty_score":0.04736537,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4386162736","doi":"10.1145/3617592","title":"Deep Learning Approaches on Image Captioning: A Review","year":2023,"lang":"en","type":"review","venue":"ACM Computing Surveys","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":164,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McMaster University","funders":"","keywords":"Closed captioning; Computer science; Deep learning; Artificial intelligence; Modalities; Context (archaeology); Field (mathematics); Natural language processing; Image (mathematics); Machine learning","authors":[{"name":"Taraneh Ghandi","is_ca":true},{"name":"Hamid Reza Pourreza","is_ca":false},{"name":"Hamidreza Mahyar","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1770216083512234,"gpt":0.3854094199385489,"spread":0.2083878115873254,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001743816,0.001417195,0.001138645,0.003227863,0.0003329866,0.001593487,0.001991772,0.001425617,0.005571042],"category_scores_gemma":[0.005127333,0.0006834535,0.0008163552,0.003915064,0.0006927071,0.003153774,0.001142674,0.001800055,0.003517564],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009490824,"about_ca_system_score_gemma":0.001456081,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002866802,"about_ca_topic_score_gemma":0.002974359,"domain_scores_codex":[0.9994963,0.00009883143,0.00005989321,0.0001049875,0.0002039859,0.00003595754],"domain_scores_gemma":[0.9970275,0.001933797,0.0001307086,0.0001030127,0.0007372604,0.00006778909],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00003461029,0.00005954921,0.0002498058,0.007723321,0.00007082496,0.0000519392,0.00006573812,0.001860375,0.0006170807,0.005278757,0.02591616,0.9580719],"study_design_scores_gemma":[0.00002750429,0.0002241119,0.001870727,0.01150377,0.0003022573,0.001166305,0.0001918895,0.008450468,0.003317778,0.01343766,0.9594078,0.00009971162],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0006307851,0.9811365,0.01234048,0.0009445751,0.0004298386,0.0000405159,0.0001098165,0.0001473083,0.004220328],"genre_scores_gemma":[0.004821733,0.9839358,0.008288825,0.0004754416,0.0004665304,0.0000446274,0.0002683106,0.00004559352,0.001653136],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.005571042,"threshold_uncertainty_score":0.018637,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2801004733","doi":"10.1109/wacv.2018.00181","title":"Scaling Human-Object Interaction Recognition Through Zero-Shot Learning","year":2018,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":163,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Artificial intelligence; Object (grammar); Object detection; Cognitive neuroscience of visual object recognition; Variety (cybernetics); Pattern recognition (psychology); Machine learning; Scaling; Action (physics); Histogram; Computer vision; Image (mathematics); Mathematics","authors":[{"name":"Liyue Shen","is_ca":false},{"name":"Serena Yeung","is_ca":false},{"name":"Judy Hoffman","is_ca":false},{"name":"Greg Mori","is_ca":true},{"name":"Li Fei-Fei","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0710747672886309,"gpt":0.3634047171561183,"spread":0.2923299498674874,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001953434,0.001431816,0.002015017,0.001792507,0.0007723262,0.001334935,0.003604401,0.002057053,0.002136054],"category_scores_gemma":[0.005770516,0.0005595797,0.001186277,0.001170567,0.001208675,0.002828507,0.003479323,0.002399128,0.001911318],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001128761,"about_ca_system_score_gemma":0.001014306,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007742822,"about_ca_topic_score_gemma":0.01427178,"domain_scores_codex":[0.9975193,0.0003997515,0.00009331949,0.001199007,0.0005227533,0.0002658836],"domain_scores_gemma":[0.99727,0.001093248,0.0001546927,0.0008097782,0.0004726968,0.0001995676],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005285001,0.001205379,0.01096782,0.00040374,0.0002596913,0.0003378448,0.0004129173,0.07014026,0.03374381,0.002889499,0.01971546,0.8593951],"study_design_scores_gemma":[0.00002111973,0.0001450141,0.004490026,0.00002242576,0.00003350915,0.0002872526,0.0001354588,0.9701136,0.01365129,0.007821407,0.003238906,0.0000400627],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.2088459,0.001838367,0.7672437,0.0004260247,0.0003153764,0.0004274279,0.001816029,0.01355833,0.005528884],"genre_scores_gemma":[0.7348444,0.0004008146,0.2496308,0.0005094807,0.000147561,0.0003240662,0.008638437,0.0004231755,0.00508125],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.007742822,"threshold_uncertainty_score":0.01539552,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2968104955","doi":"10.1109/cvpr.2019.00675","title":"Streamlined Dense Video Captioning","year":2019,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":153,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Canadian Parks and Wilderness Society","funders":"","keywords":"Closed captioning; Computer science; Event (particle physics); Context (archaeology); Dependency (UML); Task (project management); Artificial intelligence; Storytelling; Sequence (biology); Natural language processing; Image (mathematics); Narrative; Linguistics","authors":[{"name":"Jonghwan Mun","is_ca":false},{"name":"Linjie Yang","is_ca":false},{"name":"Zhou Ren","is_ca":false},{"name":"Ning Xu","is_ca":true},{"name":"Bohyung Han","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.006586964800575043,"gpt":0.2454334821047727,"spread":0.2388465173041977,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001079792,0.002717177,0.001160993,0.001611401,0.0005748793,0.001314667,0.002272602,0.001711017,0.007027224],"category_scores_gemma":[0.004760463,0.0005576361,0.0009268837,0.001535911,0.0006385685,0.002474082,0.001787622,0.001967287,0.003188004],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009278184,"about_ca_system_score_gemma":0.0008787488,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00466858,"about_ca_topic_score_gemma":0.007594666,"domain_scores_codex":[0.9989551,0.0002535766,0.00005149992,0.0003949173,0.0002503381,0.00009457771],"domain_scores_gemma":[0.9983907,0.0005803338,0.0001258773,0.0003546205,0.0004507781,0.00009778332],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007548813,0.0002773196,0.0009691638,0.0008592517,0.0001419866,0.0008023437,0.0003685034,0.1148974,0.04791408,0.004978505,0.09746293,0.7305737],"study_design_scores_gemma":[0.00008026182,0.0002574091,0.0006894363,0.00006961274,0.00005562141,0.0004650892,0.0001275219,0.9255258,0.03556396,0.007526641,0.02958369,0.0000550036],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03748581,0.003771085,0.9088811,0.0008657839,0.001023066,0.001098509,0.007983232,0.02937576,0.009515652],"genre_scores_gemma":[0.2888709,0.002161966,0.660171,0.000781469,0.0007245482,0.0008278258,0.03130648,0.001549516,0.01360627],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007027224,"threshold_uncertainty_score":0.02350843,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3176425931","doi":"10.1609/aaai.v35i3.16353","title":"Semantic Grouping Network for Video Captioning","year":2021,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":148,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Kootenay Association for Science & Technology","funders":"","keywords":"Computer science; Interpretability; Closed captioning; Margin (machine learning); Word (group theory); Redundancy (engineering); Phrase; Artificial intelligence; Natural language processing; Speech recognition; Image (mathematics); Machine learning","authors":[{"name":"Hobin Ryu","is_ca":true},{"name":"Sunghun Kang","is_ca":true},{"name":"Haeyong Kang","is_ca":true},{"name":"Chang D. Yoo","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06834906582068068,"gpt":0.3139618964753935,"spread":0.2456128306547128,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001121897,0.001958558,0.001000283,0.002376531,0.0006940772,0.000765211,0.00191944,0.001654853,0.004047051],"category_scores_gemma":[0.003361014,0.0004003341,0.000961724,0.002086348,0.0007031387,0.002439293,0.00119342,0.001284818,0.001578483],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001544623,"about_ca_system_score_gemma":0.0007665287,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006617524,"about_ca_topic_score_gemma":0.006104105,"domain_scores_codex":[0.9993431,0.0001833009,0.00003164765,0.0002179059,0.0001409278,0.00008310292],"domain_scores_gemma":[0.9992931,0.0002443895,0.00009670693,0.0001135746,0.0001968001,0.00005538766],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007675423,0.0002528631,0.001528351,0.0003721284,0.0001311074,0.0003899258,0.0003210711,0.2122558,0.0243815,0.009351962,0.01816092,0.7320869],"study_design_scores_gemma":[0.00001970563,0.0001406319,0.00052651,0.00003374656,0.00006076972,0.0001245733,0.00008453285,0.9708188,0.01065936,0.01062937,0.006874202,0.0000279488],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0480603,0.002906495,0.9294325,0.0006551074,0.0003993935,0.0003880754,0.001331578,0.007967032,0.008859577],"genre_scores_gemma":[0.5720103,0.001760056,0.405378,0.0005890199,0.0003995185,0.0004551654,0.006051729,0.0004967193,0.01285944],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006617524,"threshold_uncertainty_score":0.01353878,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2963245493","doi":"","title":"Modulating early visual processing by language","year":2017,"lang":"en","type":"article","venue":"LillOA (Université de Lille (University Of Lille))","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":147,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"Compute Canada; Natural Sciences and Engineering Research Council of Canada; Canada Research Chairs; Canadian Institute for Advanced Research; Nvidia","keywords":"Computer science; Natural language processing; Visual language; Artificial intelligence; Linguistics; Philosophy","authors":[{"name":"H. de Vries","is_ca":false},{"name":"Florian Strub","is_ca":false},{"name":"Hugo Larochelle","is_ca":false},{"name":"Olivier Pietquin","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.004933358070285787,"gpt":0.2197907985611784,"spread":0.2148574404908927,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004645729,0.00118111,0.0007030237,0.0003601743,0.0004101328,0.002414925,0.0007930335,0.001269969,0.07735024],"category_scores_gemma":[0.002727338,0.0002412036,0.0004826926,0.0002408991,0.0003936013,0.001358219,0.0008019154,0.001088395,0.009975933],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005581912,"about_ca_system_score_gemma":0.0005914543,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001560156,"about_ca_topic_score_gemma":0.00112348,"domain_scores_codex":[0.9997599,0.00002866863,0.00001185153,0.00009284915,0.00004660128,0.00006026491],"domain_scores_gemma":[0.999015,0.0004746653,0.0001066694,0.00008840083,0.0001401911,0.0001750641],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0007659988,0.00008401967,0.0004106471,0.0003453602,0.00002583629,0.0001575519,0.000108976,0.0002705103,0.9253914,0.002664717,0.005766234,0.06400882],"study_design_scores_gemma":[0.001299528,0.002919845,0.1214619,0.001039426,0.0008665309,0.001771861,0.001084274,0.01713927,0.6432858,0.05086762,0.1580255,0.0002384962],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5801118,0.01698098,0.06481376,0.01177531,0.006034236,0.0006649269,0.003749028,0.003970833,0.3118991],"genre_scores_gemma":[0.8383726,0.006031399,0.01708118,0.005467793,0.001676208,0.0004663676,0.001591972,0.001622778,0.1276896],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07735024,"threshold_uncertainty_score":0.2587623,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3101703188","doi":"10.18653/v1/2020.findings-emnlp.44","title":"ConceptBert: Concept-Aware Representation for Visual Question Answering","year":2020,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":142,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University; Thales (Canada)","funders":"","keywords":"Question answering; Computer science; Embedding; Commonsense knowledge; Artificial intelligence; Exploit; Natural language processing; Natural language; Knowledge representation and reasoning; Focus (optics); Representation (politics); Information retrieval","authors":[{"name":"François Gardères","is_ca":true},{"name":"Maryam Ziaeefard","is_ca":true},{"name":"B. Abeloos","is_ca":true},{"name":"Freddy Lécué","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03075027110620818,"gpt":0.3548092531981962,"spread":0.324058982091988,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001919513,0.001552084,0.0008505239,0.002229798,0.0007337095,0.001915586,0.003472342,0.003019616,0.01169924],"category_scores_gemma":[0.007213977,0.0005131557,0.001482415,0.001552171,0.001029975,0.006030306,0.003864669,0.003094825,0.003699381],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001725675,"about_ca_system_score_gemma":0.001576411,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006910786,"about_ca_topic_score_gemma":0.009181192,"domain_scores_codex":[0.9986022,0.000387063,0.00006778914,0.000483717,0.0003479607,0.0001113059],"domain_scores_gemma":[0.9981961,0.0008647682,0.0001010909,0.0004516105,0.0002809676,0.0001054605],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003869754,0.000467069,0.001793277,0.0008725284,0.0001367586,0.0001938276,0.0008493108,0.02888164,0.01504347,0.05664172,0.09834406,0.7963893],"study_design_scores_gemma":[0.0001130607,0.0002029743,0.001054009,0.0001667893,0.00006961024,0.0003987146,0.0003740002,0.7465235,0.02146985,0.1646197,0.06493892,0.00006886983],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01007308,0.0008846252,0.954188,0.0007241464,0.0001875006,0.0005225699,0.003753434,0.02569212,0.003974426],"genre_scores_gemma":[0.1426345,0.0005121476,0.8354788,0.00077729,0.0001222443,0.0007388682,0.01393311,0.0008935796,0.004909509],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01169924,"threshold_uncertainty_score":0.03913784,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2557264465","doi":"10.1109/cvpr.2017.339","title":"Hierarchical Boundary-Aware Neural Encoder for Video Captioning","year":2017,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":141,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"Ministero dell’Istruzione, dell’Università e della Ricerca","keywords":"Closed captioning; ENCODE; Encoding (memory); Leverage (statistics); Encoder; Recurrent neural network; Artificial neural network; Scheme (mathematics); Annotation","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.02768488918146487,"gpt":0.3282548674715134,"spread":0.3005699782900486,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005466664,0.0008818221,0.0007151489,0.0007514721,0.0002655744,0.0005359583,0.0012718,0.0008740387,0.003509131],"category_scores_gemma":[0.003047628,0.000326806,0.0005131779,0.000810114,0.0003832341,0.001781777,0.0008575738,0.001378148,0.001588581],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007460866,"about_ca_system_score_gemma":0.0005605929,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005293994,"about_ca_topic_score_gemma":0.007906853,"domain_scores_codex":[0.9996349,0.00009511411,0.00002025071,0.0001128317,0.00008850514,0.00004836288],"domain_scores_gemma":[0.9993299,0.0002567422,0.0000735041,0.0001258093,0.0001798185,0.00003424173],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004410924,0.0001934467,0.0007029035,0.0003599607,0.00007057424,0.0003180968,0.0002074373,0.1196168,0.06203073,0.01049488,0.02134704,0.7842171],"study_design_scores_gemma":[0.00001326759,0.00005593466,0.000247093,0.00001916434,0.00001893374,0.0000661685,0.00002491073,0.9750203,0.01735673,0.004792649,0.002369461,0.0000153243],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03686822,0.00164882,0.9461313,0.0003247048,0.0002105827,0.0001262189,0.001523765,0.009136291,0.004030154],"genre_scores_gemma":[0.5226837,0.001050084,0.4604123,0.0003909233,0.0001738798,0.0002617057,0.005806644,0.0004958704,0.008724906],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005293994,"threshold_uncertainty_score":0.01173919,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3000176874","doi":"10.1109/iccv.2019.00999","title":"LayoutVAE: Stochastic Scene Layout Generation From a Label Set","year":2019,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":140,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia; Simon Fraser University","funders":"","keywords":"MNIST database; Computer science; Set (abstract data type); Image (mathematics); Artificial intelligence; Autoencoder; Theoretical computer science; Computer vision; Deep learning; Programming language","authors":[{"name":"Akash Abdu Jyothi","is_ca":true},{"name":"Thibaut Durand","is_ca":true},{"name":"Jiawei He","is_ca":true},{"name":"Leonid Sigal","is_ca":true},{"name":"Greg Mori","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02946545474529133,"gpt":0.2846817826453462,"spread":0.2552163279000548,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008821355,0.001342433,0.0008283494,0.0009610797,0.0004564059,0.000889286,0.00194959,0.00150808,0.005195728],"category_scores_gemma":[0.002787887,0.0008857479,0.001292451,0.0006940002,0.0007061141,0.001251616,0.001461943,0.002108562,0.002035636],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00112286,"about_ca_system_score_gemma":0.001024315,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005455276,"about_ca_topic_score_gemma":0.01393815,"domain_scores_codex":[0.9995067,0.0001153941,0.00001466702,0.0002197165,0.00009544929,0.00004805124],"domain_scores_gemma":[0.9991423,0.0003589318,0.00006617316,0.0001935955,0.0001721018,0.00006688031],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003642146,0.0002121294,0.002113997,0.0003112904,0.0001288524,0.0002656943,0.0002279263,0.5644703,0.02818485,0.01480152,0.02788558,0.3610336],"study_design_scores_gemma":[0.00002611974,0.00003667172,0.0001346335,0.000009842827,0.000006066755,0.00003329776,0.00001608196,0.9896354,0.003166088,0.005140117,0.001786038,0.000009576987],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01391759,0.0002125103,0.9751902,0.0002085755,0.0001089867,0.0001289751,0.0009796078,0.007933493,0.00131995],"genre_scores_gemma":[0.227991,0.0001933483,0.7554896,0.0004611147,0.0001112466,0.0003807435,0.007082005,0.001890072,0.006400972],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005455276,"threshold_uncertainty_score":0.01738149,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2903711666","doi":"10.1109/tpami.2018.2886192","title":"Deep Neural Network Compression by In-Parallel Pruning-Quantization","year":2018,"lang":"en","type":"article","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":138,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Simon Fraser University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Pruning; Quantization (signal processing); Convolutional neural network; Deep learning; Artificial intelligence; Artificial neural network; Pattern recognition (psychology); Computer vision","authors":[{"name":"Frederick Tung","is_ca":true},{"name":"Greg Mori","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01616013985227046,"gpt":0.2839327377264118,"spread":0.2677725978741414,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008303128,0.001240036,0.0008881303,0.0008718221,0.0004940503,0.0009779582,0.001821889,0.0007973413,0.00232412],"category_scores_gemma":[0.004513705,0.0003375301,0.0005309425,0.001010949,0.0008107414,0.001912355,0.001226478,0.001648514,0.0006459576],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008954629,"about_ca_system_score_gemma":0.001221055,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004675454,"about_ca_topic_score_gemma":0.008577348,"domain_scores_codex":[0.9994886,0.00006879965,0.00004783713,0.00009838351,0.0002369299,0.00005947751],"domain_scores_gemma":[0.9986313,0.0003768812,0.0001178835,0.00048358,0.0003440964,0.00004631522],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005225231,0.0003526494,0.00361653,0.0002213769,0.0001257679,0.0003355119,0.0002495903,0.2746093,0.03844994,0.01531707,0.01271678,0.6534829],"study_design_scores_gemma":[0.00006274875,0.0001584146,0.0006952076,0.00002812152,0.0000419272,0.0002043812,0.00005552635,0.947582,0.03473774,0.01247586,0.00394104,0.00001707586],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1325091,0.001595937,0.8544006,0.0006536749,0.0002559248,0.0002210232,0.0004311038,0.005631589,0.004301026],"genre_scores_gemma":[0.6540109,0.0006636314,0.3380675,0.000520229,0.0001348954,0.0002388991,0.001351678,0.0004089148,0.004603373],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004675454,"threshold_uncertainty_score":0.009296477,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4225683910","doi":"10.24963/ijcai.2022/762","title":"A Survey of Vision-Language Pre-Trained Models","year":2022,"lang":"en","type":"article","venue":"Proceedings of the Thirty-First International Joint Conference on Artificial Intelligence","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":136,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Transformer; Pace; Artificial intelligence; Pointer (user interface); Deep learning; Mainstream; Focus (optics); Natural language processing; Human–computer interaction; Engineering","authors":[{"name":"Yifan Du","is_ca":false},{"name":"Zikang Liu","is_ca":false},{"name":"Junyi Li","is_ca":true},{"name":"Wayne Xin Zhao","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06806887872685286,"gpt":0.3226548770219884,"spread":0.2545859982951356,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001112483,0.00180739,0.001107363,0.0009548017,0.0003706911,0.001361325,0.002836398,0.001513078,0.00615347],"category_scores_gemma":[0.00495107,0.0007291263,0.001216061,0.001214283,0.0005826692,0.002801838,0.001192425,0.002779372,0.004400886],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001270409,"about_ca_system_score_gemma":0.00178525,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009325035,"about_ca_topic_score_gemma":0.01037677,"domain_scores_codex":[0.9994023,0.000159916,0.00004790814,0.00020034,0.000125356,0.00006427346],"domain_scores_gemma":[0.9988536,0.0005908572,0.00003728526,0.0001851892,0.0002844863,0.00004861296],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001654917,0.0001657319,0.001556014,0.0009282778,0.000168342,0.0001124103,0.0001432177,0.07835431,0.004425691,0.01390773,0.02521205,0.8748607],"study_design_scores_gemma":[0.00002702603,0.0003483755,0.001583101,0.0006960859,0.0001717221,0.0003258375,0.0001305683,0.8869478,0.01116733,0.02512463,0.07339535,0.00008217558],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"review","genre_scores_codex":[0.01597613,0.07578043,0.8786578,0.002837071,0.0009339406,0.0001945984,0.001103144,0.007855053,0.0166619],"genre_scores_gemma":[0.3618589,0.08828411,0.4787536,0.004141655,0.00163568,0.0007813876,0.01187052,0.002454492,0.0502197],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.009325035,"threshold_uncertainty_score":0.02058542,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4221155360","doi":"10.1109/cvpr52688.2022.00503","title":"MuKEA: Multimodal Knowledge Extraction and Accumulation for Knowledge-based Visual Question Answering","year":2022,"lang":"en","type":"article","venue":"2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":116,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal","funders":"National Natural Science Foundation of China","keywords":"Computer science; Embedding; Knowledge extraction; Construct (python library); Domain knowledge; Question answering; Pipeline (software); Relation (database); Commonsense knowledge; Knowledge base; Artificial intelligence; Domain (mathematical analysis); Bridge (graph theory); Natural language processing; Data mining","authors":[{"name":"Yangyang Ding","is_ca":false},{"name":"Jing Yu","is_ca":false},{"name":"Bang Liu","is_ca":true},{"name":"Yue Hu","is_ca":false},{"name":"Mingxin Cui","is_ca":false},{"name":"Qi Wu","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06767699411909972,"gpt":0.3792622694143057,"spread":0.311585275295206,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001906699,0.002518443,0.001225724,0.004348123,0.000892844,0.002038295,0.003758176,0.002603214,0.01972322],"category_scores_gemma":[0.006390942,0.0007797802,0.00244759,0.001816134,0.0009334445,0.00587007,0.005931118,0.003495964,0.008593424],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001389273,"about_ca_system_score_gemma":0.0016798,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0108472,"about_ca_topic_score_gemma":0.019304,"domain_scores_codex":[0.9986873,0.0003189505,0.00008118897,0.0005527477,0.0002352052,0.0001245915],"domain_scores_gemma":[0.9984035,0.0006302122,0.0000708567,0.0005234199,0.0002651374,0.0001068606],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0003750665,0.0005455362,0.001954983,0.001032236,0.000327181,0.0002374527,0.0007214788,0.01787088,0.01792385,0.01200623,0.05640797,0.8905971],"study_design_scores_gemma":[0.0001520491,0.0003263395,0.003239434,0.0002949658,0.0002987863,0.000429404,0.0008415524,0.8095008,0.0285896,0.07887284,0.07733202,0.0001222094],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01224932,0.001573388,0.913879,0.0005336048,0.0001788026,0.0006976005,0.005000492,0.06026256,0.005625213],"genre_scores_gemma":[0.1343512,0.0006785998,0.8344306,0.0006689911,0.00009332745,0.0007664847,0.02143489,0.0008598075,0.006716046],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01972322,"threshold_uncertainty_score":0.06598067,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2964028737","doi":"10.18653/v1/w17-2629","title":"Adversarial Generation of Natural Language","year":2017,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":115,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Canadian Institute for Advanced Research; Université de Montréal; Polytechnique Montréal","funders":"Nvidia","keywords":"Natural language generation; Computer science; Adversarial system; Natural language; Context (archaeology); Artificial intelligence; Generative grammar; Probabilistic logic; Natural language understanding; Natural language processing; Rule-based machine translation; Sentence; Language model; Estimator; Theoretical computer science; Mathematics","authors":[{"name":"Sandeep Subramanian","is_ca":true},{"name":"Sai Rajeswar","is_ca":true},{"name":"Francis Dutil","is_ca":true},{"name":"Chris Pal","is_ca":true},{"name":"Aaron Courville","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02246753577189608,"gpt":0.3164347830586666,"spread":0.2939672472867705,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001159406,0.000791035,0.0004655172,0.0003974449,0.0002697604,0.000473501,0.0009285892,0.0006999807,0.00394907],"category_scores_gemma":[0.0056466,0.0002348956,0.0006066897,0.0003346239,0.0008089087,0.0007808216,0.001109599,0.00138366,0.0008216387],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005327277,"about_ca_system_score_gemma":0.0005712312,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000974897,"about_ca_topic_score_gemma":0.001572685,"domain_scores_codex":[0.9993485,0.0002887538,0.00002013239,0.0001561744,0.0001334642,0.00005298921],"domain_scores_gemma":[0.9978268,0.001599092,0.0000952229,0.0002557641,0.0001715101,0.00005156194],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001589577,0.0001027337,0.001109217,0.0001649934,0.00005882899,0.0004135164,0.0002100442,0.8357794,0.01028729,0.06765134,0.0120917,0.0719719],"study_design_scores_gemma":[0.00001142157,0.00002059786,0.00009180346,0.000009957861,0.000005149317,0.00004657878,0.00001340179,0.9744613,0.002085711,0.02148881,0.001757986,0.000007205822],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05130355,0.0003686561,0.9374415,0.0006351719,0.0001784466,0.0001983738,0.0008069893,0.001866954,0.007200435],"genre_scores_gemma":[0.7993308,0.0003201344,0.185808,0.0006291973,0.0001041514,0.0006066567,0.002659809,0.0004753925,0.01006595],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00394907,"threshold_uncertainty_score":0.01321095,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2949833607","doi":"10.48550/arxiv.1307.0414","title":"Challenges in Representation Learning: A report on three machine learning contests","year":2013,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":103,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal","funders":"","keywords":"Representation (politics); Computer science; Artificial intelligence; Learning to learn; Feature learning; Active learning (machine learning); Data science; Machine learning; Mathematics education; Psychology; Political science","authors":[{"name":"Ian Goodfellow","is_ca":true},{"name":"Dumitru Erhan","is_ca":false},{"name":"Pierre Carrier","is_ca":true},{"name":"Aaron Courville","is_ca":true},{"name":"Mehdi Mirza","is_ca":true},{"name":"Ben Hamner","is_ca":true},{"name":"Will Cukierski","is_ca":true},{"name":"Yichuan Tang","is_ca":true},{"name":"David S. Thaler","is_ca":true},{"name":"Dong‐Hyun Lee","is_ca":true},{"name":"Yingbo Zhou","is_ca":true},{"name":"Chetan Ramaiah","is_ca":true},{"name":"Fangxiang Feng","is_ca":true},{"name":"Ruifan Li","is_ca":true},{"name":"Xiaojie Wang","is_ca":true},{"name":"Dimitris Athanasakis","is_ca":true},{"name":"John Shawe‐Taylor","is_ca":true},{"name":"Maxim Milakov","is_ca":true},{"name":"John Park","is_ca":true},{"name":"Radu Tudor Ionescu","is_ca":true},{"name":"Marius Popescu","is_ca":true},{"name":"Cristian Grozea","is_ca":true},{"name":"James Bergstra","is_ca":true},{"name":"Jingjing Xie","is_ca":true},{"name":"Łukasz Romaszko","is_ca":true},{"name":"Bing Xu","is_ca":true},{"name":"Chuang Zhang","is_ca":true},{"name":"Yoshua Bengio","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1648509459164146,"gpt":0.2514998793910733,"spread":0.08664893347465866,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04311952,0.003353053,0.003817817,0.004926904,0.005567324,0.01359234,0.004958752,0.005165655,0.01290248],"category_scores_gemma":[0.04563088,0.0008180442,0.002760589,0.007027061,0.003697047,0.01082109,0.0167286,0.01016227,0.00813999],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.006799866,"about_ca_system_score_gemma":0.009620399,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01694451,"about_ca_topic_score_gemma":0.02428427,"domain_scores_codex":[0.9747791,0.006102595,0.001261809,0.002634625,0.01109737,0.00412448],"domain_scores_gemma":[0.9414866,0.01596592,0.001265493,0.004857842,0.02129525,0.01512893],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"observational","study_design_scores_codex":[0.0002458878,0.0003028709,0.001258136,0.0005852444,0.00008235157,0.0001171953,0.0003852171,0.001883238,0.0008024549,0.01332587,0.8733804,0.1076312],"study_design_scores_gemma":[0.0001807374,0.0002725308,0.006631083,0.0005565476,0.00007822686,0.0004337794,0.001807283,0.01172059,0.003921942,0.04826097,0.9259396,0.0001967062],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"commentary","genre_gemma":"empirical","genre_scores_codex":[0.09354947,0.1513638,0.1623434,0.3346093,0.06762651,0.002245442,0.03877367,0.009459716,0.1400288],"genre_scores_gemma":[0.3538744,0.04825884,0.1576356,0.0342258,0.03868993,0.003550609,0.1886837,0.007864237,0.1672168],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.04311952,"threshold_uncertainty_score":0.2280405,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2789177853","doi":"10.1609/aaai.v32i1.12274","title":"Visual Relationship Detection With Deep Structural Ranking","year":2018,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":96,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Carleton University","funders":"China Scholarship Council; Natural Sciences and Engineering Research Council of Canada; National Natural Science Foundation of China; Canada Research Chairs","keywords":"Ranking (information retrieval); Computer science; Artificial intelligence; Complement (music); Representation (politics); Relevance (law); Object (grammar); Machine learning; Pattern recognition (psychology); Function (biology); Image (mathematics)","authors":[{"name":"Kongming Liang","is_ca":false},{"name":"Yuhong Guo","is_ca":true},{"name":"Hong Chang","is_ca":false},{"name":"Xilin Chen","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04774393774670666,"gpt":0.3167447715831568,"spread":0.2690008338364502,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008348082,0.001896025,0.001400695,0.004016099,0.0006654232,0.001542278,0.003178721,0.001658892,0.003777467],"category_scores_gemma":[0.002835093,0.0005941763,0.001211345,0.002575917,0.0004843308,0.003153138,0.002015155,0.001586217,0.002213692],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008883859,"about_ca_system_score_gemma":0.001124591,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006216206,"about_ca_topic_score_gemma":0.01481269,"domain_scores_codex":[0.9987325,0.0001873538,0.00005841866,0.0004275013,0.0003964423,0.0001977103],"domain_scores_gemma":[0.99875,0.000316013,0.0002397595,0.000304376,0.0002757334,0.0001140447],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004447433,0.0005605774,0.004214717,0.0003911644,0.0001877078,0.0003491963,0.0001617902,0.04233181,0.03378962,0.008497369,0.02006361,0.8890077],"study_design_scores_gemma":[0.00003731055,0.0001873806,0.002020791,0.00003628083,0.00007871218,0.0003588426,0.00008628179,0.9649402,0.01340062,0.0141663,0.004647304,0.00003995187],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.07075121,0.002400609,0.909874,0.000328491,0.0001357364,0.0002395018,0.001296684,0.009860622,0.005113162],"genre_scores_gemma":[0.6267779,0.0009357023,0.356066,0.0004190536,0.0001861021,0.0002171152,0.005761386,0.0005542428,0.009082506],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006216206,"threshold_uncertainty_score":0.0126369,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4307475428","doi":"10.1145/3526113.3545621","title":"Opal: Multimodal Image Generation for News Illustration","year":2022,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":96,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"USable; Computer science; Pipeline (software); Image (mathematics); Tone (literature); Multimedia; Artificial intelligence; Human–computer interaction; Linguistics; Programming language","authors":[{"name":"Vivian Liu","is_ca":false},{"name":"Han Qiao","is_ca":true},{"name":"Lydia B. Chilton","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03235914812416576,"gpt":0.2967623643262253,"spread":0.2644032162020595,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006600939,0.00106615,0.0003401218,0.0009292765,0.0003584223,0.001376897,0.001221315,0.0009303733,0.04092586],"category_scores_gemma":[0.004176745,0.0003087929,0.0007123771,0.0003223766,0.0004706389,0.001940886,0.002664908,0.0008202728,0.007500923],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002976388,"about_ca_system_score_gemma":0.0002319209,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005509158,"about_ca_topic_score_gemma":0.0008944009,"domain_scores_codex":[0.9996618,0.000104022,0.00001896166,0.00007059431,0.0001125868,0.00003204265],"domain_scores_gemma":[0.9987778,0.0007850826,0.00004848847,0.0001873678,0.0001137277,0.00008757089],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.001508667,0.0004379209,0.002114498,0.001489434,0.0001412625,0.001638637,0.002189235,0.007448649,0.06867528,0.01598488,0.1730248,0.7253468],"study_design_scores_gemma":[0.000660887,0.0007773051,0.005115304,0.0002971718,0.0001587177,0.003383244,0.001092508,0.3153363,0.1408467,0.03637942,0.4956816,0.0002707756],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04721922,0.001081266,0.6951739,0.0007763701,0.0004274234,0.000802593,0.00440804,0.2056984,0.04441281],"genre_scores_gemma":[0.3175625,0.000881445,0.615178,0.0008096385,0.0001848374,0.001111941,0.009267103,0.01342721,0.04157737],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.04092586,"threshold_uncertainty_score":0.1369106,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2969127500","doi":"10.1109/cvpr.2019.00853","title":"Progressive Attention Memory Network for Movie Story Question Answering","year":2019,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":90,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Kootenay Association for Science & Technology","funders":"","keywords":"Question answering; Computer science; Inference; Modality (human–computer interaction); Benchmark (surveying); Artificial intelligence; Fusion mechanism; Feature (linguistics); Natural language processing; Scheme (mathematics); Information retrieval; Fusion; Linguistics","authors":[{"name":"Junyeong Kim","is_ca":true},{"name":"Minuk Ma","is_ca":true},{"name":"Kyungsu Kim","is_ca":false},{"name":"Sung-Jin Kim","is_ca":false},{"name":"Chang D. Yoo","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.008055523171589318,"gpt":0.2765739735873576,"spread":0.2685184504157683,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007536606,0.0008669474,0.0005761242,0.0008541131,0.0005101176,0.0006592099,0.001866739,0.00123652,0.006650894],"category_scores_gemma":[0.00288566,0.0002633696,0.0005717921,0.0006483741,0.0004601855,0.002258354,0.00124156,0.001161217,0.001045361],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001010508,"about_ca_system_score_gemma":0.0008527113,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01114891,"about_ca_topic_score_gemma":0.01603374,"domain_scores_codex":[0.9996971,0.00006724743,0.00001468579,0.0001258575,0.00005062715,0.00004447706],"domain_scores_gemma":[0.9994942,0.0002632095,0.00003721205,0.00006533535,0.0001009368,0.00003910239],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007894555,0.0003687118,0.003334053,0.0004282726,0.0001331934,0.0002764698,0.0004858924,0.07133485,0.01824423,0.01600446,0.02477229,0.8638282],"study_design_scores_gemma":[0.00004058923,0.0001840628,0.001239805,0.00003628914,0.00008955262,0.0001486066,0.0001121472,0.9494387,0.0082532,0.03220896,0.008220079,0.00002795185],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.129546,0.00490686,0.8360386,0.002084441,0.0003868702,0.0004972578,0.002186608,0.008420245,0.01593302],"genre_scores_gemma":[0.8135365,0.0008833834,0.1679925,0.001125709,0.0002544121,0.0003423929,0.003188523,0.0001246907,0.01255185],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01114891,"threshold_uncertainty_score":0.02224946,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2599940792","doi":"10.24963/ijcai.2017/385","title":"End-to-end optimization of goal-driven and visually grounded dialogue systems","year":2017,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":89,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal","funders":"Agence Nationale de la Recherche; Compute Canada; Natural Sciences and Engineering Research Council of Canada; Canada Research Chairs; Canadian Institute for Advanced Research","keywords":"Computer science; Task (project management); Utterance; Artificial intelligence; Reinforcement learning; Sequence (biology); Object (grammar); Human–computer interaction; Engineering","authors":[{"name":"Florian Strub","is_ca":false},{"name":"Harm de Vries","is_ca":true},{"name":"Jérémie Mary","is_ca":false},{"name":"Bilal Piot","is_ca":false},{"name":"Aaron Courville","is_ca":true},{"name":"Olivier Pietquin","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01768662620118641,"gpt":0.293410836131722,"spread":0.2757242099305356,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002012165,0.001462614,0.001077029,0.0004120515,0.0005077871,0.001023977,0.001147903,0.001684338,0.002986537],"category_scores_gemma":[0.005030566,0.0006681335,0.0005389066,0.0001999563,0.001055071,0.0009668556,0.001841554,0.001666236,0.0005983359],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001325494,"about_ca_system_score_gemma":0.001754693,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00379398,"about_ca_topic_score_gemma":0.003766965,"domain_scores_codex":[0.9992028,0.000343115,0.00003179239,0.0001957223,0.0001063411,0.00012023],"domain_scores_gemma":[0.9982209,0.001218306,0.0001135234,0.00009052812,0.0002175595,0.0001392479],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001614269,0.00008772604,0.0003252307,0.00007179348,0.00002457164,0.00007706349,0.0001349516,0.962439,0.003337828,0.002672731,0.0007562634,0.02991138],"study_design_scores_gemma":[0.00001139595,0.00002421525,0.00003404039,0.000003472592,0.000002409893,0.000005501615,0.00001077644,0.997749,0.0005870737,0.001437631,0.0001318828,0.000002478275],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06235531,0.0003067872,0.9313652,0.0003233919,0.00005432195,0.0001691074,0.00009339854,0.001728103,0.003604401],"genre_scores_gemma":[0.8633749,0.00007855945,0.1329725,0.0001520469,0.00002066414,0.0002941886,0.0001751011,0.0002598951,0.002672196],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00379398,"threshold_uncertainty_score":0.01064146,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2172888184","doi":"10.48550/arxiv.1511.06361","title":"Order-Embeddings of Images and Language","year":2015,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":87,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Closed captioning; Hierarchy; Computer science; Natural language processing; Variety (cybernetics); Artificial intelligence; Image (mathematics); Logical consequence; Textual entailment; Order (exchange)","authors":[{"name":"Ivan Vendrov","is_ca":true},{"name":"Ryan Kiros","is_ca":true},{"name":"Sanja Fidler","is_ca":true},{"name":"Raquel Urtasun","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04293762358184849,"gpt":0.2187895967167586,"spread":0.1758519731349101,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008715401,0.0009069308,0.0005183077,0.002465849,0.0004519107,0.001908385,0.001204549,0.001357323,0.005928588],"category_scores_gemma":[0.007912377,0.0004529743,0.001173771,0.002079406,0.001207151,0.006666597,0.001882735,0.002217179,0.001906699],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009717367,"about_ca_system_score_gemma":0.0008062169,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002270081,"about_ca_topic_score_gemma":0.003920596,"domain_scores_codex":[0.9989132,0.0003391499,0.00008319283,0.0003606877,0.0002231389,0.00008061088],"domain_scores_gemma":[0.997502,0.00101479,0.0003173127,0.0006905646,0.0003548603,0.0001204813],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0004868298,0.0003114312,0.004458963,0.0008915444,0.0001384513,0.0005017559,0.001680644,0.04641638,0.01762296,0.4043639,0.02195004,0.5011771],"study_design_scores_gemma":[0.00003553895,0.0001324529,0.001696915,0.0001388719,0.00005868173,0.0003475423,0.0003549747,0.4321733,0.007636236,0.5378134,0.01955947,0.00005257608],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04279841,0.0009101187,0.9438046,0.0009780112,0.0002371717,0.000160117,0.002685734,0.001811823,0.006613933],"genre_scores_gemma":[0.5737073,0.001411376,0.4066539,0.0004400451,0.0003389158,0.000441874,0.007112406,0.000544038,0.009350106],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005928588,"threshold_uncertainty_score":0.01983309,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3034733309","doi":"10.18653/v1/2020.acl-main.664","title":"Improving Image Captioning with Better Use of Caption","year":2020,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":85,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Queen's University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Closed captioning; Computer science; Leverage (statistics); Artificial intelligence; Natural language processing; Semantics (computer science); Visualization; Feature learning; Representation (politics); Word (group theory); Inductive bias; Image (mathematics); Machine learning; Task (project management); Multi-task learning","authors":[{"name":"Zhan Shi","is_ca":true},{"name":"Zhou Xu","is_ca":false},{"name":"Xipeng Qiu","is_ca":false},{"name":"Xiaodan Zhu","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02151848015296971,"gpt":0.2306801638018164,"spread":0.2091616836488467,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00188524,0.002661191,0.001286784,0.002232692,0.0008249556,0.002913401,0.002826238,0.002700149,0.007712781],"category_scores_gemma":[0.00989101,0.0006015322,0.001663821,0.002069376,0.001161255,0.00497949,0.002813195,0.003596728,0.006107907],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001218828,"about_ca_system_score_gemma":0.0008954412,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002669281,"about_ca_topic_score_gemma":0.003491987,"domain_scores_codex":[0.9985659,0.0004609476,0.00006705638,0.000509947,0.0002896257,0.0001066237],"domain_scores_gemma":[0.9966292,0.001312143,0.0002653268,0.000988109,0.000664509,0.0001408096],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0004307994,0.0003542585,0.001200207,0.0009875093,0.0001914294,0.0004358585,0.0004623768,0.09661594,0.04339142,0.01212291,0.1002077,0.7435996],"study_design_scores_gemma":[0.00007124173,0.0001726436,0.0005741382,0.0001104485,0.0001126344,0.0004724415,0.0001534718,0.8922347,0.04686318,0.02222504,0.03694197,0.00006809171],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01985859,0.003570586,0.9272242,0.00144389,0.001056104,0.0006021062,0.002563799,0.03160476,0.01207593],"genre_scores_gemma":[0.2081635,0.002005955,0.761292,0.001432993,0.0006837877,0.0004734293,0.01260062,0.003289548,0.01005808],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007712781,"threshold_uncertainty_score":0.02580184,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3037533539","doi":"10.1609/aaai.v34i07.6833","title":"Learning Cross-Modal Context Graph for Visual Grounding","year":2020,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":84,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Queen's University","funders":"Natural Sciences and Engineering Research Council of Canada; National Natural Science Foundation of China; National Science Foundation","keywords":"Computer science; Ground; Artificial intelligence; Phrase; Graph; Modal; Modular design; Natural language processing; Theoretical computer science; Programming language","authors":[{"name":"Yongfei Liu","is_ca":false},{"name":"Bo Wan","is_ca":false},{"name":"Xiaodan Zhu","is_ca":true},{"name":"Xuming He","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.08715630185034338,"gpt":0.3538858751306011,"spread":0.2667295732802577,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005870227,0.001831929,0.001240217,0.002606648,0.0008389349,0.00102379,0.002966189,0.00242891,0.005064636],"category_scores_gemma":[0.002567922,0.0005973206,0.001427728,0.002427454,0.001109573,0.00332941,0.002529755,0.002049158,0.00200907],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00109643,"about_ca_system_score_gemma":0.001001414,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01086318,"about_ca_topic_score_gemma":0.02273102,"domain_scores_codex":[0.9992458,0.000105887,0.00002144416,0.0004066438,0.0001176081,0.0001027192],"domain_scores_gemma":[0.9994197,0.00017625,0.00007251839,0.0001638936,0.0001160098,0.00005162849],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003843335,0.0003597562,0.003393093,0.0004006697,0.0002145729,0.0004194688,0.0003613058,0.1947403,0.03766751,0.02394221,0.02364708,0.7144697],"study_design_scores_gemma":[0.0000361664,0.00008797261,0.0008813867,0.00003313951,0.00004172217,0.000117106,0.000113807,0.9520059,0.006008636,0.03704016,0.003609175,0.00002484054],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05740946,0.0009757699,0.9243962,0.0003590833,0.0001207338,0.00015055,0.001277411,0.0109264,0.004384431],"genre_scores_gemma":[0.6647895,0.0004421959,0.3193323,0.0006430533,0.0001077492,0.0002056992,0.007159831,0.001036424,0.00628322],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01086318,"threshold_uncertainty_score":0.02159989,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2766520430","doi":"10.1145/3123266.3123327","title":"Catching the Temporal Regions-of-Interest for Video Captioning","year":2017,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":80,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"National Natural Science Foundation of China","keywords":"Closed captioning; Computer science; Focus (optics); Representation (politics); Frame (networking); Artificial intelligence; Region of interest; Image (mathematics); Telecommunications","authors":[{"name":"Ziwei Yang","is_ca":false},{"name":"Yahong Han","is_ca":false},{"name":"Zheng Wang","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1113495865189584,"gpt":0.3552552529180734,"spread":0.243905666399115,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001584794,0.00234657,0.001378312,0.002201023,0.0005895664,0.001279808,0.001774322,0.001757308,0.002835626],"category_scores_gemma":[0.007608332,0.0005176426,0.001179126,0.001898861,0.0007579282,0.002970555,0.001607845,0.002328684,0.002638981],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009263985,"about_ca_system_score_gemma":0.0008276287,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006640478,"about_ca_topic_score_gemma":0.009345894,"domain_scores_codex":[0.9987146,0.0003509083,0.00007292897,0.0004649375,0.0002598271,0.000136876],"domain_scores_gemma":[0.9968934,0.001205055,0.0003163787,0.0006200693,0.0008201913,0.0001448514],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008443508,0.0002532622,0.001516542,0.001119736,0.0001723099,0.000495588,0.000529177,0.0494278,0.1105761,0.003903161,0.04275092,0.788411],"study_design_scores_gemma":[0.00005693009,0.000296285,0.002513452,0.0001228774,0.000194503,0.0007176365,0.0002109553,0.8969286,0.06982582,0.00583574,0.02321467,0.0000824927],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.03767877,0.006172438,0.9305654,0.0006854079,0.0005371816,0.0005852957,0.002664119,0.01535603,0.005755315],"genre_scores_gemma":[0.3906369,0.00440103,0.5799912,0.0008100251,0.000890743,0.000594984,0.01151271,0.00206978,0.009092587],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.006640478,"threshold_uncertainty_score":0.01320362,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3034585290","doi":"10.1109/cvpr42600.2020.00365","title":"Composed Query Image Retrieval Using Locally Bounded Features","year":2020,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":80,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Manitoba","funders":"","keywords":"Computer science; Image retrieval; Image (mathematics); Margin (machine learning); Benchmark (surveying); Set (abstract data type); Visual Word; Artificial intelligence; Information retrieval; Pattern recognition (psychology); Sentence; Machine learning","authors":[{"name":"Mehrdad Hosseinzadeh","is_ca":true},{"name":"Yang Wang","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02537338834740047,"gpt":0.2891620705912578,"spread":0.2637886822438573,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006596395,0.001328061,0.002033271,0.002145009,0.0004463692,0.001210235,0.001761276,0.001312278,0.004601751],"category_scores_gemma":[0.00242358,0.0003109969,0.001045616,0.002299879,0.0006045768,0.003137652,0.001407811,0.0007945354,0.002155738],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009170967,"about_ca_system_score_gemma":0.0007114896,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005190894,"about_ca_topic_score_gemma":0.006211986,"domain_scores_codex":[0.9989875,0.0001486081,0.00006560772,0.0003478809,0.0003435272,0.0001068288],"domain_scores_gemma":[0.9991176,0.0002397867,0.0001121136,0.0002790664,0.0002033782,0.0000481024],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001724672,0.0005044505,0.002093896,0.0007112778,0.0003112404,0.0009673437,0.0002999406,0.06352644,0.1518988,0.008784574,0.03140452,0.7377729],"study_design_scores_gemma":[0.000117919,0.0004091259,0.002325412,0.00002863516,0.0001619638,0.0008958992,0.0001739722,0.9433358,0.03213628,0.01160822,0.008741535,0.00006527892],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08886695,0.004145097,0.8925303,0.0004682793,0.000164904,0.0003978481,0.001469176,0.007143081,0.004814479],"genre_scores_gemma":[0.6457427,0.001369311,0.3328021,0.0006253874,0.0004112267,0.0003991608,0.006251492,0.0005911581,0.01180748],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005190894,"threshold_uncertainty_score":0.01539439,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4406343535","doi":"10.1007/s43621-025-00815-8","title":"A comprehensive review of large language models: issues and solutions in learning environments","year":2025,"lang":"en","type":"review","venue":"Discover Sustainability","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":77,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Moncton","funders":"University of Johannesburg","keywords":"Computer science; Management science; Engineering","authors":[{"name":"Tariq Shahzad","is_ca":false},{"name":"Tehseen Mazhar","is_ca":false},{"name":"Muhammad Usman Tariq","is_ca":false},{"name":"Wasim Ahmad","is_ca":false},{"name":"Khmaies Ouahada","is_ca":false},{"name":"Habib Hamam","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02134894238762933,"gpt":0.3679048077687132,"spread":0.3465558653810838,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003113806,0.0009634243,0.001609422,0.004436827,0.0005387484,0.002734516,0.001399521,0.001793671,0.006617499],"category_scores_gemma":[0.008986431,0.0005397692,0.001085999,0.005797327,0.001033455,0.004749674,0.001409524,0.001705645,0.002199707],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001446532,"about_ca_system_score_gemma":0.005687749,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003398715,"about_ca_topic_score_gemma":0.005497585,"domain_scores_codex":[0.9985886,0.0005284515,0.0002464363,0.0001673942,0.0004057263,0.000063375],"domain_scores_gemma":[0.9930624,0.005548399,0.0003642932,0.0001871579,0.0007294864,0.0001083214],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00002392185,0.00004330131,0.0002921318,0.03987125,0.0001214096,0.00008560588,0.0003513796,0.001037861,0.0003064336,0.02526461,0.02455151,0.9080506],"study_design_scores_gemma":[0.000005042069,0.00004617203,0.0006190908,0.02267722,0.0001660116,0.0002971969,0.0002502472,0.000332734,0.0002401416,0.01031178,0.9650266,0.0000278498],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0001830374,0.9948404,0.001200702,0.001057606,0.0001599129,0.00001239528,0.0000577798,0.00002024184,0.002467763],"genre_scores_gemma":[0.002036745,0.9951301,0.001610676,0.0003501919,0.0001502305,0.00002754527,0.00008394847,0.00001160769,0.0005989728],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.006617499,"threshold_uncertainty_score":0.0221377,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2155292833","doi":"10.48550/arxiv.1511.02793","title":"Generating Images from Captions with Attention","year":2015,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":75,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Generative grammar; Computer science; Artificial intelligence; Generative model; Baseline (sea); Image (mathematics); Natural language processing; Training set; Natural (archaeology); Natural language generation; Machine learning; Natural language; Geography","authors":[{"name":"Elman Mansimov","is_ca":true},{"name":"Emilio Parisotto","is_ca":true},{"name":"Jimmy Ba","is_ca":true},{"name":"Ruslan Salakhutdinov","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06370869466700849,"gpt":0.2035532282945449,"spread":0.1398445336275364,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008551939,0.001620203,0.0008777476,0.001102973,0.0004199749,0.001520359,0.002007437,0.001855022,0.007350286],"category_scores_gemma":[0.004877069,0.0008504032,0.001546579,0.0008809328,0.0009918096,0.001714842,0.00124084,0.001974232,0.002568982],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001322486,"about_ca_system_score_gemma":0.000680993,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005442805,"about_ca_topic_score_gemma":0.007964741,"domain_scores_codex":[0.9993879,0.0001801995,0.00002080622,0.0002344615,0.0001134144,0.00006321612],"domain_scores_gemma":[0.9985307,0.0008035674,0.00007936668,0.0003247025,0.0001885055,0.00007300133],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005438644,0.0003059361,0.00194874,0.0006642641,0.0001837024,0.000775437,0.0005881962,0.4984543,0.03407443,0.03621093,0.05496244,0.3712878],"study_design_scores_gemma":[0.00003633535,0.0000458284,0.000208933,0.00002332752,0.00002026317,0.000175954,0.00003079063,0.9753677,0.007032532,0.01217546,0.00486477,0.00001806924],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03654676,0.0013538,0.9371267,0.001006603,0.0003241522,0.0004299007,0.001371709,0.01154306,0.01029733],"genre_scores_gemma":[0.5303128,0.001092924,0.4418806,0.001238875,0.0003118795,0.0006369305,0.006775067,0.002306337,0.01544465],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007350286,"threshold_uncertainty_score":0.02458918,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3171547673","doi":"10.48550/arxiv.2106.03089","title":"Referring Transformer: A One-step Approach to Multi-task Visual Grounding","year":2021,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":73,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Ground; Transformer; Task (project management); Computer science; Engineering; Electrical engineering; Systems engineering; Voltage","authors":[{"name":"Muchen Li","is_ca":true},{"name":"Leonid Sigal","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1171326450951862,"gpt":0.2384591119005074,"spread":0.1213264668053212,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00172239,0.001972593,0.001359598,0.001030474,0.0004758947,0.001591524,0.004138933,0.002391988,0.008347004],"category_scores_gemma":[0.003703319,0.0007253333,0.002077588,0.001100013,0.001107975,0.00390222,0.003651001,0.002805115,0.003447182],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009918535,"about_ca_system_score_gemma":0.001301407,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005109534,"about_ca_topic_score_gemma":0.006959579,"domain_scores_codex":[0.9988501,0.0002736245,0.00004359276,0.0004848782,0.0001836299,0.0001641372],"domain_scores_gemma":[0.9989595,0.0003381002,0.00007443676,0.0003743665,0.0001689659,0.00008460917],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005542723,0.000396482,0.0009274456,0.0003114812,0.000213932,0.0003953745,0.0004915165,0.08682006,0.04995555,0.01835003,0.01629636,0.8252875],"study_design_scores_gemma":[0.00004354789,0.0002435754,0.0005558015,0.00002843854,0.00008521201,0.0001981535,0.0001012522,0.935035,0.02479108,0.03223751,0.006631169,0.00004911618],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01262489,0.0004878113,0.9666355,0.0003600203,0.00009123266,0.0001723832,0.0003245392,0.01598119,0.003322434],"genre_scores_gemma":[0.4607449,0.0005346221,0.5201771,0.0009398941,0.0001780024,0.0003539223,0.001854519,0.001426605,0.0137905],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008347004,"threshold_uncertainty_score":0.02792352,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4386071509","doi":"10.1109/cvpr52729.2023.00690","title":"PACO: Parts and Attributes of Common Objects","year":2023,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":62,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Object (grammar); Benchmark (surveying); Artificial intelligence; Code (set theory); Segmentation; Object detection; Information retrieval; Natural language processing; Computer vision; Pattern recognition (psychology); Set (abstract data type); Programming language; Geography","authors":[{"name":"Vignesh Ramanathan","is_ca":false},{"name":"Anmol Kalia","is_ca":false},{"name":"Vladan Petrović","is_ca":false},{"name":"Yi Wen","is_ca":false},{"name":"Baixue Zheng","is_ca":false},{"name":"Baishan Guo","is_ca":false},{"name":"Rui Wang","is_ca":false},{"name":"Aaron Marquez","is_ca":false},{"name":"Rama Kovvuri","is_ca":false},{"name":"Abhishek Kadian","is_ca":false},{"name":"Amir Mousavi","is_ca":true},{"name":"Yiwen Song","is_ca":false},{"name":"Abhimanyu Dubey","is_ca":false},{"name":"Dhruv Mahajan","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02133016029766966,"gpt":0.2892003363021184,"spread":0.2678701760044487,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001845521,0.003287708,0.001914875,0.004635334,0.001309475,0.003686756,0.005657102,0.002760899,0.006442948],"category_scores_gemma":[0.008185854,0.001364424,0.002788204,0.003839849,0.001320393,0.008080889,0.005532656,0.003085795,0.007811072],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00201769,"about_ca_system_score_gemma":0.001901326,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01734204,"about_ca_topic_score_gemma":0.03157492,"domain_scores_codex":[0.9970803,0.0002621085,0.0001714035,0.001475252,0.000784176,0.0002267752],"domain_scores_gemma":[0.9960311,0.000887566,0.0002639009,0.002035164,0.0005217973,0.0002603691],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.002067368,0.0005114728,0.031521,0.00376423,0.000644282,0.000541787,0.0006889077,0.02962727,0.0236508,0.01870091,0.4131311,0.4751509],"study_design_scores_gemma":[0.0001907416,0.0005868999,0.04147347,0.0009296761,0.0003962459,0.002720362,0.0008504705,0.3584247,0.0467221,0.05592572,0.491478,0.0003015259],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.105882,0.01042155,0.4084335,0.001706262,0.001022918,0.001192174,0.3358407,0.1139659,0.02153508],"genre_scores_gemma":[0.1239516,0.001799133,0.2640157,0.0007680674,0.0001700614,0.0008097706,0.59881,0.003626633,0.006049213],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01734204,"threshold_uncertainty_score":0.03448218,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2997514790","doi":"10.1609/aaai.v34i07.6783","title":"Deep Generative Probabilistic Graph Neural Networks for Scene Graph Generation","year":2020,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":57,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Artificial intelligence; Scene graph; Probabilistic logic; Generative model; Graph; Theoretical computer science; Minimum bounding box; Pattern recognition (psychology); Generative grammar; Image (mathematics)","authors":[{"name":"Mahmoud Khademi","is_ca":true},{"name":"Oliver Schulte","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.09663262041000328,"gpt":0.3077191104554348,"spread":0.2110864900454315,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006086453,0.001712244,0.001093909,0.001104179,0.0005104776,0.0009498468,0.003092768,0.001810345,0.004976742],"category_scores_gemma":[0.00253161,0.0008834586,0.001941916,0.001084369,0.0009806022,0.002501033,0.001479615,0.002649728,0.001332297],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002159259,"about_ca_system_score_gemma":0.001155158,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01274932,"about_ca_topic_score_gemma":0.02152923,"domain_scores_codex":[0.999471,0.000101807,0.00001782918,0.0002464951,0.0001024842,0.00006036154],"domain_scores_gemma":[0.9992747,0.0003588561,0.00006560812,0.000142841,0.0001133131,0.00004469492],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000123243,0.00009843989,0.001156488,0.0001891044,0.0001091644,0.0001917379,0.0001287933,0.7411143,0.005536309,0.02415283,0.01160966,0.2155899],"study_design_scores_gemma":[0.00001078921,0.0000136326,0.00008013769,0.000006834015,0.000009519976,0.00002827816,0.000008450414,0.9783812,0.0010977,0.01915381,0.001203362,0.000006231301],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01273364,0.000523738,0.9759931,0.0004622417,0.00008088889,0.0001160746,0.0008456199,0.007008727,0.002235965],"genre_scores_gemma":[0.4128157,0.0005424331,0.5704845,0.001081456,0.0001009989,0.0003766104,0.006768438,0.001353941,0.006475891],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01274932,"threshold_uncertainty_score":0.02535021,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3121592593","doi":"","title":"Long Range Arena : A Benchmark for Efficient Transformers","year":2021,"lang":"en","type":"article","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":57,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal","funders":"","keywords":"Suite; Benchmarking; Computer science; Transformer; Benchmark (surveying); Artificial intelligence; Machine learning; Data mining; Engineering","authors":[{"name":"Yi Tay","is_ca":false},{"name":"Mostafa Dehghani","is_ca":false},{"name":"Samira Abnar","is_ca":false},{"name":"Yikang Shen","is_ca":true},{"name":"Dara Bahri","is_ca":false},{"name":"Philip Pham","is_ca":false},{"name":"Jinfeng Rao","is_ca":false},{"name":"Yang Liu","is_ca":false},{"name":"Sebastian Ruder","is_ca":false},{"name":"Donald Metzler","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01244723705163878,"gpt":0.2729188266178351,"spread":0.2604715895661963,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004265424,0.002264989,0.0009533773,0.002041845,0.000740362,0.00228531,0.003637733,0.002348906,0.006817514],"category_scores_gemma":[0.02400835,0.0005741989,0.001720856,0.00184535,0.001211671,0.00602168,0.002200509,0.002464355,0.002753344],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001930459,"about_ca_system_score_gemma":0.002651514,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006835301,"about_ca_topic_score_gemma":0.01143057,"domain_scores_codex":[0.997095,0.001077718,0.0002773379,0.000750975,0.0005708408,0.0002280632],"domain_scores_gemma":[0.9896976,0.00684395,0.0003974066,0.001741801,0.001007996,0.0003112079],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001454515,0.0009416029,0.007846369,0.003465518,0.0005638048,0.0004633311,0.0003426009,0.5112389,0.006682832,0.04028985,0.09339645,0.3333143],"study_design_scores_gemma":[0.0002944482,0.000965704,0.001215261,0.0002054486,0.0001208178,0.0004012206,0.0002381987,0.9111115,0.008936742,0.05337664,0.02307618,0.0000579295],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3968473,0.01999877,0.4497386,0.005487196,0.001594307,0.001293471,0.03346751,0.04115406,0.05041873],"genre_scores_gemma":[0.6552052,0.00393226,0.2755809,0.001127181,0.0002418813,0.001005416,0.05007832,0.003429134,0.009399659],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006835301,"threshold_uncertainty_score":0.02280688,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2190067570","doi":"10.1109/cvpr.2016.501","title":"MovieQA: Understanding Stories in Movies through Question-Answering","year":2016,"lang":"en","type":"preprint","venue":"","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":55,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"Karlsruhe House of Young Scientists; Deutsche Forschungsgemeinschaft","keywords":"Computer science; Question answering; Scripting language; Set (abstract data type); Benchmark (surveying); Comprehension; Semantics (computer science); Information retrieval; Natural language processing; Domain (mathematical analysis); CLIPS; Range (aeronautics); Artificial intelligence; Programming language","authors":[{"name":"Makarand Tapaswi","is_ca":false},{"name":"Yukun Zhu","is_ca":true},{"name":"Rainer Stiefelhagen","is_ca":false},{"name":"Antonio Torralba","is_ca":false},{"name":"Raquel Urtasun","is_ca":true},{"name":"Sanja Fidler","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06700293859533554,"gpt":0.3442383981747281,"spread":0.2772354595793926,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002319202,0.0025823,0.001009445,0.003368802,0.001054551,0.002051045,0.002927799,0.003326702,0.01376144],"category_scores_gemma":[0.01469457,0.0004232551,0.001347935,0.001971847,0.0006332244,0.005275941,0.002485416,0.00250228,0.0078089],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001425497,"about_ca_system_score_gemma":0.001074079,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01344528,"about_ca_topic_score_gemma":0.02338779,"domain_scores_codex":[0.9972608,0.0009945291,0.0002461016,0.0007592622,0.0005538707,0.0001853722],"domain_scores_gemma":[0.9938545,0.003688115,0.0003463144,0.0009812003,0.0007144759,0.0004152909],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002469207,0.003266492,0.02456999,0.006676126,0.0006880354,0.000862854,0.002601572,0.01236766,0.02130647,0.006857217,0.6673708,0.2509635],"study_design_scores_gemma":[0.001318696,0.002321339,0.08776189,0.0009820097,0.0004706862,0.002601613,0.004957375,0.2819079,0.03727916,0.02657209,0.5534953,0.0003319206],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"empirical","genre_scores_codex":[0.2614771,0.01152869,0.06955513,0.003919546,0.0009218288,0.003324224,0.5854383,0.03154106,0.03229421],"genre_scores_gemma":[0.1716415,0.0009620519,0.119571,0.0009484438,0.0002494958,0.001216641,0.6981582,0.0005798649,0.006672763],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01376144,"threshold_uncertainty_score":0.0460366,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}