{"id":"W4400338820","doi":"10.1016/j.cviu.2024.104064","title":"Implicit and explicit commonsense for multi-sentence video captioning","year":2024,"lang":"en","type":"article","venue":"Computer Vision and Image Understanding","topic":"Multimodal Machine Learning Applications","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute; Canadian Institute for Advanced Research; University of British Columbia","funders":"Alliance de recherche numérique du Canada; Vector Institute; Natural Sciences and Engineering Research Council of Canada; Canadian Institute for Advanced Research","keywords":"Closed captioning; Computer science; Commonsense knowledge; Sentence; Paragraph; Natural language processing; Artificial intelligence; Task (project management); Object (grammar); Isolation (microbiology); Commonsense reasoning; Knowledge base; Transformer; Image (mathematics); World Wide Web","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001630723,0.00180909,0.0007486159,0.001133915,0.0004730717,0.001542099,0.002116861,0.001632093,0.00752888],"category_scores_gemma":[0.007254322,0.0004001062,0.0009170229,0.0007104747,0.0008188703,0.003290889,0.001838642,0.002262516,0.003736638],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008739121,"about_ca_system_score_gemma":0.0006911732,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002299889,"about_ca_topic_score_gemma":0.003830642,"domain_scores_codex":[0.9990255,0.0003375268,0.00006216277,0.0003127099,0.0001871332,0.00007506776],"domain_scores_gemma":[0.9971916,0.001242582,0.0001868399,0.0007595343,0.0004818423,0.0001376692],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007811544,0.00034838,0.00110598,0.001321384,0.0001562288,0.0006508174,0.0006244618,0.09597366,0.09945919,0.01405281,0.04955063,0.7359753],"study_design_scores_gemma":[0.00005572314,0.000276374,0.0007658905,0.00006843972,0.00006189615,0.0003507597,0.0001474922,0.9066022,0.05652909,0.01429898,0.02078753,0.00005566557],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03292479,0.001788417,0.9154409,0.0006363572,0.000408633,0.0005384969,0.003811156,0.03538854,0.009062833],"genre_scores_gemma":[0.4091274,0.0009986809,0.5627117,0.0005226327,0.0003403682,0.0005292482,0.0145328,0.001523797,0.009713387],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00752888,"threshold_uncertainty_score":0.0251866,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07097240444014455,"score_gpt":0.3486225845864008,"score_spread":0.2776501801462563,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}