{"id":"W4409362569","doi":"10.1609/aaai.v39i24.34717","title":"CodeHalu: Investigating Code Hallucinations in LLMs via Execution-based Verification","year":2025,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Security and Verification in Computing","field":"Computer Science","cited_by":13,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta; Mila - Quebec Artificial Intelligence Institute","funders":"","keywords":"Code (set theory); Computer science; Programming language; Psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004700056,0.00106955,0.0004744692,0.002532825,0.000641284,0.001389174,0.00180262,0.001047634,0.0008764029],"category_scores_gemma":[0.04671404,0.0004297564,0.0006808885,0.001390102,0.001529143,0.002265124,0.002251224,0.001493159,0.0004169026],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00103168,"about_ca_system_score_gemma":0.001756264,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005238434,"about_ca_topic_score_gemma":0.007557634,"domain_scores_codex":[0.994002,0.001987712,0.0004339518,0.001005041,0.002250867,0.0003203928],"domain_scores_gemma":[0.9550491,0.02989352,0.004302145,0.006319698,0.003751567,0.0006838777],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00253739,0.001075078,0.182112,0.002636707,0.0004836268,0.00177974,0.004416314,0.1844211,0.05538717,0.01463308,0.0293243,0.5211935],"study_design_scores_gemma":[0.0001340741,0.0006173998,0.01932392,0.0001154864,0.00007520938,0.0007340963,0.0007317234,0.9208488,0.03745877,0.01140246,0.008488168,0.00006978801],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7725768,0.001598065,0.1946766,0.0007137606,0.0001676155,0.0004876373,0.002576502,0.02342994,0.003773123],"genre_scores_gemma":[0.8838601,0.0001734497,0.1098043,0.0002228262,0.00002469204,0.000243537,0.003751994,0.0009629264,0.0009563054],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.005238434,"threshold_uncertainty_score":0.02485651,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07942367299217998,"score_gpt":0.320831477344202,"score_spread":0.241407804352022,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}