{"id":"W4410887599","doi":"10.1109/isqed65160.2025.11014310","title":"Evaluating LLM-Based Communicative Agents for Verilog Design","year":2025,"lang":"en","type":"article","venue":"","topic":"Speech and dialogue systems","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Calgary","funders":"Natural Sciences and Engineering Research Council of Canada; Intel Corporation","keywords":"Computer science; Verilog; Computer architecture; Embedded system; Field-programmable gate array","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00634598,0.0009921432,0.0003517354,0.0007947285,0.0004004578,0.0009279153,0.001811518,0.001458372,0.002250099],"category_scores_gemma":[0.02090745,0.0005028381,0.0004739702,0.0003527977,0.00102166,0.001408558,0.001106767,0.001218588,0.0005159026],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002202403,"about_ca_system_score_gemma":0.002043849,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003830534,"about_ca_topic_score_gemma":0.006863326,"domain_scores_codex":[0.9959156,0.002534676,0.0002105696,0.0002931958,0.0008883547,0.0001575427],"domain_scores_gemma":[0.9855408,0.01085751,0.000590447,0.001602142,0.001120236,0.0002888031],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00135493,0.001464609,0.00524473,0.0009088949,0.0001482375,0.0002018988,0.001210682,0.77213,0.02838423,0.01330255,0.004364806,0.1712845],"study_design_scores_gemma":[0.0001193455,0.0004680121,0.0003051537,0.00001905345,0.00002119295,0.00002693101,0.00007718414,0.9835516,0.01220786,0.001306621,0.001882727,0.00001441306],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6905199,0.0005162006,0.2775526,0.0007599062,0.0001535178,0.0009416273,0.0006416468,0.01636321,0.01255136],"genre_scores_gemma":[0.7845194,0.000100902,0.2123835,0.000126535,0.00001262486,0.0003843973,0.0005802087,0.0003422973,0.001550122],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.00634598,"threshold_uncertainty_score":0.03356117,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2232403993404547,"score_gpt":0.427165115659945,"score_spread":0.2039247163194902,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}