CROKAGE: effective solution recommendation for programming tasks by leveraging crowd knowledge
Notice bibliographique
Résumé
Agradecimentos Agradeço...A Deus, por minha vida e pela minha saúde.Aos meus pais Wanderley e Romilda pelo amor incondicional.Sem o apoio deles desde meus primeiros momentos de vida eu não teria traçado essa trajetória e não teria chegado até aqui.Ao meu orientador Marcelo Maia, por me guiar pelo caminho certo durante essa jornada, gastando comigo incontáveis horas de instruções e esclarecimentos.Aos meus colegas de laboratório Carlos Eduardo e Klerisson, pelo apoio e colaboração nos trabalhos.Aos meus ex-chefes de trabalho que me permitiram dedicar ao doutorado, e sem cujas permissões eu não teria conseguido: professores Ernando Reis, Valder Steffen, Odorico Coelho e Darizon Alves.Ao meu atual chefe, professor Helder Eterno, que me autorizou 2 anos de afastamento integral para dedicação exclusiva ao doutorado, me permitindo inclusive ir estudar no exterior.Minha gratidão será Eterna.Ao meu novo colega de laboratório do Canadá: Masud Rahman, que atuou como meu co-orientador durante meus trabalhos na Universidade de Saskatchewan e cujo papel foi fundamental para o sucesso de minhas publicações.Ao professor Chanchal Roy que me possibilitou 1 ano de pesquisa e aprendizado na Universidade de Saskatchewan.E por Ąm à Universidade Federal de Uberlândia, que me formou, me deu um mestrado, um trabalho e agora está me dando um doutorado.Me sinto em eterna dívida com essa instituição que considero minha minha segunda casa. ResumoDesenvolvedores frequentemente buscam por exemplos de código na internet para suas tarefas de programação.Infelizmente, eles enfrentam três grandes problemas.Primeiro, eles normalmente precisam ler e analisar diversos resultados das ferramentas de busca até obterem uma solução satisfatória.Segundo, a busca é prejudicada devido a uma lacuna léxica entre a consulta (descrição da tarefa) e a informação associada à solução (ex.exemplo de código).Terceiro, a solução recuperada pode não ser compreensível, como por exemplo, apenas um trecho de código sem uma explicação sucinta.Para tratar esses três problemas, propomos CROKAGE (Gerador de Respostas de Conhecimento da Multidão), uma ferramenta que recebe a descrição de uma tarefa de programação em linguagem natural e fornece uma solução compreensível para a tarefa, isto é, uma solução que contém não somente exemplos de código relevantes, mas também suas explicações sucintas escritas por desenvolvedores.Primeiramente, o conhecimento da multidão presente no Stack OverĆow é utilizado para recuperar respostas candidatas para a tarefa de programação.Em seguida, um mecanismo de relevância composto de múltiplos fatores é usado para mitigar o problema da lacuna léxica e selecionar as respostas com melhor qualidade relacionadas à tarefa.Finalmente, ocorre um processamento de linguagem natural nas respostas de melhor qualidade para entregar as soluções de programação contendo os exemplos de código acompanhados de suas explicações, ao contrário dos estudos anteriores.CROKAGE foi avaliada e comparada com sete outras abordagens-base, incluindo o estado da arte.CROKAGE superou as sete outras no fornecimento de soluções relevantes para 902 tarefas de programação.Além disso, um estudo com 24 tarefas de programação e 29 desenvolvedores, conĄrmando a superioridade de CROKAGE sobre o estado da arte em termos de relevância dos exemplos de código sugeridos, benefício das explicações do código e da qualidade geral da solução (código + explicação).
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,002 | 0,012 |
| Méta-épidémiologie (sens strict) | 0,004 | 0,001 |
| Méta-épidémiologie (sens large) | 0,002 | 0,002 |
| Bibliométrie | 0,008 | 0,003 |
| Études des sciences et des technologies | 0,001 | 0,001 |
| Communication savante | 0,002 | 0,004 |
| Science ouverte | 0,004 | 0,004 |
| Intégrité de la recherche | 0,003 | 0,002 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,006 | 0,004 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».