MétaCan
Menu
Retour à la cohorte
Enregistrement W4390970405 · doi:10.1371/journal.pdig.0000417

Peer review of GPT-4 technical report and systems card

2024· article· en· W4390970405 sur OpenAlexaff
Jack Gallifant, Amelia Fiske, Yulia A. Strekalova, Juan Sebastian Osorio-Valencia, Rachael Parke, Rogers Mwavu, Nicole Martínez, Judy Wawira Gichoya, Marzyeh Ghassemi, Dina Demner‐Fushman, Liam G. McCoy, Leo Anthony Celi, Robin Pierce

Notice bibliographique

RevuePLOS Digital Health · 2024
Typearticle
Langueen
DomaineMedicine
ThématiqueArtificial Intelligence in Healthcare and Education
Établissements canadiensUniversity of Alberta
Organismes subventionnairesNational Institute on Minority Health and Health DisparitiesNational Institute of Biomedical Imaging and BioengineeringFogarty International CenterGordon and Betty Moore FoundationNational Heart, Lung, and Blood InstituteRadiological Society of North AmericaNational Institutes of HealthNational Science Foundation
Mots-clésTransparency (behavior)CLARITYIntellectual propertyAccountabilityHealth careHarmBusinessPublic relationsPolitical scienceComputer scienceComputer security

Résumé

récupéré en direct d'OpenAlex

The study provides a comprehensive review of OpenAI's Generative Pre-trained Transformer 4 (GPT-4) technical report, with an emphasis on applications in high-risk settings like healthcare. A diverse team, including experts in artificial intelligence (AI), natural language processing, public health, law, policy, social science, healthcare research, and bioethics, analyzed the report against established peer review guidelines. The GPT-4 report shows a significant commitment to transparent AI research, particularly in creating a systems card for risk assessment and mitigation. However, it reveals limitations such as restricted access to training data, inadequate confidence and uncertainty estimations, and concerns over privacy and intellectual property rights. Key strengths identified include the considerable time and economic investment in transparent AI research and the creation of a comprehensive systems card. On the other hand, the lack of clarity in training processes and data raises concerns about encoded biases and interests in GPT-4. The report also lacks confidence and uncertainty estimations, crucial in high-risk areas like healthcare, and fails to address potential privacy and intellectual property issues. Furthermore, this study emphasizes the need for diverse, global involvement in developing and evaluating large language models (LLMs) to ensure broad societal benefits and mitigate risks. The paper presents recommendations such as improving data transparency, developing accountability frameworks, establishing confidence standards for LLM outputs in high-risk settings, and enhancing industry research review processes. It concludes that while GPT-4's report is a step towards open discussions on LLMs, more extensive interdisciplinary reviews are essential for addressing bias, harm, and risk concerns, especially in high-risk domains. The review aims to expand the understanding of LLMs in general and highlights the need for new reflection forms on how LLMs are reviewed, the data required for effective evaluation, and addressing critical issues like bias and risk.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,185
score de la tête « metaresearch » (Gemma)0,530
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesMétarecherche
Catégories consensuellesaucune
DomaineSignal candidat: Évaluation · Signal consensuel: aucune
Devis d'étudeSignal candidat: Sans objet · Signal consensuel: Sans objet
GenreSignal candidat: Synthèse · Signal consensuel: aucune
Score de désaccord entre enseignants0,815
Score d'incertitude au seuil0,980

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,1850,530
Méta-épidémiologie (sens strict)0,0020,002
Méta-épidémiologie (sens large)0,0020,003
Bibliométrie0,0120,008
Études des sciences et des technologies0,0070,010
Communication savante0,0300,016
Science ouverte0,0100,014
Intégrité de la recherche0,0130,012
Charge utile insuffisante (le modèle a refusé de juger)0,1060,123

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,237
Tête enseignante GPT0,474
Écart entre enseignants0,237 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.

Devis d'étudeSans objet
DomaineÉvaluation
GenreSynthèse

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations96
Publié2024
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revuePLOS Digital HealthMême sujetArtificial Intelligence in Healthcare and EducationTravaux en français237 207