Bibliographic record
Abstract
LA LINGUISTICA FORENSE, AREA DE LA INGENIERIA RESPECTIVA QUE RELACIONA AL LENGUAJE CON EL FORO LEGAL, RESUELVE PROBLEMAS COMO LA DETECCION DE FRAUDES O LA FILTRACION DE INFORMACION DENTRO DE LAS EMPRESAS, LA AUTORIA DE UN TEXTO O EL PLAGIO, ENTRE OTROS. EN EL INSTITUTO DE INGENIERIA DE LA UNAM, EL GRUPO DE INGENIERIA LINGUISTICA (GIL) QUE ENCABEZA GERARDO SIERRA MARTINEZ SE CENTRA SOLO EN ESAS CUESTIONES, SINO QUE TAMBIEN HA EMPRENDIDO ESTUDIOS DE FONETICA FORENSE PARA, POR EJEMPLO, DETERMINAR COMO UNA PROTESIS DENTAL CAMBIA LA FORMA DE HABLAR DE UNA PERSONA Y QUE SERIE DE TRUCOS PUEDEN HACERSE PARA APARENTAR OTRA FORMA DE EXPRESARSE. INCLUSO, EN COLABORACION CON LA UNIVERSIDAD DE MONTREAL, PRETENDE DETECTAR, DE FORMA TEMPRANA, LA ENFERMEDAD DE ALZHEIMER MEDIANTE EL ANALISIS DE TEXTOS ESCRITOS QUE PROPORCIONEN INDICIOS DE QUE UNA PERSONA TIENE RETROCESOS EN SU FORMA DE ESCRIBIR, EN EL LEXICO, LA GRAMATICA O EN COMO COMPONE. EN LINGUISTICA FORENSE, EXPLICO SIERRA MARTINEZ, SE PLANTEAN TEMAS COMO ARGUMENTACION JURIDICA, FONETICA FORENSE, DETECCION DE PARAFRASIS, PERFIL LINGUISTICO, LENGUAJE DE PROCEDIMIENTO JUDICIAL, LENGUAJE LEGAL Y ATRIBUCION DE AUTORIA. Y SE SOLUCIONAN PROBLEMAS QUE PUEDEN SER TRATADOS POR UNA SOLA PERSONA, POR EJEMPLO, EL ANALISIS DE 20 MIL O CIEN MIL CORREOS ELECTRONICOS DE UNA EMPRESA PARA SABER SI HAY FILTRACION DE INFORMACION O SE INCURRE EN UN FRAUDE. UN ASPECTO RELEVANTE SON LAS EVIDENCIAS PROBATORIAS, ES DECIR, PRESENTAR ANTE UN JUEZ LAS PRUEBAS, QUE PUEDEN SER ESCRITAS U ORALES, DE QUE SE COMETIO UN DELITO COMO LA ESTAFA. EL PUNTO ES ENCONTRARLAS EN UN MUNDO DE INFORMACION QUE PARA DE CRECER. ?ES POSIBLE DETECTAR, ENTRE 50 MIL CORREOS, UNO QUE DEMUESTRE QUE SE HA COMETIDO FRAUDE? SI, Y LO HEMOS HECHO. ASIMISMO, UN OBSTACULO TIPICO A RESOLVER DENTRO DE ESTA AREA ES DESCUBRIR QUIEN ESCRIBIO UN DOCUMENTO O DIJO ALGO. POR EJEMPLO, DE UN MENSAJE QUE DEJA UN GRUPO CRIMINAL PUEDE AVERIGUARSE EL PERFIL DEL O LOS AUTORES POR LA FORMA EN QUE SE ESCRIBE: CONOCER EL GENERO, GRUPO ETARIO, NIVEL SOCIOECONOMICO Y CULTURAL, Y SI FUERON UNA O VARIAS PERSONAS. OTRO ASUNTO ES LA DETECCION DE PLAGIO O EL USO DE PARAFRASIS. DE MANERA OBJETIVA, CON MATEMATICAS, NUMEROS Y CIENCIA NO HAY FORMA DE MENTIR. ES LO QUE SE MIDE Y HAY OPCION. DENTRO DE LA ESTILOMETRIA EXISTEN MAS DE CIEN VARIABLES PARA MEDIR LA LONGITUD DE LAS PALABRAS, LA COMPLEJIDAD DE LAS FRASES, ASI COMO EL USO DE LAS PALABRAS FUNCIONALES Y DE SIGNOS DE PUNTUACION, ENTRE OTROS ASPECTOS. LAS INVESTIGACIONES SE HAN REALIZADO CON PATROCINIO DEL CONSEJO NACIONAL DE CIENCIA Y TECNOLOGIA Y LA DIRECCION GENERAL DE ASUNTOS DEL PERSONAL ACADEMICO DE LA UNAM, Y SE HAN APLICADO PARA UNA FIRMA DE ABOGADOS QUE SOLICITO DICTAMENES DE FRAUDES O PARA EMPRESAS DE MANEJO DE INFORMACION. ADEMAS, SE HA TENIDO UN ACERCAMIENTO CON AREAS DE PROCURACION DE JUSTICIA PARA OFRECER CURSOS SOBRE FONETICA FORENSE, PUES ESAS INSTANCIAS TIENEN BUENAS HERRAMIENTAS Y DISPOSITIVOS, PERO EN OCASIONES SE LES SACA PROVECHO. IGUALMENTE, ESTA POR COMENZAR UNA SERIE DE COLABORACIONES CON LA COMISION NACIONAL DE SEGURIDAD, QUE SERA COORDINADA POR EL GRUPO DE INGENIERIA LINGUISTICA DE ESTA CASA DE ESTUDIOS Y DONDE PARTICIPARAN EXPERTOS DE OTRAS INSTITUCIONES. EL GIL ES MULTIDISCIPLINARIO Y EN EL CONVERGEN ESTUDIANTES DEL AREA DE HUMANIDADES Y DE LAS CIENCIAS E INGENIERIA. ADEMAS, ASI SE DESARROLLAN TECNOLOGIAS DEL LENGUAJE RELACIONADAS CON LA LEXICOGRAFIA COMPUTACIONAL, MINERIA DE TEXTOS, TRADUCCION AUTOMATICA, RECUPERACION DE LA INFORMACION Y CREACION DE CORPUS DIGITALES, ENTRE OTRAS.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame distilled prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. Learned from the 10,348 direct Codex labels and 10,348 direct Gemma labels. Candidate is the union of thresholded teacher heads; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels or direct frontier model labels.
Codex and Gemma teacher scores by category
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.001 | 0.002 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.000 |
| Bibliometrics | 0.000 | 0.000 |
| Science and technology studies | 0.001 | 0.001 |
| Scholarly communication | 0.002 | 0.000 |
| Open science | 0.001 | 0.001 |
| Research integrity | 0.000 | 0.001 |
| Insufficient payload (model declined to judge) | 0.002 | 0.001 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; both teacher heads agree on what is shown here.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".