Bibliographic record
Abstract
LA LINGUISTICA FORENSE, AREA DE LA INGENIERIA RESPECTIVA QUE RELACIONA AL LENGUAJE CON EL FORO LEGAL, RESUELVE PROBLEMAS COMO LA DETECCION DE FRAUDES O LA FILTRACION DE INFORMACION DENTRO DE LAS EMPRESAS, LA AUTORIA DE UN TEXTO O EL PLAGIO, ENTRE OTROS. EN EL INSTITUTO DE INGENIERIA DE LA UNAM, EL GRUPO DE INGENIERIA LINGUISTICA (GIL) QUE ENCABEZA GERARDO SIERRA MARTINEZ SE CENTRA SOLO EN ESAS CUESTIONES, SINO QUE TAMBIEN HA EMPRENDIDO ESTUDIOS DE FONETICA FORENSE PARA, POR EJEMPLO, DETERMINAR COMO UNA PROTESIS DENTAL CAMBIA LA FORMA DE HABLAR DE UNA PERSONA Y QUE SERIE DE TRUCOS PUEDEN HACERSE PARA APARENTAR OTRA FORMA DE EXPRESARSE. INCLUSO, EN COLABORACION CON LA UNIVERSIDAD DE MONTREAL, PRETENDE DETECTAR, DE FORMA TEMPRANA, LA ENFERMEDAD DE ALZHEIMER MEDIANTE EL ANALISIS DE TEXTOS ESCRITOS QUE PROPORCIONEN INDICIOS DE QUE UNA PERSONA TIENE RETROCESOS EN SU FORMA DE ESCRIBIR, EN EL LEXICO, LA GRAMATICA O EN COMO COMPONE. EN LINGUISTICA FORENSE, EXPLICO SIERRA MARTINEZ, SE PLANTEAN TEMAS COMO ARGUMENTACION JURIDICA, FONETICA FORENSE, DETECCION DE PARAFRASIS, PERFIL LINGUISTICO, LENGUAJE DE PROCEDIMIENTO JUDICIAL, LENGUAJE LEGAL Y ATRIBUCION DE AUTORIA. Y SE SOLUCIONAN PROBLEMAS QUE PUEDEN SER TRATADOS POR UNA SOLA PERSONA, POR EJEMPLO, EL ANALISIS DE 20 MIL O CIEN MIL CORREOS ELECTRONICOS DE UNA EMPRESA PARA SABER SI HAY FILTRACION DE INFORMACION O SE INCURRE EN UN FRAUDE. UN ASPECTO RELEVANTE SON LAS EVIDENCIAS PROBATORIAS, ES DECIR, PRESENTAR ANTE UN JUEZ LAS PRUEBAS, QUE PUEDEN SER ESCRITAS U ORALES, DE QUE SE COMETIO UN DELITO COMO LA ESTAFA. EL PUNTO ES ENCONTRARLAS EN UN MUNDO DE INFORMACION QUE PARA DE CRECER. ?ES POSIBLE DETECTAR, ENTRE 50 MIL CORREOS, UNO QUE DEMUESTRE QUE SE HA COMETIDO FRAUDE? SI, Y LO HEMOS HECHO. ASIMISMO, UN OBSTACULO TIPICO A RESOLVER DENTRO DE ESTA AREA ES DESCUBRIR QUIEN ESCRIBIO UN DOCUMENTO O DIJO ALGO. POR EJEMPLO, DE UN MENSAJE QUE DEJA UN GRUPO CRIMINAL PUEDE AVERIGUARSE EL PERFIL DEL O LOS AUTORES POR LA FORMA EN QUE SE ESCRIBE: CONOCER EL GENERO, GRUPO ETARIO, NIVEL SOCIOECONOMICO Y CULTURAL, Y SI FUERON UNA O VARIAS PERSONAS. OTRO ASUNTO ES LA DETECCION DE PLAGIO O EL USO DE PARAFRASIS. DE MANERA OBJETIVA, CON MATEMATICAS, NUMEROS Y CIENCIA NO HAY FORMA DE MENTIR. ES LO QUE SE MIDE Y HAY OPCION. DENTRO DE LA ESTILOMETRIA EXISTEN MAS DE CIEN VARIABLES PARA MEDIR LA LONGITUD DE LAS PALABRAS, LA COMPLEJIDAD DE LAS FRASES, ASI COMO EL USO DE LAS PALABRAS FUNCIONALES Y DE SIGNOS DE PUNTUACION, ENTRE OTROS ASPECTOS. LAS INVESTIGACIONES SE HAN REALIZADO CON PATROCINIO DEL CONSEJO NACIONAL DE CIENCIA Y TECNOLOGIA Y LA DIRECCION GENERAL DE ASUNTOS DEL PERSONAL ACADEMICO DE LA UNAM, Y SE HAN APLICADO PARA UNA FIRMA DE ABOGADOS QUE SOLICITO DICTAMENES DE FRAUDES O PARA EMPRESAS DE MANEJO DE INFORMACION. ADEMAS, SE HA TENIDO UN ACERCAMIENTO CON AREAS DE PROCURACION DE JUSTICIA PARA OFRECER CURSOS SOBRE FONETICA FORENSE, PUES ESAS INSTANCIAS TIENEN BUENAS HERRAMIENTAS Y DISPOSITIVOS, PERO EN OCASIONES SE LES SACA PROVECHO. IGUALMENTE, ESTA POR COMENZAR UNA SERIE DE COLABORACIONES CON LA COMISION NACIONAL DE SEGURIDAD, QUE SERA COORDINADA POR EL GRUPO DE INGENIERIA LINGUISTICA DE ESTA CASA DE ESTUDIOS Y DONDE PARTICIPARAN EXPERTOS DE OTRAS INSTITUCIONES. EL GIL ES MULTIDISCIPLINARIO Y EN EL CONVERGEN ESTUDIANTES DEL AREA DE HUMANIDADES Y DE LAS CIENCIAS E INGENIERIA. ADEMAS, ASI SE DESARROLLAN TECNOLOGIAS DEL LENGUAJE RELACIONADAS CON LA LEXICOGRAFIA COMPUTACIONAL, MINERIA DE TEXTOS, TRADUCCION AUTOMATICA, RECUPERACION DE LA INFORMACION Y CREACION DE CORPUS DIGITALES, ENTRE OTRAS.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.006 | 0.011 |
| Meta-epidemiology (narrow) | 0.001 | 0.000 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.003 | 0.002 |
| Science and technology studies | 0.010 | 0.042 |
| Scholarly communication | 0.013 | 0.011 |
| Open science | 0.001 | 0.007 |
| Research integrity | 0.005 | 0.006 |
| Insufficient payload (model declined to judge) | 0.010 | 0.002 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".