Publicación:
Un corpus de bigramas utilizado como corrector ortográfico y gramatical destinado a hablantes nativos de español

dc.contributor.authorSan Mateo Valdehíta, Alicia
dc.date.accessioned2025-11-07T11:03:23Z
dc.date.available2025-11-07T11:03:23Z
dc.date.issued2016-01-01
dc.descriptionLa versión registrada de este artículo, publicado por primera vez en “Revista Signos. Estudios de Lingüística, 49(90): 94-118 p.", está disponible en línea en el sitio web del editor: Pontificia Universidad Católica de Valparaíso, DOI: 10.4067/S0718-09342016000100005.
dc.descriptionThe registered version of this article, first published in “Revista Signos. Estudios de Lingüística, 49(90): 94-118 p.", is available online at the publisher's website: Pontificia Universidad Católica de Valparaíso, DOI: 10.4067/S0718-09342016000100005.
dc.description.abstractEste artículo describe el funcionamiento de un algoritmo de corrección ortográfica y gramatical para textos escritos en español, destinado a hablantes nativos competentes que realizan labores de corrección de textos. Los posibles errores se identifican por medio de análisis estadísticos (en vez de emplear el sistema de ‘etiquetado’ y análisis sintáctico que utiliza la mayor parte de correctores), comparando las combinaciones de palabras utilizadas con un corpus de referencia de cien millones de vocablos. De esa manera, se señalan los pares de palabras (bigramas) poco o muy poco frecuentes, y que, en muchas ocasiones, lo son porque contienen algún error. La limitación fundamental es que no se detectan errores que no puedan ser deducidos del análisis de palabras adyacentes. Pero, como hemos comprobado aquí en el análisis de diferentes textos, el algoritmo es capaz de localizar errores que otros correctores no identificanes
dc.description.abstractThis paper describes the performance of an algorithm of spelling and grammar checker for texts written in Spanish by proficient native speakers during proof-reading. Possible mistakes are not detected by tagging and parsing but by statistical analysis, comparing combinations of two words used in the text to a hundred-million-word corpus. Those pairs of words (bigrams) which do not occur or which are suspiciously infrequent in the corpus are highlighted; and such pairs often contain errors. The main limitation is that mistakes that arise from non-adjacent words are not detected. Nevertheless, as we have seen in this study with some different texts, the algorithm detects many errors that other grammar checkers are not able to identifyen
dc.description.provenanceMade available in DSpace on 2025-11-07T11:03:23Z (GMT). No. of bitstreams: 1 San-Mateo_Valdehita_Alicia_Corpus_bigramas_ALICIA SAN MATEO VAL.pdf: 523211 bytes, checksum: 9193bed177ebe813f04de85f5a77cc39 (MD5) Previous issue date: 2016-01-01en
dc.description.versionversión publicada
dc.identifier.citationSan Mateo Valdehíta, A. (2016): «Un corpus de bigramas utilizado como corrector ortográfico y gramatical destinado a hablantes nativos de español». Revista Signos. Estudios de Lingüística, 49(90): 94-118. DOI: 10.4067/S0718-09342016000100005.
dc.identifier.doihttp://doi.org/10.4067/S0718-09342016000100005
dc.identifier.issn0718-0934
dc.identifier.urihttps://hdl.handle.net/20.500.14468/30817
dc.journal.issue90
dc.journal.titleRevista signos
dc.journal.volume49
dc.language.isoes
dc.page.final118
dc.page.initial94
dc.publisherUniversidad Católica de Valparaíso
dc.relation.centerFacultad de Filología
dc.relation.departmentLengua Española y Lingüística General
dc.rightsinfo:eu-repo/semantics/openAccess
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/4.0/deed.es
dc.subject5701.11 Enseñanza de lenguas
dc.subject5701.10 Patología y corrección del lenguaje
dc.subject.keywordsBigramases
dc.subject.keywordscorrección de textoses
dc.subject.keywordscorrector gramaticales
dc.subject.keywordsdetección de erroreses
dc.subject.keywordspares de palabrases
dc.subject.keywordsBigramsen
dc.subject.keywordserror detectionen
dc.subject.keywordsgrammar checkeren
dc.subject.keywordspairs of wordsen
dc.subject.keywordsproof-readingen
dc.titleUn corpus de bigramas utilizado como corrector ortográfico y gramatical destinado a hablantes nativos de españoles
dc.typeartículoes
dc.typejournal articleen
dspace.entity.typePublication
relation.isAuthorOfPublicationba53e41b-3f1e-4221-8af6-d883bc2f3028
relation.isAuthorOfPublication.latestForDiscoveryba53e41b-3f1e-4221-8af6-d883bc2f3028
Archivos
Bloque original
Mostrando 1 - 1 de 1
Cargando...
Miniatura
Nombre:
San-Mateo_Valdehita_Alicia_Corpus_bigramas_ALICIA SAN MATEO VAL.pdf
Tamaño:
510.95 KB
Formato:
Adobe Portable Document Format
Bloque de licencias
Mostrando 1 - 1 de 1
No hay miniatura disponible
Nombre:
license.txt
Tamaño:
3.62 KB
Formato:
Item-specific license agreed to upon submission
Descripción: