{"id":12106,"date":"2023-07-14T10:46:35","date_gmt":"2023-07-14T13:46:35","guid":{"rendered":"https:\/\/www.pleca.org.ar\/?p=12106"},"modified":"2023-07-14T10:46:36","modified_gmt":"2023-07-14T13:46:36","slug":"corpes-corpus-del-espanol-del-siglo-xxi","status":"publish","type":"post","link":"https:\/\/www.pleca.org.ar\/pleca2\/corpes-corpus-del-espanol-del-siglo-xxi\/","title":{"rendered":"CORPES &#8211; Corpus del Espa\u00f1ol del Siglo XXI"},"content":{"rendered":"<p>El CORPES es un conjunto de textos que han sido marcados o etiquetados para que se puedan analizar y extraer de ellos datos ling\u00fc\u00edsticos de inter\u00e9s. Puede ser muy \u00fatil para investigadores y correctores. El objetivo de esta marcaci\u00f3n es preparar los textos y facilitar la recuperaci\u00f3n de informaci\u00f3n en un formato codificado en XML, siguiendo los est\u00e1ndares de la <em>Text Encoding Initiative<\/em>. El desarrollo de este sistema de codificaci\u00f3n se basa en la experiencia de la Real Academia Espa\u00f1ola en la marcaci\u00f3n de otros corpus, como el CREA y el CORDE. Se enfatiza que la etiquetaci\u00f3n debe ser objetiva y no interpretativa, y su prop\u00f3sito principal es permitir el acceso a la informaci\u00f3n.<\/p>\n<p>El CORPES busca ser un corpus de referencia que cumpla con los par\u00e1metros actuales de trabajo en esta \u00e1rea, con una distribuci\u00f3n aproximada de 25 millones de formas por cada a\u00f1o del siglo XXI. Los textos incluidos en el CORPES se han seleccionado siguiendo varios criterios:<\/p>\n<ul>\n<li>Medio: El 90 % de los textos pertenecen al lenguaje escrito y el 10 % al lenguaje oral.<\/li>\n<li>Soporte: Los textos escritos provienen de libros (40 %), publicaciones peri\u00f3dicas (40 %), material de Internet (7,5 %) y otros (2,5 %).<\/li>\n<li>Geogr\u00e1fico: La distribuci\u00f3n general del CORPES asigna el 30 % del total a textos provenientes de Espa\u00f1a y el 70 % a textos provenientes de Am\u00e9rica. Estos \u00faltimos se clasifican seg\u00fan las \u00e1reas ling\u00fc\u00edsticas habituales. Adem\u00e1s, el CORPES incluye textos de Guinea Ecuatorial y Filipinas.<\/li>\n<li>Tem\u00e1tico: Todos los textos siguen una clasificaci\u00f3n tem\u00e1tica com\u00fan, lo que permite la b\u00fasqueda por temas espec\u00edficos. Se divide en ficci\u00f3n y no ficci\u00f3n, con subcategor\u00edas dentro de cada categor\u00eda.<\/li>\n<li>Tipos de texto: Los textos tambi\u00e9n se caracterizan por su tipo o g\u00e9nero, como novela, relato, teatro, guion (ficci\u00f3n); noticias, reportajes, opini\u00f3n, cr\u00f3nica, prosa acad\u00e9mica, prosa no acad\u00e9mica, entrevistas, conversaciones (no ficci\u00f3n). Tambi\u00e9n se incluyen textos de blogs, publicaciones de Instagram, tuits, etc., provenientes de Internet.<\/li>\n<\/ul>\n<p>La posibilidad de combinar todos esos criterios permite abarcar una amplia tipolog\u00eda textual, lo que les facilita a los investigadores la recuperaci\u00f3n selectiva de la informaci\u00f3n en la consulta.<\/p>\n<p>La Real Academia Espa\u00f1ola lanz\u00f3 la versi\u00f3n 1.0 del Corpus del Espa\u00f1ol del Siglo XXI (CORPES) en mayo de 2023. Es importante tener en cuenta que esta versi\u00f3n es un recurso en construcci\u00f3n, por lo que puede presentar desequilibrios y desajustes, que se ir\u00e1n corrigiendo en futuras versiones. En la versi\u00f3n 1.0, se incluyeron m\u00e1s de 395 millones de formas. En comparaci\u00f3n con la versi\u00f3n anterior (enero de 2023), esta nueva versi\u00f3n ha incorporado alrededor de 15 millones de formas adicionales.<\/p>\n<p>Conoc\u00e9 m\u00e1s sobre esta herramienta en <a href=\"https:\/\/www.rae.es\/corpes\/\">https:\/\/www.rae.es\/corpes\/<\/a>.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>El CORPES es un conjunto de textos que han sido marcados o etiquetados para su posterior an\u00e1lisis. El objetivo de esta marcaci\u00f3n es preparar los textos y facilitar su recuperaci\u00f3n de informaci\u00f3n en un formato codificado en XML, siguiendo los est\u00e1ndares de la Text Encoding Initiative.<\/p>\n","protected":false},"author":1,"featured_media":12165,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[200],"tags":[253,251,252],"class_list":["post-12106","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-recursos","tag-codificacion","tag-corpes","tag-rae"],"_links":{"self":[{"href":"https:\/\/www.pleca.org.ar\/pleca2\/wp-json\/wp\/v2\/posts\/12106","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.pleca.org.ar\/pleca2\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.pleca.org.ar\/pleca2\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.pleca.org.ar\/pleca2\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/www.pleca.org.ar\/pleca2\/wp-json\/wp\/v2\/comments?post=12106"}],"version-history":[{"count":5,"href":"https:\/\/www.pleca.org.ar\/pleca2\/wp-json\/wp\/v2\/posts\/12106\/revisions"}],"predecessor-version":[{"id":12211,"href":"https:\/\/www.pleca.org.ar\/pleca2\/wp-json\/wp\/v2\/posts\/12106\/revisions\/12211"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.pleca.org.ar\/pleca2\/wp-json\/wp\/v2\/media\/12165"}],"wp:attachment":[{"href":"https:\/\/www.pleca.org.ar\/pleca2\/wp-json\/wp\/v2\/media?parent=12106"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.pleca.org.ar\/pleca2\/wp-json\/wp\/v2\/categories?post=12106"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.pleca.org.ar\/pleca2\/wp-json\/wp\/v2\/tags?post=12106"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}