<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Publishing DTD with OASIS Tables with MathML3 v1.1 20151215//EN" "JATS-journalpublishing-oasis-article1-mathml3.dtd">
<article article-type="research-article" dtd-version="1.1" xml:lang="es" xmlns:ali="http://www.niso.org/schemas/ali/1.0/" xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance">
	<front>
		<journal-meta>
			<journal-id journal-id-type="publisher-id">REDC</journal-id>
			<journal-title-group>
				<journal-title>Revista Espa&#xf1;ola de Documentaci&#xf3;n Cient&#xed;fica</journal-title>
				<abbrev-journal-title abbrev-type="publisher">Rev. esp. doc. cient.</abbrev-journal-title>
			</journal-title-group>
			<issn publication-format="print">0210-0614</issn>
			<issn publication-format="electronic">1988-4621</issn>
			<publisher>
				<publisher-name>Consejo Superior de Investigaciones Cient&#xed;ficas</publisher-name>
			</publisher>
		</journal-meta>
		<article-meta>
			<article-id pub-id-type="publisher-id">redc.2023.3.1996</article-id>
			<article-id pub-id-type="doi">10.3989/redc.2023.3.1996</article-id>
			<article-categories>
				<subj-group subj-group-type="heading">
					<subject>Estudios / Research Studies</subject>
				</subj-group>
			</article-categories>
			<title-group>
				<article-title>Clasificaci&#xf3;n tem&#xe1;tica autom&#xe1;tica de documentos basada en vocabularios y frecuencias de uso. El caso de art&#xed;culos de divulgaci&#xf3;n cient&#xed;fica</article-title>
				<trans-title-group xml:lang="en">
					<trans-title>Automatic thematic classification of documents based on vocabularies and use frequencies. The case of scientific dissemination articles</trans-title>
				</trans-title-group>
			</title-group>
			<contrib-group>
				<contrib contrib-type="author" corresp="yes">
					<contrib-id contrib-id-type="orcid">https://orcid.org/0000-0002-3976-7589</contrib-id>
					<name>
						<surname>Gonz&#xe1;lez-P&#xe9;rez</surname>
						<given-names>C&#xe9;sar</given-names>
					</name>
					<email xlink:href="cesar.gonzalez-perez@incipit.csic.es">cesar.gonzalez-perez@incipit.csic.es</email>
					<aff id="aff1"><institution content-type="institute">Instituto de Ciencias del Patrimonio (Incipit)</institution>, <institution content-type="council">CSIC</institution>.</aff>
				</contrib>
				<contrib contrib-type="author">
					<contrib-id contrib-id-type="orcid">https://orcid.org/0000-0001-6169-784X</contrib-id>
					<name>
						<surname>Vidal Liy</surname>
						<given-names>Jos&#xe9; Ignacio</given-names>
					</name>
					<email xlink:href="nacho.vidal@cchs.csic.es">nacho.vidal@cchs.csic.es</email>
					<aff id="aff2"><institution content-type="research-group">Centro de Ciencias Humanas y Sociales</institution>, <institution content-type="council">CSIC</institution></aff>
				</contrib>
				<contrib contrib-type="author">
					<contrib-id contrib-id-type="orcid">https://orcid.org/0000-0002-5952-4971</contrib-id>
					<name>
						<surname>Garc&#xed;a Garc&#xed;a</surname>
						<given-names>Ana</given-names>
					</name>
					<email xlink:href="ana.garcia.g@cchs.csic.es">ana.garcia.g@cchs.csic.es</email>
					<aff id="aff3"><institution content-type="research-center">Centro de Ciencias Humanas y Sociales</institution>, <institution content-type="council">CSIC</institution></aff>
				</contrib>
				<contrib contrib-type="author">
					<contrib-id contrib-id-type="orcid">https://orcid.org/0000-0001-8423-8240</contrib-id>
					<name>
						<surname>Calleja Ib&#xe1;&#xf1;ez</surname>
						<given-names>Pablo</given-names>
					</name>
					<email xlink:href="pcalleja@fi.upm.es">pcalleja@fi.upm.es</email>
					<aff id="aff4"><institution content-type="university">Universidad Polit&#xe9;cnica de Madrid</institution></aff>
				</contrib>
			</contrib-group>
			<pub-date pub-type="epub">
				<day>13</day>
				<month>06</month>
				<year>2023</year>
			</pub-date>
			<pub-date pub-type="collection">
				<month>09</month>
				<year>2023</year>
			</pub-date>
			<volume>46</volume>
			<issue>3</issue>
			<elocation-id>e362</elocation-id>
			<history>
				<date date-type="received">
					<day>14</day>
					<month>07</month>
					<year>2022</year>
				</date>
				<date date-type="rev-recd">
					<day>15</day>
					<month>09</month>
					<year>2022</year>
				</date>
				<date date-type="accepted">
					<day>19</day>
					<month>09</month>
					<year>2022</year>
				</date>
				<date date-type="pub">
					<day>06</day>
					<month>07</month>
					<year>2023</year>
				</date>
			</history>
			<permissions>
				<copyright-statement>&#xa9; 2023 CSIC</copyright-statement>
				<copyright-year>2023</copyright-year>
				<license license-type="open-access" xlink:href="https://creativecommons.org/licenses/by/4.0/">
					<license-p>Este es un art&#xed;culo de acceso abierto distribuido bajo los t&#xe9;rminos de la licencia de uso y distribuci&#xf3;n Creative Commons Reconocimiento 4.0 Internacional (CC BY 4.0).</license-p>
				</license>
			</permissions>
			<self-uri xlink:href="http://redc.revistas.csic.es/index.php/redc/article/view/XXXX/XXXX"/>
			<abstract>
				<title>Resumen</title>
				<p>A menudo es necesario clasificar documentos asign&#xe1;ndoles un tema de entre una serie de opciones predefinidas. Esta labor suele ser realizada manualmente, mediante la lectura del documento por parte de un especialista. Este proceso manual es tedioso, requiere tiempo y recursos, y es propenso a sesgos y preferencias de cada especialista.</p>
				<p>Como alternativa, en este art&#xed;culo presentamos un sistema de clasificaci&#xf3;n tem&#xe1;tica autom&#xe1;tica, capaz de clasificar cientos de documentos en pocos segundos, altamente parametrizable, y que no requiere de la intervenci&#xf3;n de especialistas. El sistema se basa en vocabularios tem&#xe1;ticos predefinidos y frecuencias de uso de formas l&#xe9;xicas, y asigna a cada documento uno o m&#xe1;s temas priorizados. El enfoque sugerido se ha desarrollado y probado en el contexto de art&#xed;culos de divulgaci&#xf3;n cient&#xed;fica en espa&#xf1;ol.</p>
				<p>Utilizando este enfoque, es posible clasificar tem&#xe1;ticamente grandes cantidades de documentos de forma sistem&#xe1;tica, usando menos recursos que si se hiciese de forma manual, y evitando sesgos desconocidos. El enfoque ha demostrado una efectividad comparable a la de otras propuestas, pero requiriendo menos recursos computacionales.</p>
			</abstract>
			<trans-abstract xml:lang="en">
				<title>Abstract</title>
				<p>It is often necessary to classify documents by assigning them a theme or topic from a series of predefined options. This work is usually done manually, by reading the document by a specialist. This manual process is tedious, requires time and resources, and is prone to bias and preferences of each specialist.</p>
				<p>As an alternative, this article presents an automatic thematic classification system, capable of classifying hundreds of documents in a few seconds, highly parameterized, and that does not require the specialists intervention. The system is based on predefined thematic vocabularies and frequencies of use of lexical forms, and assigns one or more priority topics to each document. The suggested approach has been developed and tested in the context of scientific dissemination articles in the Spanish language.</p>
				<p>Using this approach, it is possible to systematically classify large amounts of documents by topic, using fewer resources than doing it manually, and avoiding unknown biases. The approach has shown to be as effective as other proposals, but requires less computational resources.</p>
			</trans-abstract>
			<kwd-group>
				<kwd>Clasificaci&#xf3;n de documentos</kwd>
				<kwd>clasificaci&#xf3;n tem&#xe1;tica</kwd>
				<kwd>algoritmo</kwd>
				<kwd>vocabularios</kwd>
				<kwd>frecuencias l&#xe9;xicas</kwd>
				<kwd>divulgaci&#xf3;n cient&#xed;fica</kwd>
			</kwd-group>
			<kwd-group xml:lang="en">
				<kwd>Document classification</kwd>
				<kwd>thematic classification</kwd>
				<kwd>algorithm</kwd>
				<kwd>vocabularies</kwd>
				<kwd>lexical frequencies</kwd>
				<kwd>science dissemination</kwd>
			</kwd-group>
			<counts>
				<fig-count count="1"/>
				<table-count count="6"/>
				<equation-count count="6"/>
				<ref-count count="24"/>
				<page-count count="12"/>
			</counts>
		</article-meta>
	</front>
	<body>
		<sec id="sec1" sec-type="intro">
			<label>1.</label>
			<title>Introducci&#xf3;n</title>
			<p>Cualquier instituci&#xf3;n que trate con un gran n&#xfa;mero de documentos, sobre todo si son de procedencia externa, debe clasificarlos tem&#xe1;ticamente para su adecuada gesti&#xf3;n. Este es el caso de bibliotecas o archivos, por ejemplo. La clasificaci&#xf3;n tem&#xe1;tica consiste en asignar uno o m&#xe1;s temas a cada documento, de un repertorio de temas que puede ser fijo o bien cambiante. En cualquier caso, esta clasificaci&#xf3;n suele realizarse de forma manual mediante un proceso de an&#xe1;lisis de contenido, leyendo el documento o un resumen de este, si existe, por parte de un especialista humano, y asignando despu&#xe9;s uno o m&#xe1;s temas. Para decidir qu&#xe9; temas se asignan a un documento, el especialista hace uso de su conocimiento t&#xe1;cito y experiencia, y, a veces, tambi&#xe9;n de criterios previamente especificados. Sea como sea, este proceso es tedioso, requiere mucho tiempo y recursos humanos, y es propenso a los sesgos y preferencias de cada especialista.</p>
			<p>Hoy en d&#xed;a, en un momento en el que muchos de los documentos que manejamos existen en formato digital, los ordenadores permiten ejecutar algoritmos a alta velocidad, y abren una puerta a la posibilidad de dise&#xf1;ar un algoritmo capaz de clasificar tem&#xe1;ticamente grandes cantidades de documentos en muy poco tiempo, sin el concurso de especialistas humanos, y de forma libre de sesgos. La clasificaci&#xf3;n autom&#xe1;tica de documentos es uno de los mayores campos de investigaci&#xf3;n en el &#xe1;rea de la documentaci&#xf3;n (<xref ref-type="bibr" rid="B5">C&#xe1;rdenas y otros, 2014</xref>). Su evoluci&#xf3;n est&#xe1; ligada a los campos de la Inteligencia Artificial y de la Inteligencia Computacional mediante el desarrollo de algoritmos que reconocen patrones recurrentes de cada clase a partir de corpora documentales o de un gran volumen de textos de entrada (<xref ref-type="bibr" rid="B18">Rodr&#xed;guez Tapia y Camacho Ca&#xf1;am&#xf3;n, 2018</xref>). Progresivamente se han sumado disciplinas como la Estad&#xed;stica y la Ling&#xfc;&#xed;stica Computacional para las tareas de optimizaci&#xf3;n en los diferentes m&#xe9;todos de clasificaci&#xf3;n, dando lugar a una extensa literatura (<xref ref-type="bibr" rid="B1">Abiodun y otros, 2021</xref>).</p>
			<p>Existen dos enfoques principales para el tratamiento de la clasificaci&#xf3;n autom&#xe1;tica: la categorizaci&#xf3;n supervisada y la no supervisada. &#xc9;sta &#xfa;ltima se basa en t&#xe9;cnicas de <italic>clustering</italic> o modelado de t&#xf3;picos para la clasificaci&#xf3;n autom&#xe1;tica de textos (<xref ref-type="bibr" rid="B16">Nigam y otros, 2000</xref>). Sin embargo, la m&#xe1;s com&#xfa;n para la categorizaci&#xf3;n de documentos es la primera de ellas, que, bas&#xe1;ndose en el etiquetado y aprendizaje de datos, tienen como finalidad principal la predicci&#xf3;n de resultados sobre nuevos documentos, previa fase de entrenamiento. En este sentido, (<xref ref-type="bibr" rid="B11">Goller y otros, 2020</xref>) distinguen dos partes en el proceso de clasificaci&#xf3;n autom&#xe1;tica supervisada. Primero existe una fase de aprendizaje, en la que se proporcionan al sistema clasificador ejemplos previamente clasificados por humanos para entrenarlo. Despu&#xe9;s se da una fase de clasificaci&#xf3;n, en la que se asocia una categor&#xed;a y una agrupaci&#xf3;n tem&#xe1;tica a los documentos a clasificar.</p>
			<p>Dentro de los sistemas supervisados para la clasificaci&#xf3;n autom&#xe1;tica de documentos, uno de los algoritmos m&#xe1;s empleados es el llamado Na&#xef;ve Bayes. &#xc9;ste deriva del teorema de Bayes de c&#xe1;lculo de probabilidades para predecir la pertenencia de textos a determinadas categor&#xed;as. Su &#xe9;xito en el &#xe1;mbito de la categorizaci&#xf3;n tem&#xe1;tica de documentos se debe a la capacidad del algoritmo para aprender la distribuci&#xf3;n de probabilidad de los datos, en la sencillez de la estimaci&#xf3;n de par&#xe1;metros, as&#xed; como en la rapidez para realizar predicciones con entrenamientos elementales.</p>
			<p>Desde los trabajos cl&#xe1;sicos de <xref ref-type="bibr" rid="B14">Langley y otros, (1992)</xref> y <xref ref-type="bibr" rid="B15">Mccallum y Nigam, (2001)</xref> en los a&#xf1;os 1990s, los algoritmos bayesianos han contado con numerosas aplicaciones, si bien su fiabilidad para la clasificaci&#xf3;n autom&#xe1;tica de documentos fue cuestionada por (<xref ref-type="bibr" rid="B6">Caruana y Niculescu-Mizil, (2006)</xref>. Efectivamente, el algoritmo Na&#xef;ve Bayes se fundamenta en suposiciones fuertes que son por lo general dif&#xed;cilmente adaptables a las problem&#xe1;ticas habituales del procesamiento del lenguaje natural: polisemia, palabras con poco contenido sem&#xe1;ntico o con guion, o la propia expresividad de los contextos para distinguir el significado concreto de los t&#xe9;rminos.</p>
			<p>A pesar de las cr&#xed;ticas y de la complejidad de la clasificaci&#xf3;n autom&#xe1;tica aplicada a textos, todav&#xed;a son numerosos los trabajos que defienden el empleo de los algoritmos bayesianos. Se ha experimentado con dichos algoritmos la discriminaci&#xf3;n entre textos seg&#xfa;n el grado de especializaci&#xf3;n identificado en un an&#xe1;lisis de contenido previo, con un enfoque cercano a la clasificaci&#xf3;n de textos (<xref ref-type="bibr" rid="B18">Rodr&#xed;guez Tapia y Camacho Ca&#xf1;am&#xf3;n, 2018</xref>), y para otras utilidades como la detecci&#xf3;n de correo no deseado, de <italic>fake news</italic> (<xref ref-type="bibr" rid="B12">Granik y Mesyura, 2017</xref>) o identificaci&#xf3;n de autor&#xed;a de textos (<xref ref-type="bibr" rid="B20">Stein y otros, 2007</xref>).</p>
			<p>Otro de los algoritmos m&#xe1;s valorados en la clasificaci&#xf3;n autom&#xe1;tica supervisada de textos son las M&#xe1;quinas de Soporte Vectorial (SVM). Aunque aparecieron en los mismos a&#xf1;os que Na&#xef;ve Bayes (<xref ref-type="bibr" rid="B22">Vapnik, 1995</xref>), a diferencia de &#xe9;ste, las SVM aprenden las caracter&#xed;sticas diferenciadas de los elementos que se quieren clasificar y los organizan a partir de un hiperplano en un espacio vectorial. Este hiperplano act&#xfa;a como criterio separador o diferenciador de los vectores de una clase de los del resto. Los algoritmos SVM son muy utilizados actualmente en Ciencia de Datos debido, por una parte, a su alto grado de efectividad para grandes espacios de representaci&#xf3;n y, por otra parte, a su robustez para tratar sistemas complejos, esto es, aquellos en los que la dimensionalidad es mayor que el n&#xfa;mero de muestras (<xref ref-type="bibr" rid="B4">Campos Mochol&#xed;, 2021</xref>).</p>
			<p>A pesar del alto &#xed;ndice de empleo de estos dos algoritmos en los &#xfa;ltimos a&#xf1;os, los trabajos realizados por <xref ref-type="bibr" rid="B2">Beltr&#xe1;n y Barbona, (2017)</xref> est&#xe1;n mostrando que los desarrollos de redes neuronales y de vecinos m&#xe1;s cercanos (KNN, k-NN) son los que est&#xe1;n arrojando mejores resultados en la categorizaci&#xf3;n de textos period&#xed;sticos. Las redes neuronales artificiales son sistemas compuestos, formados por diversos nodos basados en el algoritmo perceptr&#xf3;n que, a su vez, se organiza en diferentes capas para la propagaci&#xf3;n de la informaci&#xf3;n. Por su parte, los algoritmos de los vecinos m&#xe1;s cercanos trabajan sobre los criterios de proximidad entre los elementos para el establecimiento de predicciones.</p>
			<p>En la bibliograf&#xed;a m&#xe1;s reciente destaca la aplicaci&#xf3;n de transformadores basados en redes neuronales en los campos de detecci&#xf3;n autom&#xe1;tica de temas y visualizaci&#xf3;n de agrupaciones documentales. Esto se debe al aumento exponencial de informaci&#xf3;n v&#xed;a Internet, en lo que la pandemia de SARS-CoV-2 ha tenido un fuerte impacto. Destaca el trabajo de (<xref ref-type="bibr" rid="B19">Song y otros, 2021</xref>) con el desarrollo de una clasificaci&#xf3;n tem&#xe1;tica autom&#xe1;tica centrada en la detecci&#xf3;n de desinformaci&#xf3;n sobre COVID-19 en medios de comunicaci&#xf3;n, blogs y redes sociales. En estos casos, se aplican t&#xe9;cnicas no supervisadas de <italic>clustering</italic> en las que el sistema clasificador calcula la similitud entre las caracter&#xed;sticas de los documentos para asignarlos a t&#xf3;picos generados autom&#xe1;ticamente.</p>
			<p>Por aproximaci&#xf3;n con el contexto de este art&#xed;culo, es de referencia el dise&#xf1;o de t&#xe9;cnicas no supervisadas basadas en an&#xe1;lisis de redes sobre noticias de ciencia y tecnolog&#xed;a en idioma espa&#xf1;ol, cuyos resultados muestran una aproximaci&#xf3;n seg&#xfa;n la similitud de temas tratados en la colecci&#xf3;n (<xref ref-type="bibr" rid="B10">Garc&#xed;a Figuerola y otros, 2017</xref>).</p>
			<p>Finalmente, debemos se&#xf1;alar que la literatura muestra una escasa utilizaci&#xf3;n de datos en idiomas diferentes del ingl&#xe9;s, as&#xed; como una aplicaci&#xf3;n escasa de t&#xe9;cnicas de clasificaci&#xf3;n tem&#xe1;tica a disciplinas de Humanidades y Ciencias Sociales. Tambi&#xe9;n aparece un uso preferente de colecciones de datos relativos a redes sociales, noticias de prensa y art&#xed;culos cient&#xed;ficos, dada la facilidad para su descarga masiva.</p>
			<p>As&#xed; pues, y en este contexto, proponemos un nuevo sistema de clasificaci&#xf3;n tem&#xe1;tica autom&#xe1;tica de documentos, muy diferente a los que se suelen encontrar en la literatura, pero de una efectividad comparable y algunas ventajas adicionales.</p>
		</sec>
		<sec id="sec2">
			<label>2.</label>
			<title>Enfoque propuesto</title>
			<p>El enfoque que proponemos se basa en los siguientes principios:</p>
			<list list-type="bullet">
				<list-item>
					<p>Existe una lista predefinida de temas. La clasificaci&#xf3;n tem&#xe1;tica se realiza asignando cero, uno o m&#xe1;s temas de esta lista a cada documento.</p>
				</list-item>
				<list-item>
					<p>Cada tema se puede caracterizar terminol&#xf3;gicamente. Es decir, existen t&#xe9;rminos que son m&#xe1;s habituales en ciertos temas y poco habituales en otros. Por ejemplo, el t&#xe9;rmino &#x201c;prima de riesgo&#x201d; suele aparecer en documentos sobre econom&#xed;a, pero no en documentos sobre biolog&#xed;a o arte.</p>
				</list-item>
				<list-item>
					<p>Cuanto m&#xe1;s frecuente es un t&#xe9;rmino en el habla com&#xfa;n, menor es su capacidad para caracterizar un tema. Por ejemplo, a pesar de que muchos documentos sobre biolog&#xed;a utilizan palabras como &#x201c;a&#xf1;o&#x201d; o &#x201c;conclusi&#xf3;n&#x201d;, estos t&#xe9;rminos no son caracter&#xed;sticos de la biolog&#xed;a.</p>
				</list-item>
			</list>
			<p>Estos principios nos llevan a plantear las siguientes bases de dise&#xf1;o para el enfoque que proponemos:</p>
			<list list-type="bullet">
				<list-item>
					<p>
						<bold>Vocabularios tem&#xe1;ticos</bold>. Cada tema que se desee tener en cuenta debe ser caracterizado mediante una lista de t&#xe9;rminos propios en el idioma de trabajo. Estos t&#xe9;rminos constituyen el vocabulario del tema. No es necesario que estos t&#xe9;rminos sean exclusivos del tema (lo cual, en la pr&#xe1;ctica, es poco factible), pero s&#xed; deben ser claramente espec&#xed;ficos de este. Es decir, la presencia de cada uno de ellos en un documento debe sugerir de forma clara que este documento trata sobre el tema correspondiente. Evidentemente, diferentes idiomas tendr&#xe1;n diferentes vocabularios tem&#xe1;ticos.</p>
				</list-item>
				<list-item>
					<p>
						<bold>Lista de frecuencias de formas l&#xe9;xicas</bold>. Es necesario poder contar con una lista de todas (o casi todas) las formas l&#xe9;xicas del idioma de trabajo, con la frecuencia de uso de cada una en el habla com&#xfa;n. Esta lista de frecuencias puede obtenerse de forma autom&#xe1;tica e inmediata a partir de un corpus suficientemente amplio de dicho idioma.</p>
				</list-item>
			</list>
			<p>El algoritmo funciona en dos fases: una fase inicial, en la cual se cargan y preparan los vocabularios tem&#xe1;ticos y la lista de frecuencias de formas l&#xe9;xicas; y una fase de producci&#xf3;n, en la que el algoritmo clasifica los documentos que se le entreguen. A grandes rasgos, el algoritmo compara cada documento a clasificar con cada vocabulario tem&#xe1;tico, teniendo en cuenta las frecuencias de los t&#xe9;rminos involucrados en el habla com&#xfa;n, y determina una afinidad del documento con cada vocabulario. Despu&#xe9;s, selecciona los vocabularios cuya afinidad cumpla una serie de requisitos, y sugiere una clasificaci&#xf3;n relativa a los temas asociados a estos vocabularios. La Tabla I muestra un esquema general del proceso.</p>
			<table-wrap id="t1">
				<label>Tabla I</label>
				<caption>
					<title>Esquema general del algoritmo propuesto.</title>
				</caption>
				<table>
					<colgroup>
						<col/>
						<col/>
					</colgroup>
					<tbody>
						<tr>
							<td align="left">
								<bold>1</bold>
							</td>
							<td align="left">
								<bold>Fase inicial</bold>
							</td>
						</tr>
						<tr>
							<td align="justify">1.1</td>
							<td align="justify">Carga de frecuencias de formas l&#xe9;xicas</td>
						</tr>
						<tr>
							<td align="justify">1.2</td>
							<td align="justify">Carga de vocabularios</td>
						</tr>
						<tr>
							<td align="justify">1.3</td>
							<td align="justify">Descarte de t&#xe9;rminos</td>
						</tr>
						<tr>
							<td align="justify">1.3.1</td>
							<td align="justify">Descarte de t&#xe9;rminos demasiado ambiguos</td>
						</tr>
						<tr>
							<td align="justify">1.3.2</td>
							<td align="justify">Descarte de t&#xe9;rminos demasiado frecuentes</td>
						</tr>
						<tr>
							<td align="left">
								<bold>2</bold>
							</td>
							<td align="left">
								<bold>Fase de producci&#xf3;n</bold>
							</td>
						</tr>
						<tr>
							<td align="justify">2.1</td>
							<td align="justify">Para cada documento (en paralelo):</td>
						</tr>
						<tr>
							<td align="justify">2.1.1</td>
							<td align="justify">Carga del documento en forma de lista de palabras</td>
						</tr>
						<tr>
							<td align="justify">2.1.2</td>
							<td align="justify">Para cada vocabulario:</td>
						</tr>
						<tr>
							<td align="justify">2.1.2.1</td>
							<td align="justify">Conteo de coincidencias</td>
						</tr>
						<tr>
							<td align="justify">2.1.2.2</td>
							<td align="justify">C&#xe1;lculo de <italic>F</italic>
								<sub>
									<italic>&#x3b2;</italic>
								</sub>
							</td>
						</tr>
						<tr>
							<td align="justify">2.1.3</td>
							<td align="justify">C&#xe1;lculo de afinidad m&#xed;nima y m&#xe1;xima</td>
						</tr>
						<tr>
							<td align="justify">2.1.4</td>
							<td align="justify">C&#xe1;lculo de afinidad umbral <italic>Q</italic>
							</td>
						</tr>
						<tr>
							<td align="justify">2.1.5</td>
							<td align="justify">C&#xe1;lculo de afinidad umbral corregida <italic>Q</italic>
								<sup>
									<italic>+</italic>
								</sup>
							</td>
						</tr>
						<tr>
							<td align="justify">2.1.6</td>
							<td align="justify">Asignaci&#xf3;n de temas</td>
						</tr>
						<tr>
							<td align="justify">2.2</td>
							<td align="justify">Presentaci&#xf3;n de resultados</td>
						</tr>
					</tbody>
				</table>
			</table-wrap>
			<p>Las secciones siguientes describen este proceso con mayor detalle.</p>
			<sec id="sec2.1">
				<label>2.1.</label>
				<title>Fase inicial</title>
				<p>Antes de poder clasificar documentos, el sistema debe preparar los datos a utilizar, tanto los vocabularios tem&#xe1;ticos como la lista de frecuencias de formas l&#xe9;xicas. Los vocabularios tem&#xe1;ticos son simples listas de t&#xe9;rminos, cada uno formado por una o m&#xe1;s palabras, abreviaturas o s&#xed;mbolos de otros tipos. Por ejemplo, el vocabulario para ciencias de la salud que utilizamos contiene t&#xe9;rminos como &#x201c;albuminuria&#x201d;, &#x201c;ligamentos articulares&#x201d; o &#x201c;citocromo p-450&#x201d;. Cada vocabulario puede almacenarse en un archivo de texto, con los t&#xe9;rminos ordenados alfab&#xe9;ticamente para facilitar su uso, y todos en min&#xfa;sculas para aumentar la eficiencia del procesado.</p>
				<p>La lista de frecuencias de formas l&#xe9;xicas, por otra parte, es una lista de dos columnas, donde la primera es la forma l&#xe9;xica y la segunda su frecuencia en el habla com&#xfa;n. Estas frecuencias se pueden expresar de forma absoluta (como n&#xfa;mero de apariciones en el corpus de origen) o relativa (como la anterior dividida entre el total de formas). En cualquier caso, el algoritmo utiliza frecuencias relativas durante la fase de producci&#xf3;n, de modo que, si la lista contiene frecuencias absolutas, debe convertir &#xe9;stas durante la fase inicial. La Tabla II muestra un ejemplo de frecuencias de formas l&#xe9;xicas obtenidas de CORPES XXI (<xref ref-type="bibr" rid="B17">Real Academia Espa&#xf1;ola, 2019</xref>).</p>
				<table-wrap id="t2">
					<label>Tabla II</label>
					<caption>
						<title>Muestra de la lista de frecuencias de formas l&#xe9;xicas de CORPES XXI.</title>
					</caption>
					<table>
						<colgroup>
							<col/>
							<col/>
						</colgroup>
						<thead>
							<tr>
								<th align="center">Forma l&#xe9;xica</th>
								<th align="center">Frecuencia absoluta</th>
							</tr>
						</thead>
						<tbody>
							<tr>
								<td align="center">maestros</td>
								<td align="center">11 890</td>
							</tr>
							<tr>
								<td align="center">botella</td>
								<td align="center">11 886</td>
							</tr>
							<tr>
								<td align="center">plantea</td>
								<td align="center">11 875</td>
							</tr>
						</tbody>
					</table>
				</table-wrap>
				<p>En &#xfa;ltimo lugar dentro de la fase inicial, el sistema procede a descartar aquellos t&#xe9;rminos de los vocabularios tem&#xe1;ticos que considere demasiado generales y poco caracter&#xed;sticos del tema en cuesti&#xf3;n. Esto se hace en dos pasos. Primeramente, se descartan los t&#xe9;rminos de cada vocabulario que tambi&#xe9;n aparecen en otros vocabularios, porque se consideran demasiado ambiguos. El n&#xfa;mero m&#xe1;ximo de vocabularios en los que un t&#xe9;rmino puede aparecer sin ser descartado (<italic>MaxTermOverlapDiscard</italic>) es proporcionado como par&#xe1;metro del algoritmo. En segundo lugar, se descartan los t&#xe9;rminos de cada vocabulario que sean demasiado frecuentes en el habla com&#xfa;n, al considerarse demasiado comunes y poco caracter&#xed;sticos del tema. Esto se consigue buscando cada t&#xe9;rmino de cada vocabulario en la lista de frecuencias de formas l&#xe9;xicas, y descart&#xe1;ndolo si su frecuencia es superior a un umbral especificado por el usuario. Este umbral (<italic>MaxTermFrequencyDiscard</italic>) es tambi&#xe9;n proporcionado como par&#xe1;metro del algoritmo. De este modo, y tras el descarte de t&#xe9;rminos, los vocabularios quedan preparados para ser utilizados durante la fase de producci&#xf3;n.</p>
			</sec>
			<sec id="sec2.2">
				<label>2.2.</label>
				<title>Fase de producci&#xf3;n</title>
				<p>Una vez que el sistema ha preparado los vocabularios y la lista de frecuencias de formas l&#xe9;xicas como se describe en el apartado anterior, est&#xe1; preparado para clasificar documentos. Los documentos pueden ser entregados al sistema de uno en uno o en lotes; en este segundo caso, el sistema es capaz de trabajar en paralelo en varios documentos a la vez, dependiendo de las capacidades de la infraestructura inform&#xe1;tica que se utilice.</p>
				<p>Para clasificar un documento, el algoritmo sigue estos pasos. Primeramente, el documento se convierte a un formato de texto sencillo, eliminando marcas de maquetaci&#xf3;n o formateo. Si los documentos ya est&#xe1;n en formato de texto, este paso es innecesario. A continuaci&#xf3;n, el documento se segmenta en una lista de palabras, descartando signos de puntuaci&#xf3;n y otros elementos del texto que no constituyan palabras. Esta lista de palabras se mantiene en el orden original en el que &#xe9;stas aparecen en el documento, es decir, no se ordena ni procesa en modo alguno. Esto permite buscar t&#xe9;rminos dentro de los documentos, ya sean t&#xe9;rminos formados por una o varias palabras. Por ejemplo, para determinar si un documento contiene el t&#xe9;rmino &#x201c;albuminuria&#x201d;, simplemente se busca esta palabra en la lista de palabras del documento. Para determinar si un documento contiene el t&#xe9;rmino &#x201c;ligamentos articulares&#x201d;, se busca la primera palabra &#x201c;ligamentos&#x201d; en la lista de palabras, y a continuaci&#xf3;n se comprueba si la palabra siguiente en la lista es &#x201c;articulares&#x201d;. </p>
				<p>De este modo, la lista de palabras del documento se contrasta con la lista de t&#xe9;rminos de cada vocabulario, calculando para cada uno un valor <italic>F</italic>
					<sub>
						<italic>&#x3b2;</italic>
					</sub> . El c&#xe1;lculo de F<sub>
						<italic>&#x3b2;</italic>
					</sub> se realiza habitualmente a partir de conteos de precisi&#xf3;n y exhaustividad, los cuales, a su vez, se calculan en funci&#xf3;n del n&#xfa;mero de coincidencias entre los dos conjuntos de datos que se comparan. Sin embargo, el algoritmo propuesto modifica este c&#xe1;lculo habitual y contempla tres posibles modos de determinar el n&#xfa;mero de coincidencias entre un documento y un vocabulario tem&#xe1;tico:</p>
				<list list-type="bullet">
					<list-item>
						<p>
							<bold>Binario</bold>. En este modo, se consideran solamente dos opciones: o bien el documento contiene el t&#xe9;rmino en evaluaci&#xf3;n, o bien no lo contiene. Si no lo contiene, se punt&#xfa;a con un 0; si lo contiene, con un 1. Esto equivale al c&#xe1;lculo habitual de <italic>F</italic>
							<sub>
								<italic>&#x3b2;</italic>
							</sub> basado en conteo de coincidencias, precisi&#xf3;n y exhaustividad.</p>
					</list-item>
					<list-item>
						<p>
							<bold>Conteo</bold>. En este modo, se cuenta el n&#xfa;mero de veces que el t&#xe9;rmino en evaluaci&#xf3;n aparece en el documento, resultando en puntuaciones que pueden oscilar entre 0 y el n&#xfa;mero de t&#xe9;rminos en el documento. Es decir, el n&#xfa;mero de coincidencias equivale al n&#xfa;mero de veces que el t&#xe9;rmino en evaluaci&#xf3;n aparece en el documento.</p>
					</list-item>
					<list-item>
						<p>
							<bold>Ponderado</bold>. En este modo, se cuenta el n&#xfa;mero de veces que el t&#xe9;rmino en evaluaci&#xf3;n aparece en el documento, y se multiplica por un peso indicativo de la frecuencia del t&#xe9;rmino, de modo que se amplifique la importancia de los t&#xe9;rminos menos frecuentes. Este peso <italic>W</italic> se calcula como el logaritmo en base 10 del cociente entre la frecuencia de la forma l&#xe9;xica m&#xe1;s com&#xfa;n de la lista de frecuencias de formas l&#xe9;xicas <italic>Fmax</italic> y la frecuencia del t&#xe9;rmino en evaluaci&#xf3;n <italic>F</italic>:</p>
					</list-item>
				</list>
				<disp-formula>
					<mml:math id="mml-1">
						<mml:mi>W</mml:mi>
						<mml:mo>=</mml:mo>
						<mml:mrow>
							<mml:mrow>
								<mml:msub>
									<mml:mrow>
										<mml:mi>log</mml:mi>
									</mml:mrow>
									<mml:mrow>
										<mml:mn>10</mml:mn>
									</mml:mrow>
								</mml:msub>
							</mml:mrow>
							<mml:mo>&#x2061;</mml:mo>
							<mml:mrow>
								<mml:mfrac>
									<mml:mrow>
										<mml:msub>
											<mml:mrow>
												<mml:mi>F</mml:mi>
											</mml:mrow>
											<mml:mrow>
												<mml:mi>m</mml:mi>
												<mml:mi>a</mml:mi>
												<mml:mi>x</mml:mi>
											</mml:mrow>
										</mml:msub>
									</mml:mrow>
									<mml:mrow>
										<mml:mi>F</mml:mi>
									</mml:mrow>
								</mml:mfrac>
							</mml:mrow>
						</mml:mrow>
					</mml:math>
				</disp-formula>
				<p>As&#xed;, el peso de los t&#xe9;rminos altamente frecuentes es amortiguado, mientras que el peso de los t&#xe9;rminos poco frecuentes se ve muy amplificado. De este modo, el n&#xfa;mero de coincidencias se obtiene sopesando la frecuencia del t&#xe9;rmino en evaluaci&#xf3;n.</p>
				<p>El modo de c&#xe1;lculo de coincidencias (<italic>MatchMode</italic>) que se desee utilizar se proporciona como par&#xe1;metro al algoritmo. Tras obtener el n&#xfa;mero de coincidencias mediante el modo que sea, se calculan los valores de precisi&#xf3;n <italic>P</italic> y exhaustividad <italic>R</italic>, y finalmente el valor <italic>F</italic>
					<sub>
						<italic>&#x3b2;</italic>
					</sub> , usando las f&#xf3;rmulas habituales:</p>
				<disp-formula>
					<mml:math id="mml-2">
						<mml:mi mathvariant="normal">P</mml:mi>
						<mml:mo>=</mml:mo>
						<mml:mfrac>
							<mml:mrow>
								<mml:mi mathvariant="normal">c</mml:mi>
								<mml:mi mathvariant="normal">o</mml:mi>
								<mml:mi mathvariant="normal">i</mml:mi>
								<mml:mi mathvariant="normal">n</mml:mi>
								<mml:mi mathvariant="normal">c</mml:mi>
								<mml:mi mathvariant="normal">i</mml:mi>
								<mml:mi mathvariant="normal">d</mml:mi>
								<mml:mi mathvariant="normal">e</mml:mi>
								<mml:mi mathvariant="normal">n</mml:mi>
								<mml:mi mathvariant="normal">c</mml:mi>
								<mml:mi mathvariant="normal">i</mml:mi>
								<mml:mi mathvariant="normal">a</mml:mi>
								<mml:mi mathvariant="normal">s</mml:mi>
							</mml:mrow>
							<mml:mrow>
								<mml:mi mathvariant="normal">t</mml:mi>
								<mml:mi mathvariant="normal">&#xe9;</mml:mi>
								<mml:mi mathvariant="normal">r</mml:mi>
								<mml:mi mathvariant="normal">m</mml:mi>
								<mml:mi mathvariant="normal">i</mml:mi>
								<mml:mi mathvariant="normal">n</mml:mi>
								<mml:mi mathvariant="normal">o</mml:mi>
								<mml:mi mathvariant="normal">s</mml:mi>
								<mml:mi mathvariant="normal"> </mml:mi>
								<mml:mi mathvariant="normal">e</mml:mi>
								<mml:mi mathvariant="normal">n</mml:mi>
								<mml:mi mathvariant="normal"> </mml:mi>
								<mml:mi mathvariant="normal">e</mml:mi>
								<mml:mi mathvariant="normal">l</mml:mi>
								<mml:mi mathvariant="normal"> </mml:mi>
								<mml:mi mathvariant="normal">d</mml:mi>
								<mml:mi mathvariant="normal">o</mml:mi>
								<mml:mi mathvariant="normal">c</mml:mi>
								<mml:mi mathvariant="normal">u</mml:mi>
								<mml:mi mathvariant="normal">m</mml:mi>
								<mml:mi mathvariant="normal">e</mml:mi>
								<mml:mi mathvariant="normal">n</mml:mi>
								<mml:mi mathvariant="normal">t</mml:mi>
								<mml:mi mathvariant="normal">o</mml:mi>
							</mml:mrow>
						</mml:mfrac>
					</mml:math>
				</disp-formula>
				<disp-formula>
					<mml:math id="mml-3">
						<mml:mi mathvariant="normal">R</mml:mi>
						<mml:mo>=</mml:mo>
						<mml:mfrac>
							<mml:mrow>
								<mml:mi mathvariant="normal">c</mml:mi>
								<mml:mi mathvariant="normal">o</mml:mi>
								<mml:mi mathvariant="normal">i</mml:mi>
								<mml:mi mathvariant="normal">n</mml:mi>
								<mml:mi mathvariant="normal">c</mml:mi>
								<mml:mi mathvariant="normal">i</mml:mi>
								<mml:mi mathvariant="normal">d</mml:mi>
								<mml:mi mathvariant="normal">e</mml:mi>
								<mml:mi mathvariant="normal">n</mml:mi>
								<mml:mi mathvariant="normal">c</mml:mi>
								<mml:mi mathvariant="normal">i</mml:mi>
								<mml:mi mathvariant="normal">a</mml:mi>
								<mml:mi mathvariant="normal">s</mml:mi>
							</mml:mrow>
							<mml:mrow>
								<mml:mi mathvariant="normal">t</mml:mi>
								<mml:mi mathvariant="normal">&#xe9;</mml:mi>
								<mml:mi mathvariant="normal">r</mml:mi>
								<mml:mi mathvariant="normal">m</mml:mi>
								<mml:mi mathvariant="normal">i</mml:mi>
								<mml:mi mathvariant="normal">n</mml:mi>
								<mml:mi mathvariant="normal">o</mml:mi>
								<mml:mi mathvariant="normal">s</mml:mi>
								<mml:mi mathvariant="normal"> </mml:mi>
								<mml:mi mathvariant="normal">e</mml:mi>
								<mml:mi mathvariant="normal">n</mml:mi>
								<mml:mi mathvariant="normal"> </mml:mi>
								<mml:mi mathvariant="normal">e</mml:mi>
								<mml:mi mathvariant="normal">l</mml:mi>
								<mml:mi mathvariant="normal"> </mml:mi>
								<mml:mi mathvariant="normal">v</mml:mi>
								<mml:mi mathvariant="normal">o</mml:mi>
								<mml:mi mathvariant="normal">c</mml:mi>
								<mml:mi mathvariant="normal">a</mml:mi>
								<mml:mi mathvariant="normal">b</mml:mi>
								<mml:mi mathvariant="normal">u</mml:mi>
								<mml:mi mathvariant="normal">l</mml:mi>
								<mml:mi mathvariant="normal">a</mml:mi>
								<mml:mi mathvariant="normal">r</mml:mi>
								<mml:mi mathvariant="normal">i</mml:mi>
								<mml:mi mathvariant="normal">o</mml:mi>
							</mml:mrow>
						</mml:mfrac>
					</mml:math>
				</disp-formula>
				<disp-formula>
					<mml:math id="mml-4">
						<mml:msub>
							<mml:mrow>
								<mml:mi>F</mml:mi>
							</mml:mrow>
							<mml:mrow>
								<mml:mi>&#x3b2;</mml:mi>
							</mml:mrow>
						</mml:msub>
						<mml:mo>=</mml:mo>
						<mml:mo>(</mml:mo>
						<mml:mn>1</mml:mn>
						<mml:mo>+</mml:mo>
						<mml:msup>
							<mml:mrow>
								<mml:mi mathvariant="normal">&#x3b2;</mml:mi>
							</mml:mrow>
							<mml:mrow>
								<mml:mn>2</mml:mn>
							</mml:mrow>
						</mml:msup>
						<mml:mo>)</mml:mo>
						<mml:mfrac>
							<mml:mrow>
								<mml:mi>P</mml:mi>
								<mml:mo>&#x2219;</mml:mo>
								<mml:mi>R</mml:mi>
							</mml:mrow>
							<mml:mrow>
								<mml:msup>
									<mml:mrow>
										<mml:mi>&#x3b2;</mml:mi>
									</mml:mrow>
									<mml:mrow>
										<mml:mn>2</mml:mn>
									</mml:mrow>
								</mml:msup>
								<mml:mo>&#x2219;</mml:mo>
								<mml:mi>P</mml:mi>
								<mml:mo>+</mml:mo>
								<mml:mi>R</mml:mi>
							</mml:mrow>
						</mml:mfrac>
					</mml:math>
				</disp-formula>
				<p>El valor de &#x3b2; que se desea utilizar para este c&#xe1;lculo (<italic>Beta</italic>) se proporciona como par&#xe1;metro al algoritmo. De este modo, se obtiene una lista de valores de afinidad <italic>F</italic>
					<sub>
						<italic>&#x3b2;</italic>
					</sub> para cada vocabulario. Estos valores indican la afinidad entre el documento que est&#xe1; siendo procesado y cada uno de los vocabularios.</p>
				<p>A continuaci&#xf3;n, el algoritmo determina cu&#xe1;les de los vocabularios tienen una afinidad con el documento que merezca ser considerada. Se descartan las afinidades m&#xe1;s bajas, y se seleccionan solo aquellas que superen un cierto umbral. Para ello, se sigue este proceso. Primeramente, se obtiene la afinidad m&#xed;nima (<italic>m</italic>) y m&#xe1;xima (<italic>M</italic>) de la lista, y se utilizan para calcular un valor de afinidad umbral <italic>Q</italic>:</p>
				<disp-formula>
					<mml:math id="mml-5">
						<mml:mi>Q</mml:mi>
						<mml:mo>=</mml:mo>
						<mml:mi>m</mml:mi>
						<mml:mo>+</mml:mo>
						<mml:msub>
							<mml:mrow>
								<mml:mi>Q</mml:mi>
							</mml:mrow>
							<mml:mrow>
								<mml:mi>f</mml:mi>
							</mml:mrow>
						</mml:msub>
						<mml:mo>(</mml:mo>
						<mml:mi>M</mml:mi>
						<mml:mo>-</mml:mo>
						<mml:mi>m</mml:mi>
						<mml:mo>)</mml:mo>
					</mml:math>
				</disp-formula>
				<p>Para esto, se utiliza un par&#xe1;metro <italic>Q</italic>
					<sub>
						<italic>F</italic>
					</sub> correspondiente al umbral m&#xed;nimo del intervalo [<italic>m, M</italic> ] que se desee considerar. Por ejemplo, si se desean considerar solo las afinidades del 75% superior del intervalo, el valor <italic>Q</italic>
					<sub>
						<italic>F</italic>
					</sub> ser&#xed;a 0,75. El valor de <italic>Q</italic>
					<sub>
						<italic>F</italic>
					</sub> se proporciona como par&#xe1;metro al algoritmo.</p>
				<p>El valor de <italic>Q</italic> as&#xed; obtenido indica que solo los temas cuyos vocabularios posean una afinidad igual o superior son temas potencialmente asignables al documento. Como mecanismo de refinamiento relativo, el algoritmo calcula un valor corregido <italic>Q</italic>
					<sup>
						<italic>+</italic>
					</sup> :</p>
				<disp-formula>
					<mml:math id="mml-6">
						<mml:msup>
							<mml:mrow>
								<mml:mi>Q</mml:mi>
							</mml:mrow>
							<mml:mrow>
								<mml:mo>+</mml:mo>
							</mml:mrow>
						</mml:msup>
						<mml:mo>=</mml:mo>
						<mml:mi>Q</mml:mi>
						<mml:mo>&#x2219;</mml:mo>
						<mml:mo>(</mml:mo>
						<mml:mn>1</mml:mn>
						<mml:mo>+</mml:mo>
						<mml:msub>
							<mml:mrow>
								<mml:mi>Q</mml:mi>
							</mml:mrow>
							<mml:mrow>
								<mml:mi>s</mml:mi>
							</mml:mrow>
						</mml:msub>
						<mml:mo>)</mml:mo>
					</mml:math>
				</disp-formula>
				<p>Para esto, se utiliza un par&#xe1;metro <italic>Q</italic>
					<sub>
						<italic>S</italic>
					</sub> correspondiente a la saliencia por encima de <italic>Q</italic> que se estipula necesaria para que una afinidad sea considerada relevante. Por ejemplo, si se desea dar una saliencia del 10% por encima de <italic>Q</italic>, el valor <italic>QS</italic> ser&#xed;a 0,1. El valor de <italic>Q</italic>
					<sub>
						<italic>S</italic>
					</sub> tambi&#xe9;n se proporciona como par&#xe1;metro al algoritmo.</p>
				<p>As&#xed;, los temas cuyos vocabularios posean una afinidad con el documento igual o superior a <italic>Q</italic>
					<sup>
						<italic>+</italic>
					</sup> se consideran temas asignables al documento, por orden decreciente de afinidad. La <xref ref-type="fig" rid="f1">Figura 1</xref> muestra un ejemplo de clasificaci&#xf3;n de varios documentos.</p>
				<p>En la <xref ref-type="fig" rid="f1">Figura 1</xref> se puede ver el valor de <italic>F</italic>
					<sub>
						<italic>&#x3b2;</italic>
					</sub> para cada documento y tema, as&#xed; como el valor de <italic>Q</italic> (punto azul oscuro) y <italic>Q</italic>
					<sup>
						<italic>+</italic>
					</sup> (punto verde) para cada documento. Seg&#xfa;n el algoritmo, cada documento recibe una clasificaci&#xf3;n tem&#xe1;tica para los temas cuya barra de afinidad en la gr&#xe1;fica supere en altura el punto verde de <italic>Q</italic>
					<sup>
						<italic>+</italic>
					</sup> . El documento 1, por ejemplo, ofrece una clasificaci&#xf3;n inequ&#xed;voca con el tema B. Para el documento 2, sin embargo, hay varios temas con afinidades bastante elevadas, aunque solo el tema C tiene una afinidad por encima de <italic>Q</italic>
					<sup>
						<italic>+</italic>
					</sup> . El documento 3, por su parte, presenta dos temas muy claros, ambos por encima de <italic>Q</italic>
					<sup>
						<italic>+</italic>
					</sup> , con lo cual ambos son asignados por el algoritmo. El documento 4 est&#xe1; en la misma situaci&#xf3;n, aunque las afinidades de los diferentes temas son m&#xe1;s parecidas entre s&#xed;. Los documentos 5 y 6 son relativamente ambiguos, ya que todos los temas poseen afinidades elevadas y parecidas. Aunque el tema C es el que muestra una afinidad m&#xe1;s elevada en ambos casos, no supera el umbral de <italic>Q</italic>
					<sup>
						<italic>+</italic>
					</sup> , por lo que no es posible asignar ning&#xfa;n tema a estos dos documentos.</p>
				<fig id="f1">
					<label>Figura 1</label>
					<caption>
						<title>Ejemplo de resultados de clasificaci&#xf3;n de 6 documentos con 5 temas. Se utiliz&#xf3; Q<sub>F</sub> = 0,75 y Q<sub>S</sub> = 0,1.</title>
					</caption>
					<graphic id="gra-1" xlink:href="REDC-46-03-e362-gf1.png"/>
				</fig>
			</sec>
		</sec>
		<sec id="sec3">
			<label>3.</label>
			<title>Validaci&#xf3;n</title>
			<p>El sistema propuesto fue validado de diferentes maneras. Primeramente, se desarroll&#xf3; una implementaci&#xf3;n de referencia. Despu&#xe9;s, se comprob&#xf3; su rendimiento, y se compararon los resultados obtenidos con los resultantes de una clasificaci&#xf3;n manual realizada por especialistas y tambi&#xe9;n con los de un sistema de clasificaci&#xf3;n basado en modelos de lenguaje.</p>
			<sec id="sec3.1">
				<label>3.1.</label>
				<title>Implementaci&#xf3;n de referencia</title>
				<p>El algoritmo propuesto fue implementado en forma de un programa escrito en C# 7 mediante Microsoft Visual Studio 2022 sobre Windows 11, utilizando .NET Framework 4.7.1. El programa fue compilado en modo <italic>Debug</italic> y ejecutado desde el entorno de desarrollo.</p>
			</sec>
			<sec id="sec3.2">
				<label>3.2.</label>
				<title>Rendimiento</title>
				<p>El rendimiento del algoritmo propuesto se evalu&#xf3; ejecutando la implementaci&#xf3;n de referencia en un ordenador personal de sobremesa Dell Precision 5820 con procesador Intel i9 de 10 n&#xfa;cleos a 3,70 GHz, 32 GB de memoria RAM, almacenamiento SSD y Windows 11 Pro. De los 10 n&#xfa;cleos de procesador, se limit&#xf3; el algoritmo a usar 8 de ellos.</p>
				<p>Se utilizaron 10 vocabularios tem&#xe1;ticos confeccionados por los autores para los temas de Ciencia de Datos, Ciencias de la Salud, Ciencias de la Vida, Ciencias Pol&#xed;ticas, Comunicaci&#xf3;n, Econom&#xed;a, Educaci&#xf3;n, Medio Ambiente, Psicolog&#xed;a, y Sociolog&#xed;a. Los vocabularios ten&#xed;an entre 714 y 10 852 t&#xe9;rminos cada uno, con una media de 4 556 t&#xe9;rminos por vocabulario y 45 560 t&#xe9;rminos en total. Se establecieron los par&#xe1;metros <italic>MaxTermOverlapDiscard</italic> = 2 y <italic>MaxTermFrequencyDiscard</italic> = 0,000005, resultando en un descarte de 2 631 t&#xe9;rminos, un 5,8 % del total. Se confeccion&#xf3; una lista de frecuencias de formas l&#xe9;xicas a partir del corpus CORPES XXI (<xref ref-type="bibr" rid="B17">Real Academia Espa&#xf1;ola, 2019</xref>), con 1 086 742 formas l&#xe9;xicas con frecuencias absolutas entre 20 670 985 y 1.</p>
				<p>Para la evaluaci&#xf3;n de rendimiento se utiliz&#xf3; un corpus compuesto de 874 art&#xed;culos divulgativos publicados en <italic>The Conversation, Spanish Edition</italic> (<xref ref-type="bibr" rid="B21"><italic>The Conversation, Spanish Edition</italic>, 2020</xref>) a lo largo de 2020, sumando 673 824 palabras en total. Los documentos se entregaron al algoritmo en formato de texto. Se establecieron los par&#xe1;metros <italic>Beta</italic> = 0,15, <italic>MatchMode</italic> = <italic>Binario</italic>, <italic>Q</italic>
					<sub>
						<italic>F</italic>
					</sub>
					<italic>= 0,75 y Q</italic>
					<sub>
						<italic>S</italic>
					</sub>
					<italic>= 0,1.</italic>
				</p>
				<p>El algoritmo proces&#xf3; los documentos y les asign&#xf3; temas en 33,82 segundos, resultando en una media de 25,84 documentos por segundo y 19 924 palabras por segundo. Para hacerlo, utiliz&#xf3; 314 MB de memoria RAM.</p>
			</sec>
			<sec id="sec3.3">
				<label>3.3.</label>
				<title>Comparaci&#xf3;n con clasificaci&#xf3;n manual</title>
				<p>El algoritmo propuesto se contrast&#xf3; con un sistema de clasificaci&#xf3;n manual convencional, realizada por especialistas en documentaci&#xf3;n e informaci&#xf3;n. Para ello, tres especialistas E<sub>1</sub>, E<sub>2</sub> y E<sub>3</sub> recibieron el mismo corpus que se describe en el apartado anterior, y la misma lista de temas. Se pidi&#xf3; a estos especialistas que trabajasen de forma independiente y asignaran un tema de la lista a cada documento, dejando sin asignar aquellos documentos que, a su juicio, no encajaran en ninguno de los temas propuestos. E<sub>1</sub> asign&#xf3; temas a 677 de los 874 documentos (un 77%), E<sub>2</sub> asign&#xf3; temas a 725 documentos (un 83%), y E<sub>3</sub> asign&#xf3; temas a 627 de los 874 documentos (un 72%). Se descartaron los documentos no clasificados por uno o m&#xe1;s especialistas y, utilizando el resto, se calcul&#xf3; la concordancia entre los especialistas, produciendo el valor kappa de Fleiss (<xref ref-type="bibr" rid="B9">Fleiss, 1971</xref>) que se muestra en la <xref ref-type="table" rid="t3">Tabla III</xref>.</p>
				<table-wrap id="t3">
					<label>Tabla III</label>
					<caption>
						<title>Valor de concordancia (kappa de Fleiss) entre especialistas para la clasificaci&#xf3;n manual.</title>
					</caption>
					<table>
						<colgroup>
							<col/>
							<col/>
						</colgroup>
						<tbody>
							<tr>
								<td align="center">Kappa de Fleiss</td>
								<td align="center">0,6476</td>
							</tr>
						</tbody>
					</table>
				</table-wrap>
				<p>Finalmente, se compararon los resultados obtenidos por cada especialista con los obtenidos mediante el algoritmo propuesto. Dado que el algoritmo puede ofrecer varios temas priorizados para cada documento, se realiz&#xf3; la comparaci&#xf3;n de dos maneras. Por un lado, se midi&#xf3; la concordancia del tema asignado a cada documento por cada especialista con el primer tema (tema con mayor afinidad) asignado por el algoritmo (<italic>K</italic>
					<sub>
						<italic>top</italic>
					</sub>). Por otro lado, se midi&#xf3; la concordancia del tema asignado por cada especialista con cualquiera de los temas asignados por el algoritmo, independientemente de su posici&#xf3;n en la lista priorizada (<italic>K</italic>
					<sub>
						<italic>any</italic>
					</sub>). Se repiti&#xf3; el proceso para cada uno de los tres modos de coincidencia del algoritmo (par&#xe1;metro <italic>MatchMode</italic>).</p>
				<p>El resultado de esta prueba produjo los resultados que se muestran en la <xref ref-type="table" rid="t4">Tabla IV</xref>.</p>
				<table-wrap id="t4">
					<label>Tabla IV</label>
					<caption>
						<title>Valores de concordancia (kappa de Fleiss) entre cada especialista y el algoritmo propuesto, para cada uno de los modos de coincidencia.</title>
					</caption>
					<table>
						<colgroup>
							<col/>
							<col/>
							<col/>
							<col/>
							<col/>
							<col/>
							<col/>
						</colgroup>
						<thead>
							<tr>
								<th align="left"> </th>
								<th align="center" colspan="2">E<sub>1</sub>
								</th>
								<th align="center" colspan="2">E<sub>2</sub>
								</th>
								<th align="center" colspan="2">E<sub>3</sub>
								</th>
							</tr>
							<tr>
								<th align="left"> </th>
								<th align="center">K<sub>top</sub>
								</th>
								<th align="center">K<sub>any</sub>
								</th>
								<th align="center">K<sub>top</sub>
								</th>
								<th align="center">K<sub>any</sub>
								</th>
								<th align="center">K<sub>top</sub>
								</th>
								<th align="center">K<sub>any</sub>
								</th>
							</tr>
						</thead>
						<tbody>
							<tr>
								<td align="justify">Binario</td>
								<td align="center">0,4819</td>
								<td align="center">0,6705</td>
								<td align="center">0,4872</td>
								<td align="center">0,7038</td>
								<td align="center">0,6061</td>
								<td align="center">0,8016</td>
							</tr>
							<tr>
								<td align="justify">Conteo</td>
								<td align="center">0,4907</td>
								<td align="center">0,7100</td>
								<td align="center">0,4942</td>
								<td align="center">0,7270</td>
								<td align="center">0,6098</td>
								<td align="center">0,8219</td>
							</tr>
							<tr>
								<td align="justify">Ponderado</td>
								<td align="center">0,4583</td>
								<td align="center">0,6813</td>
								<td align="center">0,4947</td>
								<td align="center">0,6927</td>
								<td align="center">0,5921</td>
								<td align="center">0,8291</td>
							</tr>
						</tbody>
					</table>
				</table-wrap>
				<p>Como se puede apreciar, la concordancia del algoritmo con los especialistas humanos es ligeramente inferior a la concordancia entre los propios especialistas cuando se tiene en cuenta solamente el tema principal asignado por el algoritmo (<italic>K</italic>
					<sub>
						<italic>top</italic>
					</sub>). Sin embargo, si se tiene en cuenta cualquiera de los temas asignados por el algoritmo (<italic>K</italic>
					<sub>
						<italic>any</italic>
					</sub>), entonces la concordancia del algoritmo con los especialistas humanos es claramente mayor que la concordancia entre los propios especialistas.</p>
			</sec>
			<sec id="sec3.4">
				<label>3.4.</label>
				<title>Comparaci&#xf3;n con clasificaci&#xf3;n mediante modelos de lenguaje</title>
				<p>A modo de validaci&#xf3;n adicional, se compararon los resultados de la clasificaci&#xf3;n manual descritos en el apartado anterior con los que produjo un sistema de clasificaci&#xf3;n tem&#xe1;tica basado en un modelo de lenguaje. Este sistema utiliz&#xf3; una arquitectura de <italic>transformers</italic> (<xref ref-type="bibr" rid="B23">Vaswani y otros, 2017</xref>), que son modelos de aprendizaje profundo que aprenden de un idioma, sus palabras y el contexto de estas, para luego ser adaptados a tareas concretas como clasificaci&#xf3;n mediante un proceso de ajuste fino o <italic>fine tuning</italic>. Para este proceso se necesita de un corpus ya clasificado sobre el que el modelo se entrena. El modelo de lenguaje usado fue MarIA (<xref ref-type="bibr" rid="B13">Guti&#xe9;rrez-Fandi&#xf1;o y otros, 2022</xref>), concretamente <italic>roberta-large</italic>, que ha sido previamente entrenado con 570 GB de datos textuales de la Biblioteca Nacional de Espa&#xf1;a.</p>
				<p>Para realizar el proceso de ajuste fino, primeramente se seleccionaron del corpus aquellos documentos para los que los tres especialistas humanos concordaron en su clasificaci&#xf3;n, y se dividi&#xf3; este grupo de documentos en un conjunto de entrenamiento y otro de prueba. El conjunto de entrenamiento, correspondiente a un 70% del grupo original, m&#xe1;s las clasificaciones otorgadas por los especialistas humanos, se utiliz&#xf3; para que el modelo aprendiese a clasificar documentos. El restante 30% del grupo original se utiliz&#xf3; para probar el modelo una vez entrenado. Despu&#xe9;s, se clasificaron todos los documentos del corpus con este sistema. Al comparar los resultados sugeridos por el sistema de clasificaci&#xf3;n basado en modelos de lenguaje con los producidos por los especialistas humanos, se obtienen las concordancias que se muestran en la <xref ref-type="table" rid="t5">Tabla V</xref>.</p>
				<table-wrap id="t5">
					<label>Tabla V</label>
					<caption>
						<title>Valores de concordancia (kappa de Fleiss) entre cada especialista y el sistema clasificador basado en modelos de lenguaje.</title>
					</caption>
					<table>
						<colgroup>
							<col/>
							<col/>
							<col/>
							<col/>
						</colgroup>
						<thead>
							<tr>
								<th align="left"> </th>
								<th align="center">E1</th>
								<th align="center">E2</th>
								<th align="center">E3</th>
							</tr>
						</thead>
						<tbody>
							<tr>
								<td align="justify">Kappa de Fleiss</td>
								<td align="center">0,7249</td>
								<td align="center">0,5452</td>
								<td align="center">0,6424</td>
							</tr>
						</tbody>
					</table>
				</table-wrap>
				<p>Como se puede ver en la tabla, los valores de concordancia son similares a los obtenidos comparando el algoritmo propuesto con los especialistas humanos. Un an&#xe1;lisis de varianza (ANOVA) muestra que, efectivamente, no existen diferencias significativas entre ellos para <italic>K</italic>
					<sub>
						<italic>top</italic>
					</sub> ni para <italic>K</italic>
					<sub>
						<italic>all</italic>
					</sub> con <italic>&#x3b1;</italic> = 0,05 para ninguno de los tres modos de coincidencia. Es decir, el sistema basado en modelos de lenguaje no es significativamente mejor que el algoritmo propuesto en lo que respecta a su concordancia con especialistas humanos.</p>
			</sec>
		</sec>
		<sec id="sec4" sec-type="discussion">
			<label>4.</label>
			<title>Discusi&#xf3;n</title>
			<p>En esta secci&#xf3;n, presentamos un an&#xe1;lisis de fortalezas y debilidades del algoritmo propuesto, as&#xed; como algunos comentarios sobre los valores recomendados para cada uno de los par&#xe1;metros del algoritmo y su influencia en los resultados.</p>
			<sec id="sec4.1">
				<label>4.1.</label>
				<title>Fortalezas</title>
				<p>Una fortaleza evidente del algoritmo propuesto es que produce unos resultados similares a los obtenidos por especialistas humanos, a un coste muy inferior. Un especialista humano puede clasificar, en el mejor de los casos, un documento cada 5 o 10 segundos, leyendo solo el t&#xed;tulo y quiz&#xe1; un resumen del documento, no el contenido completo, y este ritmo probablemente no es sostenible m&#xe1;s all&#xe1; de unos pocos minutos. El algoritmo propuesto, sin embargo, puede clasificar unos 26 documentos por segundo en un equipo inform&#xe1;tico de sobremesa, teniendo en cuenta el contenido completo de los documentos, y mantener este ritmo indefinidamente. Esto supone que el algoritmo propuesto tiene un rendimiento al menos 130 veces superior al de un analista humano, con resultados similares. Es l&#xf3;gico pensar que, con un equipo inform&#xe1;tico de m&#xe1;s altas prestaciones, el rendimiento ser&#xed;a superior.</p>
				<p>Por otra parte, el algoritmo propuesto produce unos resultados similares a los obtenidos mediante un sistema basado en modelos de lenguaje previamente entrenado. Sin embargo, el algoritmo propuesto es ventajoso frente a este tipo de sistemas por tres razones. Primeramente, el algoritmo propuesto no necesita de un entrenamiento previo. En segundo lugar, el algoritmo propuesto rinde aceptablemente en un equipo inform&#xe1;tico com&#xfa;n y asequible, mientras que los sistemas clasificadores basados en modelos de lenguaje necesitan de equipamientos de altas prestaciones, mucho m&#xe1;s costosos y complejos de utilizar, o bien disponibles como un servicio en la nube. Esto conlleva una dependencia de un servicio externo y los costes asociados. En tercer lugar, las clasificaciones producidas por el algoritmo propuesto son explicables; es decir, es f&#xe1;cil determinar por qu&#xe9; el algoritmo asigna un tema determinado a un documento concreto, utilizando la l&#xf3;gica correspondiente al modo de coincidencia elegido (par&#xe1;metro <italic>MatchMode</italic>). Sin embargo, no es posible determinar la raz&#xf3;n de la clasificaci&#xf3;n asignada por un sistema basado en modelos de lenguaje, dada la complejidad de su funcionamiento interno.</p>
				<p>Por otro lado, y como se ha dicho, los sistemas basados en modelos de lenguaje han de ser entrenados. Para su entrenamiento se suele utilizar una clasificaci&#xf3;n previa realizada por especialistas humanos, de modo que el sistema aprende a imitar las clasificaciones realizadas por &#xe9;stos. Esto inyecta cierto sesgo en el sistema, que reproduce las preferencias y sesgos personales de los especialistas cuyas clasificaciones se han usado para entrenarlo. El algoritmo propuesto, sin embargo, no necesita de entrenamiento, de modo que se puede argumentar que sus resultados son, en cierto modo, m&#xe1;s independientes de los sesgos y preferencias de los especialistas humanos. De hecho, algunos de los especialistas que participaron en los experimentos descritos en este art&#xed;culo han se&#xf1;alado que, tras examinar las clasificaciones producidas por el algoritmo propuesto, las han encontrado m&#xe1;s adecuadas que las de ellos. En este sentido, las clasificaciones realizadas por especialistas humanos no deben ser tomadas con una referencia absoluta en t&#xe9;rminos de correcci&#xf3;n, sino como una referencia aproximada.</p>
				<p>En relaci&#xf3;n con lo anterior, es necesario se&#xf1;alar que los vocabularios utilizados por el algoritmo son altamente reutilizables. Es decir, un vocabulario de buena calidad (ver secci&#xf3;n siguiente) puede ser utilizado por el algoritmo para clasificar numerosos documentos a lo largo de mucho tiempo.</p>
			</sec>
			<sec id="sec4.2">
				<label>4.2</label>
				<title>Debilidades</title>
				<p>Durante la puesta a punto del algoritmo y la ejecuci&#xf3;n de las pruebas de validaci&#xf3;n, se comprob&#xf3; que el resultado del sistema propuesto depende en gran medida de la calidad de los vocabularios tem&#xe1;ticos que se utilicen. De este modo, los vocabularios deben ajustarse a los siguientes requisitos:</p>
				<list list-type="bullet">
					<list-item>
						<p>Deben ser <bold>espec&#xed;ficos</bold>, es decir, contener t&#xe9;rminos que correspondan al tema en cuesti&#xf3;n de forma muy especial. Por ejemplo, un vocabulario sobre econom&#xed;a no debe contener el t&#xe9;rmino &#x201c;crisis&#x201d;, porque a pesar de que este t&#xe9;rmino es frecuente en textos sobre econom&#xed;a, tambi&#xe9;n lo es en textos sobre pol&#xed;tica o medio ambiente. En caso de duda, es preferible descartar un t&#xe9;rmino que incluirlo. El descarte autom&#xe1;tico de t&#xe9;rminos que se lleva a cabo en la fase inicial del sistema propuesto ayuda a depurar cada vocabulario en relaci&#xf3;n con qu&#xe9; otros vocabularios se est&#xe9;n utilizando.</p>
					</list-item>
					<list-item>
						<p>Deben tener un <bold>bajo solapamiento</bold> entre s&#xed;, es decir, la proporci&#xf3;n de t&#xe9;rminos que aparecen en dos o m&#xe1;s vocabularios durante el uso del algoritmo debe ser lo m&#xe1;s baja posible. A modo de ayuda durante la elaboraci&#xf3;n de los vocabularios, calculamos los valores <italic>F1</italic> (es decir, <italic>F</italic>
							<sub>
								<italic>&#x3b2;</italic>
							</sub> con <italic>&#x3b2;</italic> = 1) entre cada par de vocabularios para determinar su solapamiento, refin&#xe1;ndolos cuando se obten&#xed;an valores por encima de 0,05. El descarte autom&#xe1;tico de t&#xe9;rminos que se lleva a cabo en la fase inicial del sistema, al igual que en el caso anterior, ayuda a eliminar t&#xe9;rminos demasiado ambiguos en este sentido.</p>
					</list-item>
					<list-item>
						<p>Deben contener las <bold>flexiones</bold> correspondientes, es decir, las distintas formas de g&#xe9;nero y n&#xfa;mero para sustantivos y adjetivos, formas verbales conjugadas, etc. (ver Tabla II) Los tesauros habituales en biblioteconom&#xed;a suelen incluir solamente formas can&#xf3;nicas seleccionadas (como, por ejemplo, &#x201c;desbrozar&#x201d; o &#x201c;ciudad sat&#xe9;lite&#x201d;), dejando fuera las formas l&#xe9;xicas correspondientes a flexiones de &#xe9;stas (como, por ejemplo, &#x201c;desbrozaron&#x201d; o &#x201c;ciudades sat&#xe9;lite&#x201d;). Esta necesidad surge del hecho de que el algoritmo realiza comparaciones literales entre los t&#xe9;rminos de los vocabularios y los contenidos de los documentos a clasificar. En futuras versiones del algoritmo propuesto, este requerimiento podr&#xed;a aliviarse utilizando <italic>word stemming</italic> o incorporando un sistema de flexi&#xf3;n autom&#xe1;tica. O mediante un modo de c&#xe1;lculo de coincidencias basado en distancias de edici&#xf3;n, como se explica m&#xe1;s abajo.</p>
					</list-item>
				</list>
				<p>Aunque, como se se&#xf1;ala en el apartado anterior, el algoritmo propuesto no necesita ser entrenado y, por lo tanto, es relativamente independiente de los sesgos y preferencias de especialistas individuales, es cierto que su funcionamiento depende de la calidad de los vocabularios. Y, a su vez, los vocabularios son confeccionados por especialistas humanos. De este modo, debemos admitir que el algoritmo propuesto no deja de estar influenciado por sesgos y preferencias humanas. De todos modos, esta influencia es indirecta (a trav&#xe9;s de los vocabularios), y no constituye un patr&#xf3;n que el algoritmo aprenda e imite.</p>
				<p>Finalmente, debemos decir que es posible experimentar con distintos modos de c&#xe1;lculo de coincidencias (<italic>MatchMode</italic>). Adem&#xe1;s de las tres opciones probadas, existen opciones de coincidencia aproximada usando m&#xe9;tricas basadas en la distancia de edici&#xf3;n, como la distancia de Levenshtein (<xref ref-type="bibr" rid="B3">Black, 1999</xref>) o la distancia de Jaro-Winkler (<xref ref-type="bibr" rid="B24">Winkler, 1990</xref>). Esto permitir&#xed;a mitigar, o incluso resolver, el problema de la necesidad de listas de vocabularios con flexiones o del uso potencial de <italic>word stemming</italic> o flexi&#xf3;n autom&#xe1;tica.</p>
			</sec>
			<sec id="sec4.3">
				<label>4.3.</label>
				<title>Par&#xe1;metros y valores recomendados</title>
				<p>Tal y como se ha descrito en las secciones anteriores, el algoritmo propuesto utiliza los par&#xe1;metros que se describen en la <xref ref-type="table" rid="t6">Tabla VI</xref>.</p>
				<table-wrap id="t6">
					<label>Tabla VI</label>
					<caption>
						<title>Par&#xe1;metros utilizados por el algoritmo propuesto.</title>
					</caption>
					<table>
						<colgroup>
							<col/>
							<col/>
							<col/>
						</colgroup>
						<thead>
							<tr>
								<th align="left">Nombre</th>
								<th align="left">Descripci&#xf3;n</th>
								<th align="left">Valores</th>
							</tr>
						</thead>
						<tbody>
							<tr>
								<td align="left">
									<bold>
										<italic>MaxTermOverlapDiscard</italic>
									</bold>
								</td>
								<td align="left">N&#xfa;mero m&#xe1;ximo de vocabularios tem&#xe1;ticos en los que puede aparecer un t&#xe9;rmino antes de ser descartado como demasiado ambiguo.</td>
								<td align="left">Mayor o igual que 1.</td>
							</tr>
							<tr>
								<td align="left">
									<bold>
										<italic>MaxTermFrequencyDiscard</italic>
									</bold>
								</td>
								<td align="left">Frecuencia relativa m&#xe1;xima en el habla com&#xfa;n que puede tener un t&#xe9;rmino antes de ser descartado como demasiado general.</td>
								<td align="left">Entre 0 y 1.</td>
							</tr>
							<tr>
								<td align="left">
									<bold>
										<italic>MatchMode</italic>
									</bold>
								</td>
								<td align="left">Modo de c&#xe1;lculo de coincidencias entre documentos y vocabularios.</td>
								<td align="left">Binario, Conteo o Ponderado.</td>
							</tr>
							<tr>
								<td align="left">
									<bold>
										<italic>Beta</italic>
									</bold>
								</td>
								<td align="left">Valor beta para c&#xe1;lculo de afinidades.</td>
								<td align="left">Mayor que 0.</td>
							</tr>
							<tr>
								<td align="left">
									<bold>
										<italic>Q</italic>
									</bold>
									<sub>
										<italic>F</italic>
									</sub>
								</td>
								<td align="left">Umbral m&#xed;nimo en el intervalo de afinidades que debe tener un tema para que se considere candidato a ser asignable.</td>
								<td align="left">Entre 0 y 1.</td>
							</tr>
							<tr>
								<td align="left">
									<bold>
										<italic>Q</italic>
									</bold>
									<sub>
										<italic>S</italic>
									</sub>
								</td>
								<td align="left">Saliencia relativa m&#xed;nima que debe tener un tema por encima del valor base (Q) para que se considere asignable.</td>
								<td align="left">Mayor que 0.</td>
							</tr>
						</tbody>
					</table>
				</table-wrap>
				<p>A continuaci&#xf3;n, se describen algunos valores t&#xed;picos de estos par&#xe1;metros que, seg&#xfa;n la experiencia de los autores, funcionan bien, al menos en los casos de validaci&#xf3;n descritos en la secci&#xf3;n anterior.</p>
				<p>Para <italic>MaxTermOverlapDiscard</italic>, un valor de 1 descarta t&#xe9;rminos que aparezcan en dos o m&#xe1;s vocabularios, lo cual suele ser demasiado exigente, ya que reduce los vocabularios a listas de t&#xe9;rminos exclusivos de cada tema, que no suelen ser muchos. Un valor de 2 es m&#xe1;s razonable. En escenarios con muchos vocabularios (por encima de 10), este valor se puede incrementar a 3 o incluso a 4, especialmente si existe una cercan&#xed;a tem&#xe1;tica muy fuerte entre vocabularios. En la validaci&#xf3;n que se describe en la secci&#xf3;n anterior, los vocabularios Ciencias de la Salud y Ciencias de la Vida, por ejemplo, presentaban un solape bastante significativo, de modo que eliminar los t&#xe9;rminos comunes puede ayudar a discriminar mejor entre estos dos temas tan cercanos.</p>
				<p>En cuanto a <italic>MaxTermFrequencyDiscard</italic>, un valor de 0,000005 corresponde a descartar t&#xe9;rminos m&#xe1;s frecuentes en el habla com&#xfa;n que, por ejemplo, &#x201c;edil&#x201d;, &#x201c;&#xf3;mnibus&#x201d; o &#x201c;comitiva&#x201d;, seg&#xfa;n los datos de CORPES XXI (<xref ref-type="bibr" rid="B17">Real Academia Espa&#xf1;ola, 2019</xref>). Elevando este valor un orden de magnitud hasta 0,00005, se descartan t&#xe9;rminos m&#xe1;s frecuentes que, por ejemplo, &#x201c;conservaci&#xf3;n&#x201d; o &#x201c;cap&#xed;tulo&#x201d;.</p>
				<p>Para <italic>MatchMode</italic>, y como se ha descrito en secciones anteriores, los mejores resultados del algoritmo se obtienen utilizando el modo de conteo, con los modos binario y ponderado siendo un poco peores, aunque no de forma significativa. Las diferencias de rendimiento entre los distintos modos tampoco son significativas.</p>
				<p>En cuanto a <italic>Beta</italic>, los posibles valores se ajustan a las recomendaciones habituales para este par&#xe1;metro en el c&#xe1;lculo de concordancias mediante precisi&#xf3;n y exhaustividad. Un valor de 1 mide concordancias dando el mismo peso a la precisi&#xf3;n que a la exhaustividad. Un valor inferior a 1 (pero mayor que 0) da m&#xe1;s peso a la precisi&#xf3;n que a la exhaustividad. Esto es adecuado en escenarios de clasificaci&#xf3;n tem&#xe1;tica de documentos mediante vocabularios, como el que presentamos, en los que la precisi&#xf3;n indica qu&#xe9; proporci&#xf3;n del documento se ajusta al vocabulario y la exhaustividad indica qu&#xe9; proporci&#xf3;n del vocabulario aparece en el documento. Siendo as&#xed;, debe tener m&#xe1;s peso la precisi&#xf3;n que la exhaustividad, ya que no es tan importante que una gran parte del vocabulario est&#xe9; representada en el documento (exhaustividad) como que una gran parte del documento corresponda al vocabulario (precisi&#xf3;n). Los valores entre 0,1 y 0,3 parecen funcionar adecuadamente.</p>
				<p>En cuanto a <italic>Q</italic>
					<sub>
						<italic>F</italic>
					</sub> , un valor de 0,75 descarta temas con afinidades en el 25% inferior del intervalo, lo cual permite eliminar temas que, si bien presentan alguna afinidad con el documento, probablemente no sean centrales al mismo. Este valor es fuertemente dependiente del corpus que se est&#xe9; clasificando, as&#xed; como de la composici&#xf3;n de los vocabularios tem&#xe1;ticos que se empleen. Es posible elevar este valor hasta 0,5 para descartar el 50% inferior del intervalo de afinidades, aunque esto aumenta considerablemente el riesgo de que algunos documentos dif&#xed;ciles de clasificar queden sin ning&#xfa;n tema asignado.</p>
				<p>Finalmente, para <italic>Qs</italic> se ha utilizado un valor de 0,1, indicando as&#xed; que solo se asignan los temas que est&#xe9;n un 10% por encima de la afinidad m&#xed;nima establecida. Como en el caso anterior, es posible elevar algo el valor de este par&#xe1;metro, lo cual producir&#xed;a asignaciones tem&#xe1;ticas m&#xe1;s ajustadas, pero con mayor riesgo de que los documentos tem&#xe1;ticamente m&#xe1;s ambiguos quedasen sin clasificar.</p>
			</sec>
		</sec>
		<sec id="sec5" sec-type="conclusions">
			<label>5.</label>
			<title>Conclusiones</title>
			<p>En este art&#xed;culo se ha presentado un nuevo algoritmo para la clasificaci&#xf3;n tem&#xe1;tica autom&#xe1;tica de documentos. El algoritmo se basa en vocabularios tem&#xe1;ticos previamente elaborados y una lista de frecuencias de formas l&#xe9;xicas, y es altamente parametrizable. El algoritmo se valid&#xf3; con un corpus de art&#xed;culos de divulgaci&#xf3;n cient&#xed;fica en espa&#xf1;ol, y sus resultados se compararon con los producidos por especialistas humanos y por un sistema clasificador basado en modelos de lenguaje. Los resultados del algoritmo propuesto no son inferiores, en t&#xe9;rminos de concordancia, a los que producen los especialistas humanos o el sistema clasificador basado en modelos de lenguaje.</p>
			<p>Aunque los experimentos realizados en este trabajo se han basado en terminolog&#xed;as especializadas para &#xe1;reas espec&#xed;ficas del corpus, el algoritmo propuesto permite utilizar terminolog&#xed;as ya desarrolladas de otras &#xe1;reas. De este modo, se pueden reutilizar o reaprovechar recursos desarrollados y revisados por expertos, lo cual reduce el coste humano de trabajo para implementar nuevas clasificaciones. El algoritmo permite una gran escalabilidad en el reconocimiento de nuevas disciplinas siempre y cuando est&#xe9;n respaldadas por una terminolog&#xed;a adecuada y los vocabularios correspondientes.</p>
			<p>El algoritmo propuesto puede pues ser aplicado a otros tipos de documentos, a otros temas diferentes, o a otros idiomas. Actualmente, se est&#xe1; experimentando la aplicaci&#xf3;n del algoritmo a un nuevo corpus de textos acad&#xe9;micos especializados extra&#xed;dos de la base datos &#xcd;nDICEs-CSIC para comparar resultados entre textos de divulgaci&#xf3;n cient&#xed;fica y an&#xe1;lisis cient&#xed;ficos publicados en revistas especializadas. </p>
			<p>De la misma manera, tambi&#xe9;n es posible descender en el nivel de detalle de los vocabularios para clasificaciones tem&#xe1;ticas m&#xe1;s espec&#xed;ficas en cada una de las &#xe1;reas trabajadas. As&#xed;, por ejemplo, aquellos textos que hayan resultado englobados dentro del &#xe1;rea de &#x201c;Ciencias de la Vida&#x201d; pueden ser clasificados en subcategor&#xed;as propias como &#x201c;Patolog&#xed;a Animal&#x201d;, &#x201c;Microbiolog&#xed;a&#x201d;, &#x201c;Anatom&#xed;a Vegetal&#x201d;, etc.</p>
			<p>Finalmente, es importante recalcar la potencial implantaci&#xf3;n del algoritmo propuesto en entornos reales o repositorios cient&#xed;ficos como LA Referencia (<xref ref-type="bibr" rid="B7">Cooperaci&#xf3;n Latinoamericana de Redes Avanzadas, 2013</xref>) o Recolecta FECYT (<xref ref-type="bibr" rid="B8">FECYT, 2022</xref>), para los que la clasificaci&#xf3;n autom&#xe1;tica de documentos es una tarea relevante. Tambi&#xe9;n es interesante su inclusi&#xf3;n en webs de divulgaci&#xf3;n cient&#xed;fica como el propio repositorio de <italic>The Conversation</italic>.</p>
		</sec>
	</body>
	<back>
		<ack>
			<label>6.</label>
			<title>Agradecimientos</title>
			<p>La investigaci&#xf3;n que se describe en este art&#xed;culo fue desarrollada dentro de la Plataforma Tem&#xe1;tica Interdisciplinar (PTI) del CSIC &#x201c;El espa&#xf1;ol como lengua de comunicaci&#xf3;n cient&#xed;fica&#x201d; (PTI ES-CIENCIA).</p>
		</ack>
		<ack xml:lang="en">
			<title>Acknowledgements</title>
			<p>The research described in this paper was carried out in the context of the CSIC Interdisciplinary Thematic Platform (PTI) &#x201c;El espa&#xf1;ol como lengua de comunicaci&#xf3;n cient&#xed;fica&#x201d; (PTI ES-CIENCIA).</p>
		</ack>
		<ref-list>
			<label>7.</label>
			<title>Referencias</title>
			<ref id="B1">
				<mixed-citation publication-type="journal">
					<person-group person-group-type="author">
						<string-name>
							<surname>Abiodun</surname>
							<given-names>E. O.</given-names>
						</string-name>
						<string-name>
							<surname>Alabdulatif</surname>
							<given-names>A.</given-names>
						</string-name>
						<string-name>
							<surname>Abiodun</surname>
							<given-names>O. I.</given-names>
						</string-name>
						<string-name>
							<surname>Alawida</surname>
							<given-names>M.</given-names>
						</string-name>
						<string-name>
							<surname>Alabdulatif</surname>
							<given-names>A.</given-names>
						</string-name>
						<string-name>
							<surname>Alkhawaldeh</surname>
							<given-names>R. S.</given-names>
						</string-name>
					</person-group>
					<year>2021</year>
					<article-title>A Systematic Review of emerging Feature Selection Optimization Methods for Optimal Text Classification: The Present State and Prospective Opportunities</article-title>
					<source>Neural Computing and Applications</source>
					<volume>33</volume>
					<issue>22</issue>
					<fpage>15091</fpage>
					<lpage>15118</lpage>
					<pub-id pub-id-type="doi">10.1007/s00521-021-06406-8</pub-id>
				</mixed-citation>
			</ref>
			<ref id="B2">
				<mixed-citation publication-type="journal">
					<person-group person-group-type="author">
						<string-name>
							<surname>Beltr&#xe1;n</surname>
							<given-names>C.</given-names>
						</string-name>
						<string-name>
							<surname>Barbona</surname>
							<given-names>I.</given-names>
						</string-name>
					</person-group>
					<year>2017</year>
					<article-title>Una revisi&#xf3;n de las t&#xe9;cnicas de clasificaci&#xf3;n supervisada en la clasificaci&#xf3;n autom&#xe1;tica de textos</article-title>
					<source>Revista de Epistemolog&#xed;a y Ciencias Humanas</source>
					<volume>9</volume>
					<fpage>78</fpage>
					<lpage>90</lpage>
					<ext-link ext-link-type="uri" xlink:href="http://hdl.handle.net/2133/13776%09">http://hdl.handle.net/2133/13776%09</ext-link>
				</mixed-citation>
			</ref>
			<ref id="B3">
				<mixed-citation publication-type="book">
					<person-group person-group-type="editor">
						<string-name>
							<surname>Black</surname>
							<given-names>P. E.</given-names>
						</string-name>
					</person-group>
					<year>1999</year>
					<chapter-title>Levenshtein Distance</chapter-title>
					<source>Algorithms and Theory of Computation Handbook</source>
				</mixed-citation>
			</ref>
			<ref id="B4">
				<mixed-citation publication-type="thesis">
					<person-group person-group-type="author">
						<string-name>
							<surname>Campos Mochol&#xed;</surname>
							<given-names>M.</given-names>
						</string-name>
					</person-group>
					<year>2021</year>
					<source>Clasificaci&#xf3;n de textos basada en redes neuronales</source>
					<ext-link ext-link-type="uri" xlink:href="https://riunet.upv.es:443/handle/10251/172276">https://riunet.upv.es:443/handle/10251/172276</ext-link>
				</mixed-citation>
			</ref>
			<ref id="B5">
				<mixed-citation publication-type="journal">
					<person-group person-group-type="author">
						<string-name>
							<surname>C&#xe1;rdenas</surname>
							<given-names>J.</given-names>
						</string-name>
						<string-name>
							<surname>Olivares</surname>
							<given-names>G.</given-names>
						</string-name>
						<string-name>
							<surname>Alfaro</surname>
							<given-names>R.</given-names>
						</string-name>
					</person-group>
					<year>2014</year>
					<article-title>Clasificaci&#xf3;n autom&#xe1;tica de textos usando redes de palabras</article-title>
					<source>Revista Signos</source>
					<volume>47</volume>
					<issue>86</issue>
					<fpage>346</fpage>
					<lpage>364</lpage>
					<pub-id pub-id-type="doi">10.4067/S0718-09342014000300001</pub-id>
				</mixed-citation>
			</ref>
			<ref id="B6">
				<mixed-citation publication-type="confproc">
					<person-group person-group-type="author">
						<string-name>
							<surname>Caruana</surname>
							<given-names>R.</given-names>
						</string-name>
						<string-name>
							<surname>Niculescu-Mizil</surname>
							<given-names>A.</given-names>
						</string-name>
					</person-group>
					<year>2006</year>
					<source>An Empirical Comparison of Supervised Learning Algorithms</source>
					<conf-name>Proceedings of the 23rd International Conference on Machine Learning - ICML &#x2019;06</conf-name>
					<fpage>161</fpage>
					<lpage>168</lpage>
					<pub-id pub-id-type="doi">10.1145/1143844.1143865</pub-id>
				</mixed-citation>
			</ref>
			<ref id="B7">
				<mixed-citation publication-type="webpage">
					<person-group person-group-type="author">
						<collab>Cooperaci&#xf3;n Latinoamericana de Redes Avanzadas</collab>
					</person-group>
					<year>2013</year>
					<source>LA Referencia</source>
					<ext-link ext-link-type="uri" xlink:href="https://www.lareferencia.info/">https://www.lareferencia.info/</ext-link>
				</mixed-citation>
			</ref>
			<ref id="B8">
				<mixed-citation publication-type="webpage">
					<person-group person-group-type="author">
						<collab>FECYT</collab>
					</person-group>
					<year>2022</year>
					<source>Recolecta FECYT</source>
					<ext-link ext-link-type="uri" xlink:href="https://recolecta.fecyt.es/">https://recolecta.fecyt.es/</ext-link>
				</mixed-citation>
			</ref>
			<ref id="B9">
				<mixed-citation publication-type="journal">
					<person-group person-group-type="author">
						<string-name>
							<surname>Fleiss</surname>
							<given-names>J. L.</given-names>
						</string-name>
					</person-group>
					<year>1971</year>
					<article-title>Measuring Nominal Scale Agreement among Many Raters</article-title>
					<source>Psychological Bulletin</source>
					<volume>76</volume>
					<issue>5</issue>
					<fpage>378</fpage>
					<lpage>382</lpage>
					<pub-id pub-id-type="doi">10.1037/h0031619</pub-id>
				</mixed-citation>
			</ref>
			<ref id="B10">
				<mixed-citation publication-type="journal">
					<person-group person-group-type="author">
						<string-name>
							<surname>Garc&#xed;a Figuerola</surname>
							<given-names>C.</given-names>
						</string-name>
						<string-name>
							<surname>Berrocal</surname>
							<given-names>J. L. A.</given-names>
						</string-name>
						<string-name>
							<surname>Rodr&#xed;guez</surname>
							<given-names>A. Z.</given-names>
						</string-name>
					</person-group>
					<year>2017</year>
					<article-title>Organizaci&#xf3;n autom&#xe1;tica de documentos mediante t&#xe9;cnicas de an&#xe1;lisis de redes</article-title>
					<source>Scire: Representaci&#xf3;n y Organizaci&#xf3;n Del Conocimiento</source>
					<fpage>25</fpage>
					<lpage>36</lpage>
					<pub-id pub-id-type="doi">10.54886/scire.v1i2.4453</pub-id>
				</mixed-citation>
			</ref>
			<ref id="B11">
				<mixed-citation publication-type="article">
					<person-group person-group-type="author">
						<string-name>
							<surname>Goller</surname>
							<given-names>C.</given-names>
						</string-name>
						<string-name>
							<surname>L&#xf6;ning</surname>
							<given-names>J.</given-names>
						</string-name>
						<string-name>
							<surname>Will</surname>
							<given-names>T.</given-names>
						</string-name>
						<string-name>
							<surname>Wolff</surname>
							<given-names>W.</given-names>
						</string-name>
					</person-group>
					<year>2020</year>
					<source>Automatic Document Classification</source>
					<pub-id pub-id-type="doi">10.5281/ZENODO.4136728</pub-id>
				</mixed-citation>
			</ref>
			<ref id="B12">
				<mixed-citation publication-type="confproc">
					<person-group person-group-type="author">
						<string-name>
							<surname>Granik</surname>
							<given-names>M.</given-names>
						</string-name>
						<string-name>
							<surname>Mesyura</surname>
							<given-names>V.</given-names>
						</string-name>
					</person-group>
					<year>2017</year>
					<source>Fake News Detection Using Naive Bayes Classifier</source>
					<conf-name>2017 IEEE First Ukraine Conference on Electrical and Computer Engineering (UKRCON)</conf-name>
					<fpage>900</fpage>
					<lpage>903</lpage>
					<pub-id pub-id-type="doi">10.1109/UKRCON.2017.8100379</pub-id>
				</mixed-citation>
			</ref>
			<ref id="B13">
				<mixed-citation publication-type="journal">
					<person-group person-group-type="author">
						<string-name>
							<surname>Guti&#xe9;rrez-Fandi&#xf1;o</surname>
							<given-names>A.</given-names>
						</string-name>
						<string-name>
							<surname>Armengol-Estap&#xe9;</surname>
							<given-names>J.</given-names>
						</string-name>
						<string-name>
							<surname>P&#xe0;mies</surname>
							<given-names>M.</given-names>
						</string-name>
						<string-name>
							<surname>Llop-Palao</surname>
							<given-names>J.</given-names>
						</string-name>
						<string-name>
							<surname>Silveira-Ocampo</surname>
							<given-names>J.</given-names>
						</string-name>
						<string-name>
							<surname>Carrino</surname>
							<given-names>C. P.</given-names>
						</string-name>
						<string-name>
							<surname>Gonzalez-Agirre</surname>
							<given-names>A.</given-names>
						</string-name>
						<string-name>
							<surname>Armentano-Oller</surname>
							<given-names>C.</given-names>
						</string-name>
						<string-name>
							<surname>Rodriguez-Penagos</surname>
							<given-names>C.</given-names>
						</string-name>
						<string-name>
							<surname>Villegas</surname>
							<given-names>M.</given-names>
						</string-name>
					</person-group>
					<year>2022</year>
					<article-title>MarIA: Spanish Language Models</article-title>
					<source>Procesamiento del Lenguaje Natural</source>
					<volume>68</volume>
					<fpage>39</fpage>
					<lpage>60</lpage>
				</mixed-citation>
			</ref>
			<ref id="B14">
				<mixed-citation publication-type="confproc">
					<person-group person-group-type="author">
						<string-name>
							<surname>Langley</surname>
							<given-names>P.</given-names>
						</string-name>
						<string-name>
							<surname>Iba</surname>
							<given-names>W.</given-names>
						</string-name>
						<string-name>
							<surname>Thompson</surname>
							<given-names>K.</given-names>
						</string-name>
					</person-group>
					<year>1992</year>
					<source>An Analysis of Bayesian Classifiers</source>
					<conf-name>AAAI&#x2019;92: Proceedings of the Tenth National Conference on Artificial Intelligence</conf-name>
					<fpage>223</fpage>
					<lpage>228</lpage>
					<pub-id pub-id-type="doi">10.5555/1867135.1867170</pub-id>
				</mixed-citation>
			</ref>
			<ref id="B15">
				<mixed-citation publication-type="report">
					<person-group person-group-type="author">
						<string-name>
							<surname>Mccallum</surname>
							<given-names>A.</given-names>
						</string-name>
						<string-name>
							<surname>Nigam</surname>
							<given-names>K.</given-names>
						</string-name>
					</person-group>
					<year>2001</year>
					<article-title>A Comparison of Event Models for Naive Bayes Text Classification</article-title>
					<source>Work Learn Text Categ</source>
					<size units="pages">752</size>
					<ext-link ext-link-type="uri" xlink:href="https://www.cs.cmu.edu/~knigam/papers/multinomial-aaaiws98.pdf">https://www.cs.cmu.edu/~knigam/papers/multinomial-aaaiws98.pdf</ext-link>
				</mixed-citation>
			</ref>
			<ref id="B16">
				<mixed-citation publication-type="journal">
					<person-group person-group-type="author">
						<string-name>
							<surname>Nigam</surname>
							<given-names>K.</given-names>
						</string-name>
						<string-name>
							<surname>Mccallum</surname>
							<given-names>A. K.</given-names>
						</string-name>
						<string-name>
							<surname>Thrun</surname>
							<given-names>S.</given-names>
						</string-name>
						<string-name>
							<surname>Mitchell</surname>
							<given-names>T.</given-names>
						</string-name>
					</person-group>
					<year>2000</year>
					<article-title>Text Classification from Labeled and Unlabeled Documents using EM</article-title>
					<source>Machine Learning</source>
					<volume>39</volume>
					<issue>2</issue>
					<fpage>103</fpage>
					<lpage>134</lpage>
					<pub-id pub-id-type="doi">10.1023/A:1007692713085</pub-id>
				</mixed-citation>
			</ref>
			<ref id="B17">
				<mixed-citation publication-type="webpage">
					<year>2019</year>
					<source>Real Academia Espa&#xf1;ola</source>
					<article-title>CORPES XXI</article-title>
					<ext-link ext-link-type="uri" xlink:href="https://www.rae.es/banco-de-datos/corpes-xxi">https://www.rae.es/banco-de-datos/corpes-xxi</ext-link>
				</mixed-citation>
			</ref>
			<ref id="B18">
				<mixed-citation publication-type="journal">
					<person-group person-group-type="author">
						<string-name>
							<surname>Rodr&#xed;guez Tapia</surname>
							<given-names>S.</given-names>
						</string-name>
						<string-name>
							<surname>Camacho Ca&#xf1;am&#xf3;n</surname>
							<given-names>J.</given-names>
						</string-name>
					</person-group>
					<year>2018</year>
					<article-title>La contribuci&#xf3;n de los m&#xe9;todos de aprendizaje autom&#xe1;tico no supervisado al dise&#xf1;o de m&#xe9;todos para la clasificaci&#xf3;n textual seg&#xfa;n el grado de especializaci&#xf3;n</article-title>
					<source>Sintagma: Revista de Ling&#xfc;&#xed;stica</source>
					<volume>30</volume>
					<fpage>131</fpage>
					<lpage>149</lpage>
					<pub-id pub-id-type="doi">10.21001/sintagma.2018.30.08</pub-id>
				</mixed-citation>
			</ref>
			<ref id="B19">
				<mixed-citation publication-type="journal">
					<person-group person-group-type="author">
						<string-name>
							<surname>Song</surname>
							<given-names>X.</given-names>
						</string-name>
						<string-name>
							<surname>Petrak</surname>
							<given-names>J.</given-names>
						</string-name>
						<string-name>
							<surname>Jiang</surname>
							<given-names>Y.</given-names>
						</string-name>
						<string-name>
							<surname>Singh</surname>
							<given-names>I.</given-names>
						</string-name>
						<string-name>
							<surname>Maynard</surname>
							<given-names>D.</given-names>
						</string-name>
						<string-name>
							<surname>Bontcheva</surname>
							<given-names>K.</given-names>
						</string-name>
					</person-group>
					<year>2021</year>
					<article-title>Classification Aware Neural Topic Model for COVID-19 Disinformation Categorisation</article-title>
					<source>PLOS ONE</source>
					<volume>16</volume>
					<issue>2</issue>
					<elocation-id>e0247086</elocation-id>
					<pub-id pub-id-type="doi">10.1371/journal.pone.0247086</pub-id>
				</mixed-citation>
			</ref>
			<ref id="B20">
				<mixed-citation publication-type="confproc">
					<person-group person-group-type="author">
						<string-name>
							<surname>Stein</surname>
							<given-names>B.</given-names>
						</string-name>
						<string-name>
							<surname>zu Eissen</surname>
							<given-names>S. M.</given-names>
						</string-name>
						<string-name>
							<surname>Potthast</surname>
							<given-names>M.</given-names>
						</string-name>
					</person-group>
					<year>2007</year>
					<source>Strategies for Retrieving Plagiarized Documents</source>
					<conf-name>Proceedings of the 30th Annual International ACM SIGIR Conference on Research and Development in Information Retrieval - SIGIR &#x2019;07</conf-name>
					<fpage>825</fpage>
					<pub-id pub-id-type="doi">10.1145/1277741.1277928</pub-id>
				</mixed-citation>
			</ref>
			<ref id="B21">
				<mixed-citation publication-type="webpage">
					<source>The Conversation, Spanish Edition</source>
					<year>2020</year>
					<ext-link ext-link-type="uri" xlink:href="https://theconversation.com/es">https://theconversation.com/es</ext-link>
				</mixed-citation>
			</ref>
			<ref id="B22">
				<mixed-citation publication-type="book">
					<person-group person-group-type="author">
						<string-name>
							<surname>Vapnik</surname>
							<given-names>V. N.</given-names>
						</string-name>
					</person-group>
					<year>1995</year>
					<source>The Nature of Statistical Learning Theory</source>
					<publisher-name>Springer</publisher-name>
					<publisher-loc>New York</publisher-loc>
					<pub-id pub-id-type="doi">10.1007/978-1-4757-2440-0</pub-id>
				</mixed-citation>
			</ref>
			<ref id="B23">
				<mixed-citation publication-type="book">
					<person-group person-group-type="author">
						<string-name>
							<surname>Vaswani</surname>
							<given-names>A.</given-names>
						</string-name>
						<string-name>
							<surname>Shazeer</surname>
							<given-names>N.</given-names>
						</string-name>
						<string-name>
							<surname>Parmar</surname>
							<given-names>N.</given-names>
						</string-name>
						<string-name>
							<surname>Uszkoreit</surname>
							<given-names>J.</given-names>
						</string-name>
						<string-name>
							<surname>Jones</surname>
							<given-names>L.</given-names>
						</string-name>
						<string-name>
							<surname>Gomez</surname>
							<given-names>A. N.</given-names>
						</string-name>
						<string-name>
							<surname>Kaiser</surname>
							<given-names>&#x141;. ukasz</given-names>
						</string-name>
						<string-name>
							<surname>Polosukhin</surname>
							<given-names>I.</given-names>
						</string-name>
					</person-group>
					<year>2017</year>
					<chapter-title>Attention is All you Need</chapter-title>
					<person-group person-group-type="editor">
						<string-name>
							<surname>Guyon</surname>
							<given-names>I.</given-names>
						</string-name>
						<string-name>
							<surname>Luxburg</surname>
							<given-names>U. von</given-names>
						</string-name>
						<string-name>
							<surname>Bengio</surname>
							<given-names>S.</given-names>
						</string-name>
						<string-name>
							<surname>Wallach</surname>
							<given-names>H.</given-names>
						</string-name>
						<string-name>
							<surname>Fergus</surname>
							<given-names>R.</given-names>
						</string-name>
						<string-name>
							<surname>Vishwanathan</surname>
							<given-names>S.</given-names>
						</string-name>
						<string-name>
							<surname>Garnett</surname>
							<given-names>R.</given-names>
						</string-name>
					</person-group>
					<source>Advances in Neural Information Processing Systems</source>
					<size units="pages">30</size>
					<publisher-name>Curran Associates, Inc.</publisher-name>
					<ext-link ext-link-type="uri" xlink:href="https://proceedings.neurips.cc/paper/2017/file/3f5ee243547dee91fbd053c1c4a845aa-Paper.pdf">https://proceedings.neurips.cc/paper/2017/file/3f5ee243547dee91fbd053c1c4a845aa-Paper.pdf</ext-link>
				</mixed-citation>
			</ref>
			<ref id="B24">
				<mixed-citation publication-type="confproc">
					<person-group person-group-type="author">
						<string-name>
							<surname>Winkler</surname>
							<given-names>W. E.</given-names>
						</string-name>
					</person-group>
					<year>1990</year>
					<source>String Comparator Metrics and Enhanced Decision Rules in the Fellegi-Sunter Model of Record Linkage</source>
					<conf-name>Proceedings of the Section on Survey Research</conf-name>
					<fpage>354</fpage>
					<lpage>359</lpage>
				</mixed-citation>
			</ref>
		</ref-list>
	</back>
</article>