<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE article PUBLIC "-//NLM//DTD Journal Publishing DTD v3.0 20080202//EN" "journalpublishing3.dtd">
<article article-type="research-article" dtd-version="3.0" xml:lang="es" xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink">
	
	<front>
		
		<journal-meta>
			<journal-id journal-id-type="publisher-id">REDC</journal-id>
			<journal-title-group>
				<journal-title>Revista Espa&#x00F1;ola de Documentaci&#x00F3;n Cient&#x00ED;fica</journal-title>
				<abbrev-journal-title>Rev. Esp. Doc. Cient.</abbrev-journal-title>
			</journal-title-group>
			<issn pub-type="ppub">0210-0614</issn>
			<issn pub-type="epub">1988-4621</issn>
			<publisher>
				<publisher-name>Consejo Superior de Investigaciones Cient&#x00ED;ficas</publisher-name>
			</publisher>
		</journal-meta>
		
		<article-meta>
			<article-id pub-id-type="publisher-id">redc.2016.2.1236</article-id>
			<article-id pub-id-type="doi">10.3989/redc.2016.2.1236</article-id>
			
			<article-categories>
				<subj-group subj-group-type="heading">
				<subject>NOTAS Y EXPERIENCIAS / NOTES AND EXPERIENCES</subject>
				</subj-group>
			</article-categories>
			
			<title-group>
				<article-title>Titulaci&#x00F3;n autom&#x00E1;tica de preguntas en encuestas electorales</article-title>
				<trans-title-group xml:lang="en">
				<trans-title>Automatic Titling of Election Survey Questions</trans-title>
				</trans-title-group>
				<alt-title alt-title-type="running-head">Titulaci&#x00F3;n autom&#x00E1;tica de preguntas en encuestas electorales</alt-title>
			</title-group>
			
			<contrib-group>
		
				<contrib contrib-type="author" corresp="yes">
					<name>
					 <surname>Gallardo</surname>
					 <given-names>Carolina</given-names>
					</name>
					<xref ref-type="aff" rid="U1"/>
					<xref ref-type="corresp" rid="cor1"/>
				</contrib>
				
				<contrib contrib-type="author" corresp="yes">
					<name>
					 <surname>Carde&#x00F1;osa</surname>
					 <given-names>Jes&#x00FA;s</given-names>
					</name>
					<xref ref-type="aff" rid="U2"/>
					<xref ref-type="corresp" rid="cor2"/>
				</contrib>
		
				<aff id="U1">Departmento de Sistemas de Informaci&#x00F3;n, Escuela T&#x00E9;cnica Superior de Sistemas Inform&#x00E1;ticos. Universidad Polit&#x00E9;cnica de Madrid</aff>
				<aff id="U2">Grupo de Validaci&#x00F3;n y Aplicaciones Industriales. ETS de Ingenieros Inform&#x00E1;ticos. Universidad Polit&#x00E9;cnica de Madrid</aff>
				
			</contrib-group>
			
			<author-notes>
				<corresp id="cor1">e-mail: <email xlink:href="cgallardo@eui.upm.es">cgallardo@eui.upm.es</email></corresp>
				<corresp id="cor2">e-mail: <email xlink:href="carde@fi.upm.es">carde@fi.upm.es</email></corresp>
			</author-notes>
			
			<pub-date pub-type="epub">
				<day>30</day>
				<month>06</month>
				<year>2016</year>
			</pub-date>
			
			<pub-date pub-type="collection">
			<year>2016</year>
			</pub-date>
			
			<volume>39</volume>
			<issue>2</issue>
		
			<elocation-id>e133</elocation-id>
		
			<history>
			
				<date date-type="received">
					<day>11</day>
					<month>11</month>
					<year>2014</year>
				</date>
				<date date-type="rev-recd1">
					<day>16</day>
					<month>03</month>
					<year>2015</year>
				</date>
				<date date-type="accepted">
					<day>28</day>
					<month>07</month>
					<year>2015</year>
				</date>
			</history>
		 
			<permissions>
				<copyright-statement>&#x00A9; 2016 CSIC</copyright-statement>
				<copyright-year>2016</copyright-year>
				<license license-type="open-access" xlink:href="http://creativecommons.org/licenses/by-nc/3.0/">
					<license-p>Este es un art&#x00ED;culo de acceso abierto distribuido bajo los t&#x00E9;rminos de la licencia Creative Commons Attribution-Non Commercial (by-nc) Spain 3.0.</license-p>
				</license>
			</permissions>
		
			
			<abstract xml:lang="es">
			<title>RESUMEN</title>
			<p>Este art&#x00ED;culo describe el trabajo realizado para la generaci&#x00F3;n autom&#x00E1;tica de los t&#x00ED;tulos de las preguntas pertenecientes a las encuestas de opini&#x00F3;n que existen en las bases de datos del CIS (Centro de Investigaciones Sociol&#x00F3;gicas). Dentro del contexto del CIS, el t&#x00ED;tulo de una pregunta debe cumplir dos requisitos: desde el punto de vista de la forma, debe ser gramaticalmente correcto y tener un estilo similar a los ya existentes; y, desde el punto de vista del contenido, debe albergar el tema de la pregunta y las distintas categor&#x00ED;as de respuesta. Estas restricciones en cuanto a la forma y al contenido de los t&#x00ED;tulos desaconsejan el uso de t&#x00E9;cnicas empleadas en problemas similares, como el resumen autom&#x00E1;tico o aprendizaje autom&#x00E1;tico con corpus de entrenamiento, a favor de una metodolog&#x00ED;a basada en el an&#x00E1;lisis y conocimiento del dominio. Para ilustrar el an&#x00E1;lisis y la estrategia de resoluci&#x00F3;n del problema seguidos, hemos seleccionado las preguntas relacionadas con temas electorales, debido a la importancia estrat&#x00E9;gica y a la especializaci&#x00F3;n del CIS en este tipo de encuestas. Se describe en detalle el procedimiento seguido y la evaluaci&#x00F3;n de los resultados, valorando tanto los aspectos cualitativos como los cuantitativos. La evaluaci&#x00F3;n muestra que el 88,73% de los t&#x00ED;tulos generados cumplen estrictamente con los requisitos de forma y contenido impuestos por el CIS, lo que supone un ahorro en el trabajo manual del personal cualificado de la instituci&#x00F3;n.</p>
			</abstract>
						
			<trans-abstract xml:lang="en">
			<title>ABSTRACT</title>
			<p>This paper describes the work carried out for automatically generating titles for questions included in the opinion polls contained in CIS databases (Centro de Investigaciones Sociol&#x00F3;gicas – Spanish Center of Sociological Research). In the context of CIS, the title of a question should meet two requirements: from the point of view of form, it has to be grammatically correct and similar in style to existing ones; from the point of view of content, it must contain the subject of the question and the different options for answering. These conditions for form and content of titles discourage the use of techniques used in similar problems, such as automatic abstracting or machine learning with a training corpus, but rather favor a methodology based on an analysis and knowledge of the domain. To illustrate the analysis and the resolution strategy of the problem, we have selected a set of questions related to elections, due to their strategic importance and to CIS’s own specialization in opinion polls. The process followed and the subsequent evaluation of results are discussed in detail, with an assessment of both qualitative and quantitative aspects. The evaluation shows that 88.73% of the generated titles are in strict accordance with CIS’s requisites on form and content, resulting in reduced time spent by the institution’s qualified personnel on manual work.</p>
			</trans-abstract>

			<kwd-group xml:lang="es">
				<title>PALABRAS CLAVE</title> 
				<kwd>Miner&#x00ED;a de textos</kwd>
				<kwd>recuperaci&#x00F3;n de informaci&#x00F3;n</kwd>
				<kwd>filtrado</kwd>
				<kwd>clasificaci&#x00F3;n</kwd>
				<kwd>resumen y visualizaci&#x00F3;n</kwd>
				<kwd>titulaci&#x00F3;n autom&#x00E1;tica</kwd>
				<kwd>extracci&#x00F3;n de informaci&#x00F3;n</kwd>
				<kwd>encuestas de opini&#x00F3;n</kwd>
			</kwd-group>

			<kwd-group xml:lang="en"> 
				<title>KEYWORDS</title> 
				<kwd>Automatic titling</kwd>
				<kwd>information extraction</kwd>
				<kwd>opinion polls</kwd>
				<kwd>abstracting</kwd>
			</kwd-group>
		
		</article-meta>
	</front>
	
	<body>

		<sec id="S1">
			<title>1. INTRODUCCI&#x00D3;N</title>

			<p>La amplia variedad de elementos sobre los que trabajan los sistemas de b&#x00FA;squeda, como noticias de prensa con encabezados y t&#x00ED;tulos a modo de campos de b&#x00FA;squeda activos, preguntas para la creaci&#x00F3;n de encuestas de opini&#x00F3;n o materiales audiovisuales, representan diferentes contextos en los que el <italic>t&#x00ED;tulo</italic> es un concepto clave que sirve para guiar y efectuar la b&#x00FA;squeda. Es decir, un t&#x00ED;tulo puede usarse para clasificar, efectuar b&#x00FA;squedas o indizar recursos. Por ello, no es raro que exista inter&#x00E9;s tanto en identificar y extraer t&#x00ED;tulos de documentos sin formato como en intentar generarlos autom&#x00E1;ticamente en una amplia variedad de unidades textuales: desde colecciones de documentos, emisiones de eventos deportivos, documentos individuales o noticias (generaci&#x00F3;n de titulares).</p>

			<p>El CIS (Centro de Investigaciones Sociol&#x00F3;gicas) es una instituci&#x00F3;n oficial que lleva encuestando a la sociedad espa&#x00F1;ola desde 1960. Aparte de liderar la investigaci&#x00F3;n sociol&#x00F3;gica en Espa&#x00F1;a, una de sus tareas es distribuir la informaci&#x00F3;n relativa a los resultados de las encuestas a periodistas, investigadores o a cualquier ciudadano. Por lo tanto, requiere de un sistema que busque, indexe y recupere unidades de informaci&#x00F3;n como son las preguntas provenientes de miles de encuestas de finales de los a&#x00F1;os sesenta hasta la fecha. Este art&#x00ED;culo describe el procedimiento seguido para automatizar el proceso de generaci&#x00F3;n de t&#x00ED;tulos en todas las preguntas sin t&#x00ED;tulo que aparecen en las bases de datos de encuestas del CIS. La titulaci&#x00F3;n automatizada formaba parte de una serie de tareas que persegu&#x00ED;a la homogeneizaci&#x00F3;n y unificaci&#x00F3;n de todas las bases de datos de esta instituci&#x00F3;n, cuyo principal objetivo era generar t&#x00ED;tulos de alta calidad a trav&#x00E9;s del uso de tecnolog&#x00ED;as r&#x00E1;pidas y baratas.</p>

			<p>En principio, si consideramos un t&#x00ED;tulo como un resumen condensado, el proceso de titulaci&#x00F3;n puede considerarse asimismo como una tarea de resumen, de manera que las t&#x00E9;cnicas desarrolladas en esta &#x00E1;rea se podr&#x00ED;an aplicar al problema del titulaci&#x00F3;n. De hecho, en sus inicios, la titulaci&#x00F3;n autom&#x00E1;tica se ha abordado mediante t&#x00E9;cnicas pensadas para el resumen de textos, como las denominadas “extractivas” (Goldstein y otros, <xref ref-type="bibr" rid="CIT04">1999</xref>). No obstante, existen diferencias notables entre un t&#x00ED;tulo y un resumen que hacen que se descarte la idea de aplicar t&#x00E9;cnicas extractivas a la tarea de generaci&#x00F3;n de t&#x00ED;tulos. En primer lugar, los t&#x00ED;tulos est&#x00E1;n sujetos a fuertes restricciones de forma, estilo y extensi&#x00F3;n que cada &#x00E1;mbito de aplicaci&#x00F3;n impone. En (Garc&#x00ED;a-Guti&#x00E9;rrez, <xref ref-type="bibr" rid="CIT03">2014</xref>), se apunta la dificultad del tratamiento de los titulares de noticias debido a la presencia de elementos ret&#x00F3;ricos en los mismos, mientras que las caracter&#x00ED;sticas que definen a un buen resumen no dependen tanto del &#x00E1;mbito de aplicaci&#x00F3;n. Asimismo, es importante resaltar la relevancia cognitiva del t&#x00ED;tulo frente al resumen: se trata de una pieza clave en un espacio de informaci&#x00F3;n (Mart&#x00ED;nez-&#x00C1;vila y otros, <xref ref-type="bibr" rid="CIT09">2014</xref>) con funciones de clasificaci&#x00F3;n, indexaci&#x00F3;n o incluso como elemento orientado a capturar atenci&#x00F3;n del lector.</p>

			<p>Teniendo en cuenta c&#x00F3;mo el &#x00E1;mbito de aplicaci&#x00F3;n determina la forma y la idoneidad de un t&#x00ED;tulo, cualquier t&#x00E9;cnica (como la extractiva) que no incorpore las restricciones particulares de un &#x00E1;mbito en particular y que pueda producir resultados incoherentes e incorrectos resulta inadecuada para la tarea de generaci&#x00F3;n de t&#x00ED;tulos. En este sentido, la titulaci&#x00F3;n ha desarrollado sus propias t&#x00E9;cnicas y metodolog&#x00ED;as, evolucionando hacia modelos de aprendizaje autom&#x00E1;tico (Jin y Hauptmann, <xref ref-type="bibr" rid="CIT06">2001</xref>), dependientes del &#x00E1;mbito de aplicaci&#x00F3;n y de la existencia de corpus de entrenamiento anteriores de documentos que est&#x00E1;n titulados.</p>

			<p>Los sistemas basados en el corpus de entrenamiento y en el aprendizaje autom&#x00E1;tico son m&#x00E1;s robustos por norma general que los basados en modelos extractivos y producen t&#x00ED;tulos de mejor calidad (Jin y Hauptmann, <xref ref-type="bibr" rid="CIT07">2002</xref>), ya que tienen en cuenta el estilo y las restricciones de extensi&#x00F3;n impuestas en cada &#x00E1;mbito. El uso de t&#x00E9;cnicas de aprendizaje autom&#x00E1;tico explota el conocimiento subyacente del corpus formado por documentos titulados y disponibles con el objetivo de emplear ese conocimiento para adaptar los nuevos t&#x00ED;tulos generados a los ya existentes.</p>

			<p>En el &#x00E1;rea de resumen, pero, especialmente, en la titulaci&#x00F3;n, se ha hecho &#x00E9;nfasis en los enfoques estad&#x00ED;sticos y probabil&#x00ED;sticos, en contraposici&#x00F3;n con los modelos simb&#x00F3;licos basados en la ling&#x00FC;&#x00ED;stica (Sp&#x00E4;rck Jones, <xref ref-type="bibr" rid="CIT10">2007</xref>). El trabajo aqu&#x00ED; descrito comparte con los que est&#x00E1;n basados en las t&#x00E9;cnicas de aprendizaje autom&#x00E1;tico la dependencia del &#x00E1;mbito, por lo que busca generar t&#x00ED;tulos <italic>parecidos a los ya existentes</italic>, pero depende m&#x00E1;s de los basados en el conocimiento del dominio que en los emp&#x00ED;ricos. En esencia, seguimos un enfoque basado en patrones, un enfoque cl&#x00E1;sico en Inteligencia Artificial que se ha aplicado en una amplia variedad de tareas, como la extracci&#x00F3;n de eventos en la web (Hung y otros, <xref ref-type="bibr" rid="CIT05">2010</xref>) , la poblaci&#x00F3;n de ontolog&#x00ED;as (Liu y otros, <xref ref-type="bibr" rid="CIT08">2011</xref>), la respuesta de preguntas y la extracci&#x00F3;n de informaci&#x00F3;n (Cui y otros, <xref ref-type="bibr" rid="CIT01">2007</xref>; Spasic y otros, <xref ref-type="bibr" rid="CIT11">2010</xref>), por mencionar algunas de las aproximaciones m&#x00E1;s recientes.</p>

			<p>Hemos considerado la titulaci&#x00F3;n de preguntas como una tarea de extracci&#x00F3;n de la informaci&#x00F3;n m&#x00E1;s que como un problema de resumen de contenidos. Mientras que en (Gallardo y otros, <xref ref-type="bibr" rid="CIT02">2011</xref>) damos una imagen de conjunto del problema del &#x00E1;mbito, este art&#x00ED;culo detalla y se centra en las preguntas electorales, como motivo de su importancia cualitativa en el CIS.</p>
		</sec>	

		<sec id="S2">

		
			<title>2. PREGUNTAS ELECTORALES: AN&#x00C1;LISIS Y TIPOLOG&#x00CD;A</title>

			<p>Una <bold>pregunta</bold> es un texto corto cuyo objetivo es recopilar el valor de una o m&#x00E1;s variables sociol&#x00F3;gicas y sus distintas opciones de respuesta. Una variable sociol&#x00F3;gica puede variar desde informaci&#x00F3;n objetiva del entrevistado (como su situaci&#x00F3;n laboral, nivel de educaci&#x00F3;n o edad) a la opini&#x00F3;n del mismo acerca de un tema o persona p&#x00FA;blica en concreto. Por lo tanto, el t&#x00ED;tulo de una pregunta debe contener dos tipos de informaci&#x00F3;n:</p>
						
						<list list-type="bullet">
							<list-item>
								<p>Palabra clave: generalmente, una palabra o un t&#x00E9;rmino que sugiera las categor&#x00ED;as de respuesta de la pregunta. Por ejemplo, “Grado”, “Evaluaci&#x00F3;n”, “Aprobaci&#x00F3;n”, “Preferencia”, etc.</p>
							</list-item>
							
							<list-item>
								<p> Tema: una expresi&#x00F3;n nominal que resuma los contenidos de la pregunta (“simpat&#x00ED;a hacia movimientos sociales”, “labor del presidente de la Comunidad Aut&#x00F3;noma”, “diferentes alternativas de organizaci&#x00F3;n del estado”.</p>
							</list-item>
						</list>
			
			<p>La <xref ref-type="fig" rid="F1">Figura 1</xref> muestra dos ejemplos de preguntas. La Pregunta <italic>a</italic> es un ejemplo de estructura sin t&#x00ED;tulo, perteneciente a un estudio de 1965, y la Pregunta <italic>b</italic>, bastante m&#x00E1;s reciente, est&#x00E1; dotada de una estructura mucho m&#x00E1;s rica.</p>
			
			
					<fig id="F1">
						<label>Figura 1</label>
						<caption>
							<title>Dos preguntas modelo con niveles de estructuraci&#x00F3;n diferentes</title>
						</caption>
						<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="../images/F1.jpg"/>
					</fig>
						

			<p>Debido a la coexistencia de formatos distintos, el CIS decidi&#x00F3; homogeneizar sus bases de datos y procesar autom&#x00E1;ticamente las preguntas cuyas partes no est&#x00E1;n identificadas para obtener entidades estructuradas, incluyendo la tarea de titular las preguntas. A la hora del procesamiento, hab&#x00ED;a un total de 84.769 preguntas almacenadas en la base de datos, de las que 39.257 hab&#x00ED;an sido tituladas manualmente por el personal del CIS y usadas como modelo de referencia para definir distintos tipos de t&#x00ED;tulos y 45.512 preguntas no hab&#x00ED;an sido tituladas, as&#x00ED; que se convirtieron en nuestro objetivo.</p>

			<p>La hip&#x00F3;tesis en la que trabajaremos es la de intentar automatizar el procedimiento que realiza el personal del CIS, teniendo en cuenta las restricciones de su propio &#x00E1;mbito, e intentar aplicar estas restricciones en las preguntas sin t&#x00ED;tulo. De esta forma, aseguramos tanto homogeneidad como uniformidad en los nuevos t&#x00ED;tulos en comparaci&#x00F3;n con los ya existentes. Para hacerlo, nos vamos a centrar en el an&#x00E1;lisis de la relaci&#x00F3;n de naturaleza predominantemente ling&#x00FC;&#x00ED;stica entre una pregunta y su t&#x00ED;tulo. Este trabajo sigue por tanto un enfoque basado en el conocimiento del dominio.</p>

			<p>Para realizar un an&#x00E1;lisis de dominio, la primera tarea que se abord&#x00F3; fue la descripci&#x00F3;n y clasificaci&#x00F3;n de las preguntas y sus t&#x00ED;tulos, prestando atenci&#x00F3;n a aspectos como el n&#x00FA;mero total de t&#x00ED;tulos distintivos y sus frecuencias, los temas m&#x00E1;s frecuentes o la estructura gramatical de los mismos. Estos aspectos se describen a continuaci&#x00F3;n.</p>


		<sec id="S2.1">
			<title>2.1. Temas presentes en los t&#x00ED;tulos </title>

			<p>Los temas relacionados con las preguntas electorales resultan ser uno de los m&#x00E1;s significativos y demandados por la poblaci&#x00F3;n y los medios especializados. Los temas que definen a las preguntas electorales son los siguientes:</p>
			
				<list list-type="bullet">
					<list-item>
						<p>Afinidad y simpat&#x00ED;a con respecto a los partidos pol&#x00ED;ticos</p>
					</list-item>
					
					<list-item>
						<p>Conocimiento sobre las afiliaci&#x00F3;n pol&#x00ED;tica de los l&#x00ED;deres pol&#x00ED;ticos</p>
					</list-item>
					
					<list-item>
						<p> Conocimiento de los esl&#x00F3;ganes electorales</p>
					</list-item>
					
					<list-item>
						<p> Escala de la ubicaci&#x00F3;n ideol&#x00F3;gica de partidos pol&#x00ED;ticos</p>
					</list-item>
					
					<list-item>
						<p> Fidelidad en el voto en las elecciones</p>
					</list-item>
					
					<list-item>
						<p> Intenci&#x00F3;n de voto (<italic>se incluyen varias configuraciones y distintos tipos de votantes </italic>)</p>
					</list-item>
					
					<list-item>
						<p>Momento de voto o decisi&#x00F3;n de abstenci&#x00F3;n</p>
					</list-item>
					
					<list-item>
						<p> Razones de votar X /de no votar (<italic>se incluyen varias configuraciones </italic>)</p>
					</list-item>
					
					<list-item>
						<p>Participaci&#x00F3;n electoral com&#x00FA;n </p>
					</list-item>
					
					<list-item>
						<p>Participaci&#x00F3;n en unas elecciones dadas (<italic>en el pasado o futuro</italic>)</p>
					</list-item>
					
					<list-item>
						<p>Partido por el que no votar&#x00E1;n</p>
					</list-item>

					<list-item>
						<p> Partido que prefieren que gane</p>
					</list-item>
					
					<list-item>
						<p>Predicci&#x00F3;n electoral</p>
					</list-item>
					
					<list-item>
						<p> Prioridades (partido o candidato) en la decisi&#x00F3;n del voto</p>
					</list-item>
					
					<list-item>
						<p>Recuerdo de voto (<italic>distinguiendo los distintos tipos de votantes </italic>)</p>
					</list-item>
					
					<list-item>
						<p>Las opiniones del encuestado acerca del partido votado en las elecciones pasadas .</p>
					</list-item>
				</list>
		</sec>

		
		<sec id="S2.2">	
			<title>2.2. Estructuras gramaticales de los t&#x00ED;tulos</title>

			<p>Aunque las preguntas electorales son bastante homog&#x00E9;neas y uniformes en su formulaci&#x00F3;n, se requiere ver c&#x00F3;mo se relacionan las unas con las otras desde un punto de vista ling&#x00FC;&#x00ED;stico, considerando aspectos como qu&#x00E9; contenidos est&#x00E1;n presentes en el t&#x00ED;tulo y c&#x00F3;mo se expresan (par&#x00E1;frasis, interpretaci&#x00F3;n, resumen creativo, reformulaci&#x00F3;n completa o repetici&#x00F3;n exacta). Se observan tres tipos de relaciones ling&#x00FC;&#x00ED;sticas:</p>


		<sec id="S2.2.1">
			<title>A. El t&#x00ED;tulo es una interpretaci&#x00F3;n de las variables o de las categor&#x00ED;as de respuesta </title>

			<p>Es frecuente que en algunas preguntas, como las multivariables (con distintas posibilidades de respuesta para una misma pregunta), el t&#x00ED;tulo sea un resumen o incluso una interpretaci&#x00F3;n de todas las variables que se incluyen en la pregunta. Veamos el ejemplo siguiente:</p>


			<p><bold>T&#x00ED;tulo: Opini&#x00F3;n sobre el voto diferenciado a partidos dependiendo del tipo de convocatoria</bold></p>

			<p>Me gustar&#x00ED;a que me dijera, ahora, si Ud. est&#x00E1; m&#x00E1;s bien de acuerdo o m&#x00E1;s bien en desacuerdo con cada una de las siguientes frases. --</p>

												<p>De acuerdo  		 En desacuerdo</p>

				<list list-type="bullet">
					<list-item>
						<p>En las elecciones auton&#x00F3;micas es  mejor votar a un partido propio de la Comunidad Aut&#x00F3;noma.</p>
					</list-item>
					
					<list-item>
						<p>Lo l&#x00F3;gico es votar siempre al partido que est&#x00E1; m&#x00E1;s cerca de las propias ideas, independientemente de que las elecciones sean generales o auton&#x00F3;micas.</p>
					</list-item>
					
					<list-item>
						<p>En cualquier tipo de elecciones lo m&#x00E1;s importante son los candidatos.</p>
					</list-item>
					
					<list-item>
						<p>En las elecciones auton&#x00F3;micas es mejor votar a un partido distinto  al que est&#x00E9; en el Gobierno Central, para evitar que gobierne el mismo en todas las instituciones.</p>
					</list-item>
				</list>


			<p>En este caso, el t&#x00ED;tulo es un resumen de las distintas opciones de voto que expresa cada variable (votar al mismo partido, a partidos locales, etc.). Puesto que la tarea de titulaci&#x00F3;n se abordar&#x00E1; como un proceso de extracci&#x00F3;n de la informaci&#x00F3;n, no idearemos t&#x00E9;cnicas que requieran la comprensi&#x00F3;n o interpretaci&#x00F3;n del texto para obtener el tema de la pregunta.</p>
		</sec>

		
		<sec id="S2.2.2">
			<title>B. El t&#x00ED;tulo es una nominalizaci&#x00F3;n o par&#x00E1;frasis</title>

			<p>En este tipo de relaci&#x00F3;n, parte del t&#x00ED;tulo es una sustantivaci&#x00F3;n o par&#x00E1;frasis de un fragmento de la pregunta con ligeras variaciones. En la siguiente pregunta, la expresi&#x00F3;n inicial “Visi&#x00F3;n” es una sustantivaci&#x00F3;n y simplificaci&#x00F3;n del sintagma verbal “ver en televisi&#x00F3;n”:</p>
		
			<p><bold>T&#x00ED;tulo: Visi&#x00F3;n en televisi&#x00F3;n de propaganda electoral</bold></p>

			<p>P21  ¿Ha visto Ud. por televisi&#x00F3;n alg&#x00FA;n espacio de propaganda electoral de alg&#x00FA;n partido o coalici&#x00F3;n?—</p>

						
				<list list-type="bullet">
					<list-item>
						<p>S&#x00ED;    (Pasar a P21a)</p>
					</list-item>
					
					<list-item>
						<p>No</p>
					</list-item>
					
					<list-item>
						<p>N.C.</p>
					</list-item>
				</list>
				
		</sec>	

		<sec id="S2.2.3">
			<title>C. El t&#x00ED;tulo es un fragmento exacto de la pregunta</title>

			<p>Por &#x00FA;ltimo, el tema del t&#x00ED;tulo puede ser un fragmento exacto del texto de la pregunta, tal como ocurre en la siguiente pregunta:</p>

			<p><bold>T&#x00ED;tulo: Valoraci&#x00F3;n de los resultados electorales en las &#x00FA;ltimas elecciones auton&#x00F3;micas y municipales</bold></p>

			<p>P.23 En conjunto, y con independencia de sus preferencias personales, ¿c&#x00F3;mo valora los resultados de las &#x00FA;ltimas elecciones municipales y auton&#x00F3;micas?–</p>

						
					<list list-type="bullet">
						<list-item>
							<p>M&#x00E1;s bien positivamente</p>
						</list-item>
						
						<list-item>
							<p>M&#x00E1;s bien negativamente</p>
						</list-item>
						
						<list-item>
							<p>N.S./ N.C.</p>
						</list-item>
					</list>

			<p>Intuitivamente, el primer tipo de relaci&#x00F3;n (el tema como una interpretaci&#x00F3;n de variables) requerir&#x00E1; un tipo de procesamiento distinto de B (nominalizaci&#x00F3;n) y C (fragmento). La interpretaci&#x00F3;n de variables implica, en principio, un procesamiento de sem&#x00E1;ntica profunda, mientras que, para el resto de relaciones, el problema de titulaci&#x00F3;n se podr&#x00ED;a solucionar mediante un proceso de extracci&#x00F3;n de la informaci&#x00F3;n que sea relevante para el t&#x00ED;tulo.</p>
		</sec>
		</sec>
		</sec>

		<sec id="S3">

			<title>3. PROCESAMIENTO Y RESULTADOS</title>

			<p>La metodolog&#x00ED;a y estrategia que se va a seguir consiste en un n&#x00FA;mero de pasos basados en los hallazgos de la fase previa de an&#x00E1;lisis, a saber:</p>

				<list list-type="order">
					<list-item>
						<p><bold>Preprocesamiento de la pregunta.</bold> En esta fase, los archivos de entrada se transforman en un formato adecuado para su procesamiento.</p>
					</list-item>
					
					<list-item>
						<p><bold>Definici&#x00F3;n de reglas para el procesamiento de preguntas y la composici&#x00F3;n del t&#x00ED;tulo.</bold> El desarrollo de esta tarea est&#x00E1; determinado por las observaciones y conclusiones derivadas de la fase de an&#x00E1;lisis.</p>
					</list-item>
					
					<list-item>
						<p><bold>Resultados y evaluaci&#x00F3;n.</bold> Cuando se generen los t&#x00ED;tulos, estos deben ser evaluados. En este paso, el personal del CIS tiene un papel importante.</p>
					</list-item>
				</list>
			
			
		<sec id="S3.1">
			<title>3.1. Preprocesamiento de la pregunta</title>
				
			<p>En esta tarea, se limpian los caracteres no imprimibles y se identifican y delimitan claramente las preguntas, con el objetivo de facilitar el procesamiento de cadenas. Para este problema espec&#x00ED;fico, todas las preguntas sin <italic>t&#x00ED;tulo</italic> fueron extra&#x00ED;das y llevadas a un archivo de texto con la siguiente informaci&#x00F3;n:</p>
						
					<list list-type="bullet">
						<list-item>
							<p>Un identificador num&#x00E9;rico.</p>
						</list-item>
						
						<list-item>
							<p>El texto completo de la pregunta, que puede contener otros elementos, como instrucciones para el encuestador, m&#x00FA;ltiples variables y categor&#x00ED;as de respuesta.</p>
						</list-item>
					</list>
			</sec>
			
			
		<sec id="S3.2">	
			 <title>3.2. Reglas para el procesamiento de preguntas electorales</title>

			<p>En esta tarea se codifican las reglas para la extracci&#x00F3;n de elementos y la producci&#x00F3;n de t&#x00ED;tulos. Las preguntas electorales pueden requerir un tipo de informaci&#x00F3;n concreta, como el partido votado o el reconocimiento de esl&#x00F3;ganes, u opiniones y valoraciones relativas a las elecciones. Cada tema especificado en la secci&#x00F3;n 3 define un tipo de pregunta de modo que se definen una o varias reglas con un objetivo doble: identificar el tipo de pregunta y extraer la informaci&#x00F3;n requerida para la composici&#x00F3;n del t&#x00ED;tulo. Adem&#x00E1;s, hay otro elemento: el <italic>tipo de elecciones</italic> (regionales, municipales, nacionales o europeas), que ha de ser identificado en el texto de la pregunta e incorporado en el t&#x00ED;tulo. Por tanto, la estrategia general para estas preguntas es:</p>
			
						
					<list list-type="alpha-lower">
						<list-item>
							<p>Identificaci&#x00F3;n del tipo de pregunta.</p>
						</list-item>
						
						<list-item>
							<p>Identificaci&#x00F3;n de los elementos de la pregunta que sugieran la palabra clave y el tema.</p>
						</list-item>
						
						<list-item>
							<p>Identificaci&#x00F3;n del <italic>tipo de elecciones</italic>.</p>
						</list-item>
						
						<list-item>
							<p>Composici&#x00F3;n del t&#x00ED;tulo con los elementos encontrados.</p>
						</list-item>
					</list>
			
			 <p>A continuaci&#x00F3;n, se describen en detalle las reglas para uno de los tipos m&#x00E1;s paradigm&#x00E1;ticos, uniformes y frecuentes de preguntas sobre los tipos de elecciones: <italic>Predicci&#x00F3;n electoral, </italic>junto con la regla para el <italic>Tipo de elecciones</italic>.</p>

			<p>Desde un punto de vista sociol&#x00F3;gico y haciendo frente a elecciones futuras, resulta m&#x00E1;s interesante encuestar sobre la intenci&#x00F3;n de voto o predecir el partido ganador. El siguiente conjunto de reglas sirven para titular las preguntas que tienen que ver con la predicci&#x00F3;n de los partidos ganadores en elecciones futuras. La predicci&#x00F3;n tiene dos configuraciones principales: la predicci&#x00F3;n del partido ganador y la del candidato ganador. Similarmente a las reglas anteriores, si el tipo de elecciones aparece en la pregunta, esta informaci&#x00F3;n se debe incorporar en el t&#x00ED;tulo. Estas reglas se configuran de la siguiente manera:</p>
			
						<p>IF pregunta =~ /(cree|piensa) (Vd|Ud|usted) que &lt;nombrePartidoPolitico&gt; (tiene|tendr&#x00ED;a) muchas &lt;seqWords&gt; ganar/) THEN { SI Э &lt;eleccion&gt; → titulo = “Previsi&#x00F3;n electoral para &lt;nombrePartidoPolitico&gt; de ganar $eleccion”;  ELSE titulo = “Previsi&#x00F3;n electoral para &lt;nombrePartidoPolitico&gt;”	 }</p>
						
			
			 <p>Esta regla establece que:</p>

			<p>Si el texto de la pregunta contiene el verbo “cree” o “piensa”, seguido opcionalmente del pronombre “Usted” o cualquiera de sus variantes, a su vez, seguido del partido pol&#x00ED;tico, junto con el verbo “tiene” o “tendr&#x00ED;a”, “muchas” m&#x00E1;s una secuencia indefinida de palabras y, finalmente, del verbo “ganar”.</p>

			<p>Entonces, el t&#x00ED;tulo propuesto es “Previsi&#x00F3;n electoral para &lt;nombrePartidoPol&#x00ED;tico&gt;”.</p>

			<p>Donde nombrePartidoPolitico se reconoce por medio de expresiones regulares de complejidad variable. La pregunta siguiente se corresponde con esta regla:</p>

			<p><bold>T&#x00CD;TULO</bold>: Previsi&#x00F3;n electoral para el PSC/PSOE de ganar elecciones auton&#x00F3;micas</p>

			<p><bold>PREGUNTA</bold>: ¿Cree usted que el PSC/PSOE tiene muchas posibilidades, bastantes posibilidades, o muy pocas posibilidades de ganar las pr&#x00F3;ximas elecciones?</p>

			<p>Tambi&#x00E9;n es posible que se mencione el nombre de un pol&#x00ED;tico en lugar de un partido, como ocurre en la siguiente regla:</p>
			
						<p>SI pregunta =~ /(cree|piensa) (Vd|Ud|usted) que &lt;NombrePropio&gt; , &lt;seqWords&gt; , (tiene|tendr&#x00ED;a) &lt;seqWords&gt; posibilidad &lt;seqWords&gt; ganar/</p>

						<p> SI Э&lt;eleccion&gt; → titulo = “Previsi&#x00F3;n electoral para &lt;NombrePropio&gt; de ganar $eleccion”;</p>
						
						<p> ELSE titulo = “Previsi&#x00F3;n electoral para &lt;NombrePropio&gt;”;</p>
						
			
			 <p>La siguiente pregunta se corresponde con esta regla:</p>

			<p><bold>T&#x00CD;TULO</bold>: Previsi&#x00F3;n electoral para Juan Hormaechea de ganar elecciones auton&#x00F3;micas</p>

			<p><bold>PREGUNTA</bold>: P11 ¿Cree Vd. que Juan Hormaechea, encabezando la lista de su nuevo partido, tiene muchas posibilidades, bastantes, pocas o ninguna posibilidad de ganar las pr&#x00F3;ximas elecciones auton&#x00F3;micas?</p>

			<p>Ambas reglas dan cuenta de las distintas configuraciones del tema <italic>Predicci&#x00F3;n de las elecciones.</italic> El tipo de elecciones se reconoce de manera an&#x00E1;loga, mediante la siguiente expresi&#x00F3;n regular:</p>
			
						<p>IF pregunta =~ /(elecciones)<sub> $2</sub>((\s\s?[a-z&#x00C1;&#x00C9;&#x00CD;&#x00D3;&#x00DA;&#x00D1;&#x00E1;&#x00E9;&#x00ED;&#x00F3;&#x00FA;&#x00F1;]{2,})+)/ elecci&#x00F3;n = “elecciones$2” </p>
			
			<p>Por &#x00FA;ltimo, es posible que el t&#x00ED;tulo generado presente errores, como los puntos suspensivos y los pronombres personales <italic>Usted/t&#x00FA;</italic>, que no deber&#x00ED;an aparecer en los t&#x00ED;tulos. Una vez que se procesen las preguntas y se generen los t&#x00ED;tulos, se aplican las reglas para la correcci&#x00F3;n de errores.</p>

			<p>Hemos explicado en detalle las reglas para la titulaci&#x00F3;n de un tema paradigm&#x00E1;tico dentro de las preguntas electorales. El resto de temas se trata de forma muy similar. Cada tema, por norma general, tiene una o dos reglas, con un total de 32 reglas responsables de la totalidad de los t&#x00ED;tulos de las elecciones generados.</p>

			<p>El flujo de trabajo de procesamiento aqu&#x00ED; descrito se muestra gr&#x00E1;ficamente en la <xref ref-type="fig" rid="F2">Figura 2</xref>.</p>
			
			
					<fig id="F2">
						<label>Figura 2</label>
						<caption>
							<title>Esquema de la metodolog&#x00ED;a</title>
						</caption>
						<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="../images/F2.jpg"/>
					</fig>
						
		</sec>	

		
		<sec id="S3.3">
			<title>3.3. Resultados y evaluaci&#x00F3;n</title>

			<p>La estimaci&#x00F3;n de la calidad de los resultados de este trabajo se ha hecho considerando tanto la calidad como la cobertura de los t&#x00ED;tulos generados.</p>

		<sec id="S3.3.1">
			<title>3.3.1. Evaluaci&#x00F3;n de la calidad de los t&#x00ED;tulos generados</title>

			<p>En la valoraci&#x00F3;n de los aspectos cualitativos de los t&#x00ED;tulos, el personal del CIS tuvo un papel importante. Bas&#x00E1;ndose en su propia especialidad, clasificaron los t&#x00ED;tulos generados en tres tipos:</p>
						
						<list list-type="bullet">
							<list-item>
								<p><bold>T&#x00ED;tulos correctos</bold>: aquellos que no presentan errores gramaticales y que contienen la palabra clave y el tema.</p>
							</list-item>
							
							<list-item>
								 <p><bold>T&#x00ED;tulos imprecisos</bold>: aquellos que, a pesar de ser gramaticalmente correctos, no representan adecuadamente el tema de la pregunta. Por ejemplo, el siguiente t&#x00ED;tulo es gramaticalmente correcto pero ambiguo/impreciso en su significado:</p>
						
											 <p>Previsi&#x00F3;n electoral para este partido de ganar las elecciones</p>
							</list-item>
							
							<list-item>
								<p><bold>T&#x00ED;tulos incorrectos</bold>: aquellos que presentan errores gramaticales, parecen inconclusos o son ilegibles.</p>
							</list-item>
						</list>
			
			
			<p>Teniendo en cuenta esta clasificaci&#x00F3;n, procedimos a evaluar los t&#x00ED;tulos generados de preguntas electorales, que alcanzaban un total de hasta 3.458 t&#x00ED;tulos. Para ello, se escogi&#x00F3; una muestra aleatoria (con un margen de error del 5% y un nivel de confianza del 95%) de 346 preguntas. La <xref ref-type="table" rid="T1">Tabla I</xref> muestra los resultados de la muestra, as&#x00ED; como su inferencia para el total de la poblaci&#x00F3;n, basada en esos resultados.</p>
			
			
					<fig id="T1">
						<label>Tabla I</label>
						<caption>
							<title>Evaluaci&#x00F3;n de los t&#x00ED;tulos de las elecciones generados</title>
						</caption>
						<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="../images/T1.jpg"/>
					</fig>
						

			<p>As&#x00ED; pues, estimamos que las 32 reglas que cubren la totalidad de preguntas electorales generan correctamente el 88,73% de los t&#x00ED;tulos de las elecciones. Se observa asimismo que el n&#x00FA;mero de t&#x00ED;tulos incorrectos es bastante bajo.</p>
		</sec>	

		
		<sec id="S3.3.2">
			<title>3.3.2. Evaluaci&#x00F3;n de la cobertura de los t&#x00ED;tulos generados</title>

			<p>La evaluaci&#x00F3;n de la cobertura tiene como objetivo estimar la proporci&#x00F3;n de preguntas electorales para las que se ha generado un t&#x00ED;tulo (3.458) en relaci&#x00F3;n al n&#x00FA;mero total de preguntas electorales existentes en el corpus de preguntas no tituladas. Sin embargo, desconocemos a priori el n&#x00FA;mero total de preguntas electorales existentes en el conjunto total de preguntas (45.512).</p>

			<p>Para estimar el n&#x00FA;mero de preguntas electorales dentro del total de preguntas (45.512), escogimos una muestra aleatoria de 381 preguntas, con un nivel de confianza del 95% y un margen de error del 5%. Los resultados se muestran en la <xref ref-type="table" rid="T2">Tabla II</xref>.</p>
			
			
					<fig id="T2">
						<label>Tabla II</label>
						<caption>
							<title>Estimaci&#x00F3;n del n&#x00FA;mero total de preguntas electorales en la poblaci&#x00F3;n entera</title>
						</caption>
						<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="../images/T2.jpg"/>
					</fig>
						

			<p>Considerando los resultados de la estimaci&#x00F3;n, la cobertura se definir&#x00ED;a de la siguiente manera:</p>
			
						<fig id="E1">
							<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="../images/E1.jpg"/>
						</fig>

			<p>Los resultados de la evaluaci&#x00F3;n se resumen en la <xref ref-type="table" rid="T3">Tabla III</xref>.</p>
			
			
					<fig id="T3">
						<label>Tabla III</label>
						<caption>
							<title>Tabla resumen de resultados</title>
						</caption>
						<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="../images/T3.jpg"/>
					</fig>
						

			<p>La cobertura no es muy alta, pero aquello en lo que nos hemos centrado en el trabajo no es en la obtenci&#x00F3;n de un sistema de elevada cobertura, sino en ver si el esfuerzo llevado a cabo en el dise&#x00F1;o, la codificaci&#x00F3;n y la aplicaci&#x00F3;n de las reglas era rentable en cuanto a costes y tiempo en relaci&#x00F3;n con el m&#x00E9;todo de revisi&#x00F3;n manual que el personal del CIS ha estado empleando hasta este momento.</p>

			<p>El ahorro efectivo en costes y tiempo se ha estimado como altamente considerable, as&#x00ED; que este enfoque se ha adoptado en conjunci&#x00F3;n con la revisi&#x00F3;n manual para la tarea global de la titulaci&#x00F3;n de preguntas.</p>

			<p>No obstante, merece la pena observar las razones por las que no se ha conseguido una mayor cobertura. El primer hecho notable consiste en que las preguntas que no se cubren se corresponden con las preguntas m&#x00E1;s antiguas de la base de datos, cuando la normalizaci&#x00F3;n de preguntas era un tanto baja, o incluso inexistente. En concreto, las situaciones observadas que inciden directamente en la falta de cobertura y de correcci&#x00F3;n fueron:</p>
			
						
						<list list-type="alpha-lower">
							<list-item>
								<p>Aparici&#x00F3;n de nuevos tipos no identificados en la fase de an&#x00E1;lisis.</p>
							</list-item>
							
							<list-item>
								<p>Insuficiencia de reglas. En este caso, las reglas codificadas no consiguieron capturar la informaci&#x00F3;n relevante.</p>
							</list-item>
							
							<list-item>
								<p>Preguntas cuyo t&#x00ED;tulo es una interpretaci&#x00F3;n o resumen de sus categor&#x00ED;as de respuesta. Este tipo de preguntas quedaban fuera del &#x00E1;mbito del trabajo.</p>
							</list-item>
						</list>
			
			
			 <p>La presencia de nuevos tipos (caso a) sugiere que el corpus inicial de preguntas tituladas y sin titular no se comporta de forma parecida. Las preguntas sin titular son m&#x00E1;s antiguas que las tituladas, las cuales fueron tomadas como referencia para el an&#x00E1;lisis del &#x00E1;mbito. Si tenemos en cuenta que las encuestas del CIS reflejan el comportamiento de, en este caso, la sociedad espa&#x00F1;ola, puede que estemos encontr&#x00E1;ndonos con un signo claro de c&#x00F3;mo la sociedad espa&#x00F1;ola se ha estado familiarizando con el sistema electoral actual, de tal modo que las preguntas electorales a principios de la democracia son m&#x00E1;s irregulares y “dependientes del momento y del contexto” (preguntaban acerca de situaciones novedosas que no se repet&#x00ED;an en encuestas anteriores, solo en las posteriores). En contraposici&#x00F3;n, en los 90, tanto el sistema electoral como las encuestas electorales llevadas a cabo por esta instituci&#x00F3;n est&#x00E1;n consolidas.</p>

			<p>El caso b, sin embargo, revela que hay ciertas insuficiencias en las reglas dise&#x00F1;adas. El momento en que se realiz&#x00F3; este trabajo, no se consideraba necesaria la expansi&#x00F3;n del n&#x00FA;mero de reglas, principalmente debido a que un peque&#x00F1;o incremento en precisi&#x00F3;n podr&#x00ED;a significar un esfuerzo en mayores proporciones. Por otro lado, la cobertura y calidad de los t&#x00ED;tulos producidos con las reglas existentes fueron consideradas de gran utilidad.</p>
		</sec>
		</sec>
		</sec>

		
		<sec id="S4">
			<title>4. CONCLUSIONES</title>

			<p>Este trabajo describe el proceso que llev&#x00F3; a la titulaci&#x00F3;n autom&#x00E1;tica de las preguntas electorales del CIS. Este tipo de preguntas es uno de los m&#x00E1;s buscados y pedidos y su gesti&#x00F3;n y reutilizaci&#x00F3;n en las encuestas es esencial debido al gran n&#x00FA;mero de situaciones electorales que pueden surgir.</p>

			<p>Por otra parte, hemos seguido un enfoque directo, bastante lejos de sistemas complejos de dif&#x00ED;cil trato por parte de los responsables de estas tareas en sus instituciones. La soluci&#x00F3;n dise&#x00F1;ada ten&#x00ED;a requisitos iniciales de eficacia, simpleza y, muy notablemente, de eficiencia, esto es, en un tiempo limitado con recursos limitados.</p>

			<p>La evaluaci&#x00F3;n de los resultados result&#x00F3; ser bastante satisfactoria, ya que el 88,73% de los t&#x00ED;tulos generados eran correctos, con el consecuente ahorro en trabajo manual. Creemos que este enfoque, si no puede ser explotado directamente, establece las gu&#x00ED;as para la tarea de la titulaci&#x00F3;n de preguntas de un modo r&#x00E1;pido y directo.</p>
		</sec>
			

	</body>

	<back>
	
		<ref-list>
			<title>REFERENCIAS</title>
			
			<ref id="CIT01">
			<element-citation publication-type="journal">
			  <person-group person-group-type="author">
				  <name>
					  <surname>Cui</surname>
					  <given-names>H.</given-names>	  
				  </name>
				  <name>
					  <surname>Kan</surname>
					  <given-names>M.</given-names>	  
				  </name>
				  <name>
					  <surname>Chua</surname>
					  <given-names>T.</given-names>	  
				  </name>
			  </person-group>
			  <year>2007</year>
			  <article-title>Soft pattern matching models for definitional question answering</article-title>
			  <source>ACM Transactions on Information Systems</source>
			  <volume>25</volume>
			  <issue>2</issue>
			  <fpage>1</fpage>
			  <lpage>30</lpage>
			  <comment><uri>http://dx.doi.org/10.1145/1229179.1229182</uri></comment>
			</element-citation>
			</ref>

			<ref id="CIT02"> 
			<element-citation publication-type="conf-proc">
			  <person-group person-group-type="author">
				  <name>
					  <surname>Gallardo Pérez</surname>
					  <given-names>C.</given-names>	  
				  </name>
				  <name>
					  <surname>Cardeñosa</surname>
					  <given-names>J.</given-names>	  
				  </name>
			  </person-group>
			  <year>2011</year>
			  <article-title>Knowledge extraction for question titling</article-title>
			  <conf-name>Proceedings of the 9th international conference on Flexible Query Answering Systems (FQAS'11)</conf-name>
			  <volume>vol. 7022</volume>
			  <fpage>119</fpage>
			  <lpage>127</lpage>
			  <comment>Springer-Verlag, Berlin, Heidelberg <uri>http://dx.doi.org/10.1007/978-3-642-24764-4_11</uri></comment>
			</element-citation>
			</ref>

			<ref id="CIT03">
			<element-citation publication-type="journal">
			  <person-group person-group-type="author">
				  <name>
					  <surname>García Gutiérrez</surname>
					  <given-names>A.</given-names>	  
				  </name>
			  </person-group>
			  <year>2014</year>
			  <article-title>Análisis documental de noticias de prensa en sistemas de información factual</article-title>
			  <source>Revista Española de Documentación Científica</source>
			  <volume>37</volume>
			  <issue>2</issue>
			  <comment><uri>http://dx.doi.org/10.3989/redc.2014.2.1094</uri></comment>
			</element-citation>
			</ref>

			<ref id="CIT04">
			<element-citation publication-type="conf-proc">
			  <person-group person-group-type="author">
				  <name>
					  <surname>Goldstein</surname>
					  <given-names>J.</given-names>	  
				  </name>
				  <name>
					  <surname>Kantrowitz</surname>
					  <given-names>M.</given-names>	  
				  </name>
				  <name>
					  <surname>Mittal</surname>
					  <given-names>V.</given-names>	  
				  </name>
				  <name>
					  <surname>Carbonell</surname>
					  <given-names>J.</given-names>	  
				  </name>
			  </person-group>
			  <year>1999</year>
			  <article-title>Summarizing text documents: Sentence selection and evaluation metrics</article-title>
			  <conf-name>Proceedings of the 22Nd Annual International ACM SIGIR Conference on Research and Development in Information Retrieval, Berkeley, California, USA</conf-name>
			  <fpage>121</fpage>
			  <lpage>128</lpage>
			  <comment><uri>http://dx.doi.org/10.1145/312624.312665</uri></comment> 
			</element-citation>
			</ref>

			<ref id="CIT05">
			<element-citation publication-type="journal">
			  <person-group person-group-type="author">
				  <name>
					  <surname>Hung</surname>
					  <given-names>S.</given-names>	  
				  </name>
				  <name>
					  <surname>Lin</surname>
					  <given-names>C.</given-names>	  
				  </name>
				  <name>
					  <surname>Hong</surname>
					  <given-names>J.</given-names>	  
				  </name>
			  </person-group>
			  <year>2010</year>
			  <article-title>Web mining for event-based commonsense knowledge using lexico-syntactic pattern matching and semantic role labeling</article-title>
			  <source>Expert Systems with Applications</source>
			  <volume>37</volume>
			  <issue>1</issue>
			  <fpage>341</fpage>
			  <lpage>347</lpage>
			  <comment><uri>http://dx.doi.org/10.1016/j.eswa.2009.05.060</uri></comment>  
			</element-citation>
			</ref>

			<ref id="CIT06">
			<element-citation publication-type="conf-proc">
			  <person-group person-group-type="author">
				  <name>
					  <surname>Jin</surname>
					  <given-names>R.</given-names>	  
				  </name>
				  <name>
					  <surname>Hauptmann</surname>
					  <given-names>E. G.</given-names>	  
				  </name>				  
			  </person-group>
			  <year>2001</year>
			  <article-title>Headline generation using a training corpus</article-title>
			  <conf-name>Proceedings of the Second International Conference on Computational Linguistics and Intelligent Text Processing, CICLING. Lecture Notes on Computer Science, Berlin: Springer-Verlag</conf-name>
			  <fpage>208</fpage>
			  <lpage>215</lpage>
			</element-citation>
			</ref>

			<ref id="CIT07">
			<element-citation publication-type="conf-proc">
			  <person-group person-group-type="author">
				  <name>
					  <surname>Jin</surname>
					  <given-names>R.</given-names>	  
				  </name>
				  <name>
					  <surname>Hauptmann</surname>
					  <given-names>E. G.</given-names>	  
				  </name>				  
			  </person-group>
			  <year>2002</year>
			  <article-title>A new probabilistic model for title generation</article-title>
			  <conf-name>Proceedings of the 19th International Conference on Computational Linguistics</conf-name>
			  <comment><uri>http://dx.doi.org/10.3115/1072228.1072365</uri></comment>  
			</element-citation>
			</ref>

			<ref id="CIT08">
			<element-citation publication-type="journal">
			  <person-group person-group-type="author">
				  <name>
					  <surname>Liu</surname>
					  <given-names>K.</given-names>	  
				  </name>
				  <name>
					  <surname>Chapman</surname>
					  <given-names>W. W.</given-names>	  
				  </name>
				  <name>
					  <surname>Savova</surname>
					  <given-names>G.</given-names>	  
				  </name>				  
				  <name>
					  <surname>Chute</surname>
					  <given-names>C. G.</given-names>	  
				  </name>
				  <name>
					  <surname>Sioutos</surname>
					  <given-names>N.</given-names>	  
				  </name>
				  <name>
					  <surname>Crowley</surname>
					  <given-names>R. S.</given-names>	  
				  </name>
			  </person-group>
			  <year>2011</year>
			  <article-title>Effectiveness of lexico-syntactic pattern matching for ontology enrichment with clinical documents</article-title>
			  <source>Methods of Information in Medicine</source>
			  <volume>50</volume>
			  <issue>5</issue>
			  <fpage>397</fpage>
			  <lpage>407</lpage>
			  <comment><uri>http://dx.doi.org/10.3414/ME10-01-0020</uri></comment> 
			</element-citation>
			</ref>

			<ref id="CIT09">
			<element-citation publication-type="journal">
			  <person-group person-group-type="author">
				  <name>
					  <surname>Martínez-Ávila</surname>
					  <given-names>D.</given-names>	  
				  </name>
				  <name>
					  <surname>San Segundo</surname>
					  <given-names>R.</given-names>	  
				  </name>
				  <name>
					  <surname>Zurian</surname>
					  <given-names>F.</given-names>	  
				  </name>
			  </person-group>
			  <year>2014</year>
			  <article-title>Retos y oportunidades en organización del conocimiento en la intersección con las tecnologías de la información</article-title>
			  <source>Revista Española de Documentación Científica</source>
			  <volume>37</volume>
			  <issue>3</issue>
			  <comment><uri>http://dx.doi.org/10.3989/redc.2014.3.1112</uri></comment>
			</element-citation>
			</ref>

			<ref id="CIT10"> 
			<element-citation publication-type="journal">
			  <person-group person-group-type="author">
				  <name>
					  <surname>Spärck Jones</surname>
					  <given-names>K.</given-names>	  
				  </name>
			  </person-group>
			  <year>2007</year>
			  <article-title>Automatic summarising: The state of the art</article-title>
			  <source>Information Process. Management</source>
			  <volume>43</volume>
			  <issue>6</issue>
			  <fpage>1449</fpage>
			  <lpage>1481</lpage>
			  <comment><uri>http://dx.doi.org/10.1016/j.ipm.2007.03.009</uri></comment>  
			</element-citation>
			</ref>

			<ref id="CIT11">
			<element-citation publication-type="journal">
			  <person-group person-group-type="author">
				  <name>
					  <surname>Spasic</surname>
					  <given-names>I.</given-names>	  
				  </name>
				  <name>
					  <surname>Sarafraz</surname>
					  <given-names>F.</given-names>	  
				  </name>
				  <name>
					  <surname>Keane</surname>
					  <given-names>J. A.</given-names>	  
				  </name>
				  <name>
					  <surname>Nenadic</surname>
					  <given-names>G.</given-names>	  
				  </name>
			  </person-group>
			  <year>2010</year>
			  <article-title>Medication information extraction with linguistic pattern matching and semantic rules</article-title>
			  <source>Journal of the American Medical Informatics Association</source>
			  <volume>17</volume>
			  <issue>5</issue>
			  <fpage>532</fpage>
			  <lpage>535</lpage>
			  <comment><uri>http://dx.doi.org/10.1136/jamia.2010.003657</uri></comment> 
			</element-citation>
			</ref>
			
		</ref-list>
		
	</back>
</article>
