Buscar en este blog y otros asociados

jueves, 30 de septiembre de 2010

Eventos de interés en Octubre 2010

SDMX Technical Workshop
From the SDMX Information Model to the development of reusable software components

Lugar: Czech Statistical Office (Praga)
Fecha: 30 Septiembre – 1 Octubre 2010
Más información: http://circa.europa.eu/Public/irc/dsis/sdmxdevelopment/library?l=/technical_workshop_1/sdmx-technical-workshop-/_EN_1.0_&a=d


The Digital Preservation Training Programme

Lugar: University of London Computer Centre
Fecha: Octubre 4-6, 2010
Más información: http://www.dptp.org/


Lucene/Solr Revolution Conference

Lugar: Boston (EE.UU.)
Fecha: Octubre 5-8, 2010
Más información: http://lucenerevolution.org/


Dagstuhl Seminar to Focus on DDI and Longitudinal Data

Lugar: Schloss Dagstuhl in Wadern (Alemania)
Fecha: Octubre 17-22, 2010
Más información: http://www.dagstuhl.de/en/programm/kalender/evhp/?semnr=10422



International Conference on Dublin Core and Metadata Applications

Lugar: Pittsburgh (EE.UU.)
Fecha: Octubre 20-22, 2010
Más información: http://www.asis.org/Conferences/DC2010/



Jornadas de Estadística de las Comunidades Autónomas (JECAS)

Lugar: Cáceres (España)
Fecha: Octubre 20-23, 2010
Más información: http://www.jecas.org/




Workshop: Using DDI 3 to Support Production, Management, Dissemination, and Preservation Systems for Data in the Social Sciences and Economics

Lugar: Schloss Dagstuhl in Wadern (Alemania)
Fecha: Octubre 25-29, 2010
Más información: http://www.gesis.org/en/research/events/workshops/ddi-workshop/

martes, 28 de septiembre de 2010

Cómo incorporar inteligencia a los datos difundidos en PDF

Nuevas oportunidades con XMP (Extensible Metadata Platform)

La difusión de datos en formatos tradicionales tales como hojas de cálculo, texto plano, documentos de procesadores de texto, o en el fomato PDF (Portable Document Format) de Adobe, no son nada recomendables para su difusión, pues no aportan información sobre la estructura de los mismos, lo que impide el correcto procesamiento automático por parte de las herramientas de software.

Por esa razón, el año 1991 Statistics Sweden (Suecia) propuso un formato sencillo conocido como PC-Axis, que si bien no deja de ser un documento de texto (txt) incorpora a los datos un cojunto de metadatos estructurales y documentales que facilitan su gestión e interpretación, y permiten que aquéllos sean más facilmente procesables. Posteriomente durante esta década, cinco grandes organismos internacionales conscientes del problema de la difusión de datos en los formatos antes mencionados proponen un nuevo estándar basado en XML que es conocido como SDMX (Statistical Data and Metadata Exchange).

Sin embargo, aún son muchos los Organismos Públicos y Oficinas de Estadísticas que siguen publicando datos en los formatos tradicionales. Entre todos ellos los más usados son las hojas de cálculo Excel (XLS) y los PDF. Posiblemente este último es el peor de los formatos para la distribución de datos; además también se utiliza para la difusión de publicaciones estadísticas que contienen en su interior un importante conjunto de tablas estadísticas, gráficos o mapas.


Renunciando a la capacidad del procesamiento automático de esa información, la posibilidad que nos queda es incorporar a los PDF ciertos metadatos que documenten el contenido de los datos que contienen; para facilitar la búsqueda de los datos en ellos presentes. Para ello, Adobe XMP (Extensible Metadata Platform) facilita la captura, preservación e intercambio de metadatos.

XMP usa XML para describir los metadatos. Dado que está diseñada para existir con cualquier formato de archivo, XMP proporciona una solución flexible para gestionar de forma inteligente los PDF. Al ser completamente personalizable y ampliable, XMP permite que los grupos de trabajo y las organizaciones personalicen los metadatos necesarios para potenciar su producción y flujos de trabajo de publicación.  Adobe XMP permite:

  1. Gestionar y automatizar más eficazmente los medios al permitir que los grupos de trabajo definan los metadatos en función de sus necesidades.
  2. Expresar los metadatos en XML, lo que permite que los usuarios y sistemas que dependen de este lenguaje lo puedan comprender.
  3. Mantener los metadatos a lo largo del curso del flujo de trabajo.
Tal como señalé anteriormente XMP permite incorporar a los PDF el conjunto de metadatos que se desee, pero también se pueden incorporar por defecto los metadatos de algunos estándares tales como Dublin Core.

Para saber más: 

sábado, 25 de septiembre de 2010

¿Qué es y para qué sirve un sistema de metadatos estadísticos?

Los metadatos permiten que los datos estadísticos sean bien entendidos, compartidos y explotados de manera eficaz por todo tipo de usuarios a lo largo del tiempo; y se utilizan para poder identificar, acceder y usar los datos.
 
El Código de Buenas Prácticas de las Estadísticas Europeas en su principio número 15, sobre accesibilidad y claridad, establece que “Las estadísticas europeas deberían presentarse de forma clara y comprensible, difundirse de forma adecuada y conveniente y estar disponibles, asimismo se debería permitir el acceso a las mismas de forma imparcial, con metadatos y orientación de apoyo”.

Una definición utilizada con frecuencia nos dice que los metadatos son "datos sobre datos", en general un objeto que describe o dice algo sobre otro objeto de información. De manera formal podríamos decir que un metadato es un dato que se encarga de mantener un registro sobre el significado, contexto o propósito de un objeto informativo, con la pretensión de poder descubrir, entender, extraer y administrar dicho objeto.

De acuerdo con la definición anterior de metadatos, podríamos afirmar que un Sistema de Metadatos Estadísticos ofrece información sobre las colecciones de objetos estadísticos y la relación entre ellos, así como sobre los procesos en los que están involucrados, describiendo cada uno de los eventos, sus componentes y cada una de las restricciones que se les aplican.

Asimismo, los metadatos de la información estadística informan a los usuarios sobre los datos existentes describiendo: los conceptos, las fuentes, la calidad, su distribución, el formato, restricciones de seguridad, frecuencia de actualización, etcétera; de tal manera que sirven para describir un conjunto de datos estadísticos, contestando a las preguntas: “de qué”, “de cuándo”, “de dónde”, “de quién son”, “de dónde son” y “el cómo” se han generado los datos.

Por tanto, los metadatos estadísticos constituyen la información que permite que los datos estadísticos sean bien entendidos, compartidos y explotados de manera eficaz por todo tipo de usuarios a lo largo del tiempo; y se utilizan para poder identificar, acceder y usar los datos. Algunos de los objetivos que se persiguen con la creación de los metadatos son los siguientes:
1) Que se puedan buscar y encontrar los conjuntos de datos, es decir, saber qué datos existen para una determinada zona, referencia temporal y para un tema determinado; de acuerdo con las características específicas que el usuario demanda.

2) Facilitar la utilización de los datos, mediante la descripción de todas las características técnicas relevantes de los mismos de un modo objetivo, amplio y completo. Haciendo posible su explotación y ayudando a los usuarios tanto en la obtención de resultados como en su mantenimiento y actualización.

3) Que se pueda valorar la calidad del conjunto de datos.

4) Que se pueda elegir cuál es el conjunto de datos más idóneo para las necesidades de los usuarios.

5) Evitar la duplicidad de trabajo, informando sobre la información existente, su ubicación y su disponibilidad. 

miércoles, 22 de septiembre de 2010

La información pública espera quien se haga cargo de ella

La reutilización de datos anima a la creación de pequeñas empresas con contenido innovador.

Artículo de interés escrito por Teresa Ruiz-Tapiador en el Diario CincoDías.


Bases de datos, listas, estudios, información general... materia prima con gran potencial que suena a oportunidad para aquellos emprendedores que se animen a hacer uso de ella. Nacidos del dinero público, los datos abiertos, poco a poco, se ponen al servicio de la ciudadanía gracias a las iniciativas de terceros.

Las Administraciones generan multitud de información en formatos propios que son de difícil acceso para la mayoría de los ciudadanos. Datos de diversa índole que van desde tablas estadísticas, oportunidades laborales, recursos turísticos o incidencias de tráfico, que para más inri se encuentran perdidos en las páginas web e intranet de los organismos.

Todos son fácilmente aprovechables y generan valor añadido a las empresas que les dan forma; sólo es necesaria la colaboración de las entidades públicas para liberar cada vez más información y crear más oportunidades de negocio.



Enlaces relacionados:

sábado, 18 de septiembre de 2010

SDMX Cross-domain Code Lists

Las normas técnicas de SDMX son lo suficientemente genéricas como para permitir que las Oficinas Estadísticas puedan adoptar y aplicar cualquier representación específica de metadatos y vocabularios comunes. Sin embargo, el uso común de listas de códigos normalizadas permite a los usuarios trabajar de forma más eficaz, ya que facilita el mantenimiento y reduce la necesidad de recodificaciones o traducciones de códigos. Por ello, optar por las listas de códigos estándares tiene una gran impacto en la eficacia del intercambio de datos. Estas listas de códigos se pueden utilizar en varias capas:

 
  • Difusión e intercambio de datos y metadatos entre organizaciones;
  • Producción y presentación de informes estadísticos;
  • Uso interno (dentro de una institución)

 
SDMX se centra en las dos primeras capas y por ello SDMX Cross-domain Code Lists recomienda distintas listas básicas de códigos para varios conceptos claramente definidos y ampliamente utilizados en la difusión e interacambio de datosEl objetivo final es conseguir que las listas de códigos recomendadas en SDMX se puedan utilizar en todas las etapas del ciclo de vida de datos  por lo que la intención es recomendar más listas para otros conceptos adicionales. En ese sentido podemos distinguir dos grupos de listas de códigos:

 
1. Codificaciones básicas

 
El primer grupo está compuesto por nueve codificaciones básicas asociadas a conceptos claramente definidos y de validez internarcional. Estos códigos están relacionados con los siguientes conceptos: estado de la observación, estado de la confidencialidad, número de decimales, frecuencia, sexo (F-Female, M-Male, U-no especificado o desconocido, N-no aplicable, T-total), formato de hora, multiplicador de unidad, área y moneda. 

 
2. Codificaciones adicionales

 
El segundo grupo está compuesto por códigos adicionales que aún no pueden ser normalizados internacionalemte, porque su definición es específica de un dominio, una organización o una etapa del ciclo de vida de datos (por ejemplo, unidades de medida, sectores institucionales, estado civil). Estos códigos generalmente se usan en el intercabio de datos producto de acuerdos bilaterales, o en organizaciones pertenecientes a un área geográfica específica como pueden ser los usados por Eurostat y la Oficinas Estadísticas del Sistema Estadístico Europeo. SDMX espera que con el tiempo algunos de estos códigos se muevan hacia la categoría de códigos básicos recomendados.

 
Evidentemente los códigos utilizados exclusivamente en una sola institución no se consideran en el documento SDMX Cross-domain Code Lists. Asimismo SDMX considera que es altamente recomendable que para nuevas implementaciones se haga un esfuerzo especial para utilizar tantos elementos como sea posible de las listas recomendadas.

 
Para saber más:

En el blog: