Buscar en este blog y otros asociados

Mostrando entradas con la etiqueta VOCABULARIOS CONTROLADOS. Mostrar todas las entradas
Mostrando entradas con la etiqueta VOCABULARIOS CONTROLADOS. Mostrar todas las entradas

martes, 21 de diciembre de 2010

Slides and abstracts of the 2nd Annual European DDI Users Group Meeting


El Segundo Encuentro Europeo de Usuarios de DDI (EDDI10), que se celebra anualmente, tuvo lugar en SURFfoundation en Utrecht (Holanda) los días 8 y 9 de diciembre, con la participación de casi 70 personas de 13 países. Antes del encuentro también se impartieron cursos de DDI y SDMX, y un taller para desarrolladores de DDI. Tal como se anunció al final de la conferencia, el anfitrión de EDDI del próximo año será Swedish National Data Service (SND) en Gotemburgo. 

Las presentaciones y resúmenes del EDDI10 son de un alto interés y se pueden consultar en los siguientes enlaces:

Introduction

Wendy Thomas (MPC - Minnesota Population Center)

Arofan Gregory (ODaF - Open Data Foundation)

Peter Wittenburg (Max Planck Institute for Psycholinguistics, Nijmegen)

Searching and Locating

Wolfgang ZenkMöltgen, Brigitte Hausstein (both GESIS - Leibniz Institute for the Social Sciences), Jan Brase (TIB - German National Library of Science and Technology)

William Block (CISER - Cornell Institute for Social and Economic Research)

Johan Fihn, Olof Olsson, Iris Alfredsson, Hans Jørgen Marker (all SND - Swedish National Data Service)

Project Updates

Alerk Amin (CentERdata - Institute for Data Collection and Research)

 Christian Gerhards (Bielefeld University, Faculty of Sociology)

Metadata in the Data Production Process

Jeremy Iverson (Algenta Technologies)

Steven Vale (UNECE - United Nations Economic Commission for Europe)

DDI Software

Ørnulf Risnes (Nesstar)

Don McIntosh (STR - Space-Time Research) / presented by Arofan Gegory

Dan Smith (Algenta Technologies)

Reports and Updates on DDI activities

Meinhard Moschner (GESIS - Leibniz Institute for the Social Sciences), Taina Jääsekläinen (FSD - Finnish Social Science Data Archive), Joachim Wackerow (GESIS - Leibniz Institute for the Social Sciences)

Joachim Wackerow (GESIS - Leibniz Institute for the Social Sciences)

Stefan Kramer (CISER - Cornell Institute for Social and Economic Research)

From DDI 2 to DDI 3

Tito Castillo (Institute of Child Health, University College London)

Monika Linne, Alexander Mühlbauer, and Wolfgang Zenk-Möltgen (all GESIS - Leibniz Institute for the Social Sciences)

Data Collection

Samuel Spencer (ABS - Australian Bureau of Statistics)

Nadine Dulisch (GESIS - Leibniz Institute for the Social Sciences)

Current Status and Recent Events

William Block and Stefan Kramer (both Cornell Institute for Social and Economic Research)

Jeremy Iverson (Algenta Technologies)

Wendy Thomas, Arofan Gregory, and Joachim Wackerow (all Technical Implementation Committee, DDI Alliance)



viernes, 10 de diciembre de 2010

Eurovoc Conference: Building block of the semantic web


EuroVoc es un tesauro multilingüe cuya función primera es el tratamiento de la información documental que generan las instituciones de la Unión Europea. Se trata de un tesauro multidisciplinario que cubre ámbitos suficientemente amplios para dar cabida no sólo a los aspectos comunitarios, sino también a las perspectivas nacionales, con un perceptible acento en la actividad parlamentaria. EuroVoc es un vocabulario controlado, que puede utilizarse fuera de las instituciones de la Unión Europe, en particular en el ámbito parlamentario.

El objetivo del tesauro es aportar a los servicios responsables de la gestión y de la difusión de la información un instrumento de indización coherente que les permita gestionar con eficacia sus fondos documentales y permitir a los usuarios efectuar búsquedas documentales utilizando un lenguaje controlado. Este tesauro se encuentra disponible en XML y recientemente también lo está en SKOS (ver la entrada ¿Qué es SKOS?).

La conferencia "Building block of the semantic web" se centró en el tesauro EUROVOC y otros vocabularios controlados multilingüe como herramientas de indexación para facilitar la interoperabilidad y el acceso a la información. Ya están disponibles las presentaciones de la Conferencia:

Day 1 - 18/11/2010 
Opening
09:30 - 10:30Reception and registration
10:30 - 11:10
Conference opening and welcomeWelcome address by Ms Reicherts, General Director of the Publications Office.
Inaugurative Speech by Prof. Giovanni Sartor, European University Institute.
LEGAL INFORMATICS AND LEGAL CONCEPTS

Session 1: What news from EuroVoc and the Publications Office?
11:15 - 11:45EUROVOC, A PATH TO THE SEMANTIC WEB
Christine Laaboudi-Spoiden, Publications Office
11:45 - 12:15Improve access to EU content through thesaurus matching
JERÔME EUZENAT (INRIA LIG) &  LAURENT BEGIN (MONDECA)
12:15 - 12:45COMMON ACCESS TO EU INFORMATION - THE CELLAR PROJECT PRESENTATION
Peter Schmitz, Publications Office
12:45 - 13:00Q&A from the audience
Session 2: Thesauri "Speed Dating" workshop  
14:00 - 16:30Open discussion in working groups.
Date 1:
European Training Thesaurus
Marc Willem, Cedefop, ThessaloniqueTESE (Thesaurus for Education Systems in Europe)Wim Vansteenkiste, Education, Audiovisual & Culture Executive Agency, Brussels
Date 2:
Unesco Thesaurus
Meron Ewketu, Unesco, Paris
Date 3:
Gemet - General Multilingual Environmental Thesaurus
Stefan Jensen, European Environment Agency, Copenhagen
Agrovoc – Food and Agriculture Organisation Thesaurus
Johannes Keizer, Food and Agriculture Organization, RomeInspire Feature Concept Dictionary
Cristiano Fugazza, European Commission Joint Research Centre, Ispra
Date 4:
ESCO - European Taxonomy of Skills, Competencies and Occupations
Henric Stjernkvist, European Commission, DG Employment, Brussels
Date 5:
EUROPEAN THESAURUS ON INTERNATIONAL RELATIONS AND AREA STUDIES
Axel Huckstorf, Stiftung Wissenschaft und Politik, Berlin)
Date 6:
UNBIS - the United Nations Thesaurus
Alexandra McLeod, Dag Hammarskjöld Library, United Nations, New York
16:30 -16:50Coffee break
16:50 - 17:15The ideal thesaurus ? WORKSHOP CONCLUSION 
17:15 - 17:45ISO 25964 - THE NEW STANDARD FOR THESAURI AND INTEROPERABILITY WITH OTHER VOCABULARIES
(Stella Dextre Clarke, Consultant and project leader of the ISO 25964 Working Group)
Day 2 - 19/11/2010 (Sessions 3 and 4 are parallel sessions)
Session 3: Toward the semantic web – Metadata and Interoperability 
09:00 - 09:30DEVELOPING AND USING MULTILINGUAL SUBJECT HEADINGS LINKED DATA: A TEL MULTILINGUAL SUBJECT ACCESS INITIATIVE
Patrice Landry, Swiss National Library
09:30 - 10:00MULTILINGUAL ACCESS TO ONLINE CONTENT - THE EUROPEANA EXPERIENCE
Vivien Petras, Humboldt-University Berlin
10:00 - 10:30THE VOCABULARY MAPPING FRAMEWORK AND ITS POTENTIAL FOR IMPROVING METADATA INTEROPERABILITY IN THE SEMANTIC WEB
Gordon Dunsire, Centre for Digital Library Research - University of Strathclyde, UK
10:30 - 10:40Q&A from the audience
10:40 - 10:55Coffee break
11:00 - 11:30ARCHAEOLOGY AND TERMINOLOGY
Ceri Binding, Hypermedia Research Unit, Faculty of Advanced Technology, University of Glamorgan UK
11:30 - 11:40Q&A from the audience

Session 4: Indexing legal information
09:00 - 09:30AUTOMATIC EUROVOC INDEXING OF PARLIAMENTARY TEXTS IN ALL OFFICIAL EU LANGUAGES
Ralf Steinberger, EC Joint Research Centre, Ispra
09:30 - 10:00AUTOMATIC EUROVOC INDEXING OF PARLIAMENTARY DOCUMENTATION - LIVE DEMONSTRATION
Victoria Fernández Mera Congreso de los Diputados, Spain
10:00 - 10:30EUROVOC AND PARLIAMENTARY DOCUMENTS: A SEMI-AUTOMATIC CLASSIFICATION EXPERIENCE AT THE ITALIAN CAMERA DEI DEPUTATI
Calogero Salamone, Biblioteca Camera dei Deputati, Roma, Italy
10:30 - 10:40Q&A from the audience
10:40 - 10:55Coffee break
11:00 - 11:30AUTOMATIC INDEXING WITH THE EUROVOC THESAURUS ENABLING CROSS-LINGUAL SEARCH
Frane Šarić, University of Zagreb & Marie-Francine Moens, Katholieke Universiteit Leuven
11:30 - 11:40Q&A from the audience

Closing session
 
11:50 - 12:20VOCABULAIRE JURIDIQUE MULTILINGUE COMPARÉ
Caroline Reichling, Court of Justice of the European Union
12:20 - 12:45Closing address by Ms Reicherts, General Director of the Publications Office.

sábado, 18 de septiembre de 2010

SDMX Cross-domain Code Lists

Las normas técnicas de SDMX son lo suficientemente genéricas como para permitir que las Oficinas Estadísticas puedan adoptar y aplicar cualquier representación específica de metadatos y vocabularios comunes. Sin embargo, el uso común de listas de códigos normalizadas permite a los usuarios trabajar de forma más eficaz, ya que facilita el mantenimiento y reduce la necesidad de recodificaciones o traducciones de códigos. Por ello, optar por las listas de códigos estándares tiene una gran impacto en la eficacia del intercambio de datos. Estas listas de códigos se pueden utilizar en varias capas:

 
  • Difusión e intercambio de datos y metadatos entre organizaciones;
  • Producción y presentación de informes estadísticos;
  • Uso interno (dentro de una institución)

 
SDMX se centra en las dos primeras capas y por ello SDMX Cross-domain Code Lists recomienda distintas listas básicas de códigos para varios conceptos claramente definidos y ampliamente utilizados en la difusión e interacambio de datosEl objetivo final es conseguir que las listas de códigos recomendadas en SDMX se puedan utilizar en todas las etapas del ciclo de vida de datos  por lo que la intención es recomendar más listas para otros conceptos adicionales. En ese sentido podemos distinguir dos grupos de listas de códigos:

 
1. Codificaciones básicas

 
El primer grupo está compuesto por nueve codificaciones básicas asociadas a conceptos claramente definidos y de validez internarcional. Estos códigos están relacionados con los siguientes conceptos: estado de la observación, estado de la confidencialidad, número de decimales, frecuencia, sexo (F-Female, M-Male, U-no especificado o desconocido, N-no aplicable, T-total), formato de hora, multiplicador de unidad, área y moneda. 

 
2. Codificaciones adicionales

 
El segundo grupo está compuesto por códigos adicionales que aún no pueden ser normalizados internacionalemte, porque su definición es específica de un dominio, una organización o una etapa del ciclo de vida de datos (por ejemplo, unidades de medida, sectores institucionales, estado civil). Estos códigos generalmente se usan en el intercabio de datos producto de acuerdos bilaterales, o en organizaciones pertenecientes a un área geográfica específica como pueden ser los usados por Eurostat y la Oficinas Estadísticas del Sistema Estadístico Europeo. SDMX espera que con el tiempo algunos de estos códigos se muevan hacia la categoría de códigos básicos recomendados.

 
Evidentemente los códigos utilizados exclusivamente en una sola institución no se consideran en el documento SDMX Cross-domain Code Lists. Asimismo SDMX considera que es altamente recomendable que para nuevas implementaciones se haga un esfuerzo especial para utilizar tantos elementos como sea posible de las listas recomendadas.

 
Para saber más:

En el blog:

jueves, 9 de septiembre de 2010

Standard Code Lists Project de Eurostat

 

En Diciembre de 2009 el Consejo de Administración de Eurostat encarga a la unidad B6 de "Bases de datos de referencia y metadatos" la armonización de las listas de códigos utilizadas en el conjunto del Eurostat. A continuación se explican los antecedentes, las reglas y los procesos seguidos por dicha unidad en el mencionado trabajo de armonización.

¿Qué son las listas de códigos para fines estadísticos?

Las listas de códigos son metadatos estructurales asociados a los conceptos estadísticos utilizados en las tablas multidimensionales de la Web de Eurostat. En general estas listas se basan en las clasificaciones estadísticas oficiales, tales como NACE Rev. 2 y CIUO, pero también existen otras listas de códigos asociadas a conceptos tales como el sexo, la edad, el tiempo, etc. Actualmente existen alrededor de 500 listas de códigos en la base de datos Eurostat.

¿Por qué tienen que estar armonizadas las listas de códigos?

La gran mayoría de las listas de códigos utilizadas en las bases de datos de Eurostat, tanto en difusión como en producción, no están armonizadas en la actualidad. Esto significa que se utilizan a veces diferentes códigos para el mismo concepto estadístico (por ejemplo, para el concepto fabricación se utilizan los códigos "Dr", "B0200", "SE0_4" y "TOT_MANUF"  en cuatro bases de datos de producción diferentes, mientras que el código estándar para esta sección NACE es "D" en referencia a la industria).

Esta situación no es muy satisfactoria, tanto para los productores de datos como para los usuarios de los mismos , ya que implica realizar trabajos extra que suponen una fuente permanente de errores. Por ello la Unidad B6 de Eurostat, se ha embarcando en la elaboración, lanzamiento y gestión de listas de códigos estadísticos estandarizadas; el uso homogéneo de estas listas estandarizadas en todas las estadísticas y en todas las etapas del Ciclo de Vida de los Datos, facilita la administración de datos y su intercambio.

¿Cuáles son las normas utilizadas para armonizar las listas de códigos?

Los criterios utilizados por Eurostat para armonizar las listas de códigos son los siguientes:
  1. Se basan en las clasificaciones estadísticas oficiales o en el uso de estándares siempre que sea posible.
  2. Se utilizan sólo caracteres alfanuméricos, así como el "-" (guión) y el "_" (subrayado), con la finalidad de evitar los problemas relacionados con el uso de los códigos en  las aplicaciones de software. El guión "-" se utiliza para definir intervalos, y el subrayado "_" para la agregación de dos códigos.
  3. Para evitar problemas con los 'ceros' se utiliza un acrónimo como prefijo antes de los códigos numéricos.
  4. Para los agregados se insertan códigos adicionales en las listas estandarizadas siempre que éstos sean necesarios para la producción de datos y su difusión.
  5. Las listas de códigos deben ser directamente utilizables y cubrir la variedad de bases de datos de referencia.
¿Quién hace qué?

La unidad B6 de Eurostat elabora y mantiene las listas de códigos estandarizadas, basándose en la labor realizada por las unidades de producción y en estrecha colaboración con los administradores de los dominios de información estadística. Los códigos nuevos se envían a la unidad B6 por las unidades de producción y los administradores de dominios, para incluirlos en las revisiones regulares de las listas si la solicitud está justificada.

La unidad B6 difunde estas listas a través del servidor de metadatos de Eurostat, denominado RAMON, donde se publican clasificaciones, conceptos y definiciones, así como glosarios. Esto significa que las listas de códigos estandarizas también están disponibles para los usuarios externos. En el futuro, tras el desarrollo de nuevas aplicaciones en Eurostat, las listas de códigos estandarizadas se cargarán en su gestor de metadatos.

¿Cómo se deben utilizar estas listas de código estandarizadas?

Las listas armonizadas son o serán utilizadas en las Base de datos de referencia de Eurostat (NewCronos en la actualidad, y Eurobase en el futuro), así como en el entorno de difusión de estadísticas. Además los administradores de los dominios estadísticos deben utilizarlos, siempre que sea posible, en sus bases de datos de producción y en sus formatos de transmisión de datos. Incluso si a veces no es posible ninguna aplicación inmediata en el nivel de base de datos de producción, los administradores de dominio tienen que usarlos siempre que surja la oportunidad. La adopción de los códigos armonizados en la cadena de producción de datos permitirá reducir la necesidad de transcodification y el riesgo de errores.

Estos códigos armonizados podrían ampliarse también a los Estados miembros ya sea directamente o cada vez que éstos participan en los formatos de transmisión de datos definidos por Eurostat.

Para saber más:

jueves, 2 de septiembre de 2010

¿Qué es GENERICODE?

GENERICODE es un proyecto para definir un formato estándar de descripción de listas de códigos (también conocido como enumeraciones o vocabularios controlados). El proyecto tiene como objetivo proporcionar lo siguiente:
  1. Un modelo estándar y la representación XML del contenido de una lista de códigos.
  2. Un modelo estándar y la representación XML de los datos asociados con los elementos de una lista de códigos.
  3. Un modelo estándar y la representación XML de cómo nuevas listas se derivan de las listas existentes.
Este último punto distingue a GENERICODE de soluciones que no ofrecen más que una instantánea estática de los contenidos de una versión determinada de una lista de códigos. Por lo tanto, GENERICODE no sólo ofrece una representación de los elementos de una lista de códigos, también permite relacionar esa lista con las versiones anteriores de la misma, o con otras listas. Esto simplifica el esfuerzo para entender cómo una nueva versión de una lista difiere de la versión anterior y simplifica el cálculo de los efectos del cambio en los sistemas y procesos existentes.

GENERICODE ahora es una de las especificaciones OASIS (Organization for the Advancement of Structured Information Standards), y en ese sentido el OASIS Code List Representation TC está trabajando en una versión estandarizada de GENERICODE. Actualmente la especificación 1.0 de OASIS GENERICODE incluye las partes de la representación estática de la propuesta original del proyecto.

 
Asimismo, es importante señalar que GENERICODE es una de las especificaciones utilizadas dentro del estándar DDI (Data Documentation Initiative) para la descripción de listas de códigos en ficheros de datos, tal como consta en la DDI Technical Specification, April 2008, part I, section 4.3: Controlled Vocabularies. Asociado a estas especificacioens técnicas, se puede consultar el documento sobre buenas prácticas en la elaboración de Vocabularios Controlados preparado por uno de los grupos de trabajo de la DDI-Alliance en una sesión en la Schloss Dagstuhl, en Wadern (Alemania), en Noviembre de 2008.
   
Para saber más:

viernes, 27 de agosto de 2010

¿Qué es SKOS?

Simple Knowledge Organization System (SKOS) es una familia de lenguajes formales, diseñada para la representación de tesauros, sistemas de clasificación, taxonomías o cualquier otro tipo de vocabulario estructurado. SKOS se basa en RDF y RDFS, y su objetivo principal es permitir la publicación fácil de vocabularios controlados y estructurados para la Web semántica.


SKOS se desarrolla en el marco de la W3C y es uno de los vocabularios RDF utilizado en el proyecto SDMX-RDF para expresar el intercambio de datos y metadatos estadísticos en el estándar SDMX basado en RDF.

Para saber más: