Zoek op trefwoord in al mijn blogartikelen

Posts tonen met het label metadata fotografie. Alle posts tonen
Posts tonen met het label metadata fotografie. Alle posts tonen

dinsdag 14 juli 2020

Nieuwe zoekinterface voor WikimediaCommons

Hay Kranen bouwde een alternatief voor het zoekscherm van WikiMediaCommons dat beter functioneert en bovendien gebruiksvriendelijker is, Hay’s ‘Structured Search’.


WikiMediaCommons is de beelddatabank achter Wikipedia met ruim 60 miljoen beelden.

Je mag de beelden zelf meestal ook vrij gebruiken maar dan moet je dus wel geschikt materiaal kunnen vinden. Het probleem is dat de metadata* (de gegevens die over het beeldmateriaal zijn vastgelegd) niet eenduidig of incompleet zijn vastgelegd. Hay Kranen bouwde echter een nieuwe zoekinterface die hier verbetering in brengt en bovendien een stuk gebruikersvriendelijker is dan de originele zoekoptie van WikimediaCommons. Op woensdag 10 juni 2020 was hij te gast bij Herbert Blankensteijn in deze podcast van BNR (v.a. circa 12 minuten). In zijn nieuwsbrief ‘de Circulaire’ had Hay enkele weken eerder al over zijn initiatief geschreven.


In de zoekinterface van WikimediaCommons zelf is het bijvoorbeeld lastig om beelden vinden met metadata in een andere taal. Zoek je een boom dan vindt je dus geen foto’s die getagd zijn met ‘tree’ of ‘baum’


Hay heeft geen nieuwe zoekmachine gemaakt maar maakt gebruik van bestaande componenten en gebruikt die slim en combineert ze. Een belangrijk component is ‘’gestructureerde data” waarmee twee problemen worden aangepakt:


  1. De meertaligheid zoals in het voorbeeld hierboven genoemd (boom, tree, baum)
  2. De meerdere betekenissen die een woord kan hebben. Kiwi bijvoorbeeld kan slaan op een vrucht, een vogel of een inwoner van Nieuw Zeeland. Wanneer je op zoek bent naar foto’s van de vogel dan wil je die ook alleen in je zoekresultaten zien.


Bij gestructureerde data hebben daarom alle begrippen (items) een eigen unieke nummer (het Q-nummer). Deze worden door WiKidata uitgegeven, een ander Wiki project waar de Q-nummers worden beheerd (daar waar in Wikipedia de artikelen worden beheerd en audio- en beeldmateriaal in WikiMediaCommons) De vogel Kiwi heeft dan ook een ander nummer dan de vrucht.


Als een fotograaf nu een foto van een Kiwi (vogel) uploadt naar WikiMedia Commons dan kan hij of zij meteen de juiste link aanbrengen naar het ‘Kiwi’begrip (namelijk die van de vogel). Op dit moment is nog maar een paar procent van de beelden voorzien van deze gestructureerde data maar dat wordt snel beter (iedereen kan ze aanbrengen en bij nieuwe uploads wordt er actief om gevraagd). Daarna zijn de betreffende afbeeldingen een stuk beter vindbaar met behulp van het juiste zoekgereedschap, bijvoorbeeld Hay’s ‘Structured Search’

 

Als ik nu ‘kiwi’ in het zoekvenster typ verschijnen meteen de ‘categorieën’ waaronder het woord Kiwi beschikbaar is. Omdat ik op zoek ben naar de vogel klik ik de bovenste aan met het Q-nummer Q43642 en vervolgens krijg ik alleen maar vogels in mijn zoekresultaten.


* Beeldmateriaal zoeken gebeurt over het algemeen aan de hand van de gegevens die erover zijn vastgelegd in plaats van echte beeldherkenning. Zoek je een foto van een boom dan zoekt de zoekmachine dus niet echt naar afbeelding die de software herkent als een boom maar kijkt hij in de metadata (zoals bijvoorbeeld het veld ‘trefwoorden’). Als daar het woord ‘boom’ is ingevuld wordt het betreffende beeld in de zoekresultaten getoond. Voor meer achtergrond over metadata zie ook mijn artikelen over Keywording, Keywording deel2 of dit deel over ‘echte’ beeldherkenning.

 


maandag 1 augustus 2011

Twee waarnemingen op de 5e internationale foto metadata conferentie


Twee interessante waarnemingen voor de digitale fotograaf op de 5e internationale foto Metadata Conferentie in Istanboel op 20 mei jongstleden waren:
  • De release van het “CEPIC/IPTC Image Metadata Handbook”
  • De uitgave van het “Embedded Metadata Manifesto (2011)”
Als eerste is er dus het Metadata Handboek vrijgegeven.
Dit handboek (voor iedereen hier kosteloos te downloaden) is uitgegeven door de CEPIC en bevat ondermeer ook bijdragen van de IPTC.

CEPIC staat voor “Coordination of European Picture Agencies Stock Press and Heritage” en als zodanig zijn ze de spreekbuis van de beeldindustrie in Europa.

IPTC staat voor “International Press Telecommunications Council”, een consortium van werelds belangrijkste persbureaus en uitgevers. De belangrijkste taak van het IPTC is het ontwikkelen en onderhouden van technische standaarden ten behoeve van de nieuws uitwisseling.
Concreet betreft het handboek niet een enkel boek maar een aantal PDF bestanden:
  • Image Metadata planning, een gids voor zakelijke gebruikers
    In 17 hoofdstukken wordt hier uitgelegd wat metadata is, wat de zakelijke rechtvaardiging (business case) voor het gebruik er van is, hoe je er in de praktijk mee om kunt gaan en worden er voorbeelden gegeven voor verschillende vakgebieden.
  • Een document over de relatie van metadata en copyright
  • Een quick reference kaart voor het gebruik van de IPTC Core velden
  • Een quick reference kaart voor het gebruik van de IPTC Extension velden
  • Een interactieve metadata workflow planning tool om te bepalen welke IPTC velden gebruikt moeten worden in diverse stadia van een zakelijke werkproces
Wie mee wil discussiëren over het handboek kan op de daarvoor in het leven geroepen Yahoogroup terecht: http://groups.yahoo.com/group/iptc-photometadata


Het tweede onderwerp betreft het “Embedded Metadata Manifest (2011)”
Dit manifest gaat er over hoe metadata in digitale media bestanden ingebed kan worden en hoe het kan worden behouden. Het manifest is uitgegeven door de IPTC Photo Metadata Working Group op de 5e internationale foto Metadata Conferentie in Istanboel op 20 mei 2010.
Beeldmakers als fotografen, filmmakers, ontwerpers maar ook bibliothecarissen en curatoren hebben een gemeenschappelijk probleem. Ze worstelen allemaal om grip te houden op hun alsmaar groeiende collecties digitale media bestanden zoals foto’s en video’s en om de individuele bestanden daarin te kunnen volgen.

Met dit in gedachten draagt de werkgroep 5 principes in hun manifest uit:
  1. Metadata is essentieel om digitale media te beschrijven, te identificeren en te volgen. Daarom moet metadata worden toegekend aan alle digitale media zoals bestanden of data streams, met name in een professionele context
  2. Media bestandsformaten moeten (worden) voorzien in mogelijkheden om metadata te inbedden zodanig dat verschillende software systemen er mee om kunnen gaan. Veelal gaat dat beter met de metadata ingebed in het bestand dan met losse ‘sidecar’ bestanden waarbij het risico op verlies te groot is
  3. De betekenis van metadatavelden (inclusief de ‘labels’ in de gebruikers interfaces) en hun waardes mogen niet veranderen of verloren gaan bij omzetting naar andere formaten
  4. Copyright gegevens mogen nooit van de bestanden verwijderd worden. Deze gegevens zijn de enige manier om te voorkomen dat digitale bestanden als orphaned work (wees) worden beschouwd. Het verwijderen van deze data met de intentie om het eigenaarschap over te nemen is in veel landen verboden
  5. Andere gegevens mogen alleen verwijderd worden van bestanden wanneer de copyright houder daar toestemming voor geeft.
    Zorgvuldig gekozen en toegekende metadata velden voegen waarde toe aan media bestanden. In de meeste collecties is beschrijvende metadata essentieel voor het terugvinden en het begrijpen van de bronbestanden. Wanneer deze informatie wordt verwijderd devalueert de waarde van het bestand