Pagina's

vrijdag 6 april 2018

VOGIN IP 2018: textmining, wikidata en blockchain


Op woensdag 28 maart 2018 organiseerden VOGIN en vakblad InformatieProfessional gezamenlijk voor de zesde keer een VOGIN-IP-lezingendag. Dat is een dag vol met lezingen en workshops rond het thema “zoeken en vinden van informatie”. Voor iedereen die zich met informatie bezighoudt is dit een dag om te leren over de nieuwste trends en ontwikkelingen en om met vakgenoten te praten over de vernieuwingen in ons vakgebied. Het evenement vond plaats in de Openbare Bibliotheek van Amsterdam (OBA).

Het was druk in de OBA, honderden informatiespecialisten, functioneel beheerders, dataspecialisten etc. volgden gezamenlijk de keynote-lezing van de Amerikaanse bilbliothecaris Joseph Bush over artificial intelligence vs automation. Strekking van zijn (vrij technische) verhaal was dat je ondanks geautomatiseerd classificeren van informatie en het geautomatiseerd toekennen van metadata nog steeds ook mensen (informatiespecialisten!) in dit proces nodig hebt, onderwerpsspecialisten die toezicht houden op het proces. Hij hield verder een pleidooi om beter gebruik te maken van de data binnen organisaties: verzamelen, verwerken, analyseren en voorspellingen doen.

Meer lezen:
https://vogin-ip-lezing.net/presentaties-2018/#busch


In een productpresentatie van Marco van Gennip van Lexis Nexis werd gemeld dat 80% van de studenten in natural language zoekt (en niet met booleaanse operatoren). Hierop probeert LexisNexis in te spelen bij de verbetering van de interface van de databank. Hierover had ik nog wel wat meer willen weten.
 

In de Workshop Textmining van Hugo Benne (docent aan de ICT opleiding van de Haagse Hogschool) gingen we aan de slag met de gratis tool RapidMiner. We hadden thuis al een reader moeten bestuderen, de software moeten installeren en een paar videofilmpjes bekeken.
Textmining
 of textdatamining verwijst naar het proces om met allerhande ICT-technieken waardevolle informatie te halen uit grote hoeveelheden tekstmateriaal. Bij textmining wordt gezocht naar patronen in (of nieuwe informatie uit) ongestructureerde of semigestructureerde tekst in de vorm van natuurlijke taal.
Voorbeelden: een supermarkt onderzoekt in de transactionele gegevens uit de kassaregistraties welke producten vaak samen worden verkocht zodat deze artikelen fysiek bij elkaar in de buurt kunnen worden uitgestald in de winkel.


In 
het textmining proces heb je grofweg drie subprocessen: stap 1 is het bepalen welke dat je wilt gaan minen en het inlezen daarvan (collect); stap 2 is het voorbereiden (opschonen, structureren) van deze data (pre-proces) en de derde stap is het analyseren van de data (analyze).
In de workshop moesten we aan de slag met een casus over senimentanalyse van filmreviews. We moesten verschillende processen toepassen op een excelbestand met 1226 filmreviews voor 17 verschillende speelfilms. Doel van de opdracht was om te bepalen wat het sentiment van de reviews was en dat te vergelijken met de cijfers die de reviewers aan de film hadden toegekend.

Hoewel de workshop voor mij wat te technisch was, was mijn nieuwsgierigheid gewekt, ook omdat ik een jaar geleden op een bijeenkomst van medisch bibliothecarissen al had gehoord dat de technieken uit tekst- en datamining in toenemende mate worden toegepast op wetenschappelijke literatuur, zoals tijdschriftartikelen, monografiën en conference papers. Ik zal hierover meer informatie verzamelen en een workshop(je) geven voor geïnteresseerde collega’s.



Rein Tellier en Elwin de Man, werkzaam bij het Regionaal informatie knooppunt van de Politie Noord-Holland vertelden over hun project Forensisch OSINT (open source intelligence), een nieuwe methode van zoeken en vinden. Veel open deuren, maar wel interessant om te horen hoe zorgvuldig en juridisch correct de politie zich moet gedragen bij het verzamelen van informatie (op internet) over verdachte personen.
Zelfs hun presentatie mag niet zomaar op de Vogin-site gezet worden: Informatie over deze presentatie kan per mail aangevraagd worden bij elwin.de.man[at]politie.nl


Jaco van Ossenbruggen (Centrum Wiskunde en Informatica) hield een interessant verhaal over taal en veranderende begrippen: Detecteren van veranderingen in de betekenis van woorden en concepten (Enriching linked open data with distributional semantics to concept drift) oftewel.

Concept drift heeft betrekking op de veranderende betekenis van begrippen. Vroeger was het begrip ‘wetenschap’ verbonden met het bestuderen van Bijbelse teksten. Nu juist een seculiere activiteit. Of: Woorden die we gebruiken veranderen: migranten, vluchtelingen. Kunnen we relaties in linked open data gebruiken om te bestuderen hoe een concept veranderd is, bijv de term gay?
De onderzoeksgroep van Jaco bekijkt hoe fouten in linked open data voorkomen/opgelost kunnen worden, zodat je als je twee informatiesystemen koppelt één lijst met concepten en relaties kunt gebruiken. Dit heet ontology matching en heeft een link met het bouwen van een thesaurus om informatie van metadata te voorzien. Ook viel het begrip ‘distributional semantics’: welke woorden komen vaak met andere woorden voor?
En kun je voorspellen dat een term uit de mode raakt, wordt samengevoegd of opgesplitst?
De Waybackmachine: DBpedis probeert dit voor open data, trends analyseren.

Meer lezen:
https://vogin-ip-lezing.net/presentaties-2018/#ossenbruggen


Maarten Dammers hleld een pleidooi voor het delen van data via Wikidata
Wikidata is a free, collaborative, multilingual, secondary database, collecting structured data to provide support for Wikipedia, Wikimedia Commons, the other wikis of the Wikimedia movement, and to anyone in the world.


Wikidata is 5 jaar geleden gestart en heeft nu al 49 miljoen items, waaronder 3 miljoen over personen. Wikidata bevat 280.000 schilderijen. Data worden geautomatiseerd verzameld. Paar jaar geleden heeft iemand alle straten ingeladen in wikidata. Leek niet nuttig, maar bleek later handig ivm het koppelen van foto’s en informatie aan namen en schilders enz.
Elke claim is voorzien van een bron.

Leuk voorbeeld: Wiki loves monuments, begonnen in NL als fotowedstrijd om zoveel mogelijk foto’s en informatie over monumenten te verzamelen, is nu in 40 landen. Gegevens worden beetje bij beetje ingelezen in wikidata
Wikidata bevat 14 miljoen (wetenschappelijke) artikelen, ook gebruikt bij de bronvermeldingen in Wikidata.
Interessant om eens te bekijken: https://query.wikidata.org Je kunt hier zelf queries maken met de gegevens uit Wikidata: bijv. Welke grote steden hebben een vrouwelijke burgemeester? Of: wie is vandaag jarig?
Wat is de grootste schilderijencollectie?
Je kunt niet zomaar alle datasets op wikidata zetten, Wikidata legt de nadruk op samenhang met andere data. Publiceer je data als open data op je website, dan wordt je gemakkelijker gevonden door wikidata-verzamelaars.



Ruben Verborgh (Universiteit van Gent) vertelde over “Linked data, blockchain en andere epische sagen”
In zijn (voor mij wat te) technische verhaal legde hij uit waarom het internet geherdecentraliseerd moet worden en welke rol blockchain-technologie hierbij kan spelen
Als je nu een like geeft bij een Facebook post, staat die like op de server van Facebook. In zijn ideale model staat die like op jouw eigen server. Hierdoor krijg je een hele andere economie, waarbij grote techbedrijven zoals Google en Facebook  minder macht hebben over data.
Verborgh pleit voor het gebruik van linked data, die pas waardevol zijn als je meerdere bronnen combineert (linkt), bijv. link tussen twee bronnen, bijv. website vogin en de locatie OBA)
Blockchain is het nieuwe XML, te pas en te onpas gebruikt. Het is een technologie die nu bij bitcoin wordt gebruikt, maar die je ook zou kunnen gebruiken om data/informatie versleuteld van de ene naar de andere server te krijgen. Door ‘decentralized consensus’.






maandag 2 maart 2015

Verdiepdingen (10) : noodzaak van Webcare voor Xplora

Webcare zou zeker meer structureel onderdeel moeten zijn van ons takenpakket binnen Xplora, willen we contact blijven houden met onze doelgroep. We moeten zijn waar onze gebruikers zijn. Het is bovendien een van de manieren waarop we studenten kunnen helpen bij hun zoektocht naar literatuur en andere informatie. Ik zou heel graag eens praten met onze Avans-collega Sylvia van Gils die in een artikel in Marketingfacts uitlegt wat Avans aan webcare doet. Heel interessant.

Ik probeer zelf bij te houden wat er over Xplora gezegd wordt via een RSS-feed van een zoekopdracht naar het woord 'Xplora' in Google, maar ook via Instagram (#xplora #avans) en Twitter. Soms verzuchten studenten dat ze moeite hebben met het vinden van literatuur. Een goede reden om onze dienstverlening onder de aandacht te brengen!


















Ik zag bovenstaande tweet te laat, de vraag was al beantwoord, maar deze vraag zag ik op tijd:


woensdag 17 december 2014

(7) Verdiepdingen : content curatie

Ik heb vorig jaar rond deze tijd al een blogbericht geschreven over Muziekcuratie, een vorm van content curatie die erg in de mode lijkt.

Als ik lees wat er onder verstaan wordt, doet me dat erg denken aan mijn vorige baan als documentalist, misschien met het verschil dat punt 5. het Delen belangrijker is dan ooit.

Content curatie is een middel om iets te doen aan de informatie overload bij medewerkers.

Principe van content curatie in 5 stappen:
1. Identificeren van bronnen – Welke zijn interessant voor jouw klanten?
2. Verzamelen – Verzamel content per onderwerp.
3. Documenteren – Leg de oorspronkelijke bron van de content vast.
4. Context – Verschaf context en plaats het artikel in een kader.
5. Delen – Presenteer de informatie op een handige manier die past bij jouw doelgroep.

What's in a name, content curatie lijkt een nieuw modewoord, maar als we daardoor ons werk als informatiespecialist meer gewicht kunnen geven, is dat mooi meegenomen.



Een van de hulpmiddelen om aan content curatie te doen, Scoopit, had ik al eens uitgeprobeerd voor Verpleegkunde
Ik stuitte op een boek van de Aanwinstenlijst gezondheidszorg van de Haagse Hogeschool op Scoopit. Ik heb me direct geabonneerd op deze aanwinstenlijst. Dit zou wel eens een heel leuk idee kunnen zijn voor onze eigen Academie voor Gezondheidszorg!
Ondertussen wordt er binnen Xplora al druk geëxperimenteerd met Scoopit, bijv. binnen het domein Welzijn en Economie.

Een andere tool voor contentcuratie is Storify. Ik vond een leuk voorbeeld van het verhaal dat Storify vertelt over de jaarlijkse KNVI-dag in 2013, aan de hand van Tweets van deelnemers aan deze dag.

vrijdag 12 december 2014

(8) Verdiepdingen: copyright en creative commons

Creative Commons: eenvoudig gezegd komt het erop neer dat je dan geen vergoeding hoeft te ontvangen voor je werk, maar dat men op z’n minst naar jouw werk verwijst.

Me nooit gerealiseerd dat de dingen die ik op mijn blog schrijf ook een Creative Commons-licentie kunnen hebben, vandaar dat ik met behulp van de CC-site nu ook een vermelding op mijn blog heb opgenomen:
Creative Commons-Licentie
Dit werk valt onder een Creative Commons Naamsvermelding-NietCommercieel-GelijkDelen 4.0 Internationaal-licentie.

Via Pixabay heb ik gezocht naar CC-foto's. Leuk die rechtenvrije foto's en goed om daar wat bewuster mee om te gaan.
Maar het lukte me niet om plaatjes op te slaan en te uploaden naar mijn blog.
Uiteindelijk in Flickr gezocht naar CC-foto's en de html-code gebruikt van een plaatje en dat werkte wel, hoera.



Andere leuke sites voor rechtenvrije foto's: Skitterphoto, Unsplash en Gratisography


donderdag 27 november 2014

(5) Facebook Verdiept : kijk eens naar je apps-privacy!














(bron: Taratamiko.com)

De cursus Verdiepdingen geef goede tips om je privacy-instellingen in Facebook eens aan te pakken.
Nou had ik dat een tijd terug al goed gedaan, dacht ik zelf. Op mijn openbare profiel is niet zo veel interessants over mij te lezen.
Maar ik vergat dat ik inmiddels een aantal apps gebruik die informatie krijgen van Facebook.
Daarom heb ik via Instellingen > apps ook wat informatie-lekken gedicht. Hoop ik.
Lees maar eens welke gegevens worden doorgegeven als je via Facebook inlogt bij bepaalde apps . Niet alleen die van jezelf maar ook gegevens van je vrienden!


woensdag 12 november 2014

(4) Verdiepdingen : privacy en veiligheid online


Scary filmpje. Meteen gekeken wat er over mezelf op internet te vinden is.
Als ik mezelf Google tussen aanhalingstekens zoek, krijg ik 1300 resultaten, maar alleen een verwijzing naar Twitter op de eerste pagina en naar Blogger op de tweede pagina. Mijn naam komt verder erg vaak voor (vooral in de advocatuur...), wat wel voor wat aangename 'ruis' zorgt.
Pas als ik het woord 'blog' bij mijn naam type kom ik op pagina 2 deze blog tegen en een reactie op een weblog over schaliegas. Als ik blog vervang door 'Facebook' vind ik mezelf niet.
Volgens mij heb ik mijn privacy-instellingen redelijk ingesteld, want op werkgebied wil ik best goed vindbaar zijn, maar privé liever niet té.

maandag 10 november 2014

(3) Verdiepdingen: Instagram



Leuke tool!
Op mijn ipad had ik het al eens geïnstalleerd, maar sinds ik de iphone van mijn zoon heb overgenomen kan ik natuurlijk helemaal gemakkelijk instagrammen.








Ik heb me geabonneerd op de posts van een aantal collega's en van Avans, maar de leukste waren toch wel die van NOSjeugdjournaal en de bèta-versie van NOS Kort. De NOS hoopt via filmpjes van 15 seconden mensen warm te maken voor de langere items op tv of op haar website. Ik zie al helemaal voor me dat we voor Xplora onze dienstverlening in korte filmpjes samen vatten, als een soort teasers. Hopelijk maken die filmpjes nieuwsgierig naar de uitgebreidere uitleg...