Artikel top billede

Dansk projekt: Udklæk brugbar data fra tekstfiler

Tema: En dansker er sammen med en gruppe spaniere i gang med at udvikle et system, der finder sammenhænge mellem tal i virksomhedens datawarehouse og tekstdokumenter.

I en virksomhed falder salgstallet i et bestemt marked, men måske findes forklaringen ikke i ens taldata, men i en e-mail, virksomheden tidligere har modtaget.

Sammen med spanske kolleger har Torben Bach Pedersen fra Center for Dataintensive Systemer på Aalborg Universitet i denne uge fremvist en prototype på et system, der kan finde forklaringer på dataudsving i "bløde" tekstkilder.

Det skete på en international konference for databaser i Tyrkiet, hvor der ifølge Torben Bach Pedersen var stor interesse for at høre om teknologien ved fremvisningen onsdag og torsdag.

Multidimensionelle data

Med OLAP – online analytical processing – kan business intelligence-programmer analysere datawarehouses, hvor data er "bundet til hinanden".

Man arbejder med multidimensionelle data, hvor dimensionerne for eksempel kan være måneder, typer, kunder, produkter og regioner.

Altså kan man finde meget snævre sammenhænge i tallene - men én dimension har manglet.

"Vi ser i virksomhederne, at de har deres datawarehouse og utrolig meget taldata fra regnskaber og så videre. Og så har de en masse tekst-information. Det kan både være fra eksterne kilder og interne dokumenter. Men det er svært at binde data og tekst sammen, så man kan finde sammenhænge på tværs af informationstypen," siger Torben Bach Pedersen.

Sammenhænge mellem aktiekurser og Irak

Prototypen er blevet testet ved at lade programmet hente data for verdens aktiemarkeder. Samtidig har gruppen bag indsat artikler fra erhvervsaviser.

Torben Bach Pedersen og kollegerne har så søgt efter "Iraq" i programmet. Derefter har den fundet de markedsudsving, der ifølge erhvervsaviserne har haft noget med Irak at gøre.

Den søger altså ikke bare efter ordet "Iraq", men også hvor relevant ordet er i sammenhængen.

Den ser blandt andet på, hvilke værdier, som artiklen nævner, og som den kan genkende i data fra datawarehouset.

"Det viser sig, at det traditionelt er det japanske marked, der er mest følsomt over for uro i Irak på grund af Japans olieafhængighed," siger Torben Bach Pedersen.

Derimod var det tyske aktiemarked ikke særligt påvirket, og programmet fandt tekstbidder, der fortalte, at Tyskland fik mindre end to procent af sin olie fra Irak og Kuwait.

Ingen textmining i Danmark endnu

Den dansk/spanske gruppe er ikke den eneste, der arbejder med at grave efter årsager og konsekvenser i tekster og ikke kun i traditionelle datawarehouses.

Ernst Kier er salgschef i det nordiske BI-konsulenthus Platon og fortæller, at især SAS Institute og SPSS arbejder med den relaterede textminingsteknologi.

Ved textmining er teksten en selvstændig datakilde, hvor det måske nok er muligt at finde sammenhænge mellem kurser og tekster, men du kan ikke søge automatisk i alle dimensioner på en gang.

Efterspørgslen er dog stadig efter den traditionelle datamining, og Platon har derfor slet ikke haft nogle textminingsopgaver.

"Der skal først være en businesscase, og derfor er nogle nødt til at løbe forrest. Det er fornuftigt, at universiteter hjælper med at løbe det i gang, og det skal nok blive stort på et tidspunkt," siger Ernst Kier.

Det dansk/spanske system henter for nuværende dokumenter ind i et dokument-warehouse via XML, men planen er på længere sigt, at det kan finde kilder på hele internettet via søgemaskiner.




Brancheguiden
Brancheguide logo
Opdateres dagligt:
Den største og
mest komplette
oversigt
over danske
it-virksomheder
Hvad kan de? Hvor store er de? Hvor bor de?
Ciklum ApS
Offshore software- og systemudvikling.

Nøgletal og mere info om virksomheden
Skal din virksomhed med i Guiden? Klik her

Kommende events
Bliv klar til AI Act: Det vil påvirke både din udvikling, drift og organisation

Fordelene ved at anvende kunstig intelligens bliver stadig mere udtalte, og både som virksomhed og myndighed er det i stigende grad uholdbart ikke at udforske mulighederne. Men der er også risici forbundet på den nye teknologi, og på dette formiddagsseminar ser vi på, hvordan verdens første regulatoriske kompleks – EUs kommende AI Act – adresserer behovet for en etisk, ansvarlig og kontrolleret anvendelse af AI.

20. august 2024 | Læs mere


Det Digitale Produktpas

Kom med og hør om, hvordan du kommer i gang med at sikre din virksomhed er klar til Det Digitale Produktpas. Vi sætter fokus på, hvordan du bliver klædt på til at få styr og struktur på dine data, samt hvilke krav du skal sætte til dine leverandører og andre i din værdikæde, for at sikre den nødvendige information er tilgængelig.

21. august 2024 | Læs mere


Cyber Security Summit 2024

På Cyber Security Summit får du indsigt i det aktuelle trusselslandskab, overblikket over de nyeste værktøjer og trends indenfor sikkerhedsløsninger, indsigt i de relevante rammeværktøjer og krav samt de bedste løsninger og værktøjer til at sikre effektiv drift og høj compliance.

27. august 2024 | Læs mere