LINUXSOFT.cz Přeskoč levou lištu
Uživatel: Heslo:  
   CZUKPL

> MySQL (37) - použití fulltextového vyhledávání

MySQL umí vyhledávat fulltextem. Co to je, k čemu to použít a na co dát pozor se dozvíte v dnešním díle seriálu.

9.9.2005 07:00 | Petr Zajíc | Články autora | přečteno 32808×

Komerční sdělení: Pořádáme Kurzy MySQL

Nástroji, které se dají použít pro fulltextové vyhledávání se jednotlivé databázové systémy liší, někdy dosti podstatně. V případě MySQL mám pro Vás dobrou zprávu - tato databáze umí používat fulltext a jde jí to celkem dobře. Fulltextové vyhledávání bude námětem dnešního článku. Protože (zejména při spolupráci MySQL, nějakého skriptovacího jazyka a webu) se Vám tato funkce může velice hodit, rozebereme si ji poměrně podrobně, hned ve dvou dílech. Nejprve však mi dovolte nastínit něco teorie.

Fulltextové vyhledávání

Podle definice je fulltext "metoda vyhledávání textu uvnitř dokumentů". Jako klasický příklad se uvádí situace, kdy máte k dispozici sadu textů (možná umístěných v síti internet, na disku a podobně) s různými tématy a jediný cíl - najít text, který se bude zabývat vyhledávaným slovem, slovním spojením nebo frází. Většina definic jedním dechem dodává, že v databázích se k realizaci fulltextového vyhledávání používá speciální typ indexu.

Typickou fulltextovou funkci tedy "nakrmíte" seznamem prohledávaných textů a hledaným výrazem. Výsledkem je (nejčastěji) číslo, kterému se říká relevance (český ekvivalent závažnost nebo váha se v odborných kruzích moc neujal) a které uvádí pravděpodobnost, že prohledávaný článek obsahuje to, po čem jsme pátrali. Velice častým výstupem je potom seřazení výsledků sestupně podle relevance (tedy nejpravděpodobnější výsledky nejvýše).

Fulltextové vyhledávání plní trochu komplexnější úlohu než funkce pro práci s textem vyhledávající jeden řetězec v jiném (v MySQL představované třeba řetězcovou funkcí INSTR). Fulltext totiž umí při vyhledávání zohlednit četnost vyhledáváných slov v daném textu, jejich vzájemnou vzdálenost a podobně. Existují dokonce nástroje pro jemné doladění prohledávání - třeba příkaz pro "umělé" snížení relevance některého z hledaných slov.

Fulltext a MySQL

To, co jsme uvedli v definici platí i pro MySQL - s jistými omezeními. Měli byste ale vědět, že v praxi ani sebelepší fulltext není všemocný. Pokud se budete pohybovat v česko-slovenských vodách, měli byste vědět, že v souvislosti s použitím fulltextu v MySQL můžete pěkně narazit na:

  • diakritiku. Ne snad, že by si fulltextové vyhledávání s diakritikou neumělo poradit. Spíše ale budete prohledávat texty (například diskuse k článkům), v nichž někdo diakritiku používá a někdo ne. Slovo kočička tak nebude vůbec odpovídat slovu kocicka.
  • skloňování. Slovo kočička nebude MySQL považovat za stejné jako výraz kočiček, takže v tomto případě obdržíte při vyhledávání takové výsledky, jako by se jednalo o dvě naprosto různá slova.

Pozn.: V této souvislosti je zajímavé vědět, že existují fulltextové vyhledávače, které skloňování umí. Ne však v MySQL; takové nástroje patří mezi velmi pokročilé a používají se především u internetových vyhledávačů. A ještě doplním, že technologie za většinou vyhledávačů je mnohem komplexnější, než aby obsahovala "pouhý" fulltext.

Při používání fulltextu v MySQL byste měli vědět o dalších omezeních, které je nutné vzít v úvahu. Patří mezi ně:

  1. Fulltextové vyhledávání lze (celkem logicky) používat pouze u sloupců obsahujících řetězce (tedy CHAR, VARCHAR nebo TEXT)
  2. Fulltextové vyhledávání nerozlišuje velikost znaků. To však lze obejít tím, že je sloupec definován s klíčovým slovem BINARY - pak je brána v úvahu i velikost písmen.
  3. Fulltextové vyhledávání lze použít u MySQL pouze tehdy, pokud jsou prohledávané tabulky typu MyISAM. O typech MySQL tabulek jsme ještě v tomto seriálu nehovořili, takže vám jen poskytnu link na oficiální dokumentaci a nechám to na jindy.
  4. To, že daná tabulka má "umět" fulltextové vyhledávání lze určit již při její definici, nebo kdykoli později. Vzhledem k tomu, že MySQL používá pro zajištění fulltextového prohledávání tabulek index, platí pravidlo, které jsme již rozebírali - při hromadném nahrávání dat se vyplatí případný index zrušit, nahrát všechna data a pak jej znovu vytvořit. Je to mnohem rychlejší než plnit masivně daty tabulku, která už nějaký fulltextový index obsahuje.
  5. Jelikož je fulltext realizován indexem, můžete v MySQL touto metodou prohledávat více sloupců najednou (pomocí indexu vytvořeného na více sloupcích).
  6. Jelikož je fulltext realizován indexem, můžete mít v jediné tabulce i více fulltextových indexů. To se může hodit - jednou budete chtít vyhledávat například podle textu článku, jindy i podle jména autora či perexu.
  7. Jelikož je fulltext realizován indexem, nemůžete v MySQL bohužel fulltextem vyhledávat data pocházející z více než jedné tabulky. To může nasazení fulltextu pro některé projekty zhola znemožnit, protože existující data mohou být ve více souvisejících tabulkách.

Aby těch omezení nebylo málo, platí pro práci s fulltextem v MySQL i další "pravidla hry".

  1. Fulltextové vyhledávání funguje smysluplně pouze pro větší počet záznamů. Tabulku s jedním záznamem nelze smysluplně fulltextovat.
  2. Slova kratší než 4 písmena jsou z fulltextového vyhledávání vypuštěna. Takže, výraz pes si fulltextově nevyhledáte. (U verze databáze 4.0 nebo vyšší lze ovšem minimální délku slova pro zahrnutí do fulltextu nastavit)
  3. Existuje seznam tzv. "stop slov", která jsou často používána a která jsou z vyhledávání vyloučena. Patří mezi ně například anglický člen the. Seznam lze upravit.
  4. Dále, existuje pravidlo "padesátiprocentního prahu". To stanoví, že slova, která se vyskytují ve více než 50% prohledávaných záznamů jsou z fulltextování vyloučena. To lze "vypnout" přepsáním zdrojového kódu MySQL a rekompilací nebo obejít pomocí alternativní metody práce s fulltextem
  5. Konečně, verze MySQL 4.0.1 a vyšší obsahují tzv. BOOLEAN MODE fulltext, který umožňuje mnohem pokročilejší práci s fulltextem a který vám rozhodně příště předvedu.

Vytvoření fulltextového indexu

Mějme v MySQL tabulku obsahující sloupce CHAR, VARCHAR nebo TEXT. Klasicky se fulltextové vyhledávání předvádí na fragmentu nějakého webového redakčního systému - je to sice poněkud otřepané, ale typické, takže se toho budu rovněž držet.

create table clanky (nazev varchar (50), zneni text);

Na této tabulce můžete vytvořit fulltextový index takto:

alter table clanky add fulltext (zneni);

a/nebo, pokud bychom byli dychtivi vyhledávání rovněž v názvech článků, lze definovat jiný fulltext

alter table clanky add fulltext (nazev, zneni);

Oba fulltextové indexy mohou existovat na tabulce současně. Dost to zpomalí aktualizaci tabulky, ale umožní to vyhledávat výrazy jak v článku, tak v kombinaci článek + název.

Pozn.: Hořekování nad pomalostí změny dat v tabulkách však leckdy nemá u fulltextových vyhledávání valný význam. Často se touto metodou zpracovávají data, která se mění jen jednou nebo zřídka (jako třeba právě články v databázi redakčního systému) a právě u nich je ztráta času při vložení záznamů snesitelná.

Tento díl seriálu byl jen teoretický (pro někoho možná až příliš). Nicméně příští díl bude nabit praktickými ukázkami vyhledávání, takže se máte na co těšit. Ukážeme si, jak vyhledávat fulltextově v rozsáhlých datech - ještě prozradím, že to budou opravdu data "ze života", takže doufám, že to bude pro čtenáře přínosné.

Verze pro tisk

pridej.cz

 

DISKUZE

Fulltext feature :) 17.2.2006 13:38 Jihad




Příspívat do diskuze mohou pouze registrovaní uživatelé.
> Vyhledávání software
> Vyhledávání článků

15.4.2017 15:20 /František Kučera

Máš rád svobodný software a hardware nebo se o nich chceš něco dozvědět? Zajímá tě IoT a radiokomunikace? Přijď na sraz spolku OpenAlt, který se bude konat ve středu 19. dubna od 18:30 v Šenkovně (Sokolská 60, Praha 2).


Přidat komentář

5.3.2017 19:12 /Redakce Linuxsoft.cz
PR: 23. března proběhne v Praze konferenci na téma Cloud computing v praxi. Hlavními tématy jsou: Nejžhavější trendy v oblasti cloudu a cloudových řešení, Moderní cloudové služby, Infrastruktura současných cloudů, Efektivní využití cloudu, Nástrahy cloudových řešení a jak se jim vyhnout.
Přidat komentář

27.2.2017 22:12 /František Kučera
Pozvánka na 137. sraz OpenAlt – Praha: Tentokrát jsme si pro vás připravili neobvyklou akci. Ve středu 1.3. v 17:30 nás přivítá sdružení CZ.NIC ve svých prostorách v Milešovské ulici číslo 5 na Praze 3, kde si pro nás připravili krátkou prezentaci jejich činnosti. Následně navštívíme jejich datacentrum pod Žižkovskou věží. Provedou nás prostory, které jsou běžnému smrtelníkovi nedostupné!
Po ukončení prohlídky se všchni odebereme do hostince U vodoucha, Jagelonská 21, Praha 3 pochutnat si na některém z vybraných piv či dát si něco na zub. Rezervaci máme od 19:30, heslo je OpenAlt.
Ale pozor! Do prostor datového centra máme omezený přístup, dostane se tam pouze 10 lidí! Takže kdo přijde dříve, ten má přednost, a občanky s sebou! Kdo nebude chtít na prohlídku datového centra, může se pomalu přesunout do hostince U vodoucha a u nepřeberné nabídky piv počkat na ostatní.
Přidat komentář

18.1.2017 0:49 /František Kučera
Členové a příznivci spolku OpenAlt se pravidelně schází v Praze a Brně. Fotky z pražských srazů za uplynulý rok si můžete prohlédnout na stránkách spolku. Příští sraz se koná už 19. ledna – tentokrát je tématem ergonomie ovládání počítače – tzn. klávesnice, myši a další zařízení. Také budete mít příležitost si prohlédnout pražský hackerspace Brmlab.
Přidat komentář

8.1.2017 17:51 /František Kučera
Máš rád svobodný software a hardware nebo se o nich chceš něco dozvědět? Přijď na sraz spolku OpenAlt, který se bude konat ve čtvrtek 19. ledna od 18:30 v pražském hackerspacu Brmlab. Tentokrát je tématem srazu ergonomie ovládání počítače – tzn. klávesnice, myši a další zařízení. K vidění bude mechanická klávesnice dasKeyboard, trackball Logitech nebo grafický tablet (a velký touchpad) Wacom. Přineste i vy ukázat svoje zajímavé klávesnice a další HW. V 18:20 je sraz před budovou, v 18:30 jdeme společně dovnitř, je tedy dobré přijít včas. Podle zájmu se později přesuneme do nějaké restaurace v okolí.
Přidat komentář

1.12.2016 22:13 /František Kučera
Máš rád svobodný software a hardware nebo se o nich chceš něco dozvědět? Přijď na sraz spolku OpenAlt, který se bude konat ve čtvrtek 8. prosince od 18:00 v Radegastovně Perón (Stroupežnického 20, Praha 5). Sraz bude tentokrát tématický. Bude retro! K vidění budou přístroje jako Psion 5mx nebo Palm Z22. Ze svobodného hardwaru pak Openmoko nebo čtečka WikiReader. Přijďte se i vy pochlubit svými legendami, nebo alespoň na pivo. Moderní hardware má vstup samozřejmě také povolen.
Komentářů: 1

4.9.2016 20:13 /Pavel `Goldenfish' Kysilka
PR: Dne 22.9.2016 proběhne v Praze konference Cloud computing v praxi. Tématy bude např. nejnovější trendy v oblasti cloudu a cloudových řešení, provozování ERP v cloudu, o hostování různých typů softwaru, ale třeba i o zálohování dat nabízeném podnikům formou služby.
Přidat komentář

1.9.2016 11:27 /Honza Javorek
Česká konference o Pythonu, PyCon CZ, stále hledá přednášející skrz dobrovolné přihlášky. Máte-li zajímavé téma, neváhejte a zkuste jej přihlásit, uzávěrka je již 12. září. Konference letos přijímá i přednášky v češtině a nabízí pomoc s přípravou začínajícím speakerům. Řečníci mají navíc vstup zadarmo! Více na webu.
Přidat komentář

   Více ...   Přidat zprávičku

> Poslední diskuze

17.4.2017 19:15 / Jakub shoop
chyba

7.4.2017 15:43 / Som
foreign car repair

31.3.2017 18:33 / David Ostrovsky
Dotazník na obeznámenost s hummusem.

24.3.2017 11:54 / Hui
country cottages

16.3.2017 16:33 / BezvaDesign.cz
Re: Hledám grafika do teamu

Více ...

ISSN 1801-3805 | Provozovatel: Pavel Kysilka, IČ: 72868490 (2003-2017) | mail at linuxsoft dot cz | Design: www.megadesign.cz | Textová verze