LINUXSOFT.cz Přeskoč levou lištu
Uživatel: Heslo:  
   CZUKPL

> PostgreSQL (11) - Výběr pomocí vzorků

V tomto díle bude probrán výběr porovnáním textů se vzorky, nejen jednoduchými. ale i těmi, které umí způsobit mnoha programátorům bolení hlavy - regulárními výrazy, s ohledem na jejich použití v PostgreSQL serveru.

13.6.2005 11:00 | MaReK Olšavský | Články autora | přečteno 16969×

Komerční sdělení: Pořádáme Kurzy PgSQL

PostgreSQL server na rozdíl od MySQL, zcela určitě i dalších, nepodporuje fulltextové vyhledávání, což se může zdáti nevýhodou, ale není tomu tak. V MySQL, kde je tato funkce, v rámci některých (webových) projektů, využívána to obnáší použití speciální indexace, což není ještě nejvážnější problém, ale při použití této vlastnosti jako takové lze velmi často narazit na problémy při použití národních znakových sad.

Vyhledávání na PostgreSQL lze realizovat velice jednoduše, použitím funkcí LIKE a SIMILAR TO, přičemž přetím je třeba si předtím vstupní řetězec, sestává-li se z více slov, rozdělit na jednotlivé části, to lze realizovat buď zpracováním na úrovni aplikace, případně pomocí stored procedury na straně serveru (dle názoru autora se jedná o vhodnější způsob a uloženým procedurám bude věnována značná část seriálu.

Regulární výrazy

Zápis ^.+@.+\\..+$ může způsobit většině začínajících programátorů menší bolení hlavy, jedná se však o nejjednodušší možný regulární výraz, kterým se dá ověřit, zda-li je řetězec korektně zapsanou e-mailovou adresou (ověřit její existenci je věc trochu jiná). Samozřejmě, že i tento regulátní výraz lze napsat o něco složitěji a korektněji, protože v tomto případě bude jako validní mail vyhodnocen i řetězec 'ja@b..cz'.

Regulární výrazy si lze představit, jako obecné vzorky, které postihují tvar řetězce, poměrně pěknou začátečnickou příručku na regulární výrazy napsal Pavel Satrapa, k nalezení je na jeho stránkách. Zde v pár odstavcích bude pouze to nejjednodušší možné. Vzorky mohou být jednoduché, popisující jen znakové řetězce, případně velmi složité, popisující i opakování částí řetězce, jejich zrcadlení, atp.

Nejprve budou uvedeny alespoň některé řídící znaky používané v regulárních výrazech (a jejich přesný výraz je určen pozicí ve vzorku):

  • ^ - Následující znak(y) jsou počáteční v řetězci, případně nebud(e/ou) obsažen(y)
  • $ - Předcházející sekvence znaků je konec řetězce
  • . - (Tečka)  Libovolný znak kromě konce řádku, tečka
  • \ - escape, mění význam znaku za lomítkem, takže například pro vyhledání tří teček se nepoužívá sekvence '...', ale '\.\.\.'
  • * - opakování (!nula a vícekrát)
  • + - opakování (jednou a vícekrát)
  • ? - opakování nula, či jedenkráte
  • () - seskupení znaků do logických jednotek
  • [] - uzavření znakové třídy
  • | - Nebo, oddělení dvou variant
  • {} - Počet opakování

Protože velmi kvalitní informace o regulárních výrazech má ve své příručce Pavel Satrapa, bude zde rozsah omezen jen na několik příkládků s vysvětlením. PostgreSQL server umí regulární výrazy podle zvyklostí v jazyce Perl a v systému POSIX, proto mohou při zápise stejném, jako v PHP vzniknout určité chyby a nefunkčnosti.

Příklady:

  • ^ahoj - všechny řetězce začínající slovem ahoj
  • konec$ - všechny řetězce končící sekvencí konec
  • ^t[e|á]ta - vyhoví věty začínající slovy táta i teta
  • ^.?r(\. ){0,1}nec$ - vyhoví slova 'rnec', 'srnec', 'hrnec' i 'dr. nec'
  • ^[0-3]?[0-9](\.)( )?[0-1]?[0-9]\.$ - datum ve tvaru dd. mm, ale nekorektně, povolí třeba zápis 37. 19., správnější tvar je tedy ^(([0-2]?[0-9])|(3[01]))(\.)( )?((0?[0-9])|(1[012]))$
  •  ^([a-zA-Z0-9_-]+)(\.[a-zA-Z0-9_-]+)*@([a-zA-Z0-9_-]+\.)+[a-zA-Z]{2,5}$- ověření, zda-li se jedná o správně zapsanou e-mailovou adresu (trochu korektněji).

Vyhledávání pomocí vzorků

Vyhledání pomocí vzorku

Pokud je přesně známá alespoň část řetězce, lze v části WHERE použít příkaz LIKE, případně NOT LIKE pro vyloučení z výběru, pro výběr, je-li známa alespoň část řetězce. A tato musí být známa přesně!! Protože pro přesně určení lze použít přímo sekveci ...WHERE colx='slovo',  nabízí příkaz LIKE, použití tzv. žolíků, nebo-li divokých znaků. Tyto znaky jsou 2 (slovem dva), '_' (podtržítko) pro nahrazení jednoho znaku a '%' pro nahrazení libovolného počtu znaků. Pokud je třeba některý ze zástupných znaků vložit jako znak pro vyhledání, je nutné jej odescapovat vložením znaku '\' (zpětné lomítko), ale i tento escapovací znak lze změnit použitím klazule ESCAPE. Pokud je potřeba mít příkaz LIKE (a NOT LIKE) nezávislé na velikosti písmen, stačí přidat písmeno 'I' (odvozeno od insensitive), tj. ILIKE a NOT ILIKE.

Podobně jako příkaz LIKE funguje i SIMILAR TO, který je v normě SQL99, jeho použití není stejné jako LIKE, ale tak trochu naznačuje, co umožňují regulární výrazy.  Kromě zástupných znaků '%' a '_' jsou definovány i některé další znaky z regulárních výrazů: '|', '*', '+' , '()' a '[]'. Toto jsou všechny znaky a bloky, které SIMILAR TO podporuje, popis komplexního vyhledávání pomocí regulárních výrazů je dále.

Použití LIKE a SIMILAR TO bude nejlépe viditelné na konkrétních příkladech, které budou zkoušeny na :

SELECT * FROM products WHERE title like 'Slack';
SELECT * FROM products WHERE title like 'Slack%';
SELECT * FROM products WHERE title not ilike 'slack%';
SELECT * FROM products WHERE title SIMILAR TO '%(Ve)%';

Vyhledávání regulárními výrazy

Pro porovnání pole z databázové věty vůči vzorku se používá operátor '~' (tilda/vlnovka) s několika modifikátory - '!' (vykřičník) pro negaci a '*' (hvězdička) pro nerozlišování malých a velkých písmen. Pro vyhledávání se nepoužívá klíčové slovo LIKE (), SIMILAR TO.  Použití vyplyne opět nejlépe z příkladů:

SELECT * FROM products WHERE description ~ '\.\.\.';
SELECT * FROM products WHERE description !~ 
     '([a-zA-Z0-9_-]+)(\.[a-zA-Z0-9_-]+)*@([a-zA-Z0-9_-]+\.)+[a-zA-Z]{2,5}';
SELECT * FROM products WHERE description !~* 'slack';

Vysvětlení je takovéto. V první příkladě jsou vybrány všechny položky, které mají v popisu ... (tři tečky), v druhém jsou vybrány ty, kde není v popisu uveden e-mail a ve třetím ty, které neobsahují slovo 'slack', s ignorováním malých a velkých písmen.

Poznámka

Regulární výrazy lze v příkazu SELECT použít nejen pro vyhledávání záznamů, ale i pro získávání částí řetězců, pomocí funkce substring. Další využití (trochu složitější je) při tvorbě tabulky vytvořit donucující omezení (constrains), které budou data kontrolovat ihned při vkládání záznamů do tabulky. Protože se jedná o malinko složitější záležitosti, a ne nutné při prvních krocích s databází, je tato problematika odložena na později.

Závěr

Tento díl byl o něco kratší, než je běžným zvykem tohoto seriálu, ale vzhledem k tomu, že regulární výrazy nejsou elementární a zcela jednoduchou záležitostí, budou mít čtenáři o dostatek studijního materiálu bohatě postaráno. Protože regulární výrazy jsou tématem na vlastní seriálek...

Verze pro tisk

pridej.cz

 

DISKUZE

fulltext 13.6.2005 13:17 Tomas Konir
L Re: fulltext 13.6.2005 13:41 MaReK Olšavský
Negace 13.6.2005 20:28 Petr Zajíc
  L Re: Negace 14.6.2005 14:07 MaReK Olšavský




Příspívat do diskuze mohou pouze registrovaní uživatelé.
> Vyhledávání software
> Vyhledávání článků

15.5.2017 23:50 /František Kučera

Máš rád svobodný software a hardware nebo se o nich chceš něco dozvědět? Zajímá tě DIY, CNC, SDR nebo morseovka? Přijď na sraz spolku OpenAlt, který se bude konat ve čtvrtek 18. května od 18:00 v Radegastovně Perón (Stroupežnického 20, Praha 5).


Přidat komentář

12.5.2017 16:42 /Honza Javorek
PyCon CZ, česká konference o programovacím jazyce Python, se po dvou úspěšných ročnících v Brně bude letos konat v Praze, a to 8. až 10. června. Na konferenci letos zavítá např. i Armin Ronacher, známý především jako autor frameworku Flask, šablon Jinja2/Twig, a dalších projektů. Těšit se můžete na přednášky o datové analytice, tvorbě webu, testování, tvorbě API, učení a mentorování programování, přednášky o rozvoji komunity, o použití Pythonu ve vědě nebo k ovládání nejrůznějších zařízení (MicroPython). Na vlastní prsty si můžete na workshopech vyzkoušet postavit Pythonem ovládaného robota, naučit se učit šestileté děti programovat, efektivně testovat nebo si v Pythonu pohrát s kartografickým materiálem. Kupujte lístky, dokud jsou.
Přidat komentář

2.5.2017 9:20 /Eva Rázgová
Putovní konference československé Drupal komunity "DrupalCamp Československo" se tentokrát koná 27. 5.2017 na VUT FIT v Brně. Můžete načerpat a vyměnit si zkušenosti z oblasti Drupalu 7 a 8, UX, SEO, managementu týmového vývoje, využití Dockeru pro Drupal a dalších. Vítáni jsou nováčci i experti. Akci pořádají Slovenská Drupal Asociácia a česká Asociace pro Drupal. Registrace na webu .
Přidat komentář

1.5.2017 20:31 /Pavel `Goldenfish' Kysilka
PR: 25.5.2017 proběhne v Praze konference na téma Firemní informační systémy. Hlavními tématy jsou: Informační systémy s vlastní inteligencí, efektivní práce s dokumenty, mobilní přístup k datům nebo využívání cloudu.
Přidat komentář

15.4.2017 15:20 /František Kučera
Máš rád svobodný software a hardware nebo se o nich chceš něco dozvědět? Zajímá tě IoT a radiokomunikace? Přijď na sraz spolku OpenAlt, který se bude konat ve středu 19. dubna od 18:30 v Šenkovně (Sokolská 60, Praha 2).
Přidat komentář

5.3.2017 19:12 /Redakce Linuxsoft.cz
PR: 23. března proběhne v Praze konferenci na téma Cloud computing v praxi. Hlavními tématy jsou: Nejžhavější trendy v oblasti cloudu a cloudových řešení, Moderní cloudové služby, Infrastruktura současných cloudů, Efektivní využití cloudu, Nástrahy cloudových řešení a jak se jim vyhnout.
Přidat komentář

27.2.2017 22:12 /František Kučera
Pozvánka na 137. sraz OpenAlt – Praha: Tentokrát jsme si pro vás připravili neobvyklou akci. Ve středu 1.3. v 17:30 nás přivítá sdružení CZ.NIC ve svých prostorách v Milešovské ulici číslo 5 na Praze 3, kde si pro nás připravili krátkou prezentaci jejich činnosti. Následně navštívíme jejich datacentrum pod Žižkovskou věží. Provedou nás prostory, které jsou běžnému smrtelníkovi nedostupné!
Po ukončení prohlídky se všchni odebereme do hostince U vodoucha, Jagelonská 21, Praha 3 pochutnat si na některém z vybraných piv či dát si něco na zub. Rezervaci máme od 19:30, heslo je OpenAlt.
Ale pozor! Do prostor datového centra máme omezený přístup, dostane se tam pouze 10 lidí! Takže kdo přijde dříve, ten má přednost, a občanky s sebou! Kdo nebude chtít na prohlídku datového centra, může se pomalu přesunout do hostince U vodoucha a u nepřeberné nabídky piv počkat na ostatní.
Přidat komentář

18.1.2017 0:49 /František Kučera
Členové a příznivci spolku OpenAlt se pravidelně schází v Praze a Brně. Fotky z pražských srazů za uplynulý rok si můžete prohlédnout na stránkách spolku. Příští sraz se koná už 19. ledna – tentokrát je tématem ergonomie ovládání počítače – tzn. klávesnice, myši a další zařízení. Také budete mít příležitost si prohlédnout pražský hackerspace Brmlab.
Přidat komentář

   Více ...   Přidat zprávičku

> Poslední diskuze

11.5.2017 23:32 / lelo
Re: Problém se správcem balíčků

11.5.2017 5:45 / davd mašek
Re: Problém se správcem balíčků

10.5.2017 22:54 / lelo
Re: Problém se správcem balíčků

10.5.2017 22:19 / davd mašek
Problém se správcem balíčků

17.4.2017 19:15 / Jakub shoop
chyba

Více ...

ISSN 1801-3805 | Provozovatel: Pavel Kysilka, IČ: 72868490 (2003-2017) | mail at linuxsoft dot cz | Design: www.megadesign.cz | Textová verze