LINUXSOFT.cz Přeskoč levou lištu
Uživatel: Heslo:  
   CZUKPL

> Diskuze: Poradna regularne vyrazy cestina a slovencina

regularne vyrazy cestina a slovencina
(link)
13.10.2009 14:44
wakan tanka
Věk: ( ~31 let)

Dobry den, v clanku Pavla Satrapu http://www.root.cz/…ni-vyrazy-1/ som sa docital ze rozpoznavanie regularnych vyrazov sa riadi ASCII tabulkou a ze so slovencinou a cestinou je problem. Mohol by mi prosim niekto objasnit toto:

marek@cepi:~$ cat diakritika
áôúéťľúľščťžýáíéôäúú
ÁôúÉŤĽÚĽŠČŤŽÝÁÍÉôäÚÚ

marek@cepi:~$ grep -o „[a-z][a-z]*“ diakritika
áôúéťľúľščť
ýáíéôäúú
ôú
ôä

Aky specialny vyznam ma pismenko „ž“ ? Preco prikaz
marek@cepi:~$ cat diakritika | tr „[:lower:]“ „[:upper:]“
vrati stale lowercase znaky ?
Dopocul som sa ze by to mozno mohlo mat docinenia s $LANG, prikadam jej vypis.

marek@cepi:~$ echo $LANG
en_US.UTF-8

Mohol by mi niekto objasnit naco presne je $LANG, $LC_ALL a na co presne sluzia prikazy: export, set, env, unset ? Snazim sa pochopit BASH a kodovanie v linuxe no mam v tom dost zmatok. Dakujem velmi pekne

Re: regularne vyrazy cestina a slovencina
(link)
14.10.2009 11:50
Aleš Hakl
Bydliště: Praha

Ohledne fungovani regularnich vyrazu v jinych znakovych sadach nez obycejnem ASCII se doctete, ze "Regular expressions are a context-independent syntax that can represent a wide variety of character sets and character set orderings, where these character sets are interpreted according to the current locale. While many regular expressions can be interpreted differently depending on the current locale, many features, such as character class expressions, provide for contextual invariance across locales.". Takze velka teorie je, ze by regularni vyrazy pouzivane libc a zakladnimy systemovymy utilitami meli fungovat pro libovolny jazyk/znakovou sadu podporovany systemem a delat neco primerene logickeho.

Problem je, ze implementaci regularnich vyrazu, ktera tohle opravdu splnuje zrejmne nikdo nikdy nevidel (z mnoha ruznych jak technickych tak politickych duvodu). Nejjednodussi potom je proste predpokladat, ze to umi jenom ASCII.

Promenna LANG a ty vsechny LC_neco souvisi s definici narodniho prostredi. Souvislost s vasim problemem je ta, ze definice znakovych trid jako je upper je pochopitelne zavisla na jazyku, taktez jake znaky se radi mezi 'a' a 'z' a v jakem poradi je zavisle na jazyku (a s tim navic souvisi ta specialnost ž, protoze to jaksi neni v rozsahu a-z vcetne a presto by se za pismeno asi dalo povazovat). A ty prikazy slouzi pro ruzne manipulace s promennymi prostredi, vlastne jediny ktery vas zajima je export (a jeste spise vas zajima nejaky nastroj vaseho systemu pro globalni a trvale nastaveni locale na neco rozumneho).



Re: regularne vyrazy cestina a slovencina
(link)
18.10.2009 17:38
wakan tanka
Věk: ( ~31 let)

dobry den docital som sa ze existuje nieco co sa vola collating sequence
a ktory potom zahrnie aj znak ž

grep "[[:alpha:]][[:alpha:]]*" diakritika
áôúéťľúľščťžýáíéôäúú
ÁôúÉŤĽÚĽŠČŤŽÝÁÍÉôäÚÚ

Re: regularne vyrazy cestina a slovencina
(link)
20.10.2009 00:59
Aleš Hakl
Bydliště: Praha

To je pochopitelne to spravne reseni problemu "chci vsechna pismena, at uz to v aktualni locale znamena cokoli". Takovy detail je, ze se to nejmenuje collating sequence, ale character class ("trida znaku"). Collation sequence ("posloupnost razeni") je prave ten rozsah znaku v hranatych zavorkach.

Jeste existuji dalsi dva specialni zpusoby zapisu mnozin znaku souvisejici s razenim a to [..] a [==]. Prvnim se dava najevo, ze nechceme znak (napr. "c nebo h"), ale hlasku ("ch"). Druhy vybere vsechny znaky, ktere se radi stejne jako zadany (coz v cestine nema moc smysl, ale v temer vsech jinych jazycich ano, nutno poznamenat, ze u predchoziho je tomu temer naopak :))

Zakladni fakt je, ze ve chvili, kdy zacnete pouzivat cokoli co nejak souvisi s razenim znaku tak si rikate o problemy. Trivialni pripad je to zapomenute ž na konci, daleko podstatnejsi ovsem je to, ze snad neexistuje implementace posixovych regularnich vyrazu, ktera tohle cele implementuje opravdu spravne.

Re: regularne vyrazy cestina a slovencina
(link)
23.10.2009 10:23
wakan tanka
Věk: ( ~31 let)

Dakujem za opravu,
Skoda ze posix neriesi take veci ako diakritika, predpokladam ze nieje nejaky rozumny sposob ako to riesit, ked ani character class to nerobi stale spravne.
Nejak som nepochopil to [..] a [==] mohli by ste prosim uviest jednoduchy priklad ? mohlo by sa to hodit niekedy. Dakujem

Re: regularne vyrazy cestina a slovencina
(link)
24.10.2009 01:01
Aleš Hakl
Bydliště: Praha

No ono to tu diakritiku praveze resi. Problem je, ze diakritika je specificka pro dany jazyk a tak zavisi na nastaveni locales (konkretne LC_CTYPE a LC_COLLATE). Me prijde ze treba debiani grep se s LC_CTYPE=cs_CZ se to alespon pro ty trivialni pripady (coz je vetsina uzitecnych) chova pomerne ocekavatelne. Fakt je, ze ruzne varianty GNU grepu (a ze vlastne kazda distribuce ma svoji) jsou rozbite ruzne, ale zakladni matchovani dle character class funguje snad vsude.

Nejaky jednoduchy a smysluplny priklad vyuziti [..] a [==] bych take rad videl, nic moc rozumneho me nenapada (navic je to rozbite snad uplne vsude, protoze to nikdo nepouziva).

DISKUZE

regularne vyrazy cestina a slovencina 13.10.2009 14:44 wakan tanka
  L Re: regularne vyrazy cestina a slovencina 14.10.2009 11:50 Aleš Hakl
    L Re: regularne vyrazy cestina a slovencina 18.10.2009 17:38 wakan tanka
      L Re: regularne vyrazy cestina a slovencina 20.10.2009 00:59 Aleš Hakl
        L Re: regularne vyrazy cestina a slovencina 23.10.2009 10:23 wakan tanka
          L Re: regularne vyrazy cestina a slovencina 24.10.2009 01:01 Aleš Hakl




Příspívat do diskuze mohou pouze registrovaní uživatelé.
> Vyhledávání software
> Vyhledávání článků

18.1.2017 0:49 /František Kučera
Členové a příznivci spolku OpenAlt se pravidelně schází v Praze a Brně. Fotky z pražských srazů za uplynulý rok si můžete prohlédnout na stránkách spolku. Příští sraz se koná už 19. ledna – tentokrát je tématem ergonomie ovládání počítače – tzn. klávesnice, myši a další zařízení. Také budete mít příležitost si prohlédnout pražský hackerspace Brmlab.
Přidat komentář

8.1.2017 17:51 /František Kučera
Máš rád svobodný software a hardware nebo se o nich chceš něco dozvědět? Přijď na sraz spolku OpenAlt, který se bude konat ve čtvrtek 19. ledna od 18:30 v pražském hackerspacu Brmlab. Tentokrát je tématem srazu ergonomie ovládání počítače – tzn. klávesnice, myši a další zařízení. K vidění bude mechanická klávesnice dasKeyboard, trackball Logitech nebo grafický tablet (a velký touchpad) Wacom. Přineste i vy ukázat svoje zajímavé klávesnice a další HW. V 18:20 je sraz před budovou, v 18:30 jdeme společně dovnitř, je tedy dobré přijít včas. Podle zájmu se později přesuneme do nějaké restaurace v okolí.
Přidat komentář

1.12.2016 22:13 /František Kučera
Máš rád svobodný software a hardware nebo se o nich chceš něco dozvědět? Přijď na sraz spolku OpenAlt, který se bude konat ve čtvrtek 8. prosince od 18:00 v Radegastovně Perón (Stroupežnického 20, Praha 5). Sraz bude tentokrát tématický. Bude retro! K vidění budou přístroje jako Psion 5mx nebo Palm Z22. Ze svobodného hardwaru pak Openmoko nebo čtečka WikiReader. Přijďte se i vy pochlubit svými legendami, nebo alespoň na pivo. Moderní hardware má vstup samozřejmě také povolen.
Komentářů: 1

4.9.2016 20:13 /Pavel `Goldenfish' Kysilka
PR: Dne 22.9.2016 proběhne v Praze konference Cloud computing v praxi. Tématy bude např. nejnovější trendy v oblasti cloudu a cloudových řešení, provozování ERP v cloudu, o hostování různých typů softwaru, ale třeba i o zálohování dat nabízeném podnikům formou služby.
Přidat komentář

1.9.2016 11:27 /Honza Javorek
Česká konference o Pythonu, PyCon CZ, stále hledá přednášející skrz dobrovolné přihlášky. Máte-li zajímavé téma, neváhejte a zkuste jej přihlásit, uzávěrka je již 12. září. Konference letos přijímá i přednášky v češtině a nabízí pomoc s přípravou začínajícím speakerům. Řečníci mají navíc vstup zadarmo! Více na webu.
Přidat komentář

27.8.2016 8:55 /Delujek
Dnes po 4 letech komunitního vývoje vyšla diaspora 0.6.0.0
diaspora* je open-source, distribuovaná sociální síť s důrazem na soukromý
Více v oficiálním blog-postu
Přidat komentář

24.8.2016 6:44 /Ondřej Čečák
Poslední týden CFP LinuxDays 2016; pokud byste rádi přednášeli na LinuxDays 2016 8. a 9. října v Praze, můžete svůj příspěvek přihlásit, následovat bude veřejné hlasování.
Přidat komentář

9.8.2016 22:56 /Petr Ježek
Zařazení souborového systému reiser4 do jádra 4.7 znamená konečně konec patchování jádra jen kvůli možnosti použít reiser4.
Přidat komentář

   Více ...   Přidat zprávičku

> Poslední diskuze

18.1.2017 20:18 / martin horky
Spolupraca linuxu a microsoftu

17.1.2017 9:57 / Pavel Hrubeš
Re: Externí USB televizní karta

4.1.2017 11:24 / Marcum
extension to house

3.1.2017 10:09 / bolden
country cottages

4.12.2016 22:54 / František Kučera
Dárek

Více ...

ISSN 1801-3805 | Provozovatel: Pavel Kysilka, IČ: 72868490 (2003-2017) | mail at linuxsoft dot cz | Design: www.megadesign.cz | Textová verze