-
Path: news-archive.icm.edu.pl!news.gazeta.pl!not-for-mail
From: "Borneq" <b...@a...hidden.pl>
Newsgroups: pl.comp.programming
Subject: Re: Jak efektywnie stwierdzić czy tekst jest w UTF8?
Date: Wed, 13 Jun 2012 09:46:39 +0200
Organization: "Portal Gazeta.pl -> http://www.gazeta.pl"
Lines: 22
Message-ID: <jr9ggv$mak$1@inews.gazeta.pl>
References: <jr8els$en3$1@inews.gazeta.pl>
NNTP-Posting-Host: 194.117.241.226
Mime-Version: 1.0
Content-Type: text/plain; format=flowed; charset="iso-8859-2"; reply-type=response
Content-Transfer-Encoding: 8bit
X-Trace: inews.gazeta.pl 1339573599 22868 194.117.241.226 (13 Jun 2012 07:46:39 GMT)
X-Complaints-To: u...@a...pl
NNTP-Posting-Date: Wed, 13 Jun 2012 07:46:39 +0000 (UTC)
X-Antivirus-Status: Clean
X-MimeOLE: Produced By Microsoft MimeOLE V6.00.2900.6157
X-Priority: 3
X-Newsreader: Microsoft Outlook Express 6.00.2900.5931
X-User: bornega
X-Antivirus: avast! (VPS 120612-1, 2012-06-12), Outbound message
X-MSMail-Priority: Normal
Xref: news-archive.icm.edu.pl pl.comp.programming:197872
[ ukryj nagłówki ]Użytkownik "Borneq" <b...@a...hidden.pl> napisał w wiadomości
news:jr8els$en3$1@inews.gazeta.pl...
> Trenuję najpierw na tekstach otrzymując tabelkę 256 częstotliwości
Metoda zliczań częstotliwości jest bezradna gdy mamy stwierdzić czy tekst
jest w Unicode czy też w Uniocode z odwróceniem bajtów. Wtedy potrzebne
byłyby dwie tabelki - dla parzystych i nieparzystych bajtów. Ale przyjmijmy
że nie rozpoznajemy Unicode 16-bitowego lecz UTF-8.
Wtedy zamiast częstotliwości 256 znaków będziemy mieli częstotliwość 7-mio
bitowych i 8-io bitowych. Oba dzielą się na wystąpienia po 7-mio lub 8-io
bitowym znaku.
Ośmiobitowe należałoby podzielić na:
10xxxxxx
110xxxxx
1110xxxx
11110xxx
111110xx
1111110x
razem z 0xxxxxxx i 1111111x będzie 8 klas.
Czyli 64 gdy mamy wystąpienie po jakimś znaku. Choć to nie całkiem bo po
1111110x powinno być aż 5 razy 10xxxxxx
Następne wpisy z tego wątku
- 13.06.12 13:19 Paweł Kierski
- 13.06.12 14:18 voy
- 13.06.12 14:44 Borneq
- 13.06.12 20:31 Jordan Szubert
- 13.06.12 23:59 Borneq
- 14.06.12 01:09 Jordan Szubert
- 14.06.12 11:05 Borneq
Najnowsze wątki z tej grupy
- Do czego nadaje się QDockWidget z bibl. Qt?
- Bibl. Qt jest sztucznie ograniczona - jest nieprzydatna do celów komercyjnych
- Co sciaga kretynow
- AEiC 2024 - Ada-Europe conference - Deadlines Approaching
- Jakie są dobre zasady programowania programów opartych na wtyczkach?
- sprawdzanie słów kluczowych dot. zła
- Re: W czym sie teraz pisze programy??
- Re: (PDF) Surgical Pathology of Non-neoplastic Gastrointestinal Diseases by Lizhi Zhang
- CfC 28th Ada-Europe Int. Conf. Reliable Software Technologies
- Młodzi programiści i tajna policja
- Ada 2022 Language Reference Manual to be Published by Springer
- Press Release - AEiC 2023, Ada-Europe Reliable Softw. Technol.
- Ada-Europe - AEiC 2023 early registration deadline approaching
- Ada-Europe Int.Conf. Reliable Software Technologies, AEiC 2023
- Ile cykli zajmuje mnożenie liczb 64-bitowych?
Najnowsze wątki
- 2024-05-26 O co chodzi?
- 2024-05-26 PJ autobus-tramwaj
- 2024-05-26 Renault Trafic i lampka z czerwonym STOP
- 2024-05-26 cena pięciocyfrowa
- 2024-05-26 Re: Jak dobra KE "okrada" złą Rosję "dla Ukrainy"
- 2024-05-25 supercap
- 2024-05-25 Sulzbach => Technischer Rollouter (d/m/w) <=
- 2024-05-25 Warszawa => Senior Account Manager <=
- 2024-05-25 Warszawa => Mid PHP Developer (Laravel) <=
- 2024-05-25 Warszawa => Mid PHP Developer (Laravel) <=
- 2024-05-25 Warszawa => Interactive/Experience Designer <=
- 2024-05-25 Warszawa => Key Account Manager <=
- 2024-05-25 Warszawa => SAP WM Consultant / Execution <=
- 2024-05-25 Warszawa => Key Account Manager <=
- 2024-05-25 Re: znów ten wrocław