-
X-Received: by 10.157.1.174 with SMTP id e43mr100878ote.9.1465311187643; Tue, 07 Jun
2016 07:53:07 -0700 (PDT)
X-Received: by 10.157.1.174 with SMTP id e43mr100878ote.9.1465311187643; Tue, 07 Jun
2016 07:53:07 -0700 (PDT)
Path: news-archive.icm.edu.pl!news.icm.edu.pl!news.nask.pl!news.nask.org.pl!news.unit
0.net!usenet.blueworldhosting.com!feeder01.blueworldhosting.com!peer01.iad.high
winds-media.com!news.highwinds-media.com!feed-me.highwinds-media.com!q32no48075
84qgq.0!news-out.google.com!z5ni90qge.0!nntp.google.com!p34no3787746qgp.1!postn
ews.google.com!glegroupsg2000goo.googlegroups.com!not-for-mail
Newsgroups: pl.comp.programming
Date: Tue, 7 Jun 2016 07:53:07 -0700 (PDT)
In-Reply-To: <nj6j3r$7db$1@node2.news.atman.pl>
Complaints-To: g...@g...com
Injection-Info: glegroupsg2000goo.googlegroups.com; posting-host=178.37.232.66;
posting-account=xjvq9QoAAAATMPC2X3btlHd_LkaJo_rj
NNTP-Posting-Host: 178.37.232.66
References: <nj6f0k$26n$1@node2.news.atman.pl>
<c...@g...com>
<nj6j3r$7db$1@node2.news.atman.pl>
User-Agent: G2/1.0
MIME-Version: 1.0
Message-ID: <2...@g...com>
Subject: Re: Algorytm szukania podobny do Google
From: "M.M." <m...@g...com>
Injection-Date: Tue, 07 Jun 2016 14:53:07 +0000
Content-Type: text/plain; charset=UTF-8
Content-Transfer-Encoding: quoted-printable
X-Received-Bytes: 3063
X-Received-Body-CRC: 3301987270
Xref: news-archive.icm.edu.pl pl.comp.programming:209452
[ ukryj nagłówki ]On Tuesday, June 7, 2016 at 3:44:29 PM UTC+2, Borneq wrote:
> W dniu 07.06.2016 o 15:36, M.M. pisze:
> > Podstawą jest zahasowany słownik słów. Każde słowo ma listę stron na
> > których ono wstępuje. Lista jest uporządkowana według trafności. Trafność
> > liczą jakimś algorytmem - dobry algorytm wydaje się bardziej
> > problematyczny. Jeśli wyszukiwanie z minusem, to jeszcze strona musi
> > mieć zahasowany słownik słów. Jeśli z operatorem and, to część wspólna
> > urli. Problemem jest zrównoleglenie i osiągnięcie dużej wydajności.
>
> jak to na przykładzie?
> dokument 0: Ala ma kota
> dokument 1: Tadek ma psa
>
> leksykon słów :
> Ala - 0
> kota - 0
> ma - 0,1
> psa - 1
> Tadek -1
Bo jak inaczej?
> dla danego słowa może być bardzo dużo:
> the - 0,1,2,3,4,6,7,8,9,10..
> is - 0,1,2,3,4,5,6,7,9,10..
Może jeśli słowo ma więcej niż 100tys stron, to jest trafia do osobnej
hash-table?
> teraz operacja [the AND is] może trwać długo
Bo ja wiem... To dobrze działa w środowisku
rozproszonym. Tego bym się nie bał. Trudniej zrobić
dobry page-rank. Trudniej zapewnić aktualizację w
locie, albo redundancję, typu N% komputerów padło a
wyszukiwarka poprawnie działa z prawdopodobieństwem
powyżej M%.
> Nie wiem na przykład dlaczego w
> http://webserver2.tecgraf.puc-rio.br/eda/referencias
/Google-petteri_huuhka_google_paper.pdf
> w Forward barrels nhits jest 8 bitowe a w inverted barrels tylko 5 bitowe.
Nie wiem, trzaby się wczytać.
Pozdrawiam
Następne wpisy z tego wątku
- 07.06.16 17:34 Piotr Chamera
- 07.06.16 22:31 Borneq
- 08.06.16 10:32 Borneq
- 08.06.16 11:41 Borneq
Najnowsze wątki z tej grupy
- Xiaomi [Chiny - przyp. JMJ] produkuje w całkowitych ciemnościach i bez ludzi
- Prezydent SZAP/USONA Trump ułaskawił prezydenta Hondurasu Hernandeza skazanego na 45 lat więzienia
- Rosjanie chwalą się prototypem komputera kwantowego. "Najważniejszy projekt naukowy Rosji"
- A Szwajcarzy kombinują tak: FinalSpark grows human neurons from stem cells and connects them to electrode arrays
- Re: Najgorszy język programowania
- NOWY: 2025-09-29 Alg., Strukt. Danych i Tech. Prog. - komentarz.pdf
- Na grupie comp.os.linux.advocacy CrudeSausage twierdzi, że Micro$lop używa SI do szyfrowania formatu dok. XML
- Błąd w Sofcie Powodem Wymiany 3 Duńskich Fregat Typu Iver Huitfeldt
- Grok zaczął nadużywać wulgaryzmów i wprost obrażać niektóre znane osoby
- Can you activate BMW 48V 10Ah Li-Ion battery, connecting to CAN-USB laptop interface ?
- We Wrocławiu ruszyła Odra 5, pierwszy w Polsce komputer kwantowy z nadprzewodzącymi kubitami
- Ada-Europe - AEiC 2025 early registration deadline imminent
- John Carmack twierdzi, że gdyby gry były optymalizowane, to wystarczyły by stare kompy
- Ada-Europe Int.Conf. Reliable Software Technologies, AEiC 2025
- Linuks od wer. 6.15 przestanie wspierać procesory 486 i będzie wymagać min. Pentium
Najnowsze wątki
- 2026-01-29 KSeF - 13 wątpliwości
- 2026-01-29 A ja się pochwalę
- 2026-01-29 Warszawa => Mid/Senior IT Recruiter <=
- 2026-01-29 Warszawa => Senior Java Developer <=
- 2026-01-29 Warszawa => IT Recruiter <=
- 2026-01-28 Degradacja
- 2026-01-28 Wysoki Sąd poinstruował czego unikać wyzywając Owsiaka "Równiejszego"
- 2026-01-28 Białystok => Solution Architect (Workday) - Legal Systems <=
- 2026-01-28 Białystok => Preseles Inżynier (background baz danych) <=
- 2026-01-28 Wrocław => Konsultant wdrożeniowy ERP <=
- 2026-01-28 Łódź => Microsoft Engineer <=
- 2026-01-28 Białystok => Tester manualny <=
- 2026-01-27 Tradycja ciągania posłów po sądach za wystąpienia w Sejmie będzie kontynuowana [Lepper 2]
- 2026-01-27 Pierwszy raz sprzedano więcej samochodów zeeletryfikowanych niż ice
- 2026-01-27 Elektryczny Kałasznikow




Dlaczego nowe mieszkania są coraz mniejsze? Dane GUS pokazują prawdziwy powód