-
Data: 2019-11-18 16:06:50
Temat: Re: DeepL
Od: "M.M." <m...@g...com> szukaj wiadomości tego autora
[ pokaż wszystkie nagłówki ]On Monday, November 18, 2019 at 3:38:04 PM UTC+1, Borneq wrote:
> W dniu 10.11.2019 o 10:16, Borneq pisze:
> > No i stało się. Zainstalowałem DeepL lokalnie na komputerze, do tej pory
> > używałem przez internet. Działa szybciej niż przez internet, nie trzeba
>
> z pdf z https://github.com/lmthang/thesis
> przykład gdzie nie ma słownika tylko korpus równolegly
>
> Chodzi o to, jakie maksymalne informacje można wydobyć z korpusa.
>
> parallel corpus
> She loves cats = Elle aime les chats
> She loves him = Elle l'aime
> He adores cute cats = Il adore les chats mignons
> He has a cat = Il a un chat
>
> pytanie: jak przetłumaczyć na podstawie tych 4 zdań "She loves cute cats"?
Nie wiem, ale chyba albo ilość danych rośnie wykładniczo, albo musimy
znać model.
> ja dochodzę do wniosku że
> Elle aime les chats mignons
> deepL: Elle adore les chats mignons - słuszniej, ale nie wynika to z
> tych 4 zdań
>
> można się dowiedzieć że
> she = elle
> loves = aime (cats)|l'aime(him) przy czym te słowa są zadziwiająco
> podobne, czyli nie inne tylko inna forma
> w rzeczywistości l'aime jest dużo mocniejsze (lubi-kocha) a nie inna forma
> cats = les chats //nawet podobne ale nie trzeba się tym sugerować
> him = albo znika w tym zdaniu, stając się domyślny albo staje się
> przedrostkiem - w rzeczywistości jeśli obiektem jest "on", wtedy się
> opuszcza
> he = Il
> adores = adore
> cute = mignons + zamiana miejscami słów we frazie
> has - a
> a cat = un cat, tylko skąd wiedzieć że to nie "a" zostało przetłumaczone
> na "a"?? - potrzebne są albo
> wstępne informacje językowe albo więcej zdań w korpusie
Taki nieprzemyślany pomysł: bierzemy tyle sieci neuronowych ile jest słów w
języku docelowym jedna siec ze słowem pustym. Sieci mogą mieć wspólne wagi.
Wrzucamy z kontekstu 100 poprzednich słów, 100 następnych i oczywiście słowo
tłumaczone. Do zdania tłumaczonego dodajemy sztuczne słowa nie istniejące
w oryginalnym języku, np. słowo "Zwykle prawą ręką zapalam światło" zamieniamy
na zdanie "aaaa bbbb Zwykle cccc dddd prawą eeee ffff ręką gggg hhhh zapalam
iiii jjjj światło kkkk llll". Czasami sieć dla sztucznych słów wypluje
słowa typu a, the, albo jakieś idiomy. Innym razem sieć wypluje slowo puste, co
będzie znaczyło, że tego slowa się nie tłumaczy. Potem inny zestaw sieci zadba o
kolejność, interpunkcję, wielkie litery... a może to kolejny zestaw doda
idiomy i słowa których nie da się wyrazić uboższą gramatyką w języku docelowym?
> Gdyby zapytać się o : He has a cat -> Elle a un chat
> można stwierdzić nawet bez wiedzy o tym czy "a" to "has" czy "a" to "a"
> Tylko należy zauważyć że te zdania są bardzo krótkie i dość łatwo można
> je dopasować
Pomimo że są krótkie, to czasami wieloznaczność słów uniemożliwia
przetłumaczenie bez kontekstu, słynny polski 'granat', 'on ma granat',
chodzi o owoc czy ładunek wybuchowy, a może o kolor?
Pozdrawiam
Następne wpisy z tego wątku
- 18.11.19 19:42 Borneq
- 18.11.19 20:11 Borneq
- 18.11.19 23:18 M.M.
- 18.11.19 23:24 M.M.
- 22.11.19 15:20 M.M.
Najnowsze wątki z tej grupy
- Do czego nadaje się QDockWidget z bibl. Qt?
- Bibl. Qt jest sztucznie ograniczona - jest nieprzydatna do celów komercyjnych
- Co sciaga kretynow
- AEiC 2024 - Ada-Europe conference - Deadlines Approaching
- Jakie są dobre zasady programowania programów opartych na wtyczkach?
- sprawdzanie słów kluczowych dot. zła
- Re: W czym sie teraz pisze programy??
- Re: (PDF) Surgical Pathology of Non-neoplastic Gastrointestinal Diseases by Lizhi Zhang
- CfC 28th Ada-Europe Int. Conf. Reliable Software Technologies
- Młodzi programiści i tajna policja
- Ada 2022 Language Reference Manual to be Published by Springer
- Press Release - AEiC 2023, Ada-Europe Reliable Softw. Technol.
- Ada-Europe - AEiC 2023 early registration deadline approaching
- Ada-Europe Int.Conf. Reliable Software Technologies, AEiC 2023
- Ile cykli zajmuje mnożenie liczb 64-bitowych?
Najnowsze wątki
- 2024-06-10 wyobrazcie sobie ze
- 2024-06-10 malowanie samochodu
- 2024-06-10 News from Poland
- 2024-06-10 Czy na pewno będą CŁA na chińskie samochody?
- 2024-06-09 Dlaczego w Polsce sie nic nie udaje, na przykładzie niebieskiego lasera a teraz perskowitów
- 2024-06-09 Dlaczego w Polsce sie nic nie udaje, na przykładzie niebieskiego lasera a teraz perskowitów
- 2024-06-09 Wykrywanie przerwy w długim przewodzie zakopanym w ziemi.
- 2024-06-09 Czemu news.chmurka.nwt jest taki wolny?
- 2024-06-11 Funbox 3.0 zakres adresów DHCP
- 2024-06-11 Re: Funbox 3.0 zakres adresów DHCP
- 2024-06-09 Miernik szybkości netu
- 2024-06-11 Panele PV w pionie (prawie).
- 2024-06-11 czy ta grupa żyje?
- 2024-06-11 Warszawa => Senior React Native Developer <=
- 2024-06-11 Gdańsk => Kierownik Działu Spedycji Międzynarodowej <=