Atrybucje i licencje

Lexicave korzysta z zewnętrznych zasobów językowych i bibliotek programistycznych. Niniejsza strona spełnia wymogi licencyjne dotyczące atrybucji oraz informuje, w jakim zakresie te materiały są wykorzystywane w usłudze.

1. Wykrywanie stron fiszek (hiszpański / polski)

Przy indeksowaniu fiszek i w edytorze platforma może automatycznie rozpoznawać, czy hiszpańska i polska strona fiszki są zapisane w prawidłowej kolejności. Do tego celu w infrastrukturze serwisowej (nie w przeglądarce użytkownika) wykorzystujemy:

  • listy częstości n-gramów (1–3 wyrazów) zbudowane z poniższych korpusów;
  • heurystyki znaków i artykułów;
  • bibliotekę franc (MIT) wyłącznie dla dłuższych fragmentów tekstu.

Przetworzone listy częstości nie są udostępniane użytkownikom ani pobierane z aplikacji — służą wyłącznie do wewnętrznej analizy tekstu w ramach działania usługi. Użytkownik widzi wynik (np. ostrzeżenie o odwróconych stronach), a nie surowe dane korpusowe.

2. KWJP — Korpus Współczesnego Języka Polskiego

Źródło: KWJP — Korpus Współczesnego Języka Polskiego (IPI PAN)

Adres: https://github.com/ipipan/kwjp100-varia

Licencja: Creative Commons Attribution 4.0 International (CC BY 4.0)

Wykorzystanie w Lexicave: budowa wewnętrznych list częstości polskich form (w połączeniu z Tatoeba) do rozpoznawania języka stron fiszek.

3. Tatoeba

Źródło: Tatoeba — zbiór przykładowych zdań w wielu językach

Adres: https://tatoeba.org/

Licencja: Creative Commons Attribution 2.0 France (CC BY 2.0 FR) — eksport zbiorczy zdań

Wykorzystanie w Lexicave: budowa wewnętrznych list częstości dla języka polskiego i hiszpańskiego (n-gramy) do rozpoznawania stron fiszek.

4. franc (biblioteka npm)

Projekt: franc — wykrywanie języka naturalnego

Autor: Titus Wormer

Adres: https://github.com/wooorm/franc

Licencja: MIT License

Wykorzystanie w Lexicave: pomocnicze wykrywanie języka hiszpańskiego lub polskiego na dłuższych stronach fiszek (≥ 4 tokenów lub ≥ 28 znaków), po ograniczeniu do języków ES i PL.

5. CORPES — Real Academia Española

Źródło: CORPES — Corpus del Español del Siglo XXI, lista częstości lematów (lista total de frecuencias)

Autor: Real Academia Española

Adres: https://www.rae.es/corpes/

Licencja: Creative Commons Attribution-ShareAlike 4.0 International (CC BY-SA 4.0)

Wykorzystanie w Lexicave: ranking częstości z CORPES posłużył do wyboru czasowników hiszpańskich w module koniugacji. Dostosowana lista (lematy, pozycja w rankingu oraz polskie glosy Lexicave; także warianty zwrotne) jest udostępniana w usłudze jako plik /data/conjugation/es-verbs-top500.json na licencji CC BY-SA 4.0. Silnik odmiany i pozostała część Lexicave nie są objęte tą licencją. Te same dane częstości mogą pojawiać się w materiałach informacyjnych serwisu (np. wykres pokrycia lematów).

6. Inne materiały w repozytorium

Szczegóły techniczne budowy leksykonu ES|PL: plik data/flashcards/es-pl-lexicon/NOTICE.txt w repozytorium źródłowym Lexicave. Licencje czcionek używanych w interfejsie: /fonts/OFL.txt. Licencje niektórych ikon tablicy: /board-icons/LICENSE.txt.

7. Kontakt

W sprawach dotyczących atrybucji lub licencji zasobów wykorzystanych w Lexicave: info@hiszpan.ski.

Polityka prywatności • Regulamin • Pomoc