Domov
Delo poteka v treh smereh: priprava večjezičnih podatkovnih zbirk za področja, kjer so podatki občutljivi ali redki, načrtovanje arhitekture modela in pripadajočega tokenizatorja, ter primerjava rezultatov z veliko večjimi modeli. Vsi rezultati, tj. modeli, nabori podatkov in koda za usposabljanje, so sproti objavljeni v odprti kodi skupaj s pripadajočo dokumentacijo. Več o projektu.
Kaj projekt objavlja¶
Vse, kar projekt ustvari, je javno sproti, ne šele ob koncu.
-
Članki, prednatisi (preprinti), posterji in predavanja, vsak z ustreznim DOI-jem, PDF datoteko in BibTeX zapisom, kjer so ti na voljo.
-
Usposobljeni modeli in urejeni korpusi, objavljeni takoj, ko postanejo uporabni.
-
Podatkovni cevovod, primerjava tokenizatorjev ter koda za usposabljanje in evalvacijo, pri čemer se vsak poskus zabeleži med samim izvajanjem.