Skoči na vsebino

Podoktorski projekt ARIS Z2-70067

Majhni jezikovni modeli za brezkontekstno pridobivanje informacij

Strukturirane informacije, pridobljene iz besedil v evropskih jezikih, s poudarkom na slovenščini, s pomočjo modelov, ki so dovolj majhni, da lahko delujejo na strojni opremi, ki jo ima posamezna organizacija že v lasti.

Domov

Delo poteka v treh smereh: priprava večjezičnih podatkovnih zbirk za področja, kjer so podatki občutljivi ali redki, načrtovanje arhitekture modela in pripadajočega tokenizatorja, ter primerjava rezultatov z veliko večjimi modeli. Vsi rezultati, tj. modeli, nabori podatkov in koda za usposabljanje, so sproti objavljeni v odprti kodi skupaj s pripadajočo dokumentacijo. Več o projektu.

Kaj projekt objavlja

Vse, kar projekt ustvari, je javno sproti, ne šele ob koncu.

  • Objave

    Članki, prednatisi (preprinti), posterji in predavanja, vsak z ustreznim DOI-jem, PDF datoteko in BibTeX zapisom, kjer so ti na voljo.

  • Modeli in podatkovne zbirke

    Usposobljeni modeli in urejeni korpusi, objavljeni takoj, ko postanejo uporabni.

  • Koda in poskusi

    Podatkovni cevovod, primerjava tokenizatorjev ter koda za usposabljanje in evalvacijo, pri čemer se vsak poskus zabeleži med samim izvajanjem.