Skoči na vsebino

O projektu

Motivacija, poudarek in podatki projekta SLM4IE.

O projektu

Motivacija

Projekt SLM4IE izhaja iz treh omejitev današnjih velikih jezikovnih modelov: zasebno delovanje je drago, besedila, ki so najbolj pomembna, nikoli niso bila vključena v njihove podatke za usposabljanje, prav tako pa na isto vprašanje ne odgovorijo dvakrat enako.

Občutljive vsebine (npr. medicinske, finančne, pravne) ni mogoče pošiljati v lastniške oblačne storitve, zato mora model delovati na strojni opremi v lasti organizacije, ta oprema pa stane več, kot si večina manjših ustanov lahko privošči. Istega gradiva ni na spletu, zato ga ni niti v podatkih za usposabljanje, zaradi česar se občutek modela za jezik oddaljuje od izrazoslovja in oblikovanja področja, ki naj bi ga bralo. Jeziki z omejenimi viri, med katerimi je tudi slovenščina, so v teh podatkih za usposabljanje prav iz tega razloga slabo zastopani.

Splošnost ima svojo ceno. Širok model plačuje svojo raznovrstnost pri vsaki, še tako majhni nalogi, v obliki procesorske moči, energije in stroškov. In ker model generira besedilo, lahko isto vprašanje ob naslednjem zagonu vrne drugačen odgovor. Ekstrakcija informacij pa zahteva ravno nasprotno: enak odgovor vsakič znova in od modela, ki ustreza stroju v prostoru.

Usmeritev projekta

Projekt gradi majhne jezikovne modele za brezkontekstno pridobivanje informacij, kar pomeni brez označenih primerov in brez vsakokratnega usposabljanja za posamezno nalogo, in so hkrati dovolj majhni, da delujejo na komercialnem grafičnem pospeševalniku (GPU). Preizkušajo se tako arhitekture, ki temeljijo izključno na kodirnikih (encoder-only), kot tiste, ki temeljijo izključno na dekodirnikih (decoder-only), pri čemer se merita učinkovitost stiskanja in optimizacijskih tehnik v primerjavi s ceno natančnosti. Poleg modelov projekt ureja tudi referenčne nabore podatkov (benchmarke) za področja, ki jih obstoječi nabori ne zajemajo, kar omogoča neposredno primerjavo majhnega modela z dosti večjim pod enakimi pogoji. Delovni sklopi opisujejo organizacijo dela in predvidena poročila.

Rezultati so objavljeni sproti in ne šele ob zaključku: modeli in nabori podatkov na Hugging Face, podatkovni cevovod ter koda za usposabljanje in evalvacijo pa na GitHubu, vsak z ustrezno dokumentacijo, potrebno za uporabo. Vse je objavljeno v odprti kodi, kjer koli to dopuščajo licence.

Podatki o projektu

Naslov
Majhni jezikovni modeli za brezkontekstno pridobivanje informacij v evropskih jezikih
Številka projekta
Z2-70067
Shema
Podoktorski raziskovalni projekt ARIS
Financer
ARIS, Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Partner
Event Registry
Trajanje
marec 2026 – februar 2028
Vodja projekta
dr. Erik Novak