O projektu
Motivacija¶
Projekt SLM4IE izhaja iz treh omejitev današnjih velikih jezikovnih modelov: zasebno delovanje je drago, besedila, ki so najbolj pomembna, nikoli niso bila vključena v njihove podatke za usposabljanje, prav tako pa na isto vprašanje ne odgovorijo dvakrat enako.
Občutljive vsebine (npr. medicinske, finančne, pravne) ni mogoče pošiljati v lastniške oblačne storitve, zato mora model delovati na strojni opremi v lasti organizacije, ta oprema pa stane več, kot si večina manjših ustanov lahko privošči. Istega gradiva ni na spletu, zato ga ni niti v podatkih za usposabljanje, zaradi česar se občutek modela za jezik oddaljuje od izrazoslovja in oblikovanja področja, ki naj bi ga bralo. Jeziki z omejenimi viri, med katerimi je tudi slovenščina, so v teh podatkih za usposabljanje prav iz tega razloga slabo zastopani.
Splošnost ima svojo ceno. Širok model plačuje svojo raznovrstnost pri vsaki, še tako majhni nalogi, v obliki procesorske moči, energije in stroškov. In ker model generira besedilo, lahko isto vprašanje ob naslednjem zagonu vrne drugačen odgovor. Ekstrakcija informacij pa zahteva ravno nasprotno: enak odgovor vsakič znova in od modela, ki ustreza stroju v prostoru.
Usmeritev projekta¶
Projekt gradi majhne jezikovne modele za brezkontekstno pridobivanje informacij, kar pomeni brez označenih primerov in brez vsakokratnega usposabljanja za posamezno nalogo, in so hkrati dovolj majhni, da delujejo na komercialnem grafičnem pospeševalniku (GPU). Preizkušajo se tako arhitekture, ki temeljijo izključno na kodirnikih (encoder-only), kot tiste, ki temeljijo izključno na dekodirnikih (decoder-only), pri čemer se merita učinkovitost stiskanja in optimizacijskih tehnik v primerjavi s ceno natančnosti. Poleg modelov projekt ureja tudi referenčne nabore podatkov (benchmarke) za področja, ki jih obstoječi nabori ne zajemajo, kar omogoča neposredno primerjavo majhnega modela z dosti večjim pod enakimi pogoji. Delovni sklopi opisujejo organizacijo dela in predvidena poročila.
Rezultati so objavljeni sproti in ne šele ob zaključku: modeli in nabori podatkov na Hugging Face, podatkovni cevovod ter koda za usposabljanje in evalvacijo pa na GitHubu, vsak z ustrezno dokumentacijo, potrebno za uporabo. Vse je objavljeno v odprti kodi, kjer koli to dopuščajo licence.
Podatki o projektu¶
- Naslov
- Majhni jezikovni modeli za brezkontekstno pridobivanje informacij v evropskih jezikih
- Številka projekta
- Z2-70067
- Shema
- Podoktorski raziskovalni projekt ARIS
- Financer
- ARIS, Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
- Gostitelj
- Odsek za umetno inteligenco, Institut Jožef Stefan
- Partner
- Event Registry
- Trajanje
- marec 2026 – februar 2028
- Vodja projekta
- dr. Erik Novak
- Kontakt
- erik.novak@ijs.si