mislo

Fakulteta za računalništvo in informatiko · Univerza v Ljubljani

Veliki jezikovni modeli in obdelava naravnega jezika

Za predmet Veliki jezikovni modeli in obdelava naravnega jezika še ni zapiskov.

Imaš svoje zapiske? Objavi jih: ceno določiš ti, z naročnino ti ostane cela, DDV se doda kupcu.

Objavi zapiske

Čakaš na zapiske? Prijavi se in povej. Ko jih kdo objavi, dobiš sporočilo.

Želim zapiske

Kaj lahko narediš že danes

Naloži svoje gradivo za predmet Veliki jezikovni modeli in obdelava naravnega jezika: Mai ga prebere in ti iz njega naredi kartice, kviz in razlago, ko ti kaj ni jasno. Če zapiske kasneje objaviš, jih prodajaš tukaj.

Naloži svoje gradivo

Učni načrt

Podatki so iz učnega načrta, ki ga objavlja Fakulteta za računalništvo in informatiko. Prebrano 7. 9. 2026. Poglej izvirnik

6 kreditnih točk

Obveznosti v urah

  • Predavanja45 ur
  • Vaje30 ur
  • Samostojno delo105 ur

Vsebina

  1. Uvod v obdelavo naravnega jezika in VJM: kaj je naravni jezik z vidika računalništva, dvoumnost in jezikovna kompleksnost, kratka zgodovina ONJ, od tradicionalnih do nevronskih pristopov, kje srečamo VJM v vsakdanji rabi.
  2. Osnove dela z besedili: priprava in čiščenje besedil, kodiranje znakov, optično prepoznavanje besedila (OCR) in transkripcija, jezikovna normalizacija, lematizacija in oblikoslovno označevanje, regularni izrazi, tokenizacija (vključno z modernimi pristopi – npr. BPE in WordPiece).
  3. Mere podobnosti in osnovne predstavitve besedil: vreča besed (BoW), TF-IDF, kosinusna podobnost, n- grami, gručenje besedil, uvrščanje sentimenta z enostavnimi metodami.
  4. Jezikovni viri: korpusi (Gigafida, ccGigafida, slWaC, KAS, Common Crawl, Wikipedia), označeni viri (SUK, korpusi za vrednotenje), repozitoriji (CLARIN.SI, Hugging Face) in Evropski jezikovni podatkovni prostor, licenčni in pravni vidiki, FAIR načela, etika zbiranja podatkov.
  5. Globoke nevronske mreže in vložitve besed: intuitivna razlaga nevronskih mrež, kontekstualne in nekontekstualne vložitve (word2vec, fastText), večjezične vložitve, podobnost stavkov in dokumentov.
  6. Veliki jezikovni modeli: arhitektura transformer (na intuitivni ravni), modeli kodirnik in/ali dekodirnik (BERT, GPT, T5), kako uči VJM-je, spodbujevano učenje s povratnim človeškim odzivom (RLHF), odprti in zaprti modeli, lokalna raba modelov (Ollama), strošek, hitrost in okoljski vidik uporaba VJM kot storitev.
  7. Oblikovanje ukaznih pozivov (prompt engineering): osnove pisanja navodil, tehnike (zero-shot, few-shot, chain-of-thought), strukturirani izhodi (JSON), sistemski pozivi in vloge, pogoste napake in halucinacije, vzorci za praktične naloge (klasifikacija, povzemanje, ekstrakcija, prevajanje, urejanje besedil).
  8. S poizvedovanjem obogateno generiranje (RAG): priprava dokumentov, vektorske baze (FAISS, Chroma), iskalniki in pridobivanje besedil, sestava ogrodja RAG nad lastnimi dokumenti.
  9. Semantične in leksikalne tehnologije: WordNet in sloWNet, FrameNet, BabelNet, ontologije in grafi znanja (Wikidata), povezovanje entitet, terminološke zbirke; kako VJM dopolnjujemo s strukturiranim znanjem.
  10. Jezikoslovne naloge in večjezičnost: prepoznavanje imenskih entitet, prevajanje, razdvoumljanje pomenov besed, analiza sentimenta, odkrivanje koreferenčnosti; specifike slovenščine in drugih morfološko bogatih jezikov.
  11. Vrednotenje in zanesljivost VJM: avtomatske metrike (BLEU, ROUGE, BERTScore), človeško vrednotenje, jezikovni model kot sodnik, ocenjevalne lestvice (SloBENCH), pristranskost, varnost in etični vidiki.
  12. Agentne tehnologije in orodja: klici funkcij, integracija z zunanjimi viri, princip MCP, agenti za pomoč pri raziskovanju, pisanju in podatkovni analizi.
  13. Uporaba jezikovnih tehnologij v praksi: študije primerov iz humanistike in družboslovja - prevodoslovja, jezikoslovnih raziskav, družboslovja, izobraževanja, knjižničarstva in zgodovine; načrtovanje lastnega mini-projekta.
  14. Multimodalni in govorni modeli (kratek pregled): samodejna razpoznava govora (npr. Whisper), sinteza govora, modeli besedilo–slika, intuitivna predstavitev za naloge, kjer ne gre samo za besedilo.
  15. Projektno delo: študenti v majhnih skupinah ali individualno rešijo izbrani problem na večji količini besedilnih podatkov (npr. analiza arhivskega gradiva/knjig, gradnja klepetalnika nad korpusom, primerjalna analiza modelov, jezikovna obdelava družbenomedijskih virov).

Ocenjevanje

Sprotno preverjanje v okviru predavanj 10 %, Projektno delo z vmesnimi poročili in javno predstavitvijo končnega poročila 50 %, Končni pisni izpit (konceptualni del) 40 %

Pogoji za vključitev

Posebni pogoji za vključitev v delo niso predpisani. Predmet je zasnovan kot uvodni, pri čemer je zaželjeno osnovno znanje programiranja v Pythonu. Priporočamo splošno informacijsko pismenost in zanimanje za delo z besedilnimi podatki ter osnovno poznavanje statistike. Po potrebi se v okviru vaj nudi krajši uvod za delo v okolju Jupyter / Google Colab.

Literatura

  • Jurafsky, D., Martin, J. H. Speech and Language Processing: An Introduction to Natural Language Processing, Computational Linguistics and Speech Recognition. 3rd edition draft, 2026. (izbrana poglavja / selected chapters; prosto dostopno / openly available)
  • Alammar, J., Grootendorst, M. Hands-On Large Language Models: Language Understanding and Generation. O'Reilly Media, 2024.
  • Bird, S., Klein, E., Loper, E. Natural Language Processing with Python (NLTK Book). O'Reilly, dostopno na nltk.org. (izbrana poglavja kot uvod v praktično delo)
  • Phoenix, J., Taylor, M. Prompt Engineering for Generative AI. O'Reilly Media, 2024.

Kako deluje

  1. Zapiske kupiš enkrat in ostanejo tvoji.
  2. V aplikaciji iz njih dobiš kartice, kvize in Mai, ki pozna gradivo.
  3. Ceno določi avtor. Prodajalec je Mislo AI, račun dobiš od nas.