Matematica din spatele inteligenței artificiale

Inteligența artificială nu este, în esență, magie și nici o colecție de reguli scrise manual. Scriem o întrebare, iar câteva secunde mai târziu primim un răspuns coerent. Îi oferim o fotografie și poate identifica obiecte. Îi dăm câteva exemple și poate învăța să recunoască tipare pe care nu i le-am descris niciodată explicit.

În spatele acestei aparente „inteligențe” se află însă ceva mult mai puțin misterios: matematică. Modelele moderne de inteligență artificială sunt construite pe idei care, în multe cazuri, au fost dezvoltate cu mult înainte de apariția calculatoarelor moderne. Vectorii, matricile, probabilitățile, derivatele și metodele de optimizare formează împreună limbajul matematic prin care calculatoarele pot învăța din date.

Pentru a înțelege inteligența artificială, nu este obligatoriu să fii matematician. Dar este fascinant să vezi că, în spatele unei rețele neuronale cu miliarde de parametri, se află în esență aceleași operații matematice fundamentale pe care le putem scrie pe o foaie de hârtie.

Nu este nevoie să presupunem că mașina „înțelege” lumea în același mod în care o înțelege un om. Din punct de vedere matematic, este suficient să observăm că ea poate descoperi relații stabile între cantități și poate folosi aceste relații pentru a produce rezultate noi.

Orice informație trebuie să devină calculabilă

Un calculator nu lucrează direct cu concepte precum „pisică”, „tristețe”, „ploaie” sau „democrație”. Pentru el, orice informație trebuie reprezentată într-o formă care poate fi prelucrată.

O imagine poate fi descrisă prin valorile culorilor din fiecare punct al ei. Un sunet poate fi descris prin variația semnalului în timp. Un text poate fi descompus în unități care primesc reprezentări numerice.

Important este că transformarea nu înseamnă că obiectul real devine un număr. Numărul este doar o reprezentare a unei anumite proprietăți a obiectului. O fotografie nu este „numerele” din calculator. Numerele sunt o modalitate de a descrie fotografia suficient de precis pentru ca un calculator să poată efectua operații asupra ei.

Iar de aici începe matematica inteligenței artificiale: transformarea informației într-o formă asupra căreia se pot face calcule.

Mașina caută relații

Să presupunem că avem foarte multe fotografii și vrem ca un sistem să distingă între câini și pisici. Nu îi oferim neapărat o listă completă de reguli despre cum arată un câine. În schimb, îi oferim multe exemple. Sistemul observă că anumite caracteristici apar frecvent împreună cu eticheta „câine”, iar altele apar mai frecvent împreună cu eticheta „pisică”.

Matematic, problema poate fi privită astfel: există un număr mare de caracteristici observabile, iar sistemul încearcă să determine cât de relevante sunt aceste caracteristici pentru rezultatul final. O anumită caracteristică poate avea o influență mică. Alta poate avea o influență mai mare. Unele pot fi importante doar împreună cu alte caracteristici.

Prin urmare, sistemul nu caută neapărat o singură regulă. El construiește un ansamblu foarte mare de relații cantitative.

Învățarea înseamnă reducerea unei erori

Aceasta este una dintre cele mai importante idei.

Un model produce un rezultat. Rezultatul poate fi comparat cu rezultatul dorit. Diferența dintre cele două reprezintă eroarea.
Dacă sistemul identifică o imagine ca fiind a unei pisici, iar imaginea era de fapt a unui câine, există o discrepanță între predicție și realitate. Pentru ca sistemul să învețe, trebuie să existe o metodă prin care această discrepanță să poată fi măsurată. Apoi apare întrebarea fundamentală:

Ce trebuie schimbat pentru ca eroarea să fie mai mică?

Răspunsul la această întrebare este una dintre problemele centrale ale matematicii din spatele inteligenței artificiale.

Modelul modifică treptat valorile care controlează comportamentul său. După fiecare modificare, rezultatul este verificat din nou. Dacă eroarea scade, modificarea a fost utilă. Dacă eroarea crește, modificarea a fost nepotrivită sau trebuie compensată prin alte modificări. Repetat de milioane sau chiar miliarde de ori, acest proces poate transforma un sistem inițial incapabil să rezolve problema într-unul care produce rezultate foarte bune pe exemple noi.

De ce sunt necesare atât de multe calcule?

O rețea neuronală modernă poate conține un număr enorm de valori care pot fi ajustate. Fiecare dintre aceste valori poate influența rezultatul final. Mai mult, influența unei valori poate depinde de celelalte valori. De aceea, nu este suficient să găsim o singură soluție și să o introducem în sistem. Trebuie să găsim simultan foarte multe valori care, luate împreună, produc comportamentul dorit.

Să ne imaginăm un panou cu milioane de butoane. Fiecare buton modifică puțin rezultatul, iar unele butoane interacționează între ele. Problema antrenării unui model constă în găsirea unei configurații a acestor butoane care produce rezultate bune.
Matematica oferă metode pentru a face această căutare într-un mod sistematic, în loc să încercăm toate configurațiile posibile.

Nu orice rezultat este sigur

Inteligența artificială lucrează frecvent cu incertitudinea. Atunci când un model primește o informație nouă, mai multe răspunsuri pot fi compatibile cu ceea ce a învățat.

În cazul unei imagini, de exemplu, sistemul poate considera că există o probabilitate mare ca obiectul să fie o pisică și una mai mică să fie un câine.

În cazul limbajului, situația este și mai evidentă. După o anumită secvență de cuvinte, mai multe continuări pot fi posibile.
Modelul nu trebuie să găsească întotdeauna unicul răspuns corect. El trebuie să determine care variante sunt mai compatibile cu informația disponibilă. Această idee este esențială pentru modelele moderne de limbaj.

Când un astfel de sistem generează un text, el nu alege următorul cuvânt în mod arbitrar. Pentru fiecare pas, evaluează foarte multe posibilități și atribuie fiecăreia o anumită măsură a plauzibilității. Apoi selectează o continuare pe baza acestor valori.

Prin repetarea procesului, un răspuns este construit pas cu pas.

De ce poate apărea o greșeală?

Un model poate produce un răspuns greșit chiar atunci când calculele sale sunt executate perfect.

Motivul este următorul: matematica poate garanta corectitudinea calculelor, dar nu poate garanta că informațiile din care pornește modelul sunt corecte sau că relațiile învățate sunt valabile în orice situație. Dacă datele conțin erori, modelul poate învăța acele erori.

Dacă anumite exemple apar mult mai frecvent decât altele, modelul poate ajunge să le considere mai reprezentative decât sunt în realitate. Dacă problema întâlnită de model este foarte diferită de problemele din datele de antrenament, relațiile pe care le-a învățat pot să nu mai fie suficiente.

Așadar, un calcul poate fi corect, în timp ce concluzia obținută din acel calcul poate fi greșită.

Inteligența artificială ca problemă de aproximare

Lumea reală este extrem de complexă. Între cauze și efecte există un număr enorm de relații.

Un model de inteligență artificială încearcă să construiască o aproximare matematică a unora dintre aceste relații. Nu reproduce realitatea în întregime. Nici nu are nevoie să o facă.

Dacă vrem să recunoaștem obiecte, avem nevoie de o aproximare suficient de bună pentru a distinge între ele. Dacă vrem să traducem un text, avem nevoie de o aproximare a relațiilor dintre expresiile din două limbi. Dacă vrem să generăm text, avem nevoie de o aproximare a relațiilor dintre secvențele de limbaj.

Performanța unui sistem depinde, printre altele, de cât de bine reușește această aproximare să se păstreze atunci când primește informații pe care nu le-a întâlnit exact în timpul antrenării.

Concluzie

Matematica din spatele inteligenței artificiale poate părea complicată deoarece sistemele moderne conțin un număr uriaș de operații și valori ajustabile.

Ideea fundamentală este însă surprinzător de simplă. Informația este transformată într-o formă calculabilă. Sistemul caută relații între aceste informații. Produce un rezultat. Măsoară diferența dintre rezultat și ceea ce era de așteptat. Își modifică modul de calcul pentru a reduce această diferență. Repetă procesul de un număr foarte mare de ori.

Din această succesiune de pași apar modele capabile să recunoască tipare, să facă predicții și să genereze informații noi.
În spatele comportamentului aparent inteligent nu există un singur calcul miraculos. Există un număr enorm de calcule simple, organizate într-un sistem matematic complex.

Iar una dintre cele mai interesante idei este tocmai aceasta: inteligența artificială nu devine puternică pentru că un singur calcul este extraordinar de complicat, ci pentru că foarte multe relații matematice simple pot fi combinate, ajustate și aplicate la o scară uriașă.

Bibliografie

Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer.
Bishop, C. M., & Bishop, H. (2024). Deep Learning: Foundations and Concepts. Springer.
Deisenroth, M. P., Faisal, A. A., & Ong, C. S. (2020). Mathematics for Machine Learning. Cambridge University Press.
Goodfellow, I., Bengio, Y., & Courville, A. (2016). Deep Learning. MIT Press.

 


Încadrare în categoriile științelor educației:

prof. Ane-Mari Vlăduț

Liceul Tehnologic Cristofor Nako, Sânnicolau Mare (Timiş), România
Profil iTeach: iteach.ro/profesor/ane.vladut