Ghid de grupare ierarhică: AGNES, DIANA și nu numai

Ultima actualizare: 08/13/2026
  • Clusterizarea ierarhică organizează datele într-o structură arborescentă numită dendrogramă, evitând necesitatea de a prestabili numărul de clustere.
  • AGNES construiește clustere de jos în sus prin fuziune iterativă, în timp ce DIANA divide un singur grup mare de sus în jos.
  • Calitatea clusterelor este evaluată folosind metrici interne, cum ar fi indicele Davies-Bouldin, sau comparații externe prin intermediul metodelor de precizie și rechemare.

Vizualizare 3D profesională a unui dendrograma pentru clustering jerárquico, arătând structura arborelui unde los punctele de date se fuzează în grupuri.

Ai simțit vreodată că te uiți la un munte de date și pur și simplu nu poți vedea pădurea din cauza copacilor? Aici intervine gruparea. Practic, este arta de a grupa punctele de date în funcție de cât de similare sunt , asigurându-te că elementele dintr-un grup sunt strâns legate, în timp ce grupurile în sine rămân departe una de cealaltă. Este o piatră de temelie a învățării automate nesupravegheate, ceea ce înseamnă că computerul găsește tipare fără a i se spune în prealabil ce să caute.

Deși există o mulțime de modalități de a segmenta datele, gruparea ierarhică este oarecum specială. În loc să aleagă pur și simplu un număr aleatoriu de grupuri, aceasta creează o structură imbricată care arată ca un arbore genealogic . Indiferent dacă încercați să diversificați un portofoliu de acțiuni sau să segmentați baza de clienți, această abordare vă oferă o hartă vizuală a modului în care datele dvs. se raportează, permițându-vă să decideți unde să tăiați arborele pentru a obține numărul perfect de grupuri.

preparare de date și infrastructură
Articol asociat:
Stăpânirea pregătirii datelor și a infrastructurii pentru era inteligenței artificiale

Logica fundamentală a grupării ierarhice

Reprezentare abstractă de blocuri digitale și patroni de roșu care simbolizează datele brute și nu sunt grupate înainte de procesul de clustering.

În esență, gruparea ierarhică construiește o ierarhie de grupuri. Aceasta este adesea reprezentată de o dendrogramă , o diagramă de tip arbore unde axa verticală reprezintă distanța sau diferența dintre grupuri. Cu cât ramura este mai joasă, cu atât elementele sunt mai similare. Această metodă este incredibil de flexibilă, deoarece nu te obligă să predefini numărul de grupuri (k) de la început, spre deosebire de algoritmi precum K-Means.

AGNES: Abordarea de jos în sus

Panou de vizualizare a datelor financiare cu active grupate pe sectoare, ilustrând aplicația de clustering în diversificarea cartelor.

AGNES, sau Aglomerative Nesting, este cea mai comună variantă de grupare ierarhică. Începe cu o mentalitate de „fiecare pentru sine”, unde fiecare punct de date individual începe ca un grup minuscul propriu . De acolo, algoritmul îmbină iterativ cele două grupuri cele mai apropiate până când totul este grupat într-un singur grup gigantic.

análisis de grafos en data analytics
Articol asociat:
Stăpânirea analizei grafice în era Big Data

Procesul urmează în general acești pași: mai întâi, se calculează o matrice de proximitate folosind o metrică de distanță (cum ar fi distanța euclidiană). Apoi, cele două puncte cele mai similare sunt unite. Matricea este actualizată pentru a reflecta acest nou grup, iar procesul se repetă. Pentru ca acest lucru să funcționeze, aveți nevoie de un criteriu de legătură pentru a decide cum să măsurați distanța dintre grupuri:

  • Legătură simplă: Se uită la distanta minima între oricare două puncte din grupuri diferite. Acest lucru poate duce la „înlănțuire”, în care grupurile cresc în linii lungi și subțiri.
  • Legătură completă: Se concentrează pe distanta maxima între puncte, tinzând să creeze grupuri sferice mai compacte.
  • Legătura medie: Calculează distanță medie între toate perechile de puncte din două clustere, oferind o cale de mijloc echilibrată.
  • Legătură centroidă: Măsoară distanța dintre centre geometrice (centroizi) a clusterelor, care este adesea mai robustă împotriva valorilor aberante.
  • Metoda lui Ward: În loc de distanță brută, își propune să minimizează varianța totală intra-cluster, menținând eficient grupurile strânse și coezive.

DIANA: Strategia de sus în jos

Profesionales analizând grafice de date într-o pizarra blanca, reprezentând validarea clusterelor și luarea deciziilor bazate în date.

Pe de altă parte, avem DIANA (Analiza Divizivă). Dacă AGNES se referă la construirea unui turn, DIANA se referă la sculptarea unei sculpturi . Începe cu un grup masiv care conține fiecare punct de date și îl împarte recursiv în altele mai mici.

analiza datelor cu SQL
Articol asociat:
Analiza datelor cu SQL: de cero a experto cu exemple și tehnici

Algoritmul identifică clusterul cu cel mai mare diametru (punctele cele mai diferite) și găsește observația cea mai „fragmentată” - cea care este cea mai diferită de restul. Această observație începe un grup nou, iar celelalte puncte sunt reatribuite în funcție de grupul de care sunt mai aproape . Aceasta continuă până când fiecare punct este izolat. Spre deosebire de AGNES, trebuie doar să alegeți o metrică de distanță; aici nu este necesară nicio metodă de legătură .

Măsurarea succesului și a calității

Întrucât nu există un răspuns „corect” în învățarea nesupervizată, folosim metrici specifice pentru a vedea dacă clusterele noastre au sens. În general, le împărțim în validare internă și externă.

Validarea internă nu are nevoie de etichete externe. De exemplu, indicele Davies-Bouldin analizează raportul dintre coeziunea în cadrul clusterelor și separarea dintre clustere; un scor mai mic este mai bun. Potențialul de stres măsoară suma distanțelor la pătrat până la centroizi, deși aceasta scade în mod natural pe măsură ce adăugați mai multe clustere. Alte instrumente populare includ Metoda Cotului și Analiza Siluetei pentru a găsi acel „punct ideal” pentru numărul de grupuri.

Funcțiile ferestrei SQL
Articol asociat:
Stăpânirea funcțiilor ferestrei SQL pentru analiza avansată a datelor

Validarea externă intră în joc atunci când aveți un standard de aur sau etichete de specialitate cu care să comparați. Metrici precum Precizia, Rechemarea și măsura F tratează rezultatul clusterizării ca pe o problemă de clasificare. De asemenea, puteți utiliza Teoria Informației , utilizând Entropia și Informația Mutuală pentru a vedea cât de multă incertitudine este redusă atunci când se compară rezultatul algoritmului cu categorii cunoscute.

Utilități în lumea reală: de la finanțe la știința datelor

Aceasta nu este doar o teorie academică. În finanțe, de exemplu, clusterizarea este o forță pentru diversificarea portofoliului . Prin utilizarea unei matrice de corelație a randamentelor activelor ca măsură a distanței, investitorii pot crea o dendrogramă pentru a vedea ce acțiuni se mișcă în același ritm. Pentru a diversifica cu adevărat, ar trebui să se aleagă active din diferite ramuri ale arborelui, asigurându-se că portofoliul nu este expus excesiv unui singur factor de risc.

Dincolo de finanțe, gruparea ajută la segmentarea pieței prin gruparea clienților cu obiceiuri de cumpărare similare, permițând companiilor să își adapteze marketingul. Cheia este de a experimenta cu diferite metrici de distanță - cum ar fi Manhattan sau Mahalanobis - și diverse metode de conectare pentru a vedea care dintre ele dezvăluie cele mai plauzibile modele în setul de date specific analizat.

Stăpânirea acestor tehnici ierarhice permite o înțelegere profundă și structurală a datelor, trecând de la detaliile granulare ale punctelor individuale la imaginea de ansamblu a categoriilor globale. Prin echilibrarea strategiilor aglomerative și divizive și validarea rezultatelor prin intermediul unor indicatori interni și externi, se poate transforma zgomotul brut, neetichetat, în informații utile și organizate.

analiza datelor în timp real
Articol asociat:
Analiza datelor în timp real: ghid complet pentru companii
Postări asemănatoare: