- Hierarhiskā klasterizācija sakārto datus kokam līdzīgā struktūrā, ko sauc par dendrogrammu, tādējādi izvairoties no nepieciešamības iepriekš iestatīt klasteru skaitu.
- AGNES veido klasterus no apakšas uz augšu, izmantojot iteratīvu apvienošanu, savukārt DIANA sadala vienu lielu grupu no augšas uz leju.
- Klasteru kvalitāte tiek novērtēta, izmantojot iekšējos rādītājus, piemēram, Deivisa-Buldina indeksu, vai ārējos salīdzinājumus, izmantojot Precision and Recall.
Vai esat kādreiz jutuši, ka skatāties uz datu kalnu un vienkārši nevarat redzēt mežu aiz kokiem? Šeit talkā nāk klasterizācija. Tā būtībā ir datu punktu grupēšanas māksla, pamatojoties uz to līdzību , nodrošinot, ka grupas ietvaros esošie elementi ir cieši saistīti, kamēr pašas grupas atrodas tālu viena no otras. Tas ir nekontrolētas mašīnmācīšanās stūrakmens, kas nozīmē, ka dators atrod modeļus, iepriekš nepasakot, ko meklēt >.
Lai gan ir daudz veidu, kā sadalīt datus, hierarhiskā klasterizācija ir nedaudz īpaša. Tā vietā, lai vienkārši izvēlētos nejaušu grupu skaitu, tā izveido ligzdotu struktūru, kas izskatās kā ģimenes koks . Neatkarīgi no tā, vai mēģināt dažādot akciju portfeli vai segmentēt klientu bāzi, šī pieeja sniedz vizuālu ceļvedi par to, kā jūsu dati ir saistīti, ļaujot jums izlemt, kur sagriezt koku , lai iegūtu perfektu klasteru skaitu.
Hierarhiskās klasterizācijas pamatloģika

Hierarhiskā klasterizācija pēc būtības veido grupu hierarhiju. To bieži attēlo ar dendrogrammu — koka formas diagrammu, kur vertikālā ass attēlo attālumu vai atšķirību starp klasteriem. Jo zemāks ir zars, jo līdzīgāki ir elementi. Šī metode ir neticami elastīga, jo atšķirībā no tādiem algoritmiem kā K-Means tā neliek jums jau no paša sākuma iepriekš definēt klasteru skaitu (k) .
AGNES: Augšupvērsta pieeja

AGNES jeb aglomeratīvā ligzdošana ir visizplatītākais hierarhiskās klasterizācijas paveids. Tā sākas ar principu “katrs par sevi”, kur katrs atsevišķs datu punkts sākas kā savs mazs klasteris . Pēc tam algoritms iteratīvi apvieno divus tuvākos klasterus, līdz viss tiek apvienots vienā milzīgā grupā.
Process parasti notiek šādi: vispirms, izmantojot attāluma metriku (piemēram, Eiklīda attālumu), tiek aprēķināta tuvuma matrica . Pēc tam tiek savienoti divi līdzīgākie punkti. Matrica tiek atjaunināta, lai atspoguļotu šo jauno grupu, un process atkārtojas. Lai tas darbotos, ir nepieciešams saistīšanas kritērijs , lai izlemtu, kā mērīt attālumu starp grupām:
- Viena saite: Skatās uz minimālais attālums starp jebkuriem diviem punktiem dažādos klasteros. Tas var novest pie "ķēdēšanas", kur klasteri aug garās, plānās līnijās.
- Pilnīga saistīšana: Koncentrējas uz maksimālais attālums starp punktiem, mēdzot veidot kompaktākas, sfēriskākas grupas.
- Vidējais savienojums: Aprēķina vidējais attālums starp visiem punktu pāriem divos klasteros, nodrošinot līdzsvarotu vidusceļu.
- Centroīda saikne: Mēra attālumu starp ģeometriskie centri (centroīdi) klasteru, kas bieži vien ir izturīgāks pret novirzēm.
- Vorda metode: Neapstrādāta attāluma vietā tā mērķis ir samazināt kopējo klastera iekšējo dispersiju, efektīvi saglabājot klasterus blīvus un saliedētus.
DIĀNA: Stratēģija no augšas uz leju

No otras puses, mums ir DIANA (Divisive Analysis — sadalošā analīze). Ja AGNES ir par torņa celtniecību, tad DIANA ir par skulptūras izgrebšanu . Tā sākas ar vienu masīvu klasteri, kurā ir katrs datu punkts, un rekursīvi sadala to mazākos.
Algoritms identificē klasteri ar lielāko diametru (visnelīdzīgākos punktus) un atrod visvairāk "šķembu" novērojumu — to, kas visvairāk atšķiras no pārējiem. Šis novērojums sāk jaunu grupu, un citi punkti tiek pārdalīti, pamatojoties uz to, kurai grupai tie atrodas tuvāk . Tas turpinās, līdz katrs punkts ir izolēts. Atšķirībā no AGNES, jums jāizvēlas tikai attāluma metrika; šeit nav nepieciešama saistīšanas metode.
Panākumu un kvalitātes mērīšana
Tā kā nekontrolētā mācīšanās gadījumā nav “pareizas” atbildes, mēs izmantojam īpašus rādītājus, lai noskaidrotu, vai mūsu klasteri patiešām ir jēgpilni. Mēs tos parasti sadalām iekšējā un ārējā validācijā.
Iekšējai validācijai nav nepieciešamas ārējas etiķetes. Piemēram, Deivisa-Buldina indekss aplūko klasteru iekšējās kohēzijas un starpklasteru atdalīšanas attiecību; zemāks rādītājs ir labāks. Stresa potenciāls mēra kvadrātveida attālumu summu līdz centroīdiem, lai gan tas dabiski samazinās, pievienojot vairāk klasteru. Citi populāri rīki ir elkoņu metode un siluetu analīze , lai atrastu “zelta punktu” grupu skaitam.
Ārējā validācija tiek izmantota, ja ir pieejams zelta standarts vai ekspertu etiķetes, ar ko salīdzināt. Tādi rādītāji kā precizitāte, atcerēšanās spēja un F-mērs klasterizācijas rezultātu traktē kā klasifikācijas problēmu. Varat arī izmantot informācijas teoriju , izmantojot entropiju un savstarpējo informāciju, lai redzētu, cik lielā mērā nenoteiktība samazinās, salīdzinot algoritma rezultātu ar zināmām kategorijām.
Reālās pasaules lietderība: no finansēm līdz datu zinātnei
Tā nav tikai akadēmiska teorija. Piemēram, finansēs klasterizācija ir portfeļa diversifikācijas spēkstacija . Izmantojot aktīvu ienesīguma korelācijas matricu kā attāluma mēru, investori var izveidot dendrogrammu, lai redzētu, kuri akciju virzās vienā ritmā. Lai patiesi diversificētu, būtu jāizvēlas aktīvi no dažādiem koka zariem, nodrošinot, ka portfelis nav pārāk pakļauts vienam riska faktoram.
Papildus finansēm klasterizācija palīdz tirgus segmentācijā , grupējot klientus ar līdzīgiem pirkšanas paradumiem, ļaujot uzņēmumiem pielāgot savu mārketingu. Galvenais ir eksperimentēt ar dažādiem attāluma rādītājiem, piemēram, Manhetenas vai Mahalanobisa, un dažādām sasaistes metodēm, lai noskaidrotu, kura no tām atklāj visticamākos modeļus konkrētajā analizētajā datu kopā.
Šo hierarhisko metožu apgūšana ļauj iegūt dziļu, strukturālu datu izpratni, pārejot no atsevišķu punktu detalizētas detaļas uz globālu kategoriju kopējo ainu. Līdzsvarojot aglomeratīvās un šķeļošās stratēģijas un validējot rezultātus, izmantojot iekšējos un ārējos rādītājus, neapstrādātu, nemarķētu troksni var pārveidot par rīcības spējīgu, organizētu informāciju.

