- Hierarkkinen klusterointi järjestää tiedot puumaiseksi rakenteeksi, jota kutsutaan dendrogrammiksi, jolloin klusterien lukumäärää ei tarvitse asettaa etukäteen.
- AGNES rakentaa klustereita alhaalta ylöspäin iteratiivisen yhdistämisen avulla, kun taas DIANA jakaa yhden suuren ryhmän ylhäältä alaspäin.
- Klusterin laatua arvioidaan käyttämällä sisäisiä mittareita, kuten Davies-Bouldin-indeksiä, tai ulkoisia vertailuja Precision and Recallin avulla.
Oletko koskaan tuntenut, että tuijotat valtavaa datavuorta etkä näe metsää puilta? Tässä kohtaa klusterointi astuu kuvaan. Se on pohjimmiltaan datapisteiden ryhmittelyä niiden samankaltaisuuden perusteella varmistaen, että ryhmän sisällä olevat asiat ovat tiiviisti yhteydessä toisiinsa, kun taas ryhmät pysyvät kaukana toisistaan. Se on koneoppimisen kulmakivi, mikä tarkoittaa, että tietokone löytää säännönmukaisuuksia ilman, että sille kerrotaan etukäteen, mitä etsiä.
Vaikka datan lohkomiseen ja pilkkomiseen on monia tapoja, hierarkkinen klusterointi on hieman erityinen. Sen sijaan, että se valitsisi vain satunnaisen määrän ryhmiä, se luo sisäkkäisen rakenteen, joka näyttää sukupuulta . Yritätpä sitten hajauttaa osakesalkkua tai segmentoida asiakaskuntaasi, tämä lähestymistapa antaa sinulle visuaalisen tiekartan siitä, miten datasi liittyvät toisiinsa, jolloin voit päättää, mistä leikata puuta saadaksesi täydellisen määrän klustereita.
Hierarkkisen klusteroinnin ydinlogiikka

Hierarkkinen klusterointi rakentaa pohjimmiltaan ryhmien hierarkian. Tätä usein edustaa dendrogrammi , puumainen kaavio, jossa pystysuora akseli edustaa klusterien välistä etäisyyttä tai eroavuutta. Mitä alempi haara, sitä samankaltaisempia alkiot ovat. Tämä menetelmä on uskomattoman joustava, koska se ei pakota sinua määrittelemään klusterien lukumäärää (k) etukäteen alusta alkaen, toisin kuin algoritmit, kuten K-Means.
AGNES: Alhaalta ylös -lähestymistapa

AGNES eli agglomeratiivinen sisäkkäistäminen on yleisin hierarkkisen klusteroinnin muoto. Se alkaa "jokainen on oma itsensä" -mentaliteetilla, jossa jokainen yksittäinen datapiste aloittaa omana pienenä klusterinaan . Siitä eteenpäin algoritmi yhdistää iteratiivisesti kaksi lähimpänä olevaa klusteria, kunnes kaikki on niputettu yhdeksi jättimäiseksi ryhmäksi.
Prosessi yleensä seuraa seuraavia vaiheita: ensin lasketaan läheisyysmatriisi käyttämällä etäisyysmetriikkaa (kuten euklidista etäisyyttä). Sitten kaksi samankaltaisinta pistettä yhdistetään. Matriisia päivitetään vastaamaan tätä uutta ryhmää, ja prosessi toistetaan. Jotta tämä toimisi, tarvitset linkityskriteerin, jolla päätetään, miten ryhmien välinen etäisyys mitataan:
- Yksittäinen kytkentä: Katsoo minimietäisyys minkä tahansa kahden pisteen välillä eri klustereissa. Tämä voi johtaa "ketjuutumiseen", jossa klusterit kasvavat pitkinä, ohuina viivoina.
- Täydellinen linkitys: Keskittyy suurin etäisyys pisteiden välillä, mikä pyrkii luomaan kompaktimpia, pallomaisempia ryhmiä.
- Keskimääräinen kytkentä: Laskee keskimääräinen etäisyys kaikkien pisteparien välillä kahdessa klusterissa, mikä tarjoaa tasapainoisen keskitien.
- Keskipisteen kytkentä: Mittaa etäisyyden geometriset keskipisteet (keskipisteet) klustereista, mikä on usein kestävämpää poikkeavia havaintoja vastaan.
- Wardin menetelmä: Raa'an etäisyyden sijaan se pyrkii minimoi klusterin sisäinen kokonaisvarianssi, pitäen klusterit tehokkaasti tiiviinä ja yhtenäisinä.
DIANA: Ylhäältä alas -strategia

Toisaalta meillä on DIANA (Divisive Analysis). Jos AGNESissa on kyse tornin rakentamisesta, DIANAssa on kyse veistoksen veistämisestä . Se alkaa yhdestä massiivisesta klusterista, joka sisältää jokaisen yksittäisen datapisteen, ja jakaa sen rekursiivisesti pienempiin osiin.
Algoritmi tunnistaa halkaisijaltaan suurimman klusterin ( erittäin erilaiset pisteet) ja löytää "sirpaleisimman" havainnon – sen, joka eroaa eniten muista. Tämä havainto aloittaa uuden ryhmän, ja muut pisteet jaetaan sen perusteella, kumpaa ryhmää ne ovat lähempänä . Tämä jatkuu, kunnes jokainen piste on eristetty. Toisin kuin AGNES:ssä, sinun tarvitsee valita vain etäisyysmetriikka; tässä ei tarvita linkitysmenetelmää .
Menestyksen ja laadun mittaaminen
Koska ohjaamattomassa oppimisessa ei ole "oikeaa" vastausta, käytämme tiettyjä mittareita nähdäksemme, ovatko klusterimme todella järkeviä. Yleensä jaamme nämä sisäiseen ja ulkoiseen validointiin.
Sisäinen validointi ei tarvitse ulkoisia nimikkeitä. Esimerkiksi Davies-Bouldin-indeksi tarkastelee klusterin sisäisen koheesion ja klusterien välisen etäisyyden suhdetta; alhaisempi pistemäärä on parempi. Stressin potentiaali mittaa keskipisteisiin nähden neliöityjen etäisyyksien summaa, vaikka tämä luonnollisesti laskee klustereita lisättäessä. Muita suosittuja työkaluja ovat kyynärpäämenetelmä ja siluettianalyysi , joilla löydetään ryhmien lukumäärän "kultainen keskipiste".
Ulkoinen validointi tulee mukaan kuvaan, kun sinulla on vertailukelpoinen standardi tai asiantuntija-arvioinnit. Mittarit, kuten tarkkuus, palautusprosentti ja F-mitta, käsittelevät klusterointitulosta luokitteluongelmana. Voit myös käyttää informaatioteoriaa hyödyntäen entropiaa ja keskinäistä informaatiota nähdäksesi, kuinka paljon epävarmuus vähenee, kun algoritmin tulosta verrataan tunnettuihin luokkiin.
Reaalimaailman hyödyllisyys: Rahoituksesta datatieteeseen
Tämä ei ole vain akateemista teoriaa. Esimerkiksi rahoituksessa klusterointi on salkun hajauttamisen voimanpesä . Käyttämällä omaisuuserien tuottojen korrelaatiomatriisia etäisyyden mittana sijoittajat voivat luoda dendrogrammin nähdäkseen, mitkä osakkeet liikkuvat samassa tahdissa. Todellisen hajauttamisen mahdollistamiseksi valittaisiin omaisuuseriä puun eri oksista varmistaen, ettei salkku ole liikaa alttiina yhdelle riskitekijälle.
Rahoituksen lisäksi klusterointi auttaa markkinoiden segmentoinnissa ryhmittelemällä asiakkaita, joilla on samanlaiset ostotottumukset, jolloin yritykset voivat räätälöidä markkinointiaan. Tärkeintä on kokeilla erilaisia etäisyysmittareita – kuten Manhattan tai Mahalanobis – ja erilaisia linkitysmenetelmiä sen selvittämiseksi, mikä paljastaa uskottavimmat kaavat analysoitavassa tietyssä aineistossa.
Näiden hierarkkisten tekniikoiden hallinta mahdollistaa datan syvällisen ja rakenteellisen ymmärryksen, jossa siirrytään yksittäisten pisteiden tarkkuudesta globaalien luokkien kokonaiskuvaan. Tasapainottamalla agglomeratiivisia ja jakavia strategioita ja validoimalla tuloksia sisäisten ja ulkoisten mittareiden avulla, raaka, nimeämätön kohina voidaan muuttaa toimintakelpoiseksi , organisoiduksi tiedoksi.

