Hierarkkinen klusterointiopas: AGNES, DIANA ja sen jälkeen

Viimeisin päivitys: 08/13/2026
Kirjoittaja: C SourceTrail
  • Hierarkkinen klusterointi järjestää tiedot puumaiseksi rakenteeksi, jota kutsutaan dendrogrammiksi, jolloin klusterien lukumäärää ei tarvitse asettaa etukäteen.
  • AGNES rakentaa klustereita alhaalta ylöspäin iteratiivisen yhdistämisen avulla, kun taas DIANA jakaa yhden suuren ryhmän ylhäältä alaspäin.
  • Klusterin laatua arvioidaan käyttämällä sisäisiä mittareita, kuten Davies-Bouldin-indeksiä, tai ulkoisia vertailuja Precision and Recallin avulla.

Visualización 3D profesional de un dendrograma para clustering jerárquico, mostrando la estructura de árbol donde los puntos de datos se fusionan en grupos.

Oletko koskaan tuntenut, että tuijotat valtavaa datavuorta etkä näe metsää puilta? Tässä kohtaa klusterointi astuu kuvaan. Se on pohjimmiltaan datapisteiden ryhmittelyä niiden samankaltaisuuden perusteella varmistaen, että ryhmän sisällä olevat asiat ovat tiiviisti yhteydessä toisiinsa, kun taas ryhmät pysyvät kaukana toisistaan. Se on koneoppimisen kulmakivi, mikä tarkoittaa, että tietokone löytää säännönmukaisuuksia ilman, että sille kerrotaan etukäteen, mitä etsiä.

Vaikka datan lohkomiseen ja pilkkomiseen on monia tapoja, hierarkkinen klusterointi on hieman erityinen. Sen sijaan, että se valitsisi vain satunnaisen määrän ryhmiä, se luo sisäkkäisen rakenteen, joka näyttää sukupuulta . Yritätpä sitten hajauttaa osakesalkkua tai segmentoida asiakaskuntaasi, tämä lähestymistapa antaa sinulle visuaalisen tiekartan siitä, miten datasi liittyvät toisiinsa, jolloin voit päättää, mistä leikata puuta saadaksesi täydellisen määrän klustereita.

preparación de datos e infraestructura
Aiheeseen liittyvä artikkeli:
Datan valmistelun ja infrastruktuurin hallinta tekoälyaikakaudelle

Hierarkkisen klusteroinnin ydinlogiikka

Representación abstracta de bloques digitales y patrones de red que symbolzan datos brutos y no agrupados antes del proceso de clustering.

Hierarkkinen klusterointi rakentaa pohjimmiltaan ryhmien hierarkian. Tätä usein edustaa dendrogrammi , puumainen kaavio, jossa pystysuora akseli edustaa klusterien välistä etäisyyttä tai eroavuutta. Mitä alempi haara, sitä samankaltaisempia alkiot ovat. Tämä menetelmä on uskomattoman joustava, koska se ei pakota sinua määrittelemään klusterien lukumäärää (k) etukäteen alusta alkaen, toisin kuin algoritmit, kuten K-Means.

AGNES: Alhaalta ylös -lähestymistapa

Panel de visualización de datos financieros con activos agrupados por sektories, ilustrando la aplicación del clustering en la diversificación de carteras.

AGNES eli agglomeratiivinen sisäkkäistäminen on yleisin hierarkkisen klusteroinnin muoto. Se alkaa "jokainen on oma itsensä" -mentaliteetilla, jossa jokainen yksittäinen datapiste aloittaa omana pienenä klusterinaan . Siitä eteenpäin algoritmi yhdistää iteratiivisesti kaksi lähimpänä olevaa klusteria, kunnes kaikki on niputettu yhdeksi jättimäiseksi ryhmäksi.

analisis de grafos ja data-analytics
Aiheeseen liittyvä artikkeli:
Graafianalytiikan hallinta Big Datan aikakaudella

Prosessi yleensä seuraa seuraavia vaiheita: ensin lasketaan läheisyysmatriisi käyttämällä etäisyysmetriikkaa (kuten euklidista etäisyyttä). Sitten kaksi samankaltaisinta pistettä yhdistetään. Matriisia päivitetään vastaamaan tätä uutta ryhmää, ja prosessi toistetaan. Jotta tämä toimisi, tarvitset linkityskriteerin, jolla päätetään, miten ryhmien välinen etäisyys mitataan:

  • Yksittäinen kytkentä: Katsoo minimietäisyys minkä tahansa kahden pisteen välillä eri klustereissa. Tämä voi johtaa "ketjuutumiseen", jossa klusterit kasvavat pitkinä, ohuina viivoina.
  • Täydellinen linkitys: Keskittyy suurin etäisyys pisteiden välillä, mikä pyrkii luomaan kompaktimpia, pallomaisempia ryhmiä.
  • Keskimääräinen kytkentä: Laskee keskimääräinen etäisyys kaikkien pisteparien välillä kahdessa klusterissa, mikä tarjoaa tasapainoisen keskitien.
  • Keskipisteen kytkentä: Mittaa etäisyyden geometriset keskipisteet (keskipisteet) klustereista, mikä on usein kestävämpää poikkeavia havaintoja vastaan.
  • Wardin menetelmä: Raa'an etäisyyden sijaan se pyrkii minimoi klusterin sisäinen kokonaisvarianssi, pitäen klusterit tehokkaasti tiiviinä ja yhtenäisinä.

DIANA: Ylhäältä alas -strategia

Profesionales analizando gráficos de datos en una pizarra blanca, representando la validición de clusters y la toma de Decisiones basadas en datos.

Toisaalta meillä on DIANA (Divisive Analysis). Jos AGNESissa on kyse tornin rakentamisesta, DIANAssa on kyse veistoksen veistämisestä . Se alkaa yhdestä massiivisesta klusterista, joka sisältää jokaisen yksittäisen datapisteen, ja jakaa sen rekursiivisesti pienempiin osiin.

SQL-tietoanalyysi
Aiheeseen liittyvä artikkeli:
Análisis de datos con SQL: de cero a experto con ejemplos y técnicas

Algoritmi tunnistaa halkaisijaltaan suurimman klusterin ( erittäin erilaiset pisteet) ja löytää "sirpaleisimman" havainnon – sen, joka eroaa eniten muista. Tämä havainto aloittaa uuden ryhmän, ja muut pisteet jaetaan sen perusteella, kumpaa ryhmää ne ovat lähempänä . Tämä jatkuu, kunnes jokainen piste on eristetty. Toisin kuin AGNES:ssä, sinun tarvitsee valita vain etäisyysmetriikka; tässä ei tarvita linkitysmenetelmää .

Menestyksen ja laadun mittaaminen

Koska ohjaamattomassa oppimisessa ei ole "oikeaa" vastausta, käytämme tiettyjä mittareita nähdäksemme, ovatko klusterimme todella järkeviä. Yleensä jaamme nämä sisäiseen ja ulkoiseen validointiin.

Sisäinen validointi ei tarvitse ulkoisia nimikkeitä. Esimerkiksi Davies-Bouldin-indeksi tarkastelee klusterin sisäisen koheesion ja klusterien välisen etäisyyden suhdetta; alhaisempi pistemäärä on parempi. Stressin potentiaali mittaa keskipisteisiin nähden neliöityjen etäisyyksien summaa, vaikka tämä luonnollisesti laskee klustereita lisättäessä. Muita suosittuja työkaluja ovat kyynärpäämenetelmä ja siluettianalyysi , joilla löydetään ryhmien lukumäärän "kultainen keskipiste".

SQL-ikkunan toiminnot
Aiheeseen liittyvä artikkeli:
SQL-ikkunafunktioiden hallinta edistyneeseen data-analyysiin

Ulkoinen validointi tulee mukaan kuvaan, kun sinulla on vertailukelpoinen standardi tai asiantuntija-arvioinnit. Mittarit, kuten tarkkuus, palautusprosentti ja F-mitta, käsittelevät klusterointitulosta luokitteluongelmana. Voit myös käyttää informaatioteoriaa hyödyntäen entropiaa ja keskinäistä informaatiota nähdäksesi, kuinka paljon epävarmuus vähenee, kun algoritmin tulosta verrataan tunnettuihin luokkiin.

Reaalimaailman hyödyllisyys: Rahoituksesta datatieteeseen

Tämä ei ole vain akateemista teoriaa. Esimerkiksi rahoituksessa klusterointi on salkun hajauttamisen voimanpesä . Käyttämällä omaisuuserien tuottojen korrelaatiomatriisia etäisyyden mittana sijoittajat voivat luoda dendrogrammin nähdäkseen, mitkä osakkeet liikkuvat samassa tahdissa. Todellisen hajauttamisen mahdollistamiseksi valittaisiin omaisuuseriä puun eri oksista varmistaen, ettei salkku ole liikaa alttiina yhdelle riskitekijälle.

Rahoituksen lisäksi klusterointi auttaa markkinoiden segmentoinnissa ryhmittelemällä asiakkaita, joilla on samanlaiset ostotottumukset, jolloin yritykset voivat räätälöidä markkinointiaan. Tärkeintä on kokeilla erilaisia ​​etäisyysmittareita – kuten Manhattan tai Mahalanobis – ja erilaisia ​​linkitysmenetelmiä sen selvittämiseksi, mikä paljastaa uskottavimmat kaavat analysoitavassa tietyssä aineistossa.

Näiden hierarkkisten tekniikoiden hallinta mahdollistaa datan syvällisen ja rakenteellisen ymmärryksen, jossa siirrytään yksittäisten pisteiden tarkkuudesta globaalien luokkien kokonaiskuvaan. Tasapainottamalla agglomeratiivisia ja jakavia strategioita ja validoimalla tuloksia sisäisten ja ulkoisten mittareiden avulla, raaka, nimeämätön kohina voidaan muuttaa toimintakelpoiseksi , organisoiduksi tiedoksi.

reaaliaikainen tietojen analysointi
Aiheeseen liittyvä artikkeli:
Análisis de datos en tiempo real: guía completa para empresas
Related viestiä: