- Word2Vec muuntaa sanat moniulotteisiksi vektoreiksi jakaumahypoteesin perusteella, jossa merkitys johdetaan kontekstista.
- Malli hyödyntää kahta pääarkkitehtuuria: CBOW:ta kohdesanan ennustamiseen kontekstista ja Skip-Gramia kontekstin ennustamiseen kohdesanasta.
- Semanttiset suhteet tallennetaan lineaarisina siirtyminä vektoriavaruudessa, mikä mahdollistaa kielelliset analogiat matemaattisten operaatioiden avulla.
Oletko koskaan miettinyt, miten kone oikeasti "ymmärtää", mitä tarkoitamme puhuessamme? Emme voi vain ojentaa tietokoneelle sanakirjaa ja odottaa sen ymmärtävän vivahteita. Pitkään koneet näkivät sanat vain erillisinä symboleina , mikä tarkoitti, että "koira" oli aivan yhtä erilainen kuin "kissa" kuin "mikroaaltouuni". Kaikki muuttui Word2Vecin myötä. Word2Vec on mullistava luonnollisen kielen käsittelyn tekniikka, jonka avulla tietokoneet voivat yhdistää sanat matemaattiseen tilaan , jossa merkitys määritellään läheisyyden perusteella.
Pohjimmiltaan Word2Vec perustuu jakaumahypoteesiin , joka on hienostunut tapa sanoa, että sanan voi ymmärtää sen seuran perusteella. Jos kahdella sanalla on usein samat naapurit, niillä on todennäköisesti samanlainen merkitys. Analysoimalla valtavia määriä tekstiä Word2Vec muuntaa sanat moniulotteisiksi vektoreiksi , mikä luo semanttisen kartan, jossa kielelliset suhteet muuttuvat yksinkertaiseksi geometriaksi.
Vanha koulukunta: Laskentaan perustuvat lähestymistavat

Ennen kuin Word2Vec otti vallan, käytimme lukumäärään perustuvia menetelmiä. Perusversiossa käytettiin yhteisesiintymismatriiseja , joissa yksinkertaisesti laskettiin, kuinka monta kertaa sana A esiintyi sanan B lähellä. Vaikka nämä matriisit olivat yksinkertaisia, niistä tuli hirvittävän suuria ja ne täyttyivät nollilla, mikä teki niiden laskemisesta painajaismaista. Tämän korjaamiseksi tutkijat käyttivät tekniikoita, kuten Positive Pointwise Mutual Information (PPMI) -menetelmää assosiaation mittaamiseen paremmin tai Latent Semantic Analysis (LSA) -menetelmää , joka käyttää singulaariarvon hajotelmaa (SVD) datan pienentämiseen ja piilotettujen "aiheiden" paljastamiseen dokumenteissa.
Miten Word2Vec oikeasti toimii

Word2Vec muutti skriptin toimintaa käsittelemällä ongelmaa ennustustehtävänä laskutehtävän sijaan. Pelkän sanojen laskemisen sijaan se käyttää matalaa, kaksikerroksista neuroverkkoa upotusten oppimiseen. Malli liu'uttaa ikkunaa valtavan tekstimäärän yli keskittyen keskeiseen sanaan ja sen ympäröivään kontekstiin. Säätämällä vektoreita iteratiivisesti maksimoidakseen oikeiden naapureiden ennustamisen todennäköisyyden , malli työntää semanttisesti samankaltaisia sanoja luonnollisesti lähemmäs toisiaan vektoriavaruudessa.
Kaksi tapaa kouluttaa: CBOW vs. Skip-Gram

- Jatkuva sanapussi (CBOW): Ajattele tätä "täyttöharjoituksena". Malli tarkastelee ympäröiviä kontekstisanoja ja yrittää ennusta puuttuva keskeinen sanaSe on yleensä nopeampi kouluttaa ja toimii erinomaisesti usein esiintyvien sanojen kanssa.
- Ohita-grammi: Tämä on käänteinen lähestymistapa. Malli ottaa yhden keskeisen sanan ja yrittää ennustaa ympäröivää kontekstiaVaikka se vie enemmän aikaa, Skip-Gram on paljon parempi käsittelemään harvinaisia sanoja ja harvinaisten semanttisten suhteiden tallentamista.
Koulutuksen tehostaminen: Negatiivinen otanta

Jokaisen yksittäisen sanan todennäköisyyden laskeminen massiivisessa sanastossa joka kerta, kun ikkunaa siirretään, olisi uskomattoman hidasta . Tämän välttämiseksi Word2Vec käyttää negatiivista näytteenottoa . Sen sijaan, että malli päivittäisi jokaisen sanan sanakirjassa, se päivittää vain kohdesanan ja kourallisen satunnaisesti valittuja "negatiivisia" esimerkkejä . Tämä vähentää laskennallista kuormitusta merkittävästi tinkimättä opittujen upotusten laadusta, sillä usein sanoja otetaan näytteistämällä niiden frekvenssijakauman perusteella varmistaakseen, ettei malli laiskotele.
Semanttisen avaruuden taika
Kun koulutus on valmis, tuloksena on semanttinen tila , jossa voit itse asiassa suorittaa matematiikkaa sanoilla. Yksi hienoimmista löydöistä on, että nämä suhteet ovat usein lineaarisia . Jos esimerkiksi otat "Kuninkaan" vektorin, vähennät "Mies" ja lisäät "Nainen", tuloksena oleva piste avaruudessa on uskomattoman lähellä "Kuningattaren" vektoria. Tämä osoittaa, että malli on vanginnut sukupuolen ja kuninkaallisuuden abstraktin käsitteen yksinkertaisen vektoriaritmetiikan avulla.
Perussanojen tuolla puolen: Laajennukset ja muunnelmat
Word2Vecin menestys sytytti kokonaisen laajennusperheen. Doc2Vec laajensi ideaa esittämään kokonaisia kappaleita tai dokumentteja yksittäisinä vektoreina, mikä mahdollisti edistyneen dokumenttien luokittelun. Sitten tuli Top2Vec , joka yhdistää dokumenttien upottamisen klusterointialgoritmeihin, kuten HDBSCAN, löytääkseen aiheita automaattisesti ilman merkittyjä tietoja. Jopa biologiset tieteet saivat osansa BioVecin myötä , soveltaen näitä periaatteita DNA- ja proteiinisekvensseihin biokemiallisten mallien ymmärtämiseksi.
Tulosten arviointi
Mistä tiedämme, onko malli todella "älykäs"? Tähän on kaksi päätapaa. Sisäinen arviointi tarkastelee sisäisiä ominaisuuksia ja käyttää vertailuarvoja nähdäkseen, vastaavatko mallin samankaltaisuuspisteet ihmisen harkintaa vai pystyykö se ratkaisemaan analogiatestejä . Ulkoinen arviointi on käytännöllisempää; se sisältää upotusten kytkemisen reaalimaailman tehtävään, kuten mielipideanalyysiin tai tekstin luokitteluun, sen tarkistamiseksi, paraneeko yleinen suorituskyky. Vaikka uudemmat mallit, kuten BERT tai ELMo, tarjoavat kontekstuaalisia upotuksia (eli sanan vektori muuttuu lauseen perusteella), Word2Vec on edelleen staattisten sanaesitysten perusta.
Muuntamalla ihmiskielen kaaoksen jäsennellyksi geometriseksi maisemaksi nämä tekniikat mahdollistavat koneiden navigoinnin merkityksen perässä kosini-samankaltaisuuden ja vektorisiirtymien avulla. Negatiivisen näytteenoton tehokkuudesta Skip-Gramin ja CBOW:n monipuolisuuteen, kyky kartoittaa kielelliset kontekstit matemaattisiksi koordinaateiksi on muuttanut perustavanlaatuisesti sitä, miten rakennamme kaikkea hakukoneista käännöstyökaluihin.
