- Google kehittää TorchTPU:ta tehdäkseen tekoälysiruistaan täysin yhteensopivia PyTorchin kanssa ja helpottaakseen siirtymistä Nvidian näytönohjaimista.
- Tavoitteena on tehdä TPU-suorittimista valtavirran vaihtoehto pilvessä ja paikallisesti, mikä vähentää riippuvuutta Nvidian CUDA-ekosysteemistä.
- Google tekee tiivistä yhteistyötä PyTorchin ylläpitäjän Metan kanssa ja harkitsee osien järjestelmän avoimen lähdekoodin käyttöönottoa nopeuttaakseen käyttöönottoa.
- Vahvempi PyTorch-tuki voisi leikata kustannuksia ja poistaa teknisiä esteitä yrityksille, jotka haluavat monipuolistaa tekoälyinfrastruktuuriaan.
Google muokkaa hiljaisesti strategiaansa tekoälylaskennan kilpailussa . Keskittymistään sisäisiin merkkeihinsä jälkeen yritys panostaa nyt tekoälysirujensa saumattomaan toimimiseen PyTorchin kanssa, joka on avoimen lähdekoodin työkalupakki, josta on tullut useimpien tekoälykehittäjien oletusvalinta maailmanlaajuisesti.
Tämän muutoksen ytimessä on sisäisesti nimellä "TorchTPU" tunnettu projekti , jonka tarkoituksena on kuroa umpeen kuilua Googlen laitteiston rakentamisen ja asiakkaiden todellisten tekoälyjärjestelmien rakentamisen välillä. Nostamalla PyTorch-tuen ensiluokkaiseksi Tensor-prosessointiyksiköissään (TPU) Google pyrkii hyödyntämään Nvidian CUDA-ohjelmistoekosysteemin kautta rakentamaa valtavaa etua.
Google tekee TPU-suorittimista vakavan kilpailijan Nvidian näytönohjaimille
Googlen TPU-prosessoreita on pitkään markkinoitu tekoälytyökuormiin räätälöityinä tehokkaina siruina , mutta ne eivät ole vastanneet Nvidian näytönohjainten yleisyyttä. Yksi keskeinen syy on se, että Nvidia käytti vuosia varmistaakseen, että PyTorch toimii poikkeuksellisen hyvin sen laitteistolla, kun taas Google keskittyi pääasiassa omiin työkaluihinsa ja sisäisiin työnkulkuihinsa.
Alphabetin sisällä TPU:ista on tullut kriittinen kasvumoottori Google Cloudille . Näiden sirujen käyttöoikeuden myyminen pilvialustansa kautta on nyt keskeinen osa sitä, miten Google pyrkii todistamaan sijoittajille, että sen tekoälyinvestoinnit voivat muuttua konkreettisiksi tuloiksi, ei vain tutkimuksen arvovallaksi tai kokeellisiksi tuotteiksi.
Pelkkä laitteisto ei kuitenkaan riitä kehittäjien puolelleen. TPU-piirejä harkitsevat yritykset ovat toistuvasti kertoneet Googlelle, että ohjelmistojen yhteensopivuus on ollut ongelma : PyTorchia vahvasti standardoineet tiimit eivät halua uudistaa koodiaan tai kouluttaa henkilöstöään uudelleen vain kokeillakseen uutta sirua.
Tässä kohtaa TorchTPU astuu kuvaan. Aloitteen tarkoituksena on tehdä TPU-suorittimista kehittäjän näkökulmasta yhtä helppokäyttöisiä PyTorchin kanssa kuin Nvidian näytönohjaimet nykyään ovat . Tavoitteena on, että olemassa olevia PyTorch-malleja ja -putkia voidaan siirtää minimaalisilla muutoksilla, jolloin TPU-kokeilun kustannukset ja riskit laskevat jyrkästi.
Google Cloudin tiedottaja on välttänyt teknisten yksityiskohtien käsittelyä, mutta vahvisti, että päätavoitteena on antaa asiakkaille paljon suurempi joustavuus tekoälytyökuormien suorittamisessa riippumatta siitä, minkä laitteiston he valitsevat.
Mitä TorchTPU todella muuttaa PyTorch-kehittäjille
Alun perin Metan luoma ja mainostama PyTorch on tullut käytännössä standardikehykseksi nykyaikaisten tekoälyjärjestelmien rakentamiseen . Useimmat Piilaaksossa ja muualla toimivat insinöörit eivät koodaa käsin ytimiä Nvidian, AMD:n tai Googlen siruille; sen sijaan he luottavat PyTorchiin ja vastaaviin kehyksiin, jotka tarjoavat valmiiksi rakennettuja komponentteja ja koulutusapuohjelmia.
Julkaisustaan vuonna 2016 lähtien PyTorchin kasvu on ollut läheisesti sidoksissa CUDAan ja sitä ympäröiviin kirjastoihin , ohjelmistopinoon, jota monet Wall Streetin analyytikot pitävät Nvidian tärkeimpänä strategisena voimavarana. Nvidian insinöörit ovat investoineet voimakkaasti varmistaakseen, että PyTorch toimii mahdollisimman tehokkaasti heidän näytönohjaimillaan, mikä tekee pariliitoksesta oletusvalinnan laaja-alaisten tekoälymallien koulutukseen ja käyttöönottoon.
Google sitä vastoin tuki vuosia Jaxia , toista ohjelmistokehystä, jota suosittiin erityisesti sen omissa tutkimus- ja tuotetiimeissä. TPU:t käyttivät XLA- nimistä kääntäjäkerrosta Jax-pohjaisen koodin tehokkaaseen suorittamiseen, ja suuri osa Googlen sisäisestä tekoälyohjelmistopinosta ja suorituskyvyn optimoinnista rakennettiin tämän yhdistelmän ympärille.
Tuloksena on, että Googlen itsensä sirujen käyttötapojen ja useimpien ulkoisten asiakkaiden mieluummin työskentelytapojen välillä on kasvava epäsuhta . Monet yritykset ovat standardoineet lähes kokonaan PyTorchin pohjalta, mikä tarkoittaa, että siirtyminen TPU-prosessoreihin on tyypillisesti tarkoittanut mullistavaa muutosta työkaluissa, koodissa ja kehittäjätaidoissa.
Google pyrkii TorchTPU:n avulla poistamaan tätä kitkaa. Projektin tavoitteena on tarjota täysimittainen PyTorch-tuki TPU-suorittimille , jotta yritykset voivat edelleen luottaa tuttuihin kirjastoihin, harjoitussilmukoihin ja käyttöönottomalleihin muuttaen vain taustalla olevaa laitteistokohdetta. Tämä voisi merkittävästi vähentää sekä suunnittelutyötä että oppimiskäyrää tiimeille, jotka haluavat arvioida TPU:iden suorituskykyä tai kustannusetuja.
Enemmän resursseja, avointa lähdekoodia ja syvempää sitoutumista
Aloitteeseen perehtyneiden mukaan TorchTPU ei ole vain yksi sivukokeilu. Toisin kuin joissakin aiemmissa yrityksissä saada PyTorch toimimaan TPU-piireillä, Google on nyt antanut tälle hankkeelle enemmän organisatorista huomiota, budjettia ja strategista painoarvoa . Se on pitänyt sitä tekoälyinfrastruktuurin etenemissuunnitelmansa keskeisenä pilarina pikemminkin kuin kapeana yhteensopivuusprojektina.
Yksi merkittävimmistä harkinnan alla olevista elementeistä on TorchTPU:n taustalla olevan ohjelmistopinon avoimen lähdekoodin osien kehittäminen . Julkaisemalla keskeiset komponentit yhteisölle Google toivoo nopeuttavansa käyttöönottoa, houkuttelevansa ulkopuolisia osallistujia ja rakentavansa luottamusta suurten asiakkaiden keskuudessa, jotka haluavat läpinäkyvyyttä ja pitkän aikavälin vakautta tekoälyalustoilleen.
Tämän avoimemman asenteen tarkoituksena on myös rauhoittaa yrityksiä, jotka ovat kokeneet TPU-tuen liian tiukasti sidoksissa Googlen sisäiseen toimintatapaan. Antamalla ulkopuolisille kehittäjille mahdollisuuden tarkastaa, laajentaa ja debugata TorchTPU-komponentteja, TPU:t voisivat tuntua vähemmän yksityiseltä saarekkeelta ja enemmän ensiluokkaisilta kansalaisilta laajemmassa PyTorch-ekosysteemissä.
Yrityksille tällä on käytännön merkitystä. Jos TorchTPU onnistuu, se voi merkittävästi alentaa siirtymiskustannuksia Nvidian näytönohjaimista Googlen näytönohjaimiin , mikä helpottaa laskentainfrastruktuurin monipuolistamista ilman monivuotista ohjelmistojen uudelleenkirjoittamista.
Asiakkaat ovat toistuvasti kertoneet Googlelle, että historiallinen vaatimus siirtyä Jaxiin oli merkittävä este. PyTorch hallitsee jo tekoälykehittäjien keskuudessa, ja nopeasti muuttuvilla markkinoilla harvat organisaatiot ovat valmiita keskeyttämään tuotekehityssuunnitelmiaan siksi aikaa, kun heidän tiiminsä sopeutuvat uuteen kehykseen vain käyttääkseen vaihtoehtoista laitteistoa.
Sisäisestä laitteistosta laajaan yritystarjontaan
Alphabet piti pitkään suurimman osan TPU-kapasiteetistaan Googlen sisäisessä käytössä , ja se käytti haku-, käännös-, suositusjärjestelmiä ja varhaista tekoälytutkimusta. Tämä kanta alkoi muuttua vuonna 2022, kun pilvipalveluosastolle annettiin enemmän valtaa TPU-yksiköiden tuotteistamisen ja myynnin suhteen.
Sittemmin TPU-piirien saatavuus Google Cloudin kautta on lisääntynyt huomattavasti . Yritysten kiinnostuksen tekoälyyn kiihtyessä Google on asemoinut sirunsa keinoksi, jolla asiakkaat voivat hyödyntää huippuluokan laskentatehoa ilman, että heidän tarvitsee hallita omia tiiviisti kytkettyjä GPU-klustereitaan.
Viime aikoina Google on mennyt askeleen pidemmälle myymällä TPU-laitteita suoraan käyttöönotettaviksi asiakkaiden omissa datakeskuksissa , ei pelkästään julkisen pilvensä kautta. Tämä muutos antaa suuremmille organisaatioille, joilla on tiukat sääntely- tai viivevaatimukset, mahdollisuuden integroida TPU-laitteet paikalliseen infrastruktuuriinsa ja hyötyä silti Googlen laitteistosuunnitelmasta.
Tämä laajennus muuttaa myös Googlen sisäisiä prioriteetteja. Yritys tarvitsee TPU-kapasiteettia sekä omien tekoälytuotteidensa – Gemini-chatbotista tekoälypohjaisiin hakutoimintoihin – pyörittämiseen että ulkoisten Google Cloud -asiakkaiden palvelemiseen, mukaan lukien tunnetut tekoälyyritykset, kuten Anthropic, jotka ovat riippuvaisia vuokratusta TPU-kapasiteetista.
Kaiken tämän koordinoimiseksi Google on nostanut tekoälyinfrastruktuurin johtajuutta: veteraanijohtaja Amin Vahdat nimitettiin tekoälyinfrastruktuurin päälliköksi, ja hän raportoi nyt suoraan toimitusjohtaja Sundar Pichaille . Tämä raportointilinja korostaa, kuinka keskeiseksi laitteisto- ja ohjelmistopinosta on tullut Googlen laajemmissa tekoälytavoitteissa.
Yhteistyö Metan kanssa PyTorchin vahvistamiseksi TPU-suorittimissa
Google ei pyri yksin TorchTPU:n pariin. Keskusteluista tietävien lähteiden mukaan yritys tekee tiivistä yhteistyötä PyTorchin luojan ja ylläpitäjän Metan kanssa nopeuttaakseen TPU:iden tukea ja yhdenmukaistaakseen teknisiä suuntia, jotka hyödyttävät molempia osapuolia.
Yritysten välisissä keskusteluissa on mukana järjestelyjä, jotka antaisivat Metalle pääsyn suurempaan TPU-kapasiteettiin . Aiempien ehdotusten kerrotaan muodostaneen tämän hallittuina palveluina: Google ottaisi käyttöön sirunsa ympäristöissä, joissa Meta voisi käyttää omia ohjelmistojaan ja mallejaan, ja Google hoitaisi suuren osan operatiivisista kustannuksista.
Metalle PyTorchin tehokas toiminta laajemmalla laitteistovalikoimalla on strategisesti tärkeää. Yrityksellä on selkeä kannustin vähentää päättelykustannuksia ja monipuolistaa toimintaansa pois yksinomaan Nvidian näytönohjaimista sekä omien menojensa pienentämiseksi että neuvotteluasemansa vahvistamiseksi tulevia siruostoja neuvoteltaessa.
Yhteistyössä Googlen kanssa Meta voi auttaa varmistamaan, että PyTorch pysyy laitteistoriippumattomana ja laajasti optimoituna sen sijaan, että sitä pidettäisiin tiukasti yhden toimittajan ekosysteemiin sidottuna. Tämä puolestaan vahvistaa PyTorchin asemaa yhteisöstandardina ja pitää viitekehyksen houkuttelevana sekä tutkijoille että yrityksille.
Meta on toistaiseksi kieltäytynyt kommentoimasta julkisesti näitä erityisjärjestelyjä, mutta intressien yhtymäkohta on selvä : sosiaalisen median ja tekoälyn jättiläinen haluaa vaihtoehtoja Nvidian ulkopuolelle, kun taas Google haluaa PyTorchin tuntuvan natiivilta sen TPU-suorittimissa, jotta useammat asiakkaat olisivat halukkaita kokeilemaan niitä.
Nvidian CUDA-edun hyödyntäminen
Nvidian tekoälyvalta ei rajoitu pelkästään tehokkaiden näytönohjainten toimittamiseen. Yritys on vuosien varrella rakentanut laajan ohjelmistopinon – jonka perustana on – joka on syvästi integroitu frameworkeihin, kuten PyTorch. Tästä laitteiston ja ohjelmiston yhdistelmästä on tullut huippuluokan tekoälymallien oletusarvoinen koulutus- ja päättelyalusta.
Tiiviin integraation vuoksi monet organisaatiot pitävät Nvidiasta luopumista riskialttiina ja kalliina . Koodikanta, työnkulut ja henkilöstön asiantuntemus on kaikki viritetty CUDA:lle, minkä vuoksi vaihtoehtoiset sirut näyttävät mahdolliselta kitkan lähteeltä, vaikka ne paperilla lupaisivatkin parempaa hinnoittelua tai suorituskykyä.
Googlen TorchTPU-hanke on suora yritys murentaa tätä etulyöntiasemaa. Jos PyTorch toimii TPU-suorittimilla samalla helppoudella ja suorituskyvyn säätömahdollisuuksilla kuin Nvidian näytönohjaimilla, yritykset saavat uskottavan vaihtoehdon suurille tekoälytyökuormille . Markkinoilla, joilla tekoälylaskennan kysyntä on räjähdysmäisessä kasvussa ja tarjonnan rajoitukset ovat yleisiä, toisen vakavasti otettavan vaihtoehdon olemassaolo voisi olla erittäin houkuttelevaa.
Samaan aikaan Googlen päätös harkita TorchTPU-pinon keskeisten osien avoimen lähdekoodin kehittämistä viestii erilaisesta lähestymistavasta kuin Nvidian vertikaalisesti integroituneempi tyyli. Jakamalla enemmän taustalla olevaa ohjelmistoa Google pyrkii rakentamaan luottamusta kehittäjien keskuudessa, jotka arvostavat läpinäkyvyyttä ja siirrettävyyttä.
Mikään tästä ei takaa, että TPU:t korvaavat näytönohjaimet, mutta se muuttaa laskentakaavaa. Sen sijaan, että asiakkaat valitsisivat Nvidian kypsän ekosysteemin ja vaihtoehdon välillä, joka vaatii täydellisen työkalupakin migraation, he voisivat punnita suorituskykyä, kustannuksia ja saatavuutta pysyen samalla tutussa PyTorch-ympäristössä.
Tämä muutos voisi helpottaa organisaatioiden laitteistotoimittajien yhdistelyä ajan myötä sekä pilvi- että paikallisissa käyttöönottoissa sen sijaan, että tekoälysuunnitelmansa lukittaisiin oletusarvoisesti yhteen toimittajaan.
Googlen syventäessä sitoutumistaan PyTorchiin TorchTPU:n kautta, lisätessä yritysten pääsyä TPU-suorittimiin ja tiivistäessä yhteistyötä Metan kanssa, tekoälyinfrastruktuurin kilpailukenttä muuttuu epävakaammaksi. Nvidian johtoasema, joka perustuu vuosien laitteisto- ja CUDA-integraatiokokemukseen, on edelleen huomattava, mutta asiakkaat näkevät nyt realistisempia tapoja monipuolistaa tekoälytyökuormituksensa käyttöpaikkoja ja laskennan hintaa.
