Uutiset

Azerbaijanin kielen suurten kielimallien kouluttaminen Amazon SageMaker AI:lla

Azerbaijanin kielen suurten kielimallien kouluttaminen Amazon SageMaker AI:lla on mahdollistanut merkittäviä edistysaskeleita telekommunikaatioalalla. Azercell Telecom, Azerbaijanin johtava telekommunikaatiopalvelujen tarjoaja, on yhteistyössä AWS Generative AI Innovation Centerin kanssa kehittänyt uudenlaisen tuotantovalmiin kehyksen, joka parantaa merkittävästi kielimallien koulutustehokkuutta ja vähentää muistinkäyttöä.

Haasteet ja ratkaisut

Azerbaijanin kielen monimutkainen morfologia ja rajalliset koulutusaineistot asettivat haasteita suurten kielimallien kehittämiselle. Azercellin tavoitteena oli luoda asiakaslähtöinen chatbot ja muita telekommunikaatioon liittyviä sovelluksia hyödyntävä kielimalli. Ratkaisuna oli mukauttaa perustamalleja Azerbaijanin kielelle, mikä edellytti uusien menetelmien kehittämistä ja optimointia.

Yhteistyössä AWS:n kanssa Azercell kehitti kuuden viikon aikana tehokkaan kehyksen Amazon SageMaker AI -alustalla. Tämä kehys paransi koulutuksen läpimenoaikaa 23 prosentilla ja vähensi huippumuistin käyttöä 58 prosentilla ml.p5.48xlarge-instanssissa. Lisäksi kehitettiin räätälöity tokenisaattori, joka kaksinkertaisti mallin käsittelemän Azerbaijanin tekstin määrän.

Räätälöidyn tokenisaattorin kehittäminen

Azerbaijanin kielen monimutkaisuus vaati uudenlaisen tokenisaattorin kehittämistä, joka pystyy käsittelemään kielen erityispiirteitä tehokkaasti. Byte-Level Byte-Pair Encoding (BBPE) -algoritmin avulla luotiin tokenisaattori, joka kattaa kaikki Azerbaijanin kielen erityismerkit ilman manuaalista aakkosmääritystä. Tämä paransi merkittävästi koodauksen tehokkuutta, mikä näkyi tokenien määrän puolittumisena per sana.

Tokenisaattorin kehittämisessä kokeiltiin erilaisia sanastokokoja 50 000:sta 100 000:een tokeniin. Lopulliseksi valittiin 100 000 tokenin sanasto, joka tarjosi parhaan tasapainon sanan pirstoutumisen ja harvinaisten tokenien koulutussignaalin välillä.

Muistin optimointi ja tehokkuus

Jatkokoulutuksessa keskeinen haaste oli GPU-muistin optimointi. Muistin tehokas käyttö vaikutti suoraan koulutuksen läpimenoon. PyTorchin Fully Sharded Data Parallel (FSDP) -menetelmän ja Liger Kernel -integraation avulla saavutettiin merkittäviä parannuksia. FSDP jakaa parametrit, gradientit ja optimoijien tilat GPU:iden kesken, mikä vähensi merkittävästi per-GPU-muistin käyttöä.

Liger Kernelit, jotka ovat muistiystävällisiä, Triton-pohjaisia toteutuksia, yhdistävät useita operaatioita yhdeksi GPU-kernelin käynnistykseksi. Tämä vähentää väliaikaisia muistinvarauksia ja parantaa laskennan tehokkuutta ilman numeerista tarkkuuden menetystä. Näiden optimointien avulla saavutettiin 7-kertainen parannus maksimierän koossa ja 23 prosentin parannus läpimenossa.

Miksi tämä on tärkeää

Azercellin ja AWS:n yhteistyö osoittaa, kuinka suurten kielimallien kouluttaminen voi tuoda huomattavia etuja erityisesti morfologisesti rikkaissa kielissä, kuten Azerbaijanin kielessä. Uudet optimointimenetelmät ja räätälöidyt tokenisaattorit voivat merkittävästi parantaa mallien suorituskykyä ja tehokkuutta, mikä avaa uusia mahdollisuuksia kieliteknologian sovelluksille. Tämä kehitystyö tarjoaa arvokkaita oppeja ja menetelmiä muillekin kielille, joilla on rajallisesti koulutusaineistoa.