- LiteRT-LM nodrošina augstas veiktspējas orķestrācijas slāni, kas ļauj Gemma 4 modeļiem efektīvi darboties perifērijas aparatūrā, piemēram, Raspberry Pi.
- Jauktas precizitātes kvantēšanas izmantošana ievērojami samazina atmiņas aizņemto laiku, ļaujot sarežģītām LLM mašīnām darboties ar tikai 0.8 GB RAM.
- Aparatūras paātrinājums, izmantojot XNNPACK un eksperimentālu WebGPU atbalstu, kā arī gaidāmā Hailo AI HAT integrācija optimizē secinājumu ātrumu.
- Pašatjaunojošas programmaparatūras ieviešana ar divu banku atjauninājumiem nodrošina, ka OTA mākslīgā intelekta izvietojumi ražošanas vidē saglabājas stabili un noturīgi.
Vai esat kādreiz domājuši, vai varētu ietilpināt milzīga valodas modeļa jaudu nelielā tāfelē, kas ietilpst jūsu plaukstā? Sapnis par sarežģītu GenAI ieviešanu perifērijā beidzot ir kļuvis par realitāti, pateicoties Raspberry Pi un Google jaunāko mākslīgā intelekta rīku sinerģijai. Mēs runājam par pasauli, kurā jūsu lietu interneta ierīces ne tikai seko vienkāršiem skriptiem, bet arī faktiski saprot un ģenerē cilvēkam līdzīgu tekstu bez nepieciešamības pastāvīgi būt savienotam ar mākoņkrātuvi.
Lai tas darbotos nevainojami, ir nepieciešams īpašs steks: Raspberry Pi aparatūra, LiteRT izpildlaika efektivitāte un Gemma 4 saimes intelekts. Apvienojot šos elementus, izstrādātāji var veidot privātas, zema latentuma lietojumprogrammas , kas apstrādā datus lokāli, nodrošinot, ka sensitīva informācija nekad nepamet ierīci, vienlaikus saglabājot ātru lietotāja pieredzi, izmantojot optimizētu aparatūras paātrinājumu.
LiteRT-LM un Gemma 4 ekosistēmas izpakošana

Šīs darbības centrā ir LiteRT-LM , kas darbojas kā augstas veiktspējas orķestrācijas slānis. Tas nav tikai apvalks; tas ir izstrādāts starpplatformu izpildei , kas nozīmē, ka tas tiek galā ar lielo valodu modeļu (LLM) darbināšanas smago slodzi Android, iOS, tīmekļa un lietu interneta platformās. Tiem, kas iedziļinās Gemma 4, īpaši E2B variantā , efektivitāte ir satriecoša. Google izmanto gudru jauktas precizitātes kvantēšanas shēmu (2 bitu, 4 bitu un 8 bitu svaru apvienošana), kas ļauj modeļa svara nospiedumu samazināt līdz pat 0.8 GB , padarot to ideāli piemērotu perifērijas ierīču ierobežotajai RAM.
LiteRT-LM sniedzas tālāk par vienkāršu teksta ģenerēšanu, atbalstot multimodalitāti , ļaujot izmantot gan vizuālos, gan audio datus. Tas ievieš arī funkciju izsaukšanu , kas maina spēles noteikumus aģentūru darbplūsmu veidošanā . Tā vietā, lai vienkārši tērzētu, mākslīgais intelekts faktiski var aktivizēt konkrētus rīkus vai API , lai veiktu reālus uzdevumus. Turklāt vairāku marķieru paredzēšanas (MTP) izstrādātāju ieviešana ir palielinājusi secinājumu ātrumu līdz pat 3 reizēm , ievērojami samazinot laiku, ko lietotāji pavada, gaidot atbildi.
Soli pa solim: Gemma 4 izvietošana Raspberry Pi 5 ierīcē

Savas perifērijas mākslīgā intelekta spēkstacijas iestatīšana ir vienkāršāka, nekā izklausās. Vispirms jums būs jāsagatavo aparatūra. Izmantojot Raspberry Pi Imager , ieteicams instalēt Raspberry Pi OS 64 bitu versiju uz Raspberry Pi 5. Kad operētājsistēma ir pārprogrammēta un esat izveidojis SSH savienojumu ar plati, varat pārbaudīt, vai jūsu arhitektūra ir aarch64, lai nodrošinātu saderību ar mākslīgā intelekta binārajiem failiem.
Programmatūras pusē ir iekļauti daži galvenie rīki. Tā vietā, lai cīnītos ar sarežģītiem vides pārvaldniekiem, mākslīgā intelekta vides pārvaldībai vislabāk ir izmantot uv . Pēc uv instalēšanas varat iestatīt Python 3.13 virtuālo vidi un instalēt litert-cli-nightly pakotni. Lai faktiski izvilktu modeli, jums būs nepieciešams Hugging Face lasīšanas marķieris . Ja tas ir ieviests, vienkārša komanda, piemēram, litert lm run, var izvilkt gemma-4-E2B-it modeli tieši no kopienas krātuves un dažu sekunžu laikā sākt lokālu sarunu.
Robežu paplašināšana: aparatūras paātrinājums un MLOps

Lai gan centrālais procesors (CPU) apstrādā lielāko daļu darba, izmantojot XNNPACK delegātu , ir eksperimentāls atbalsts GPU paātrināšanai. Raspberry Pi 5 tas tiek panākts, izmantojot V3DV atvērtā koda Vulkan draiveri . Iestatot vides mainīgo V3D_WEBGPU_OVERRIDE=1 , varat izmantot WebGPU. Joprojām ir vērts atzīmēt, ka pašlaik centrālais procesors (CPU) bieži vien pārspēj GPU šajās konkrētajās darba slodzēs, taču pamats turpmākiem ieguvumiem ir izveidots, īpaši ar gaidāmo Hailo AI paātrinātāju integrāciju , izmantojot AI HAT+.
Papildus sākotnējai iestatīšanai sarežģīti kļūst šo ierīču uzturēšana darbībā. Šeit noder pašdziedinošās programmaparatūras koncepcija . Lai izvairītos no baisā "bezgalīgās sāknēšanas cilpas" OTA atjauninājumu laikā, mūsdienu komandas izmanto divu nodalījumu atmiņu (A banka un B banka ). Ierīce izmēģinājuma fāzē testē jauno mākslīgā intelekta lietderīgo slodzi; ja tā izraisa atmiņas noplūdi vai neatbilst RTOS termiņiem , sāknēšanas ielādētājs automātiski atgriežas pie zināmās labās programmaparatūras . Tas novērš dārgas fiziskās apkopes un nodrošina, ka jūsu perifērijas mākslīgais intelekts saglabā noturību.

LiteRT izpildlaika efektivitātes un Gemma 4 kompaktā izmēra konverģence pārveido Raspberry Pi no hobija plates par profesionālas klases Edge AI serveri . Izmantojot tādus rīkus kā LiteRT komandrindas saskarni, jauktas precizitātes kvantizāciju un noturīgas programmaparatūras stratēģijas, izstrādātāji tagad var izvietot aģentūrisku, multimodālu AI , kas darbojas pilnībā bezsaistē, bruģējot ceļu jaunas paaudzes viedām, pašpietiekamām iegultām sistēmām.