A Khosla Ventures amerikai kockázati tőkealap által támogatott, a Kaliforniai Technológia Intézetből, a Caltech-ből indult PrismML startup közzétette a kínai Alibaba Qwen modelljének tömörített változatait. A technológia ötvennégy gigabájtról négyre csökkentette a modell méretét.
Mit is jelent ez?
Leginkább azt, hogy így a Qwen mind a 27 milliárd paramétere futtatható 15-ös vagy újabb iPhone-okon.

A startup vezérigazgatója elmondta: az Apple jelenleg vizsgálja a technológiát, bár a tárgyalásokat még nagyon korai szakaszban lévőként jellemezte. A tömörítést úgy érik el, hogy a modelleket ternér (háromkomponensű) vagy bináris kvantálásra (jelfeldolgozásra) állítják át, így az egyes értékeket 16 bitről mindössze két vagy három lehetséges értékre csökkentik.
Bár a modellek teljesítménye összességében – különösen a tények felidézése terén – néhány százalékponttal romlik, a tömörített változatok akár tizennégyszer kevesebb memóriát igényelnek, nyolcszor gyorsabban generálnak válaszokat, és három-hatszor kevesebb energiát fogyasztanak a hagyományos verziókhoz képest.
Az Apple számára a nagyobb tudású mesterséges intelligencia közvetlen iPhone-on történő futtatása csökkentené a késleltetést és a felhőalapú szolgáltatások költségeit, támogatná az adatvédelmi törekvéseket, valamint lehetővé tenné az offline működést. Mindez különösen értékes az egészségügyi adatok és a számítógépes képalkotás (computational photography) terén.
Ezeket az állításokat, különösen a folyamatos használat alatti energiafogyasztás és a többmillió eszköz-konfiguráció melletti teljesítmény tekintetében azonban valós körülmények között, széles körben is igazolni kell – figyelmeztetnek elemzők.
