Conform Playtech.ro: Jalapeno, noul chip OpenAI, promite eficiență sporită în inferența AI
OpenAI susține că noul său chip, denumit Jalapeno, ar putea oferi o îmbunătățire semnificativă a performanței și a eficienței energetice în sarcinile de inferență AI, adică în procesul de rulare a modelelor deja antrenate. Rezultatele preliminare, prezentate în cadrul conferinței Hot Chips, sugerează că Jalapeno ar putea depăși soluțiile Nvidia existente în anumite scenarii cheie.
Testele au fost efectuate utilizând suita publică InferenceX de la SemiAnalysis și au vizat trei modele AI recunoscute: GPT-OSS 120B, DeepSeek R1 670B și Kimi K2.5 de la Moonshot AI, acesta din urmă impresionând prin cei aproximativ un trilion de parametri ai săi. Conform datelor OpenAI, beneficiile Jalapeno devin cele mai evidente atunci când se urmărește o latență scăzută.
Avantaje semnificative în condiții de latență redusă
În scenariile cu latență redusă, OpenAI afirmă că cipul lor poate atinge o latență end-to-end cu 1,7 până la 3,6 ori mai mică comparativ cu sistemele Nvidia GB200 și GB300. Aceste diferențe pot deveni chiar mai pronunțate în anumite puncte de funcționare analizate.
Compania precizează că Jalapeno a demonstrat un avantaj de până la 8,6-104,3 ori în ceea ce privește performanța raportată la consumul de energie, în comparație cu cele mai rapide setări anterioare ale GB300 pentru intervalul dintre tokeni. Aceasta ar putea însemna o eficiență energetică mult superioară în procesarea cererilor.
Este important de menționat modul în care au fost realizate aceste comparații. OpenAI și-a raportat rezultatele bazându-se pe consumul nominal al acceleratorului. Totuși, în timpul testelor, Jalapeno a consumat efectiv maxim aproximativ 550 W. O comparație bazată pe consumul total al sistemului restrânge diferența, Jalapeno fiind cotat la aproximativ 1,18 kW per accelerator, față de 2,55 kW pentru GB300.
Limitări și direcții viitoare
Prezentarea rezultatelor OpenAI nu implică neapărat depășirea completă a tuturor soluțiilor de ultimă generație de la Nvidia. Un detaliu crucial este că testele nu au inclus Vera Rubin, noua platformă Nvidia cu care OpenAI intenționează să colaboreze pentru implementarea unor sisteme cu o capacitate totală de 10 GW începând din a doua jumătate a anului 2026.
De asemenea, Jalapeno este proiectat exclusiv pentru inferență, adică pentru rularea și generarea răspunsurilor din partea modelelor AI antrenate. Nu este destinat procesului de antrenare a modelelor, un domeniu în care acceleratoarele Nvidia continuă să domine.
O altă diferență relevantă constă în modul de utilizare. Principalele comparații au pus Jalapeno în fața configurațiilor GB200 și GB300 care foloseau predicția unui singur token. În centrele de date, soluțiile Nvidia sunt frecvent utilizate cu tehnici precum multi-token prediction, care pot modifica semnificativ rezultatele privind eficiența.
Primele sisteme bazate pe chip-urile Jalapeno urmează să fie implementate de OpenAI începând cu jumătatea a doua a anului 2026.
Sursa: Playtech.ro

Fii primul care comentează