Red Hat dodatno produbljuje suradnju s Amazon Web Servicesom s ciljem isporuke napredne, skalabilne i učinkovitije AI inferencije u produkcijskim okruženjima
Fokus ove inicijative je omogućiti organizacijama veću fleksibilnost i izbor pri pokretanju generativnih AI radnih opterećenja, neovisno o hardverskoj podlozi, uz korištenje AWS-ovih specijaliziranih AI čipova Trainium i Inferentia.

Kako generativna umjetna inteligencija sve snažnije ulazi u poslovne procese, raste i potreba za optimiziranom infrastrukturom koja može isporučiti visoke performanse uz kontrolu troškova. Prema IDC-u, značajan dio organizacija u idućim godinama okrenut će se prilagođenom siliciju i specijaliziranim AI čipovima kako bi odgovorili na zahtjeve skalabilnosti i učinkovitosti. Upravo tu se pozicionira Red Hatova strategija “bilo koji model, bilo koji hardver”.
Središnji dio suradnje čini Red Hat AI Inference Server, temeljen na vLLM-u, koji će biti omogućen za rad na AWS Inferentia2 i Trainium čipovima. Time se dobiva zajednički sloj za AI inferenciju sposoban podržati širok raspon generativnih AI modela, uz nižu latenciju i do 30–40 posto bolji omjer cijene i performansi u usporedbi s usporedivim GPU instancama. Takav pristup olakšava prijelaz s eksperimentiranja na stabilna produkcijska AI okruženja.
Suradnja obuhvaća i dublju integraciju unutar Red Hat OpenShift ekosustava. Razvijen je AWS Neuron operator za OpenShift, OpenShift AI i OpenShift Service on AWS, čime se korisnicima osigurava jednostavniji i podržani put za pokretanje AI radnih opterećenja na AWS akceleratorima. Dodatno, Red Hat kroz Ansible Automation Platform olakšava orkestraciju AI servisa u AWS okruženju.
Važan element cijele priče ostaje i open source zajednica. Red Hat i AWS zajednički rade na optimizaciji dodataka za AWS AI čipove unutar vLLM projekta, čime se ubrzava razvoj i dostupnost skalabilne AI inferencije. Cilj je jasan – učiniti generativnu umjetnu inteligenciju dostupnijom, učinkovitijom i spremnom za stvarne poslovne primjene u hibridnom oblaku.
Dostupnost rješenja započinje već sada kroz AWS Neuron operator u OpenShift OperatorHubu, dok se podrška Red Hat AI Inference Servera za AWS AI čipove očekuje u developer preview izdanju početkom 2026. godine.

