← Nazad na blogZoho CRM

AMD kupuje Taalas: AI modeli ugravirani u silicijum mijenjaju pravila inference

5. Maj 2026 · BIXIE Team · 12 min čitanja

AMD je u četvrtak objavio akviziciju torontskog startupa Taalas, koji ugrađuje težine AI modela direktno u silicijum. Riječ je o potezu koji može drastično sniziti cijenu i ubrzati izvođenje (inferencu) velikih jezičkih modela — a to je, prije ili kasnije, dobra vijest za svaku firmu koja AI plaća po tokenu.

Šta Taalas zapravo radi

Većina današnjih AI akceleratora čuva težine modela u memoriji i izvodi ih kroz arhitekturu sličnu GPU-u. Taalas ide potpuno drugim putem: težine modela se "ugraviraju" direktno u silicijum, pa čip postaje svojevrsni ASIC skrojen za tačno jedan model. Zato ih zovu MSIC — model-specific integrated circuit.

Rezultat su brojke koje zvuče nevjerovatno. Testni čip HC1, napravljen na TSMC 6nm procesu, servirao je Meta Llama 3.1 8B brzinom od skoro 17.000 tokena u sekundi — prema objavljenim podacima iz februara, oko 48 puta brže od Nvidijinih GPU-a tog vremena i 8,5 puta brže od Cerebras akceleratora.

AMD nije objavio finansijske detalje, ali je jasno da je ovo prava akvizicija, ne običan acquihire. Druga generacija čipa (HC2), koja stiže ovog ljeta, trebala bi podržati 20 milijardi parametara po čipu. Uz pipeline paralelizam, to bi značilo da je za model od triliona parametara potrebno samo 50 akceleratora — znatno kompaktnije i energetski efikasnije od klasičnih GPU farmi.

Zašto je ovo velika vijest

Trka u AI infrastrukturi danas se vodi na dva fronta: brzina i cijena po tokenu. Brža i jeftinija inferenca direktno se preliva u cijenu aplikacija — od AI asistenata u kodiranju do chatbota za korisničku podršku i RPA rješenja.

Postoji i nusefekt koji vrijedi pratiti. Jedan od pouzdanijih načina za smanjenje halucinacija je takozvani test-time scaling — model dobije više vremena da "razmisli" prije odgovora. To troši znatno više tokena i čini odgovore skupljima. Ako AMD uspije sniziti cijenu tokena za red veličine, modeli će moći razmišljati duže, a da to korisnici ne osjete u računu.

Gdje je caka

Glavna mana je fleksibilnost. Kada je model "upečen" u silicijum, promjena nije trivijalna: nova verzija modela zahtijeva novi prolaz kroz proizvodnju čipa. Taalas tvrdi da je dovoljno zamijeniti samo dva sloja metala, što je jeftinije nego krenuti od nule, ali i dalje daleko od "push dugmeta" na koji smo navikli u oblaku.

Zato je ova tehnologija realna za modele koji se rijetko mijenjaju, a masovno koriste. AMD planira Taalas čipove pariti sa svojim Instinct GPU rješenjima: GPU za obradu složenih upita, Taalas za brzu generaciju tokena. Očekivano zatvaranje posla je u četvrtom kvartalu, uz regulatorna odobrenja.

Šta to znači za firme u regionu

Za firme u BiH i regionu ovo nije vijest o kupovini novog hardvera — to je signal o smjeru cijena. Kada veliki igrači snize cijenu inference, pada i cijena AI usluga koje koristimo svakodnevno: asistenata, agenata, automatizovanih procesa.

Praktična preporuka: pri odabiru AI provajdera gledajte cijenu po tokenu i stvarne performanse, ne samo marketinške priče. Infrastrukturna trka između AMD-a, Nvidije i novih igrača ide u korist kupaca — a pametne firme će tu razliku iskoristiti prije konkurencije.

Izvor: The Register, 06.08.2026.

🤖 Ovaj tekst pripremljen je uz pomoć AI alata, a pregledan je i odobren od strane BIXIE tima prije objave. Pročitajte kako koristimo AI.