Wat heeft Google aangekondigd?
De aankondiging van 23 september 2026 beschrijft lokale workflows met Gemma 4 26B A4B via LiteRT. De SDK kan daarnaast OpenAI-compatibele lokale servers aanspreken, waaronder Ollama, LM Studio en vLLM.
Het is dus niet simpelweg een nieuw model dat je “in Ollama plugt”. Het is een SDK die onder andere een lokale runtime kan aanroepen. Model, runtime en agentlogica blijven verschillende lagen.
Lokaal of hybride? Dat verschil doet ertoe
Een volledig lokale configuratie kan offline werken nadat de benodigde software en modellen zijn geïnstalleerd. Google laat ook een hybride voorbeeld zien: een cloudmodel plant en lokale modellen voeren taken uit. Die tweede opzet is niet volledig offline.
Voor de getoonde 26B-configuratie adviseert Google meer dan 24 GB VRAM of unified memory. Dat advies geldt niet automatisch voor ieder model dat je via Ollama gebruikt.
Onze duiding: test de keten, niet alleen de demo
Een agent combineert modeluitvoer met acties. Dat maakt de evaluatie anders dan bij een losse chatbot. Een plausibel antwoord is onvoldoende wanneer de toepassing ook bestanden kan aanpassen of een externe tool kan gebruiken.
Begin met een begrensde werkruimte en minimaal benodigde rechten. Test mislukte toolaanroepen, onduidelijke instructies en onverwachte invoer. Meet hoeveel taken echt correct eindigen en hoeveel menselijke correctie nodig is.
Voor organisaties zit de vraag daarmee niet alleen in “kan het lokaal?”, maar ook in “kunnen we deze workflow betrouwbaar begrenzen, testen en onderhouden?”. De aankondiging is een aanleiding voor een experiment, geen bewijs dat een specifieke bedrijfsworkflow productierijp is.
Bronnen & verantwoording
De uitleg en afwegingen zijn van deze site. Productspecificaties komen uit de onderstaande primaire bronnen; mogelijkheden kunnen veranderen.