Advarer mot å velge feil modell: «Dyreste ordet i hele kodebasen»
– Dere kan betale flaggskip-pris for oppgaver en rimelig variant ville løst like greit, advarer Jasvinder Sadana.
Modellnavnet i API-kallet ditt er sannsynligvis mindre gjennomtenkt enn variabelnavnet du valgte klokken 23 kvelden før fristen.
Likevel er det trolig det dyreste enkeltordet i hele kodebasen.
Noen skrev det inn fordi det virket, ingen har rørt det siden, og nå betaler dere flaggskip-pris for oppgaver en rimelig variant ville løst like greit.
Omtrent som å bestille catering til en kort kaffepause.
Løses arkitektonisk
Ifølge a16z sin analyse av prisutviklingen for språkmodell-inferens (LLMflation) kostet det 60 dollar å prosessere en million tokens på et gitt kvalitetsnivå i 2021.
Tre år senere fantes et alternativ som klarte samme test for seks øre per million tokens. Faktoren er over tusen, altså omtrent forskjellen mellom en kebab og en åtteretters middag for samme sult, og trenden fortsetter med rundt tidoblet forbedring i året.
De mest modne miljøene har allerede løst dette arkitektonisk:
I en undersøkelse blant hundre CIO-er svarer 37% at de kombinerer fem eller flere modeller i produksjon, opp fra 29% året før.
Det er ikke lenger bare et prinsipp om riktig modell til riktig oppgave, det er en rutingfunksjon: den kollegaen som faktisk leser dokumentasjonen før hen svarer i chatten.
Feil modell til feil oppgave
Norske virksomheter henger etter.
55 prosent har begynt å bruke generativ KI, opp fra 24 prosent i 2023, ifølge Samfunnsøkonomisk Analyses undersøkelse fra NHO. I offentlig sektor har over halvparten innført KI, men bare én av fire har klart å kutte kostnader, melder Digdir i IT i praksis 2025.
Jeg lurer på hvor mye av det gapet som skyldes manglende ruting, og ikke at teknologien plutselig sluttet å levere verdi.
Jeg synes svakheten fortjener like mye oppmerksomhet som gevinsten:
En rutingfunksjon som bommer, sender den vanskelige oppgaven til den billigste varianten, og svaret kommer tilbake med samme skråsikre tonefall som en praktikant som ikke vet hva hen ikke vet.
Skjult ekstraarbeid er en kostnad tokenprisen aldri fanger opp.
Samtidig bygges kapasiteten alt dette skal kjøre på i stort tempo, nærmest som en sportsarena reist kun for grafikkort. Norge har 112 registrerte datasentre fordelt på 60 kommersielle operatører, og Arbeiderpartiet krever nå strengere regulering av nyetableringer.
Men det hjelper lite å reise flere haller hvis regningen uansett suser av gårde fordi ingen har bygget styringen av hvilket alternativ som brukes til hva.
Ikke for én utvikler å avgjøre
Jeg vet ikke om terskelen mellom billig og dyr inferens er lik for enhver kodebase, og jeg vet ikke om et lite team uten eget plattformmiljø får bygget dette raskere enn et stort miljø med dedikerte utviklere.
Men det er ikke noe én utvikler bør avgjøre alene ved kaffemaskinen:
Utviklere, produkteiere og drift bør bli enige om terskelen sammen, før regningen blir noen andres problem.
Har dere faktisk regnet på hva modellstrengen i produksjonskoden koster, eller er det bare den som overlevde sist sprint?
Spoiler: Nesten alltid det siste.
Foretrekk oss i Google Discover
Ved å legge oss til som foretrukket kilde i Google vil du blant annet få opp flere av sakene våre i Google Discover. Tusen takk for støtten!