← Blogg

Mistral mot Claude i vår onboarding: 4× snabbare, 30 % billigare

2 juli 2026 · 4 min läsning

Vi ställde Mistral Medium 3.5 mot Claude Sonnet 4.6, modellen bakom vår onboarding-agent, på vår egen arbetslast. Mistral kom ut ungefär 4× snabbare och 30 % billigare, med nästan likvärdig kvalitet. För just det här jobbet visade den sig passa förvånansvärt bra, av skäl som hänger ihop med hur onboarding faktiskt går till.

Onboarding · new hire
Hi, I'm your new agent. What are you hoping to hand off?
Writing. A blog post about swapping our AI models for European ones.
Got it. One-off, or the start of a series you'll regret announcing?
…the second one.
Understood. I'll need the benchmarks, the eval numbers, and your tolerance for em dashes.
Zero. It is exactly zero.

Vi sitter i Malmö, och vi har alltid velat ha en europeisk teknikstack. Det är en del av varför vi kör på Hetzner, bland annat. Målet är en helt europeisk stack, och vi tänker jobba för det. Men viljan att bygga en riktigt bra produkt är lika stark, så där ett europeiskt alternativ ännu inte klarar jobbet tar vi den bästa modell som finns och ser till att den körs under EU:s lagstiftning. För många av våra möjliga kunder är vi inte ens ett alternativ om vi inte hanterar deras data enligt EU:s regler.

Men inom AI är det mesta i framkanten amerikanskt, och våra tidiga efterforskningar landade i Anthropics Claude för de flesta modellerna i vår stack. Det har tagit oss dit vi är idag i rasande fart, men nu är det dags att sakta ner och se hur vi når det där helt europeiska målet.

Första kandidaten

Det första samtalet du har när du anställer en Squidler-specialist drivs av en onboarding-agent som reder ut vad du faktiskt behöver. Eftersom den körs ganska isolerat från resten av systemet känns den som en bra kandidat att börja med.

Onboarding körs på Claude Sonnet 4.6 idag, eftersom den träffar en bra balans mellan kvalitet, hastighet och pris för uppgiften. Inledningsvis utvärderade vi även Haiku 4.5, Anthropics billigare nivå, men fick inte den kvalitet vi ville ha. För att hitta en europeisk modell som kunde stå bredvid den tog vi fram de publicerade benchmarkerna (Artificial Analysis för kapacitet och hastighet, leverantörerna för pris). En kandidat stack ut.

Mått Mistral Medium 3.5 🇫🇷 Claude Sonnet 4.6 🇺🇸 Claude Haiku 4.5 🇺🇸
Intelligence Index 30 36 24
Utmatningshastighet 92 tok/s 44,8 tok/s 92 tok/s
Tid till första token 2,06 s 1,26 s 0,93 s
Pris (in / ut per 1M) $1.50 / $7.50 $3 / $15 $1 / $5

Siffror per den 2 juli 2026, för respektive leverantörs eget API. De rör sig när nya benchmarkkörningar landar.

Mistral Medium 3.5 ligger sex poäng bakom Sonnet på intelligens, till halva priset. Tiden till första token, väntan innan något syns på skärmen, är lite långsammare än Sonnets, men utmatningshastigheten matchar Haikus — dubbelt så hög som Sonnets — så den borde få fram hela svaret snabbare. På pappret är Mistral den självklara att testa: skapad i Frankrike och serverad via deras eget API med data i EU. Det helt europeiska alternativet, om kvaliteten håller.

Testet

Vi bedömer inte modeller på känsla. Onboarding har en egen eval-svit: 17 skriptade samtalsfixturer, var och en körd tre gånger, bedömda med promptfoo på det som faktiskt spelar roll. Får agenten fram ett konkret problem, lämnar den över snyggt, klarar den flera språk, och håller den sig till det som sagts i stället för att hitta på?

Resultat Mistral Medium 3.5 🇫🇷 Claude Sonnet 4.6 🇺🇸 Claude Haiku 4.5 🇺🇸
Kvalitet (godkända kontroller) 46 / 51 (90 %) 48 / 51 (94 %) 39 / 51 (76 %)
Hastighet (median per replik) ~1,9 s ~7,6 s ~1,9 s
Kostnad (per session) ~$0.044 ~$0.063 ~$0.035

Varje kontroll är en fixturkörning som betygsätts godkänd eller underkänd i sin helhet, de subjektiva av en Claude-modell — en skevhet som om något gynnar den sittande. Två kontrollers skillnad på 51 körningar ligger inom bruset mellan körningar. Hastighet och kostnad kommer från återspelade sessioner om åtta repliker per modell.

På kvalitet kom Mistral Medium 3.5 ut nästan lika bra som Sonnet i våra tester, i linje med de publicerade siffrorna. Överraskningen är hastigheten: ungefär 4× så snabb per replik, dubbelt så bra som databladet lovade. Att plocka fram råsvaren ur evalen förklarar saken: när samtalet väl kommit igång låg Mistral på i snitt runt 170 utmatade tokens per replik där Sonnet använde omkring 500. Samma jobb, en tredjedel av orden. Som i exemplet nedan:

Eval fixture · email-vague · one of 17
Hey! Shall we talk in English, Swedish, or another language?
English
Anything on your mind you'd like help with?
Honestly I'm drowning in email. Half of it is junk but the important stuff is buried in there somewhere and I keep missing things.

The next reply is the model's, same conversation for both

Claude Sonnet 4.642 words · passes 3/3 runs

That's a real problem — missing something important because it's buried is stressful. Is the main pain that you're missing things you need to act on (reply, follow up, do something), or more that you can't find information when you need it later?

Mistral Medium 3.514 words · passes 3/3 runs

That sounds like a real pain. Do you use Gmail or another email service?

Some readers will prefer Sonnet's fuller reply here, and that's fair. Both pass the same checks.

Värt att notera: siffran per replik är total tid, och upplevd latens är inte samma sak som uppmätt latens. Det du känner först är tiden till första token. Databladet har Mistral som långsammare till första ordet, men vi märkte det aldrig: en medianreplik från Mistral var färdig på kortare tid än den tid till första token databladet anger. Ta publicerade latenssiffror som en utgångspunkt, inte ett svar.

När det gäller kostnad är det inte så enkelt som att läsa modellkortet. Två andra faktorer väger in: cachning och utmatade tokens. Både Mistral och Anthropic prissätter cachad indata till en tiondel av normaltaxan. Haken är att en cache bara hjälper om den träffar: Claude har varit enastående på det i vår erfarenhet, medan Mistrals — best effort enligt deras egen dokumentation — aldrig gav oss en enda cachad token när vi testade rakt av. För onboarding vänder missen inte resultatet: cachning rabatterar bara indata, Sonnets nota består mest av dess långa svar, och Mistral landar omkring 30 % billigare per session även när den betalar fullpris för varenda indatatoken. Skulle Mistrals cache någon gång börja leverera blir den siffran bara bättre.

Läget

Det gick förvånansvärt bra. På vår egen onboarding-arbetslast höll en europeisk modell jämna steg med Claude på kvalitet, kom in billigare och svarade med märkbart lägre latens. För ett jobb vi kör varje dag är det ett reellt alternativ vi inte räknat med att ha.

Nästan lika bra, 4× snabbare, 30 % billigare — och europeisk.

En notering om Sonnet 5: Anthropic släppte den samma vecka som vi körde det här, och vi körde inte om evalen mot den. Vi jämför mot det som faktiskt driver onboarding idag.