← Blog

Mistral gegen Claude in unserem Onboarding: 4× schneller, 30 % günstiger

2. Juli 2026 · 4 Min. Lesezeit

Wir haben Mistral Medium 3.5 gegen Claude Sonnet 4.6 antreten lassen, das Modell hinter unserem Onboarding-Agenten, auf unserer eigenen Arbeitslast. Mistral kam rund 4× schneller und 30 % günstiger heraus, bei nahezu gleichwertiger Qualität. Für genau diesen Job passte es überraschend gut, aus Gründen, die damit zu tun haben, wie Onboarding tatsächlich abläuft.

Onboarding · new hire
Hi, I'm your new agent. What are you hoping to hand off?
Writing. A blog post about swapping our AI models for European ones.
Got it. One-off, or the start of a series you'll regret announcing?
…the second one.
Understood. I'll need the benchmarks, the eval numbers, and your tolerance for em dashes.
Zero. It is exactly zero.

Wir sitzen in Malmö, und wir wollten schon immer einen europäischen Tech-Stack. Unter anderem deshalb laufen wir auf Hetzner. Das Ziel ist ein durchgängig europäischer Stack, und wir arbeiten darauf hin. Aber der Antrieb, ein richtig gutes Produkt zu bauen, ist genauso stark, also nehmen wir dort, wo eine europäische Option die Aufgabe noch nicht trägt, das beste verfügbare Modell und sorgen dafür, dass es unter EU-Recht läuft. Für viele unserer möglichen Kunden sind wir nicht einmal eine Option, wenn wir ihre Daten nicht nach EU-Regeln behandeln.

Bei KI ist allerdings der Großteil der Spitze amerikanisch, und unsere frühen Untersuchungen haben uns für die meisten Modelle in unserem Stack bei Claude von Anthropic landen lassen. Das hat uns mit rasendem Tempo dorthin gebracht, wo wir heute sind, aber jetzt ist es Zeit, langsamer zu machen und zu schauen, wie wir dieses durchgängig europäische Ziel erreichen.

Der erste Kandidat

Das erste Gespräch, das du führst, wenn du einen Squidler-Spezialisten einstellst, wird von einem Onboarding-Agenten geführt, der herausfindet, was du tatsächlich brauchst. Da er ziemlich isoliert vom Rest des Systems läuft, wirkt er wie ein guter Kandidat für den Anfang.

Onboarding läuft heute auf Claude Sonnet 4.6, weil das Modell für diese Aufgabe eine gute Balance aus Qualität, Tempo und Preis trifft. Anfangs haben wir auch Haiku 4.5 evaluiert, Anthropics günstigere Stufe, bekamen aber nicht die Qualität, die wir wollten. Um ein europäisches Modell zu finden, das daneben bestehen kann, haben wir die veröffentlichten Benchmarks herangezogen (Artificial Analysis für Leistungsfähigkeit und Tempo, die Anbieter für den Preis). Ein Kandidat stach heraus.

Kennzahl Mistral Medium 3.5 🇫🇷 Claude Sonnet 4.6 🇺🇸 Claude Haiku 4.5 🇺🇸
Intelligence Index 30 36 24
Ausgabegeschwindigkeit 92 tok/s 44,8 tok/s 92 tok/s
Zeit bis zum ersten Token 2,06 s 1,26 s 0,93 s
Preis (rein / raus pro 1M) $1.50 / $7.50 $3 / $15 $1 / $5

Zahlen mit Stand 2. Juli 2026, jeweils für die eigene API des Anbieters. Sie verschieben sich, sobald neue Benchmark-Läufe erscheinen.

Mistral Medium 3.5 liegt bei der Intelligenz sechs Punkte hinter Sonnet, zum halben Preis. Die Zeit bis zum ersten Token, also die Wartezeit, bis überhaupt etwas auf dem Bildschirm erscheint, ist etwas länger als bei Sonnet, aber die Ausgabegeschwindigkeit entspricht der von Haiku — dem Doppelten von Sonnet —, es sollte die vollständige Antwort also schneller liefern. Auf dem Papier ist Mistral der offensichtliche Testkandidat: in Frankreich entwickelt und über die eigene API ausgeliefert, mit Daten in der EU. Die durchgängig europäische Option, wenn die Qualität hält.

Der Test

Wir beurteilen Modelle nicht nach Bauchgefühl. Onboarding hat eine eigene Eval-Suite: 17 skriptgesteuerte Gesprächs-Fixtures, jede drei Mal ausgeführt, bewertet mit promptfoo auf das, was tatsächlich zählt. Bringt der Agent ein konkretes Problem zutage, übergibt er sauber, kommt er mit mehreren Sprachen klar, und bleibt er bei dem, was gesagt wurde, statt sich etwas auszudenken?

Ergebnis Mistral Medium 3.5 🇫🇷 Claude Sonnet 4.6 🇺🇸 Claude Haiku 4.5 🇺🇸
Qualität (bestandene Checks) 46 / 51 (90 %) 48 / 51 (94 %) 39 / 51 (76 %)
Tempo (Median pro Zug) ~1,9 s ~7,6 s ~1,9 s
Kosten (pro Session) ~$0.044 ~$0.063 ~$0.035

Jeder Check ist ein Fixture-Lauf, der als Ganzes mit bestanden oder nicht bestanden bewertet wird, die subjektiven davon durch ein Claude-Modell — eine Schieflage, die wenn überhaupt dem Amtsinhaber nützt. Zwei Checks Unterschied auf 51 Läufe liegen im Rauschen zwischen den Läufen. Tempo und Kosten stammen aus wiederholten Sessions mit acht Zügen pro Modell.

Bei der Qualität kam Mistral Medium 3.5 in unseren Tests fast so gut wie Sonnet heraus, im Einklang mit den veröffentlichten Zahlen. Die Überraschung ist das Tempo: rund 4× so schnell pro Zug, doppelt so gut, wie es das Datenblatt versprach. Ein Blick in die Rohantworten aus der Eval erklärt es: Sobald das Gespräch in Gang kommt, lag Mistral im Schnitt bei etwa 170 ausgegebenen Token pro Zug, wo Sonnet rund 500 brauchte. Dieselbe Aufgabe, ein Drittel der Wörter. Wie im Beispiel unten:

Eval fixture · email-vague · one of 17
Hey! Shall we talk in English, Swedish, or another language?
English
Anything on your mind you'd like help with?
Honestly I'm drowning in email. Half of it is junk but the important stuff is buried in there somewhere and I keep missing things.

The next reply is the model's, same conversation for both

Claude Sonnet 4.642 words · passes 3/3 runs

That's a real problem — missing something important because it's buried is stressful. Is the main pain that you're missing things you need to act on (reply, follow up, do something), or more that you can't find information when you need it later?

Mistral Medium 3.514 words · passes 3/3 runs

That sounds like a real pain. Do you use Gmail or another email service?

Some readers will prefer Sonnet's fuller reply here, and that's fair. Both pass the same checks.

Erwähnenswert: Der Wert pro Zug ist die Gesamtzeit, und gefühlte Latenz ist nicht dasselbe wie gemessene Latenz. Was du zuerst spürst, ist die Zeit bis zum ersten Token. Laut Datenblatt ist Mistral beim ersten Wort langsamer, aber wir haben es nie gemerkt: Ein Mistral-Zug war im Median in kürzerer Zeit fertig, als das Datenblatt für die Zeit bis zum ersten Token angibt. Nimm veröffentlichte Latenzzahlen als Ausgangspunkt, nicht als Antwort.

Bei den Kosten reicht ein Blick auf die Modellkarte nicht. Zwei weitere Faktoren spielen hinein: Caching und ausgegebene Token. Mistral und Anthropic berechnen gecachten Input beide zu einem Zehntel des normalen Tarifs. Der Haken ist, dass ein Cache nur hilft, wenn er trifft: Claude war darin nach unserer Erfahrung herausragend, während Mistrals Cache — laut eigener Doku nur Best Effort — uns im direkten Test kein einziges gecachtes Token lieferte. Fürs Onboarding dreht dieser Fehlschlag das Ergebnis nicht: Caching vergünstigt nur den Input, Sonnets Rechnung besteht überwiegend aus seinen langen Antworten, und Mistral landet rund 30 % günstiger pro Session, selbst wenn es für jedes einzelne Input-Token den vollen Preis zahlt. Sollte Mistrals Cache irgendwann anfangen zu liefern, wird diese Zahl nur besser.

Wo es steht

Es lief überraschend gut. Auf unserer eigenen Onboarding-Last hielt ein europäisches Modell bei der Qualität mit Claude mit, kam günstiger heraus und antwortete mit spürbar geringerer Latenz. Für eine Aufgabe, die wir jeden Tag fahren, ist das eine echte Option, mit der wir nicht gerechnet hatten.

Fast so gut, 4× schneller, 30 % günstiger — und europäisch.

Eine Anmerkung zu Sonnet 5: Anthropic hat es in derselben Woche veröffentlicht, in der wir das hier durchgeführt haben, und wir haben die Eval nicht noch einmal dagegen laufen lassen. Wir vergleichen mit dem, was das Onboarding heute tatsächlich betreibt.