Mistral gegen Claude in unserem Onboarding: 4× schneller, 30 % günstiger
2. Juli 2026 · 4 Min. Lesezeit
Wir haben Mistral Medium 3.5 gegen Claude Sonnet 4.6 antreten lassen, das Modell hinter unserem Onboarding-Agenten, auf unserer eigenen Arbeitslast. Mistral kam rund 4× schneller und 30 % günstiger heraus, bei nahezu gleichwertiger Qualität. Für genau diesen Job passte es überraschend gut, aus Gründen, die damit zu tun haben, wie Onboarding tatsächlich abläuft.
Wir sitzen in Malmö, und wir wollten schon immer einen europäischen Tech-Stack. Unter anderem deshalb laufen wir auf Hetzner. Das Ziel ist ein durchgängig europäischer Stack, und wir arbeiten darauf hin. Aber der Antrieb, ein richtig gutes Produkt zu bauen, ist genauso stark, also nehmen wir dort, wo eine europäische Option die Aufgabe noch nicht trägt, das beste verfügbare Modell und sorgen dafür, dass es unter EU-Recht läuft. Für viele unserer möglichen Kunden sind wir nicht einmal eine Option, wenn wir ihre Daten nicht nach EU-Regeln behandeln.
Bei KI ist allerdings der Großteil der Spitze amerikanisch, und unsere frühen Untersuchungen haben uns für die meisten Modelle in unserem Stack bei Claude von Anthropic landen lassen. Das hat uns mit rasendem Tempo dorthin gebracht, wo wir heute sind, aber jetzt ist es Zeit, langsamer zu machen und zu schauen, wie wir dieses durchgängig europäische Ziel erreichen.
Der erste Kandidat
Das erste Gespräch, das du führst, wenn du einen Squidler-Spezialisten einstellst, wird von einem Onboarding-Agenten geführt, der herausfindet, was du tatsächlich brauchst. Da er ziemlich isoliert vom Rest des Systems läuft, wirkt er wie ein guter Kandidat für den Anfang.
Onboarding läuft heute auf Claude Sonnet 4.6, weil das Modell für diese Aufgabe eine gute Balance aus Qualität, Tempo und Preis trifft. Anfangs haben wir auch Haiku 4.5 evaluiert, Anthropics günstigere Stufe, bekamen aber nicht die Qualität, die wir wollten. Um ein europäisches Modell zu finden, das daneben bestehen kann, haben wir die veröffentlichten Benchmarks herangezogen (Artificial Analysis für Leistungsfähigkeit und Tempo, die Anbieter für den Preis). Ein Kandidat stach heraus.
| Kennzahl | Mistral Medium 3.5 🇫🇷 | Claude Sonnet 4.6 🇺🇸 | Claude Haiku 4.5 🇺🇸 |
|---|---|---|---|
| Intelligence Index | 30 | 36 | 24 |
| Ausgabegeschwindigkeit | 92 tok/s | 44,8 tok/s | 92 tok/s |
| Zeit bis zum ersten Token | 2,06 s | 1,26 s | 0,93 s |
| Preis (rein / raus pro 1M) | $1.50 / $7.50 | $3 / $15 | $1 / $5 |
Zahlen mit Stand 2. Juli 2026, jeweils für die eigene API des Anbieters. Sie verschieben sich, sobald neue Benchmark-Läufe erscheinen.
Mistral Medium 3.5 liegt bei der Intelligenz sechs Punkte hinter Sonnet, zum halben Preis. Die Zeit bis zum ersten Token, also die Wartezeit, bis überhaupt etwas auf dem Bildschirm erscheint, ist etwas länger als bei Sonnet, aber die Ausgabegeschwindigkeit entspricht der von Haiku — dem Doppelten von Sonnet —, es sollte die vollständige Antwort also schneller liefern. Auf dem Papier ist Mistral der offensichtliche Testkandidat: in Frankreich entwickelt und über die eigene API ausgeliefert, mit Daten in der EU. Die durchgängig europäische Option, wenn die Qualität hält.
Der Test
Wir beurteilen Modelle nicht nach Bauchgefühl. Onboarding hat eine eigene Eval-Suite: 17 skriptgesteuerte Gesprächs-Fixtures, jede drei Mal ausgeführt, bewertet mit promptfoo auf das, was tatsächlich zählt. Bringt der Agent ein konkretes Problem zutage, übergibt er sauber, kommt er mit mehreren Sprachen klar, und bleibt er bei dem, was gesagt wurde, statt sich etwas auszudenken?
| Ergebnis | Mistral Medium 3.5 🇫🇷 | Claude Sonnet 4.6 🇺🇸 | Claude Haiku 4.5 🇺🇸 |
|---|---|---|---|
| Qualität (bestandene Checks) | 46 / 51 (90 %) | 48 / 51 (94 %) | 39 / 51 (76 %) |
| Tempo (Median pro Zug) | ~1,9 s | ~7,6 s | ~1,9 s |
| Kosten (pro Session) | ~$0.044 | ~$0.063 | ~$0.035 |
Jeder Check ist ein Fixture-Lauf, der als Ganzes mit bestanden oder nicht bestanden bewertet wird, die subjektiven davon durch ein Claude-Modell — eine Schieflage, die wenn überhaupt dem Amtsinhaber nützt. Zwei Checks Unterschied auf 51 Läufe liegen im Rauschen zwischen den Läufen. Tempo und Kosten stammen aus wiederholten Sessions mit acht Zügen pro Modell.
Bei der Qualität kam Mistral Medium 3.5 in unseren Tests fast so gut wie Sonnet heraus, im Einklang mit den veröffentlichten Zahlen. Die Überraschung ist das Tempo: rund 4× so schnell pro Zug, doppelt so gut, wie es das Datenblatt versprach. Ein Blick in die Rohantworten aus der Eval erklärt es: Sobald das Gespräch in Gang kommt, lag Mistral im Schnitt bei etwa 170 ausgegebenen Token pro Zug, wo Sonnet rund 500 brauchte. Dieselbe Aufgabe, ein Drittel der Wörter. Wie im Beispiel unten:
The next reply is the model's, same conversation for both
That's a real problem — missing something important because it's buried is stressful. Is the main pain that you're missing things you need to act on (reply, follow up, do something), or more that you can't find information when you need it later?
That sounds like a real pain. Do you use Gmail or another email service?
Some readers will prefer Sonnet's fuller reply here, and that's fair. Both pass the same checks.
Erwähnenswert: Der Wert pro Zug ist die Gesamtzeit, und gefühlte Latenz ist nicht dasselbe wie gemessene Latenz. Was du zuerst spürst, ist die Zeit bis zum ersten Token. Laut Datenblatt ist Mistral beim ersten Wort langsamer, aber wir haben es nie gemerkt: Ein Mistral-Zug war im Median in kürzerer Zeit fertig, als das Datenblatt für die Zeit bis zum ersten Token angibt. Nimm veröffentlichte Latenzzahlen als Ausgangspunkt, nicht als Antwort.
Bei den Kosten reicht ein Blick auf die Modellkarte nicht. Zwei weitere Faktoren spielen hinein: Caching und ausgegebene Token. Mistral und Anthropic berechnen gecachten Input beide zu einem Zehntel des normalen Tarifs. Der Haken ist, dass ein Cache nur hilft, wenn er trifft: Claude war darin nach unserer Erfahrung herausragend, während Mistrals Cache — laut eigener Doku nur Best Effort — uns im direkten Test kein einziges gecachtes Token lieferte. Fürs Onboarding dreht dieser Fehlschlag das Ergebnis nicht: Caching vergünstigt nur den Input, Sonnets Rechnung besteht überwiegend aus seinen langen Antworten, und Mistral landet rund 30 % günstiger pro Session, selbst wenn es für jedes einzelne Input-Token den vollen Preis zahlt. Sollte Mistrals Cache irgendwann anfangen zu liefern, wird diese Zahl nur besser.
Wo es steht
Es lief überraschend gut. Auf unserer eigenen Onboarding-Last hielt ein europäisches Modell bei der Qualität mit Claude mit, kam günstiger heraus und antwortete mit spürbar geringerer Latenz. Für eine Aufgabe, die wir jeden Tag fahren, ist das eine echte Option, mit der wir nicht gerechnet hatten.
Fast so gut, 4× schneller, 30 % günstiger — und europäisch.
Eine Anmerkung zu Sonnet 5: Anthropic hat es in derselben Woche veröffentlicht, in der wir das hier durchgeführt haben, und wir haben die Eval nicht noch einmal dagegen laufen lassen. Wir vergleichen mit dem, was das Onboarding heute tatsächlich betreibt.