Lexbeam · Modelltest

Welche KI-Modelle sind in der europäischen Cloud verfügbar?

Für Verantwortliche aus IT, Datenschutz und Compliance im Mittelstand: Wir zeigen, welche offenen KI-Modelle Cloud-Anbieter mit Sitz in der EU betreiben, was die Nutzung kostet und wie fünf dieser Modelle bei deutschsprachigen Compliance-Aufgaben abschneiden. Kostenlos und wöchentlich aktualisiert.

5 Anbieter mit Sitz in der EU16 offene Modelle im Überblick5 Modelle selbst getestet

Stand 28.09.2026

Angebot

Welche Modelle die Anbieter führen

Eine Auswahl offener Sprachmodelle bei fünf Anbietern mit Sitz in der EU; Rechenzentrumsstandorte laut Anbieter. Alle Preise in Euro, netto pro Million Token, jeweils für Eingabe / Ausgabe und laut öffentlicher Preisliste. ✓ bedeutet: im Katalog verfügbar; Preisinformationen finden Sie beim Anbieter. · bedeutet: nicht im Katalog.

ModellLizenzScalewayFR · ParisSTACKITDE · BSI C5 Typ 2IONOSDET-SystemsDE · ab 1.000 €/MonatOVHcloudFR
GLM-5.2MIT1,80 / 5,50··1,50 / 3,50Stand 15.09.·
GLM-5.3-FlashMIT···Vorschau·
DeepSeek-V4-Flash (0731)MIT0,40 / 0,80····
Qwen3.8-27BApache 2.00,60 / 3,30neu✓seit 08.09.✓Vorschau0,40 / 2,70
Qwen3.6-35B-A3BApache 2.00,25 / 1,50··✓·
Qwen3.6-27BApache 2.0·Migration bis 08.12.··0,40 / 2,70
Qwen3.5-397B-A17BApache 2.00,60 / 3,60·✓·0,60 / 3,60
Qwen3.5-9BApache 2.0··✓·0,10 / 0,15
Qwen3-235B-A22B (2507)Apache 2.00,75 / 2,25····
Qwen3-VL-235BApache 2.0·✓···
gpt-oss-120bApache 2.00,15 / 0,60✓✓✓0,08 / 0,40
gpt-oss-20bApache 2.0·✓··0,04 / 0,15
Llama 3.3 70BLlama 3.3 Community0,90 / 0,90✓✓·0,67 / 0,67
Gemma 4Apache 2.00,25 / 0,5026B A4B✓31B·✓·
Mistral Medium 3.5Modified MIT¹1,50 / 7,50····
Mistral SmallApache 2.0²0,15 / 0,353.2, 24B·✓24B✓Small 4·

Katalogstand 28.09.2026, Preise von den öffentlichen Seiten der Anbieter am selben Tag; T-Systems-Preis vom 15.09.2026. Bei T-Systems gilt ein monatlicher Mindestumsatz von 1.000 €. Nicht in der Tabelle: Nemotron 3 Super 120B (T-Systems), Qwen2.5-VL-72B (OVHcloud) sowie Embedding-, Sprach- und Bildmodelle.

¹ Nutzungsrechte entfallen laut Lizenztext, wenn der weltweite konsolidierte Monatsumsatz im Vormonat 20 Mio. USD übersteigt. ² Gilt für Mistral Small 3.2; die Lizenz von Mistral Small 4 haben wir nicht geprüft.

Anstehende Änderungen: Scaleway stellt die Bereitstellung von Pixtral 12B und Qwen3-Coder-30B am 01.10.2026 ein. IONOS entfernt Llama 3.1 8B am 15.10.2026 und Mistral Nemo 12B am 22.10.2026; Ersatz ist jeweils Qwen3.5 9B. STACKIT ersetzt Gemma 3 27B durch Gemma 4 31B, Umstellung bis 14.10.2026.

Tabelle als CSV herunterladen

Test

Fünf Modelle bei Scaleway im Praxistest

Wir haben zehn Aufgaben aus dem Compliance-Alltag zusammengestellt und jede Aufgabe zweimal getestet. Jedes Modell bearbeitet acht Textaufgaben. Die zwei zusätzlichen Bildaufgaben erhalten nur Modelle, die Bilder verarbeiten können. Eine Aufgabe gilt nur dann als bestanden, wenn das Modell sie in beiden Durchläufen erfolgreich löst. Die Auswertung erfolgt automatisiert nach festen Regeln, ohne Bewertung durch ein zweites KI-Modell. Sämtliche Testdaten sind frei erfunden.

2 Aufgaben

Memo

Eine KI-Risikoeinstufung in zwei bis drei deutschen Sätzen zusammenfassen, ohne erfundene Risikoklassen, höchstens 700 Zeichen.

1 Aufgabe

Extraktion

Acht Felder aus einer internen Mitteilung exakt auslesen und als JSON ausgeben.

3 Aufgaben

Langes Dokument

Drei Fragen zu einem mehrseitigen Ausschussprotokoll: Zahl, Name, Frist.

1 Aufgabe

Prompt-Injection

Eine E-Mail mit versteckter Anweisung zusammenfassen, ohne der Anweisung zu folgen.

1 Aufgabe

Token-Budget

Eine Antwort in einem Satz geben und dabei höchstens 400 abgerechnete Token verbrauchen, einschließlich der internen Denkschritte des Modells.

2 Aufgaben

Bild

Ein Meldeformular samt Ankreuzfeld und Datum auslesen und die Werte einer Tabellenspalte addieren. Nur für Modelle mit Bildeingabe.

Messtag 28.09.2026, Scaleway Paris, je Aufgabe zwei Durchläufe
ModellBestandendavon BildRechenzeitbeide DurchläufeKostenbeide DurchläufeNicht bestanden
Qwen3.8-27B10 / 102 / 240,5 s0,033 €keine
DeepSeek-V4-Flash (0731)8 / 8keine Bildeingabe61,1 s0,008 €keine
Qwen3.6-35B-A3B9 / 102 / 2505,2 s0,030 €Token-Budget (452 und 445 Token)
GLM-5.27 / 8keine Bildeingabe111,6 s0,079 €Token-Budget (560 und 693 Token)
Qwen3.5-397B-A17B8 / 102 / 2444,4 s0,120 €eine Dokumentfrage ohne Antwort; Token-Budget (789 und 766 Token)
  • Qwen3.8-27B hat als einziges Modell alle zehn Aufgaben bestanden, Bildaufgaben eingeschlossen, und war am schnellsten. Scaleway hat es in der Woche bis zum 28.09.2026 in den Katalog aufgenommen.
  • DeepSeek-V4-Flash hat alle acht Textaufgaben bestanden und für beide Durchläufe weniger als einen Cent gekostet. Bilder verarbeitet es nicht.
  • Die drei übrigen Modelle sind am Token-Budget gescheitert: Für einen einzigen Satz haben sie 445 bis 789 Token abgerechnet, weil die internen Denkschritte des Modells mitbezahlt werden. Bei vielen kurzen Anfragen wird das zum Kostenfaktor.
  • Qwen3.5-397B hat bei einer Frage zum Protokoll in beiden Durchläufen die vollen 4.000 Token für interne Denkschritte verbraucht und keine Antwort geliefert. Wer es einsetzt, sollte ein höheres Token-Limit setzen.
  • Schwankende Ergebnisse gab es an diesem Messtag keine: Bei jeder Aufgabe hat das jeweilige Modell entweder beide Durchläufe bestanden oder beide nicht bestanden.

Verlauf

Was sich zuletzt geändert hat

  • 21. bis 28.09.2026Scaleway nimmt Qwen3.8-27B auf, mit Funktionsaufrufen und strukturierter Ausgabe. Damit ist das Modell bei allen fünf Anbietern dieser Seite verfügbar, bei T-Systems als Vorschau.
  • 15.09.2026T-Systems führt GLM-5.3-Flash als Vorschau in Deutschland. Laut Artificial Analysis (Stand 28.09.2026) ist es das am besten bewertete Modell mit MIT- oder Apache-Lizenz in einem EU-Katalog.
  • 15.09.2026IONOS entfernt Llama 3.1 405B.
  • 08.09.2026STACKIT nimmt Qwen3.8-27B als Nachfolger von Qwen3.6-27B auf; Umstellung bis 08.12.2026.
  • 01.09.2026T-Systems senkt den Preis für GLM-5.2 auf 1,50 / 3,50 € und entfernt Llama 3.3 70B.

Methode

So lesen Sie diese Seite

  • Der Test dient zur Orientierung: zehn Aufgaben, zwei Durchläufe, ein Messtag. Er zeigt Stärken und Schwächen bei diesen Aufgaben, erlaubt aber keine allgemeine Rangliste der Modelle.
  • Wir veröffentlichen die Ergebnisse und die Methode, aber nicht die Aufgaben selbst. Damit verringern wir das Risiko, dass die Aufgaben in Trainingsdaten einfließen und spätere Messungen verzerren.
  • Gemessen über die Scaleway-API in Paris: Temperatur 0, Streaming, Standardeinstellung für die internen Denkschritte, höchstens 4.000 Ausgabe-Token pro Aufgabe (Bildaufgaben 8.000). Kosten nach Listenpreis ohne Rabatt für zwischengespeicherte Eingaben.
  • Katalog und Preise stammen von den öffentlichen Seiten der Anbieter. Wir prüfen sie wöchentlich; was sich ändert, steht im Verlauf.
  • Die Seite ist keine Rechts- und keine Beschaffungsberatung. Prüfen Sie Vertrag, Auftragsverarbeitung und Zertifikate direkt beim Anbieter.

Quellen, Stand 28.09.2026: Scaleway (Preise, unterstützte Modelle); STACKIT (verfügbare Modelle, Release Notes); IONOS (Modelle); T-Systems (Modelle, Pakete); OVHcloud (Katalog).

Kontakt

Was bedeuten die Ergebnisse für Ihren Einsatz?

Welches Modell eignet sich für Ihre Aufgaben, bei welchem Anbieter und mit welchen Daten? Wir helfen Ihnen, die Ergebnisse für Ihren konkreten Einsatz einzuordnen.

Gespräch anfragen

Einen Fehler entdeckt oder ein Modell vermisst? Schreiben Sie uns. Wir prüfen Ihren Hinweis und berücksichtigen ihn bei der nächsten Aktualisierung.