Zum Hauptinhalt springen

Modelle (EU-Hosting)

CLYE AI unterstützt mehrere KI-Modelle unterschiedlicher Hersteller. Alle aufgeführten Modelle werden in Europa gehostet.

Die verfügbaren Modelle werden direkt aus dem CLYE AI LLM-Gateway geladen und bei jedem Build aktualisiert.

Die konkret verfügbaren Modelle können je nach Workspace, Rolle oder Vertrag variieren.

CLYE AI Policies

Policies sind die empfohlene Wahl für die meisten Nutzer. Sie sind vorkonfigurierte Routing-Regeln, die je nach Aufgabe automatisch das passende Modell auswählen, ohne dass du dich um Modellversionen kümmern musst.

Wenn du im Chat ein anderes Modell auswählst, während gerade noch eine Antwort läuft, startet CLYE AI diese Antwort direkt mit dem neu gewählten Modell neu. Du musst die laufende Antwort also nicht erst separat stoppen.

Wenn gerade keine Antwort läuft, wird nur die Auswahl umgestellt. Die nächste Anfrage nutzt dann das neu gewählte Modell.

Policies sind vorkonfigurierte Modell-Routing-Regeln. Der tatsächlich genutzte Modell-Typ hängt von der jeweiligen Policy-Konfiguration ab, alle EU-gehostet.

ModellVisionReasoningToolsKontextMax. Output
Claude Sonnet 4.61M64K
Claude Sonnet 51M128K
GLM 5.1200K
GLM 5.21M131K
GPT 5 Mini200K100K
GPT 5.2400K128K
GPT 5.41M128K
GPT 5.51M128K
GPT 5.6 Luna1M128K
GPT 5.6 Sol1M128K
GPT 5.6 Tera1M128K
Standard131K33K

Direkte Modell-Zugriffe nach Anbieter

Für erweiterte Kontrolle kannst du Modelle direkt über ihren Anbieter ansprechen.

Modelle in der Suche nacheinander auswählen

Wenn du in einer Modellauswahl nach einem Begriff filterst und dann einen Treffer auswählst, bleibt dein Suchbegriff erhalten. So kannst du mehrere passende Modelle direkt hintereinander markieren, ohne den Filter jedes Mal neu eingeben zu müssen.

Beispiel:

  1. Öffne die Modellauswahl.
  2. Gib gpt-5.6 in die Suche ein.
  3. Wähle ein passendes Modell aus.
  4. Die Suche bleibt stehen, sodass du sofort weitere Treffer mit demselben Begriff auswählen kannst.

In der Oberfläche helfen kleine Typ-Icons bei der schnellen Orientierung:

  • 🧠 Brain-Icon: wird bei Modellnamen angezeigt, die Thinking oder Reasoning enthalten
  • ⚡ Blitz-Icon: wird bei Modellnamen angezeigt, die Instant oder Flash enthalten

Diese Icons siehst du sowohl in der Modell-Liste und Konfiguration in den Bot- bzw. Space-Einstellungen als auch im Modell-Dropdown im Chat.

Zusätzlich zeigt CLYE AI für unterstützte Anbieter ein Anbieter-Logo an. Für Mistral-Modelle wird automatisch das Mistral-Logo verwendet, sobald solche Modelle in deiner Umgebung verfügbar sind. Das gilt auch für Modell-IDs und Modellfamilien, die auf Mistral basieren, zum Beispiel mistral, mixtral, ministral, magistral, codestral, devstral oder pixtral.

Für die kuratierten Mistral-Einträge Mistral Large, Mistral Medium und Mistral Small verwendet CLYE AI jetzt außerdem ein Kontextfenster von 256K in der Modellübersicht. Das sorgt dafür, dass die Anzeige in der Oberfläche zum kuratierten Modellkatalog passt.

Die Icons sind eine Orientierungshilfe in der Oberfläche. Maßgeblich bleibt immer der konkrete Modellname.

Wenn du in den Bot- oder Space-Einstellungen einen Wert für Max. Output festlegst, gilt dafür jetzt eine feste Untergrenze von 16 Tokens. Werte darunter werden in CLYE AI automatisch auf 16 angehoben, damit betroffene Modelle – besonders aus der GPT-5-Familie – zuverlässig nutzbar bleiben.

In den Allgemeinen Einstellungen eines Assistenten findest du neben der normalen Modellkarte bei Bedarf auch eine eigene Karte für das STT-Modell (Speech-to-Text). Diese Karte ist auch in der Legacy-Ansicht der Einstellungen sichtbar, damit du die Transkriptionskonfiguration unabhängig von der übrigen Modellwahl prüfen und anpassen kannst.

Wenn du in den Bot- oder Space-Einstellungen über Modell hinzufügen weitere Modelle zur Auswahl hinterlegst, verhindert CLYE AI jetzt robuster, dass derselbe Eintrag versehentlich doppelt als zusätzliche Modellkarte erscheint. Das ist besonders dann relevant, wenn Änderungen im Hintergrund mehrfach angewendet oder gespeicherte Modelllisten aus älteren Ständen übernommen werden.

Falls in älteren Konfigurationen bereits doppelte Modellkarten auftauchen, werden diese beim nächsten Laden oder Speichern der Einstellungen in der Regel automatisch bereinigt. Maßgeblich bleibt dabei immer die tatsächliche Modellliste in den Einstellungen.

Lokale Modelle und Admin-Aktualisierung

Wenn in deiner Umgebung lokale Modelle (zum Beispiel über Ollama oder ein angebundenes LLM-Gateway) verfügbar sind, werden sie in der Modellauswahl jetzt vollständiger angezeigt. Modelle werden dabei nicht mehr allein wegen bestimmter Namensbestandteile ausgeblendet.

Das ist besonders hilfreich, wenn du eigene oder selbst gehostete Modelle mit individuellen Namen verwendest. Maßgeblich für die Auswahl bleibt, ob das Modell vom verbundenen Provider bereitgestellt wird.

Wenn dein LLM-Gateway neben physischen Modellen auch eigene Policies als Alias bereitstellt, gilt bei identischer Modell-ID jetzt die Policy aus dem Gateway. So bleibt ein bewusst angelegter Gateway-Alias in der Modellauswahl sichtbar und wird nicht von einem gleichnamigen Direktmodell eines anderen Providers verdrängt.

Das betrifft zum Beispiel Setups, in denen eine Policy wie claude-sonnet-5 über den lokalen Gateway-Katalog bereitgestellt wird, während zusätzlich ein Direktanbieter dieselbe ID anbietet. In diesem Fall verwendet CLYE AI im Picker bevorzugt die Gateway-Policy. Das gilt sowohl für die normale Modellauswahl als auch für kuratierte Einträge, bei denen dieselbe Modell-ID zusätzlich in anderer Schreibweise oder mit Präfixen wie policy/... auftauchen kann.

In den Agent-Einstellungen sehen Nicht-Entwickler in der Auswahl Agent Modelle jetzt gezielt nur noch solche Routing-Policies aus dem Gateway. Damit wählst du dort bevorzugt stabile Alias-Namen statt einzelner Direktprovider-IDs. Entwickler behalten weiterhin den vollständigen Katalog.

Wenn in deiner Umgebung gerade keine Gateway-Policies verfügbar sind – zum Beispiel in lokalen Setups ohne passendes Gateway oder bei einem vorübergehenden Gateway-Ausfall – fällt die Auswahl für Nicht-Entwickler automatisch auf den bisherigen kuratierten Katalog zurück. Die Modellwahl bleibt dadurch nutzbar und wird nicht leer angezeigt.

Ist in einem Assistenten bereits ein Modell gespeichert, das in der aktuellen Auswahl nicht mehr angeboten wird, erscheint es im Picker zusätzlich unter Aktuell konfiguriert. So bleibt der bisherige Wert sichtbar, sauber beschriftet und kann gezielt ersetzt werden. Nach dem Wechsel auf ein anderes Modell verschwindet dieser Sonder-Eintrag wieder.

Für physische Gateway-Modelle bleibt die bisherige Reihenfolge erhalten: Sie überschreiben bei gleicher ID nicht automatisch andere Provider-Einträge. Die Bevorzugung gilt gezielt nur für bewusst angelegte Gateway-Policies.

Die Einschränkung auf Policies gilt nur für die Agent-Einstellungen. Bereiche wie Chunking, Routing oder die Gateway-Verwaltung dürfen weiterhin auch direkte Modelle anzeigen, weil diese Auswahlen andere Anwendungsfälle abdecken.

Auch Eigenschaften wie Bildanalyse werden für Gateway-Modelle jetzt robuster aus dem Modellkatalog aufgelöst. Wenn ein Modell im Picker mit einer direkten Anbieter-ID wie local:gpt-5.6-tera erscheint, die Vision-Fähigkeit im Gateway aber auf einer zugehörigen Policy- oder Alias-Zeile hinterlegt ist, ordnet CLYE AI diese Information trotzdem dem richtigen Modell zu.

Falls der Gateway-Katalog für ein Modell selbst keine verwertbaren Metadaten liefert, verwendet CLYE AI dafür als Fallback die kuratierte Modellkonfiguration. So stimmt die sichtbare Einordnung im Modellwähler – zum Beispiel bei Bildanalyse – in der Regel auch dann besser mit dem tatsächlichen Modellverhalten überein, wenn ein lokales oder per Gateway angebundenes Modell über mehrere Alias-Namen auftaucht.

Wenn die Modellliste in der Oberfläche veraltet wirkt oder neu hinzugefügte Modelle noch nicht auftauchen, kannst du als Admin unter Admin → Modelle den Button Modell-Cache leeren verwenden. Dadurch werden die gecachten Modelllisten neu geladen.

Typische Fälle für die manuelle Aktualisierung:

  • du hast beim Provider oder im Gateway neue Modelle bzw. Policies bereitgestellt
  • ein lokaler Endpoint war zuvor zu langsam oder kurzfristig nicht erreichbar
  • die angezeigte Modellliste passt offensichtlich nicht mehr zum aktuellen Provider-Stand

Nach Änderungen am Gateway-Katalog oder an Policies kann ein manueller Cache-Refresh sinnvoll sein, damit die aktualisierte Auswahl sofort unter Admin → Modelle und im Picker erscheint.

AWS Bedrock (Anthropic)🇪🇺 EU

ModellVisionReasoningToolsKontextMax. Output
Claude Haiku 4.5200K64K
Claude Opus 4.5200K64K
Claude Opus 4.71M128K
Claude Opus 4.81M128K
Claude Opus 51M128K
Claude Sonnet 41M64K
Claude Sonnet 4.51M64K
Claude Sonnet 4.61M64K
Claude Sonnet 51M128K
Kimi K2.5128K16K
MiniMax M2.5-128K16K

Azure (OpenAI)🇪🇺 EU

ModellVisionReasoningToolsKontextMax. Output
GPT 4.1-1M33K
GPT 4.1 Mini-1M33K
GPT 4.1 Nano-1M33K
GPT 4o Mini-128K16K
GPT 5400K128K
GPT 5 Mini-200K100K
GPT 5 Nano-200K100K
GPT 5.1400K128K
GPT 5.2-400K128K
GPT 5.41M128K
GPT 5.51M128K
GPT 5.6 Luna1M128K
GPT 5.6 Sol1M128K
GPT 5.6 Terra1M128K
o4 Mini-200K100K
Openai Responses/GPT 4.1-1M33K
Openai Responses/GPT 4.1 Mini-1M33K
Openai Responses/GPT 4.1 Nano-1M33K
Openai Responses/GPT 5.41M128K
Openai Responses/GPT 5.51M128K
Openai Responses/GPT 5.6 Luna1M128K
Openai Responses/GPT 5.6 Sol1M128K
Openai Responses/GPT 5.6 Terra1M128K

Coding🇪🇺 EU

ModellVisionReasoningToolsKontextMax. Output
Gemini 2.5 Flash1M66K
Gemini 2.5 Pro1M66K

Google Vertex AI🇪🇺 EU

ModellVisionReasoningToolsKontextMax. Output
Claude Haiku 4.5200K64K
Claude Opus 4.5200K64K
Claude Opus 4.61M128K
Claude Opus 4.71M128K
Claude Opus 4.81M128K
Claude Opus 51M128K
Claude Sonnet 41M64K
Claude Sonnet 4.51M64K
Claude Sonnet 4.61M128K
Claude Sonnet 51M128K
Gemini 2.5 Flash1M66K
Gemini 2.5 Flash Image1M66K
Gemini 2.5 Flash Lite1M66K
Gemini 2.5 Pro1M66K
Gemini 3.1 Flash Lite1M66K
Gemini 3.5 Flash1M66K
Gemini 3.5 Flash Lite1M66K
Gemini 3.7 Flash1M66K

Inceptron🇪🇺 EU

ModellVisionReasoningToolsKontextMax. Output
GLM 5.2-1M1M
Kimi K2.6262K262K
Kimi K2.7 Code256K256K
MiniMax M2.5-197K197K

Mistral AI🇪🇺 EU

ModellVisionReasoningToolsKontextMax. Output
Codestral Latest--131K
Devstral Latest--256K
Devstral Small Latest--131K
GLM 5.2-1M128K
Leanstral 1.5--262K33K
Mistral Large Latest--131K
Mistral Medium 3.5262K
Mistral Medium Latest--131K
Mistral Small 2503--33K
Mistral Small 2603256K
Mistral Small Latest256K
Open Mistral 7b--33K

Nebius (Open Source)🇪🇺 EU · Open Source

ModellVisionReasoningToolsKontextMax. Output
GLM 5.2-1M131K
Google/Gemma 3.27b It-128K8K
Kimi K3-1M131K
Meta LLaMA/LLaMA 3.3.70B Instruct--128K
Nousresearch/Hermes 4.405b-128K
Nousresearch/Hermes 4.70b-128K
Nvidia/Nemotron 3 Nano Omni-300K
Openai/GPT Oss 120b-131K128K
Qwen/Qwen3 Next 80b A3b Thinking-128K
Qwen/Qwen3.235b A22b Instruct 2507-128K
Qwen/Qwen3.30b A3b Instruct 2507-128K
Qwen/Qwen3.32b-128K
Zai Org/GLM 5.1-200K

OpenAIEU

ModellVisionReasoningToolsKontextMax. Output
GPT 5.2400K128K

Openai Responses🇪🇺 EU

ModellVisionReasoningToolsKontextMax. Output
GPT 5.2400K128K

Sference🇪🇺 EU

ModellVisionReasoningToolsKontextMax. Output
Deepseek V4 Flash 0731-1M131K
GLM 5.2-1M131K
Kimi K3-1M262K
Thinkingcap Qwen3.6.27b-262K33K

TensorX🇪🇺 EU

ModellVisionReasoningToolsKontextMax. Output
Deepseek V4 Flash 0731-1M1M
Deepseek V4 Pro 0424-1M1M
GLM 5.2-1M1M
Kimi K2.7 Code262K262K
Kimi K31M262K
MiniMax M31M1M

Begriffe

EU / Souveräne Cloud Das Modell läuft in einer EU-Region bzw. in einer klar abgegrenzten Cloud-Umgebung (z. B. EU-Region eines Hyperscalers oder dediziertes EU-Hosting). Relevant für Datenschutz- und Compliance-Anforderungen.

Open Source Das Modell ist (nach Herstellerangaben) offen verfügbar/lizenzierbar und kann grundsätzlich auch selbst betrieben werden. Proprietäre Modelle sind typischerweise nur als Service nutzbar.

Vision Das Modell kann Bilder und Screenshots verarbeiten und analysieren.

Reasoning Das Modell verfügt über erweiterte Denkschritte (Chain-of-Thought / Reasoning-Modus) für komplexe Aufgaben.

Tools Das Modell unterstützt Funktionsaufrufe (Tool Calling / Function Calling), z. B. für MCP-Integrationen.

Kontext / Max. Output Gibt an, wie viel Text das Modell gleichzeitig verarbeiten bzw. ausgeben kann. K = Tausend Tokens, M = Million Tokens.

Modelle automatisch abgerufen am 02. September 2026. Aktuell verfügbare Modelle können je nach Workspace, Rolle oder Vertrag variieren.