AI
Unser LLMaaS Gateway (Large Language Models as a Service) bietet hochperformanten Zugriff auf eine kuratierte Auswahl aktueller Open-Weight-Sprachmodelle. Die Inferenz läuft vollständig auf unserer in der Schweiz betriebenen GPU-Infrastruktur — Ihre Prompts, Embeddings und generierten Antworten verlassen die Schweiz nicht.
Verfügbare Modelle
Die folgenden Modelle sind aktuell produktiv über das Gateway verfügbar. Die Liste wird live von der API geladen.
Weitere Top-Modelle befinden sich in der Evaluierungsphase und werden in Kürze hinzugefügt. Alle Modelle sind nach dem Format provider/model (z.B. ew/glm-5.3-flash) ansprechbar, so dass ein Modellwechsel in der Regel ein Einzeiler bleibt.
OpenAI-kompatible API
Das Gateway exponiert eine OpenAI-kompatible REST-Schnittstelle — bestehender Code, der das OpenAI-SDK (Python, Node, Go, …) nutzt, kann ohne Anpassung der Anwendungslogik auf unsere Endpoints zeigen:
POST /v1/chat/completions— Chat- und Reasoning-Anfragen, inkl. Streaming und Tool-CallingPOST /v1/embeddings— Vektor-Embeddings für RAG, semantische Suche, KlassifikationPOST /v1/rerank— Re-Ranking von Suchergebnissen für höhere TrefferqualitätGET /v1/models— Liste aller aktuell verfügbaren Modelle
→ Vollständige Schnittstellenbeschreibung unter API Reference.
→ Optionen pro Request – Response-Caching und Steuerung des Content-Loggings – werden unter Request Options beschrieben.
Systemone-kompatible API
Als Alternative zur OpenAI-kompatiblen Schnittstelle unterstützt das Gateway die Systemone-API (POST /v1/systemone) mit dem Modell ew/dex. Statt freien Text zu generieren, übermitteln Sie einen State zusammen mit beliebig vielen getypten Fragen und erhalten pro Frage genau eine getypte Antwort – inklusive Wahrscheinlichkeiten:
noul— Ja/Nein-Frage, beantwortet mit der Wahrscheinlichkeit, dass die Antwort „Ja" lautetchoice— eine von bis zu 255 benannten Optionen, beantwortet mit der Gewinner-Option und den Wahrscheinlichkeiten pro Optionscore— Bewertung auf einer geordneten Skala mit bis zu 10 Stufen, beantwortet mit der erwarteten Stufe und deren Verteilung
Die Antworten werden berechnet, indem die möglichen Antwort-Labels direkt am Modell bewertet werden — es wird kein Text generiert, nichts muss geparst werden, und die Antwort ist ein einzelnes JSON-Dokument (Streaming wird nicht unterstützt; output_tokens ist immer 0). Damit eignet sich die API überall dort, wo eine feste Entscheidung wichtiger ist als Fliesstext:
- Ticket-Routing & Triage — eingehende Anfragen Billing, Technik oder Verkauf zuordnen und die Dringlichkeit mit
noulentscheiden - Stimmungs- & Eskalations-Bewertung — Kundenmeldungen auf einer definierten Skala einstufen, bevor sie an eine Person übergeben werden
- Klassifikation mit Schwellenwerten — direkt auf den zurückgegebenen Wahrscheinlichkeiten agieren, z.B. Erlauben/Blocken mit einem Confidence-Schwellwert
- Guardrails für Agenten — günstige Ja/Nein-Prüfungen, die Tool-Aufrufe oder Eskalationen absichern
Die API folgt der publizierten System-One-Spezifikation — bestehende System-One-Clients und SDKs (z.B. das TypeSafe-SDK) funktionieren, indem ihre Base-URL auf das Gateway gelegt und das Modell auf ew/dex gesetzt wird.
→ Vollständige Schnittstellenbeschreibung unter API Reference.
Virtuelle Keys & Governance
Das Gateway unterstützt Virtual Keys (Prefix sk-bf-...) für feingranulare Zugriffskontrolle, Modell-Routing und Verbrauchsverfolgung pro Team, Projekt oder Anwendungsfall. Sie können Ihre Virtual Keys selbst im Cloud Services Portal unter AI anlegen und verwalten.
→ Siehe AI-Verwaltung zum Anlegen von AI-Projekten und Erzeugen von API-Keys.
Typische Anwendungsfälle
- RAG-Pipelines — Dokumentensuche mit Embeddings + Rerank, kontextbasierte Antwortgenerierung
- Code-Assistenz — interne Entwicklerwerkzeuge, Code-Review und Refactoring-Vorschläge
- Klassifikation & Extraktion — strukturierte Datenextraktion aus E-Mails, Berichten, Tickets
- Agenten & Automatisierung — Tool-Calling-fähige Workflows mit kontrollierten Schreibrechten
- Mehrsprachige Inhalte — Übersetzung und Lokalisierung mit Fokus auf DACH-Sprachräume
Limited Access
Ausgewählte Kunden können ihren API-Key direkt im Cloud Services Portal unter AI erzeugen. Der Zugriff auf diese Funktion wird schrittweise freigegeben — wenn in Ihrem Portal der Bereich AI noch nicht sichtbar ist, ist Ihr Konto noch nicht freigeschaltet.