Zum Inhalt

AI

Unser LLMaaS Gateway (Large Language Models as a Service) bietet hochperformanten Zugriff auf eine kuratierte Auswahl aktueller Open-Weight-Sprachmodelle. Die Inferenz läuft vollständig auf unserer in der Schweiz betriebenen GPU-Infrastruktur — Ihre Prompts, Embeddings und generierten Antworten verlassen die Schweiz nicht.

Verfügbare Modelle

Die folgenden Modelle sind aktuell produktiv über das Gateway verfügbar. Die Liste wird live von der API geladen.

*Modelle werden geladen…*

Weitere Top-Modelle befinden sich in der Evaluierungsphase und werden in Kürze hinzugefügt. Alle Modelle sind nach dem Format provider/model (z.B. ew/glm-5.3-flash) ansprechbar, so dass ein Modellwechsel in der Regel ein Einzeiler bleibt.

OpenAI-kompatible API

Das Gateway exponiert eine OpenAI-kompatible REST-Schnittstelle — bestehender Code, der das OpenAI-SDK (Python, Node, Go, …) nutzt, kann ohne Anpassung der Anwendungslogik auf unsere Endpoints zeigen:

  • POST /v1/chat/completions — Chat- und Reasoning-Anfragen, inkl. Streaming und Tool-Calling
  • POST /v1/embeddings — Vektor-Embeddings für RAG, semantische Suche, Klassifikation
  • POST /v1/rerank — Re-Ranking von Suchergebnissen für höhere Trefferqualität
  • GET /v1/models — Liste aller aktuell verfügbaren Modelle

→ Vollständige Schnittstellenbeschreibung unter API Reference.

→ Optionen pro Request – Response-Caching und Steuerung des Content-Loggings – werden unter Request Options beschrieben.

Systemone-kompatible API

Als Alternative zur OpenAI-kompatiblen Schnittstelle unterstützt das Gateway die Systemone-API (POST /v1/systemone) mit dem Modell ew/dex. Statt freien Text zu generieren, übermitteln Sie einen State zusammen mit beliebig vielen getypten Fragen und erhalten pro Frage genau eine getypte Antwort – inklusive Wahrscheinlichkeiten:

  • noul — Ja/Nein-Frage, beantwortet mit der Wahrscheinlichkeit, dass die Antwort „Ja" lautet
  • choice — eine von bis zu 255 benannten Optionen, beantwortet mit der Gewinner-Option und den Wahrscheinlichkeiten pro Option
  • score — Bewertung auf einer geordneten Skala mit bis zu 10 Stufen, beantwortet mit der erwarteten Stufe und deren Verteilung

Die Antworten werden berechnet, indem die möglichen Antwort-Labels direkt am Modell bewertet werden — es wird kein Text generiert, nichts muss geparst werden, und die Antwort ist ein einzelnes JSON-Dokument (Streaming wird nicht unterstützt; output_tokens ist immer 0). Damit eignet sich die API überall dort, wo eine feste Entscheidung wichtiger ist als Fliesstext:

  • Ticket-Routing & Triage — eingehende Anfragen Billing, Technik oder Verkauf zuordnen und die Dringlichkeit mit noul entscheiden
  • Stimmungs- & Eskalations-Bewertung — Kundenmeldungen auf einer definierten Skala einstufen, bevor sie an eine Person übergeben werden
  • Klassifikation mit Schwellenwerten — direkt auf den zurückgegebenen Wahrscheinlichkeiten agieren, z.B. Erlauben/Blocken mit einem Confidence-Schwellwert
  • Guardrails für Agenten — günstige Ja/Nein-Prüfungen, die Tool-Aufrufe oder Eskalationen absichern

Die API folgt der publizierten System-One-Spezifikation — bestehende System-One-Clients und SDKs (z.B. das TypeSafe-SDK) funktionieren, indem ihre Base-URL auf das Gateway gelegt und das Modell auf ew/dex gesetzt wird.

→ Vollständige Schnittstellenbeschreibung unter API Reference.

Virtuelle Keys & Governance

Das Gateway unterstützt Virtual Keys (Prefix sk-bf-...) für feingranulare Zugriffskontrolle, Modell-Routing und Verbrauchsverfolgung pro Team, Projekt oder Anwendungsfall. Sie können Ihre Virtual Keys selbst im Cloud Services Portal unter AI anlegen und verwalten.

→ Siehe AI-Verwaltung zum Anlegen von AI-Projekten und Erzeugen von API-Keys.

Typische Anwendungsfälle

  • RAG-Pipelines — Dokumentensuche mit Embeddings + Rerank, kontextbasierte Antwortgenerierung
  • Code-Assistenz — interne Entwicklerwerkzeuge, Code-Review und Refactoring-Vorschläge
  • Klassifikation & Extraktion — strukturierte Datenextraktion aus E-Mails, Berichten, Tickets
  • Agenten & Automatisierung — Tool-Calling-fähige Workflows mit kontrollierten Schreibrechten
  • Mehrsprachige Inhalte — Übersetzung und Lokalisierung mit Fokus auf DACH-Sprachräume

Limited Access

Ausgewählte Kunden können ihren API-Key direkt im Cloud Services Portal unter AI erzeugen. Der Zugriff auf diese Funktion wird schrittweise freigegeben — wenn in Ihrem Portal der Bereich AI noch nicht sichtbar ist, ist Ihr Konto noch nicht freigeschaltet.