Marktanalyse 2026
Ein direkter Vergleich mit Hyperscalern (AWS, Azure, Google Cloud) und den führenden Inferenz-Spezialisten Together AI, Fireworks und Groq — und wo NOVO sich mit wettbewerbsfähigen Economics, gebündelter Kapazität und einer Enterprise-Schicht zwischen Commodity-Inferenz und Hyperscalern positioniert.
01 — Positionierungsmatrix
X-Achse: Enterprise-Tauglichkeit (Datenresidenz, gebündelte SLAs) · Y-Achse: Preis pro 1M Tokens (oben = günstig)
02 — Preisvergleich pro 1M Tokens
Referenzmodell für Open-Weight-Preise: Llama 3.3 70B, Stand August 2026. AWS Bedrock dient als konkrete Hyperscaler-Preisreferenz. Together AI: $1.04/$1.04 Input/Output; Groq: $0.59/$0.79; DeepInfra (Turbo) via OpenRouter: ca. $0.10/$0.32. AWS Bedrock listet Llama 3.3 70B mit $0.72/$0.72 Input/Output; Fireworks listet Llama 3.3 70B Serverless mit $0.90 je 1M Tokens. NOVO: $0.49 / 1M Tokens als Management-Zielrate, noch kein live validierter Produktionspreis.
* NOVO positioniert sich bewusst nicht als weltweit günstigster Commodity-Anbieter. Der Zielwert von $0.49 kombiniert wettbewerbsfähige Inferenz-Economics mit planbarer Capacity, regionalem Routing und einer gebündelten Enterprise-Vertragsschicht. Einzelne Commodity-Provider können bei bestimmten Modellen günstiger sein.
03 — Feature-Vergleich
| Kriterium | AWS Bedrock | Together AI | Fireworks | Groq | DeepInfra | NOVO ★ |
|---|---|---|---|---|---|---|
| Preis / 1M Tokens | $0.72 | $1.04 | $0.90 | $0.79 | $0.32 | $0.49 Target |
| Schnittstelle kompatibel mit OpenAI | ~ | ✓ | ✓ | ✓ | ✓ | ✓ Geplant |
| Regionale Datenresidenz | ✓ | ~ | ~ | ✕ | ~ | ✓ Geplant |
| Einheitliche Verfügbarkeitsgarantie über mehrere Anbieter | ✕ | ✕ | ✕ | ✕ | ✕ | ✓ Kernziel |
| Keine dauerhafte Speicherung von Kundendaten | ~ | ~ | ~ | ~ | ~ | ◌ Validierung |
| Bündelung externer Rechenkapazität ohne eigene Groß-Infrastruktur | ✕ | ~ | ~ | ✕ | ~ | ✓ Kernmodell |
| Kostenvorteile beim Einkauf von Rechenleistung in der Golfregion | ✕ | ✕ | ✕ | ✕ | ✕ | ◌ Validierung |
✓ = öffentlich klar dokumentiert · ~ = abhängig von Produkt, Region oder Vertrag · ✕ = im hier verglichenen Standardangebot nicht ersichtlich.
04 — Wettbewerber-Profile
Die dominanten Cloud-Anbieter mit globaler Infrastruktur und tiefster Enterprise-Integration. Bieten sowohl GPU-Rohkapazität als auch verwaltete Frontier-Modell-APIs, jedoch zu Premium-Preisen.
Etablierter Anbieter für Open-Weight-Modell-Inferenz mit breitem Modellkatalog, OpenAI-kompatibler API und wettbewerbsfähigen Preisen (~$1.04 / 1M Tokens, Llama-3.3-70B-Klasse).
Inferenz-Plattform mit Fokus auf schnelle Serving-Stacks, Custom-Deployments und Enterprise-Workloads. Für Llama 3.3 70B ist aktuell kein direkt vergleichbarer Serverless-Tokenpreis ausgewiesen; das Modell wird als On-Demand-Deployment angeboten.
Custom-Silicon- und Inferenzanbieter mit eigener LPU-Technologie und sehr hoher Serving-Performance. Llama 3.3 70B liegt aktuell bei $0.59 Input / $0.79 Output je 1M Tokens; Groq dokumentiert rund 280+ Tokens/s für das Modell. Ein starker Performance-Wettbewerber, nicht nur ein Preisvergleich.
Commodity- und Routing-Angebote setzen die Preisuntergrenze: DeepInfra wird für Llama 3.3 70B aktuell mit etwa $0.10 Input / $0.32 Output je 1M Tokens geroutet. OpenRouter bündelt mehrere Provider und bietet Routing, Fallbacks und je nach Provider Zero-Retention-Optionen.
05 — Der NOVO-Vorteil
NOVO zielt mit $0.49 / 1M Tokens auf einen Preis unter Together AI für Llama 3.3 70B und unter Groqs gewichteter Input/Output-Spanne. Einzelne Commodity-Anbieter bleiben günstiger; NOVO verkauft deshalb Preis + Capacity + Enterprise-Abstraktion.
Ziel ist Wholesale-Kapazität aus kosteneffizienten Regionen und von mehreren Partnern zu bündeln. Der wirtschaftliche Vorteil muss über reale Supplier-Quotes, Auslastung und Verträge validiert werden; NOVO plant ohne eigene Rechenzentren.
Keine dauerhafte Speicherung von Kundendaten ist als Architekturziel vorgesehen. Technische Telemetrie, Security- und Billingdaten werden separat behandelt; die finale Ausgestaltung muss vor Produktionsstart auditiert werden.
Optionale EU-Datenresidenz und dediziertes Routing sichern vertragsfeste Enterprise-SLAs für regulierte Branchen — gebündelt über mehrere Kapazitätsanbieter.
Mehr gebündelte Nachfrage verbessert die Planbarkeit von Capacity-Commitments. Größere Commitments können Einkaufskonditionen und Auslastung verbessern — ein Scale-/Capacity-Flywheel, kein garantierter Netzwerkeffekt.
NOVO Group Inc. (Delaware) für Kapitalzugang und Dual-Track-Exit-Vorbereitung. NOVO Arabia RHQ (Riad) für Kapazitäts-Beschaffung und GCC-Marktzugang.