Bild: KI-generiertCerebras CS-4 schafft 4.400 Token pro Sekunde
Cerebras verdoppelt mit dem WSE-3T die Rechenleistung und Speicherbandbreite seines Wafer-Beschleunigers. Das modulare CS-4-System soll bei gpt-oss-120b bis zu 4.400 Token pro Sekunde und Nutzer erreichen, stellt Rechenzentren aber vor hohe Anforderungen bei Stromversorgung und Kühlung.
Bild: KI-generiertOpenAI Ultrafast: GPT-5.6 Sol 14-mal schneller
OpenAI hat eine neue API-Leistungsstufe namens Ultrafast angekündigt, die das Spitzenmodell GPT-5.6 Sol bis zu 14-mal schneller ausführt und bis zu 750 Output-Tokens pro Sekunde liefert. Möglich macht das Spezialhardware von Cerebras. Der Modus läuft zunächst als begrenzte Vorschau für ausgewählte Kunden, Preise und Verfügbarkeitstermine nennt OpenAI nicht.