Fireworks veröffentlicht Ember-1 mit 50 % weniger Tokens
Fireworks Research hat mit Ember-1 ein neues, spezialisiertes KI-Modell vorgestellt, das die Leistung von Kimi K3 bei nahezu 40 % geringerem Tokenverbrauch bietet. Das Modell, das auf der Architektur von Kimi K3 aufbaut, wurde entwickelt, um ineffizientes reasoning zu reduzieren, ohne dabei die Genauigkeit oder die Fähigkeit zur komplexen Problemlösung zu beeinträchtigen. Damit reagiert Fireworks auf die wachsende Anforderung von Entwicklern nach kosteneffizienteren Lösungen, insbesondere für agentic Coding und mehrstufige Workloads, bei denen längere Reasoning-Verläufe die Kosten quadratisch ansteigen lassen. Die Entwicklung von Ember-1 basierte auf über fünfzig Trainingsexperimenten und zweihundert Evaluierungen. Das Forschungsteam entwickelte neue Trainingsalgorithmen, die das Modell dazu anweisen, unnötige Denkschritte zu überspringen, während wertvolle Selbstreflexion und Fehlerkorrekturen erhalten bleiben. Der gesamte Trainingsprozess erfolgte auf der Fireworks Serverless Training Plattform, was eine schnelle Iteration ohne Infrastruktur-Overhead ermöglichte. Die Trainingsdaten umfassen Mathematik, Softwareentwicklung, Tool-Nutzung und Multi-Turn-Interaktionen, um eine breite Generalisierung der Token-Effizienz zu gewährleisten. Unabhängige Benchmarks und die Specialized Intelligence Index-Tests bestätigen die Überlegenheit von Ember-1 im Kosten-Nutzen-Verhältnis. Auf dem Doximity Bedside Bench übertrifft das Modell unter anderem GPT-5.6 Sol, GPT-6 Astra und Claude Opus 5 in der Pareto-Optimierung zwischen Qualität und Kosten pro Aufgabe. In drei Branchencharts mit jeweils über fünfzig Testfällen erreicht Ember-1 die Qualität des Kimi K3 im Maximalmodus, bei gleichzeitig um bis zu 51,9 % geringeren Kosten. Live-A/B-Tests mit zwei Kunden in der Produktion zeigten eine durchschnittliche Tokenreduktion von 35 % bei gleicher Aufgabenabschlussrate und verbesserter Fehlerrate. Auch im internen Einsatz durch die Fireworks-Entwickler verlief der Wechsel nahtlos, ohne dass Arbeitsabläufe beeinträchtigt wurden. Besonders im agentic Coding zeigt Ember-1 erhebliche wirtschaftliche Vorteile, da hier traditionell bis zu 90 % der Tokens für interne Reasoning-Phasen verbraucht werden. Durch die optimierte Architektur werden redundante Schleifen vermieden und die Kosten pro Task deutlich gesenkt. Die Validierung erstreckt sich auf Software-Engineering-Benchmarks wie SWE-bench Verified, DeepSWE 1.1 und Interaktiv-Tests, in denen Ember-1 die Effizienz von Kimi K3 in allen Einstellungskategorien dominiert. Ember-1 ist ab sofort als Research Preview auf Fireworks Serverless verfügbar und markiert den Auftakt einer laufenden Modellserie von Fireworks Research, die auf spezialisierte Intelligenz ausgelegt ist. Zusätzlich wird ein Trainingssupport eingeführt, der Unternehmen ermöglicht, Ember-1 mit eigenen Daten auf spezifische Workloads anzupassen. Fireworks plant, die Leistungsfähigkeit von Ember-1 schrittweise auf weitere Anwendungsdomänen zu erweitern und die Token-Effizienz als zentrales Architekturprinzip weiterzuentwickeln. Entwickler können das Modell direkt über die Fireworks-Plattform evaluieren und sollen ihre Erfahrungen mit dem Hersteller austauschen.
