HyperAIHyperAI

Command Palette

Search for a command to run...

LLM
Generative KI

Cloudflare startet Clef KI-Modelle mit RL-Fine-Tuning

Cloudflare hat die Open-Source-Entscheidungsmodelle Clef und Clef-flash veröffentlicht, die auf der Workers-Plattform als Teil der KI-Infrastruktur bereitgestellt werden. Die Modelle sind unter der Apache-2.0-Lizenz auf Hugging Face verfügbar und sollen Entwickler bei der Implementierung automatisierter, agentenbasierter Workflows unterstützen. Im Gegensatz zu großen Sprachmodellen, die auf sequenzieller Textgenerierung basieren, liefern Entscheidungsmodelle deterministische, strukturierte Ausgabewerte mit Wahrscheinlichkeitszuordnungen. Clef und Clef-flash sind speziell für schnelle Routing-Entscheidungen, Klassifizierungen und Priorisierungen konzipiert. Das Architektur-Konzept verzichtet auf autoregressive Token-Generierung und nutzt stattdessen eine nicht-autoregressive Bewertungsschicht, die auf einem Qwen-Basismodell fußt. Clef arbeitet mit einer 27-Milliarden-Parameter-Version, Clef-flash mit einer leichteren 9-Milliarden-Variante. Beide Modelle unterstützen ein 64-Kontext-Token-Fenster, integrieren einen Vision-Encoder zur Bildklassifizierung und sind vollständig API-kompatibel zum aktuell diskutierten Jev-System. In benchmarkbasierten Vergleichen schneiden die Modelle sowohl in der Genauigkeit als auch in der Latenz deutlich besser ab als etablierte Alternativen. Durch das Hosting auf Cloudflares globalen Edge-Rechenzentren entstehen minimale Netzwerklatenzen, was Clef besonders für Hot-Path-Entscheidungen in Agenten-Orchestratoren geeignet macht. Die Auslastung der GPUs am Netzwerkrand beschleunigt die Inferenz signifikant und reduziert gleichzeitig die Betriebskosten im Vergleich zum kontinuierlichen Aufruf großer Sprachmodelle. Parallel zum Release stellt Cloudflare eine neue Reinforcement-Learning-Plattform vor, die eine gezielte Feinabstimmung der Clef-Modelle auf branchenspezifische Szenarien ermöglicht. Interne Pilotprojekte haben bereits gezeigt, dass vortrainierte Entscheidungsmodelle in Kombination mit unternehmensinternen Datennetzen die Effizienz bei der Support-Triage, Bedrohungserkennung und Crawler-Validierung steigern. Die neue RL-Infrastruktur nutzt dabei bestehende Cloudflare-Primitiven wie das AI Gateway zur Traffic-Erfassung, isolierte Container-Umgebungen für RL-Sandboxes und die Bring-Your-Own-Model-Funktion von Workers AI. Derzeit wird die Feinabstimmung von Front-Deployed-Engineers begleitet, wobei eine eigenständige Selbstbedienungsplattform in naher Zukunft folgen soll. Cloudflare positioniert die Clef-Familie als zentralen Baustein seiner Agenten-Strategie. Durch die Kombination deterministischer Entscheidungsfindung, niedriger Latenz und nahtloser Cloudflare-Integration soll die Entwicklung autonomer KI-Agenten beschleunigt werden. Entwickler können die Modelle direkt über die Worker-REST-API anbinden oder die Gewichte lokal implementieren.

Verwandte Links