HyperAIHyperAI

Command Palette

Search for a command to run...

通义千问
LLM

Cerebras推理服务模型目录

近日,Cerebras正式发布其公开推理模型目录,明确平台模型服务标准与底层压缩技术策略。目前,平台已上线OpenAI GPT OSS与Qwen 3.8 27B两款核心模型,参数量分别达到1200亿与270亿,推理吞吐峰值约分别为3000与1500 tokens/s。开发者可通过免费试用或按量付费接口调用,企业客户则能借助专用端点获取更高并发与生产级服务等级协议。 针对模型压缩与量化技术,Cerebras强调公开端点严格提供未经剪枝的原始模型以保障推理精度。平台仅在静态存储环节采用选择性权重量化,而激活值、注意力计算及KV缓存等动态推理过程均维持全精度运行。对于REAP等前沿剪枝算法,公司目前仅将其开源至Hugging Face供学术验证,暂不纳入生产级API。 平台同时承诺,现有模型架构将保持长期稳定,杜绝未经通知的底层修改。未来若部署新型压缩方案,必将开辟独立端点以确保技术透明与用户选择权。该策略在平衡前沿研究与工程落地的同时,显著提升了推理服务的可预期性,为算力密集型应用的高可靠部署奠定了坚实基础。

相关链接