HyperAIHyperAI

Command Palette

Search for a command to run...

Fireworks、新AI「Ember-1」でトークン半減を実現

Fireworks Researchは、推論能力を最適化した専門モデル「Ember-1」の本格提供を開始した。Kimi K3のアーキテクチャを基盤としつつ、不要な推論プロセスを大幅に削減するよう学習を最適化することで、品質を維持したまま生成トークン数を約40%前後に圧縮することに成功した。 近年の推論型AIモデルは内部思考にトークンの大部分を消費しており、マルチターン型エージェントワークロードでは文脈が蓄積するごとにコストが急増する課題を抱えていた。従来の推論強度引き下げ設定では品質低下を招くため、Fireworks開発チームは50回以上のトレーニング実験と200件以上の評価を実施。独自学習アルゴリズムを開発し、自己検証や反復推論を維持しつつ、不要な思考ループを削除する仕組みを構築した。モデル開発はFireworks Serverless Training上で完結し、従来のプロビジョニング時間を短縮して迅速な実装を可能にした。 評価結果は顕著である。専門知能指数(SII)およびDoximityの臨床シナリオベンチマーク「Bedside Bench」において、Ember-1は費用対効果のパレートフロンティアを形成。GPT-5.6やGPT-6 Astra、Claude Opus 5などの主要クローズドモデルと比較しても、タスクあたりのコストを大幅に下回りながら高品質な回答を出力した。また、公開ベンチマーク7項目に加え、実顧客の生産環境におけるA/Bテストでも、推論トークンを約70%削減した結果、総合トークン使用量は約39%減少し、作業完了率や成功率などの主要メトリクスは維持または向上した。内部開発チームの実証でも、品質低下なしにインフラコストを抑制する効果が確認されている。 Ember-1は「Research Preview」として現在提供中であり、エージェント開発やコード生成など推論トークンがコストの大半を占めるワークロードに最適化されている。今後は「Ember」シリーズの継続的な展開を予定し、Serverlessトレーニング機能を介した顧客固有データによるカスタムモデル学習サポートも開始する。Fireworks Researchはトークン効率化と専門知能の融合を推進し、開発者のコスト最適化とスケーラビリティの向上に注力していく方針だ。

関連リンク