HyperAIHyperAI

Command Palette

Search for a command to run...

Amazon、AlexaのAIコストを最適化で削減

アマゾン、Alexa+のAI推論コスト削減へ大規模なインフラ再設計へ アマゾン・ドット・コムは2024年末から2025年初頭にかけて、AI搭載音声アシスタントAlexa+の推論コストを大幅に削減するための大規模なインフラ再設計を実行している。同社の内部文書によると、Alexa+の拡大に伴いAWSのクラウドコストは2026年に約17億ドルに達する見込みで、当初の財務目標を大きく上回る水準となった。このコスト膨張に対応するため、アマゾンはAnthropicのClaudeモデルへの依存を縮小し、自前のAIモデルへの移行や推論最適化を加速させている。 施策の中心は、リクエストの最適ルーティングである。専門的な応答には従来Claude Sonnetを使用していた機能を自社モデルへ移行し、一般的な問い合わせにはキャッシュや決定論的処理を適用して大規模言語モデルの呼び出しを回避する。また、複雑な推論には最先端モデルを、単純なタスクには低コストモデルを活用するマルチモデルルーティングの導入を標準化しており、顧客体験を維持しつつ推論コストを圧縮する方針だ。 ハードウェア面では、GPUの処理効率を最大化する取り組みが進められている。ソフトウェアの最適化により、既存の計算資源から約50%の処理能力向上と応答時間約40%の短縮を見込んでおり、単なる設備増強ではなく単位GPUあたりのトランザクション数を4倍以上に引き上げることを目指している。また、Nvidia製GPUに加えて自社開発のTrainiumチップの活用評価も行い、推論インフラのコスト構造を根本から見直している。 この動きは、大規模言語モデルの能力競争からいかに低コストで推論を実行するかという実用化・スケーラビリティの段階へ産業が転換しつつあることを示している。CEOのアンディ・ジャッシーは昨年株主書簡で、推論コストの劇的な低下がAIの普及とさらなる支出を促進すると指摘しており、今回のAlexa+のインフラ刷新はその方針を具現化するものと見られる。アマゾンは本格的なAlexa+の展開において、AIモデルと計算資源をデフォルトで過剰に投入せず、選別して配置する戦略を確立しつつある。

関連リンク