8ヶ月前

概要

SGD（確率的勾配降下法）はエポック間で訓練データをシャッフルする必要があるが、現行の単語レベル言語モデルシステムではこれを実施していない。訓練データ内のすべての文を単純にシャッフルすると、モデルが文間の依存関係を学習できなくなる。本稿では、エポック間で訓練データを部分的にシャッフルする方法を提案する。この方法により、バッチごとにランダム性を持たせつつ、大部分の文の順序を維持することが可能となる。結果として、Penn TreebankおよびWikiText-2データセットにおいて単語レベル言語モデリングにおける新たな最先端の成果を達成した。

ソースPDF

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助

すぐに使える GPU

最適な料金体系

開始する料金を見る

HyperAI Newsletters

最新情報を購読する

北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします

メール配信サービスは MailChimp によって提供されています

8ヶ月前

Ofir Press

概要

SGD（確率的勾配降下法）はエポック間で訓練データをシャッフルする必要があるが、現行の単語レベル言語モデルシステムではこれを実施していない。訓練データ内のすべての文を単純にシャッフルすると、モデルが文間の依存関係を学習できなくなる。本稿では、エポック間で訓練データを部分的にシャッフルする方法を提案する。この方法により、バッチごとにランダム性を持たせつつ、大部分の文の順序を維持することが可能となる。結果として、Penn TreebankおよびWikiText-2データセットにおいて単語レベル言語モデリングにおける新たな最先端の成果を達成した。

ソースPDF

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助

すぐに使える GPU

最適な料金体系

開始する料金を見る

HyperAI Newsletters

最新情報を購読する

北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします

メール配信サービスは MailChimp によって提供されています

訓練データの部分的なシャッフルによる言語モデルの改善 | 記事 | HyperAI超神経

Command Palette

訓練データの部分的なシャッフルによる言語モデルの改善

Ofir Press

概要

AIでAIを構築

HyperAI Newsletters

Command Palette

訓練データの部分的なシャッフルによる言語モデルの改善

Ofir Press

概要

AIでAIを構築

HyperAI Newsletters

Command Palette

訓練データの部分的なシャッフルによる言語モデルの改善

Ofir Press

概要

AIでAIを構築

HyperAI Newsletters