1ヶ月前

過去の解読による言語モデルの改善

Siddhartha Brahma

要約

高正規化LSTMは言語モデルのいくつかのベンチマークデータセットで印象的な結果を達成しています。本研究では、コンテキスト内の最後のトークンを次のトークンの予測分布を使用してデコードする新しい正規化手法を提案します。この手法により、モデルはより多くのコンテキスト情報を保持する方向にバイアスがかかるため、次のトークンの予測能力が向上します。パラメータ数や学習時間にほとんど追加負荷をかけずに、我々の過去デコード正規化（Past Decode Regularization, PDR）手法は単一のソフトマックスを使用してPenn Treebankデータセットで単語レベルのペルプレキシティ55.6、WikiText-2データセットで63.5を達成しました。さらに、PDRとソフトマックス混合モデルを組み合わせることで、これらのデータセットでの単語レベルのペルプレキシティが53.8と60.5に改善しました。また、我々の手法はPenn Treebankキャラクターデータセットにおいて文字レベル言語モデリングで1.169ビット/文字を達成しました。これらの結果はそれぞれの設定において新たな最先端を示しています。