HyperAIHyperAI

Command Palette

Search for a command to run...

LongBench-Pro ロングコンテキスト包括的評価データセット

Discordで議論

日付

7ヶ月前

ライセンス

Apache 2.0

LongBench-Proは、長文文脈言語モデルを評価するために2025年にリリースされたデータセットです。このデータセットは、異なるコンテキストの長さ、タスクの種類、動作条件下における長文テキストの理解と処理におけるモデルの能力を体系的に評価することを目的としています。 このデータセットには、レベル1タスク11件とレベル2タスク25件を含む1,500件のサンプルが含まれています。タスクは、コンテキストの使用頻度に基づいて、フルコンテキストタスクと部分コンテキストタスクに分類されます。英語と中国語の両方のサンプルが含まれており、英語と中国語のデータがバランスよく分散されています。タスクの難易度は、「簡単」、「中」、「難しい」、「最高」の4段階に分類されています。コンテキストの長さに関しては、サンプルは8kトークンから256kトークンまでの6つの長さの範囲をカバーし、均等に分散されています。

引用

@misc{chen2026longbenchprorealisticcomprehensive, title={LongBench Pro: より現実的で包括的なバイリンガル長文コンテキスト評価ベンチマーク}, author={Ziyang Chen、Xing Wu、Junlong Jia、Chaochen Gao、Qi Fu、Debing Zhang、Songlin Hu}、 年={2026}、 eprint={2601.02872}、 archivePrefix={arXiv}、 primaryClass={cs.CL}、 url={https://arxiv.org/abs/2601.02872}、 }

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています